485 는 녹음 배치 디렉터리 58개가 각각 한 연령대 100% 다.
N/22 는 전원 20대, N/23 은 전원 50대다. 그래서
화자로 갈라도 검증 화자가 학습 화자와 같은 배치에 들어 있고, 모델은 나이가 아니라
그 배치의 마이크·방·게인을 외우면 됐다. 그게 나이와 1:1이라 정확도가 0.884까지 올라갔다.
| 무엇으로 갈랐나 | MAE | 기준선 |
개선 | 6분류 정확도 |
| 화자 분리 — 처음 방식, 누수 있음 |
1.9년 | 10.8년 | +8.9년 |
0.884 |
| 배치 분리 — 녹음 조건까지 분리 |
9.6년 | 11.4년 | +1.8년 |
0.375 |
| 109 자유대화 — 다른 데이터셋·다른 발화 |
9.1년 | 10.6년 | +1.5년 |
— |
배치를 갈랐을 때(9.6년)와 아예 다른 데이터셋(9.1년)이 거의 같은 값이다.
이 9년대가 이 모델의 실제 실력이고, 기준선 대비 개선은 1.5년다.
재현: python voice485/agebatch.py, python voice485/age109.py