← 홈 · 랩 콘솔

목소리나이 · 성별 — 체험 후보 검증

사업 문서가 2순위로 올린 “내 목소리는 몇 살?”. 받아온 VoiceNet(laion) Age 는 실패했고(MAE 14.6년, 기준선 15.1년), 485 낭독으로 학습한 헤드는 녹음 배치 누수였다(1.9년 → 배치 분리 9.6년). AI Hub 자유대화(109 일반 + 107 노인)로 다시 학습해서, 녹음 환경을 갈라 검증했다 — 11~91세. 순위는 잘 매기는데 예측이 평균 쪽으로 모여서, 실제만큼 펴는 보정을 걸었다. 수치는 아래 표에 있다. 녹음하면 셋을 나란히 보여준다.

자유대화로 다시 학습했다 — 11~91세 · 녹음 환경 3종을 갈라서 검증

불러오는 중…

VoiceNet Age 검증 — 485 화자 270명, 실제 연령대 라벨과 대조

불러오는 중…

MAE 2.0년은 왜 틀렸나 — 녹음 배치가 곧 연령대였다

485 는 녹음 배치 디렉터리 58개가 각각 한 연령대 100% 다. N/22 는 전원 20대, N/23 은 전원 50대다. 그래서 화자로 갈라도 검증 화자가 학습 화자와 같은 배치에 들어 있고, 모델은 나이가 아니라 그 배치의 마이크·방·게인을 외우면 됐다. 그게 나이와 1:1이라 정확도가 0.884까지 올라갔다.

무엇으로 갈랐나MAE기준선 개선6분류 정확도
화자 분리 — 처음 방식, 누수 있음 1.9년10.8년+8.9년 0.884
배치 분리 — 녹음 조건까지 분리 9.6년11.4년+1.8년 0.375
109 자유대화 — 다른 데이터셋·다른 발화 9.1년10.6년+1.5년 —

배치를 갈랐을 때(9.6년)와 아예 다른 데이터셋(9.1년)이 거의 같은 값이다. 이 9년대가 이 모델의 실제 실력이고, 기준선 대비 개선은 1.5년다. 재현: python voice485/agebatch.py, python voice485/age109.py

화자 21명, 한 명씩 — 109 자유대화 · 화자당 30발화 평균 · 485 헤드를 걸어 본 것

불러오는 중…

직접 해보기

마이크로 6초 녹음하면 두 모델의 추정 나이를 나란히 보여주고, 각각의 실제 오차도 같이 띄운다. 두 번 이상 찍으면 어느 쪽이 목소리를 따라오는지 기록으로 보여준다. 녹음은 브라우저 안에서 WAV 로 만들어 보내고 저장하지 않는다.

마이크 권한이 필요하다
또는 파일 업로드