← 홈 · 랩 콘솔

voice485 — 한국어 낭독 7감정 헤드

Gemma 4 오디오 타워(Apache-2.0)를 동결하고 그 위에 얹은 작은 MLP 만 학습했다. 아래 샘플은 전부 학습에 쓰지 않은 화자의 것이다 — 소리를 직접 들으면서 정답과 모델 예측을 맞대 볼 수 있다.

학습 요약

불러오는 중…

이 정확도의 일부는 녹음 조건이다 — 배치로 갈라서 다시 쟀다

485 는 녹음 배치 디렉터리 58개로 나뉘어 있다. 연령대는 배치 하나에 한 종류만 들어 있어서(N/22=전원 20대) 나이 헤드는 통째로 누수였다 (경위). 감정은 배치 하나에 6~7종이 섞여 있어 사정이 낫지만, 그래도 화자 분리만으로는 녹음 조건이 새어 들어온다.

무엇으로 갈랐나EmoWhisperGemma 4 +PCA 1024최빈클래스
화자 분리 — 위 요약의 값 0.6770.672 0.6860.194
배치 분리 — 녹음 조건까지 분리 0.5670.604 0.6280.167

0.07 가량이 채널이었다. 나이처럼 무너지지는 않는다 — 최빈클래스 0.167 대비 0.628 은 여전히 실질적인 신호다. 다만 다른 도메인에서 증분이 0 이었던 것과 앞뒤가 맞는다: 채널로 번 부분은 다른 마이크·다른 방에서 녹음한 음성에 옮겨가지 않는다.

인코더를 바꾼 이유가 여기 있다. 화자 분리(누수 있음)에서는 둘이 같지만 — 시드 구간이 겹친다 — 배치를 갈라 처음 보는 녹음 조건에서 재면 Gemma 4 가 앞선다(시드 구간이 전혀 안 겹친다: 0.565~0.568 vs 0.601~0.606). Gemma 4 임베딩이 배치 음향에 덜 기댄다는 뜻이고, 485 가 원래 앓던 병이 그것이다. EmoWhisper 는 가중치 라이선스가 모델카드에 없어 온프렘 판매 근거도 없었다. 근거는 DATA.md.

검증 화자 샘플 — 들어보고 판정한다

불러오는 중…

혼동행렬 — 무엇을 무엇으로 착각하나

불러오는 중…

내 음성으로 돌려보기 — 모델을 골라서 따로 돌린다

wav/mp3/m4a 를 올리면 학습 때와 같은 전처리(16kHz, 앞 6초)로 돌린다. 고른 것만 돈다 — 겹쳐 돌리면 어느 신호가 무엇을 낸 건지 안 보인다. 운율만 고르면 인코더를 아예 올리지 않는다.

또는