fav-signals-lab · 음성 모델 스택

동결 인코더 위에 헤드만 얹는다 — 서버는 Gemma 4, 브라우저는 Whisper-tiny

fav-signals-lab · 음성 모델 스택 동결 인코더 위에 헤드만 얹는다 — 서버는 Gemma 4, 브라우저는 Whisper-tiny 서버 — 동결 인코더 서버 — 우리가 학습한 헤드 브라우저 — 폰 안에서만 음성 입력 · 16kHz mono · Architecture component · 서버 6초 · 브라우저 3초 창 음성 입력 16kHz mono 서버 6초 · 브라우저 3초 창 Gemma 4 오디오 타워 · 304.8M · 동결 · Apache-2.0 · 서버 — 동결 인코더 · (150, 1536) · 실제 랭크 1024 Gemma 4 오디오 타워 304.8M · 동결 · Apache-2.0 (150, 1536) · 실제 랭크 1024 시간축 평균 · (150,1536) → 1536 → PCA · 서버 — 동결 인코더 시간축 평균 (150,1536) → 1536 → PCA 7감정 헤드 · AI Hub 485 낭독 28,525문장 · 서버 — 우리가 학습한 헤드 · 녹음 배치 분리 0.628 7감정 헤드 AI Hub 485 낭독 28,525문장 녹음 배치 분리 0.628 대화 3결 헤드 · 71631 성인 · 71632 청소년 2,811명 · 서버 — 우리가 학습한 헤드 · 긍정 · 중립 · 부정 대화 3결 헤드 71631 성인 · 71632 청소년 2,811명 긍정 · 중립 · 부정 나이 회귀 헤드 · 109+107 자유대화 3,445명 · 서버 — 우리가 학습한 헤드 · 환경 교차 MAE 6.3~8.5년 나이 회귀 헤드 109+107 자유대화 3,445명 환경 교차 MAE 6.3~8.5년 성별 헤드 · 같은 3,445명 · 환경×성별 균형 · 서버 — 우리가 학습한 헤드 · AUC 0.995~0.997 성별 헤드 같은 3,445명 · 환경×성별 균형 AUC 0.995~0.997 체험 화면 · 랩 콘솔 · serve.py /api/predict · Architecture component 체험 화면 · 랩 콘솔 serve.py /api/predict 운율 지표 · 음높이 · 휴지 · 속도 · 떨림 · Architecture component 운율 지표 음높이 · 휴지 · 속도 · 떨림 Whisper-tiny 인코더 · 8M · 동결 · MIT · 브라우저 — 폰 안에서만 · 멜 계산까지 ONNX 안 Whisper-tiny 인코더 8M · 동결 · MIT 멜 계산까지 ONNX 안 브라우저 헤드 4개 · 7감정 · 3결(증류) · 나이 · 성별 · 브라우저 — 폰 안에서만 · ser_tiny.onnx 16MB · int8 브라우저 헤드 4개 7감정 · 3결(증류) · 나이 · 성별 ser_tiny.onnx 16MB · int8 실시간 음성 감정 · 0.5초마다 · 소리는 폰 밖으로 안 나간다 · Architecture component 실시간 음성 감정 0.5초마다 · 소리는 폰 밖으로 안 나간다 log-mel 3초 파형 인코더 우회 Legend Frontend Backend External

인코더 — 라이선스와 크기로 골랐다

  • • EmoWhisper 는 가중치 라이선스가 없어 2026-09-19 Gemma 4 오디오 타워(Apache-2.0)로 바꿨다
  • • Gemma 4 타워(305M)는 브라우저에 무겁다 — 브라우저는 Whisper-tiny(8M, MIT)
  • • 1536 은 hidden 1024 의 선형사영이다 — 뒤 512차원은 정보가 0

지금 쓰는 헤드

  • • 7감정 — 485 낭독, 녹음 배치를 갈라 0.628(무작위 0.143)
  • • 대화 3결 — 71631 성인 1,886명 + 71632 청소년 925명
  • • 나이 · 성별 — 3,445명, 녹음 환경 3종을 갈라 검증 · 환경 균형

쓰지 않는 것 · 한계

  • • 485 나이 — 녹음 배치가 곧 연령대였다(누수), 제거
  • • 낭독 감정은 자연 대화로 안 옮겨간다(0.213) — 그래서 대화 3결을 따로 배웠다
  • • VoiceNet 43차원 — 절반이 합성음인 외부 데이터로 배운 모델, 로컬 비교에만 남김