소리공방의 음성 인식은 OpenAI의 Whisper 모델을 내 브라우저 안에서 돌려요. 같은 Whisper라도 모델 크기에 따라 결과가 크게 달라요.
소리공방에서 직접 잰 결과
공개 한국어 낭독 샘플 4개(문장당 약 9~12초)로 시험했어요. 글자 오류율은 띄어쓰기와 문장부호를 뺀 글자 기준이에요.
| 모델 | 평균 글자 오류율 | 처리 시간 | 비고 |
|---|---|---|---|
| tiny | 사용 어려움 | 음성 길이의 약 0.3~1.4배 | 같은 말을 반복하거나 엉뚱한 글이 나왔어요 |
| base | 문장에 따라 12~67% | 약 0.6~1.3배 | 한 문장은 중간에서 끊겼어요 |
| small | 약 4% | 약 1.4~4배(첫 실행은 모델 내려받기 포함) | 가장 안정적이었어요 |
표본이 4문장뿐이고 또박또박 읽은 녹음이라, 실제 회의나 통화 녹음에서는 오류가 더 클 수 있어요. 이 수치는 이 PC 한 대에서 잰 값이에요.
광고 (guide-mid)
틀리는 이유
- 모델이 작을수록 한국어처럼 학습 자료가 상대적으로 적은 언어에서 약해요.
- 소음, 여러 사람이 동시에 말하는 상황, 전문 용어, 외래어에서 틀려요.
- 숫자와 단위는 표기가 흔들려요(예: 15m, 15미터).
결과를 더 낫게 하려면
- PC에서 큰 모델(small) 을 쓰세요.
- 잡음이 많으면 노이즈 제거를 먼저 해요.
- 결과는 편집기에서 직접 듣고 고쳐요.
- 중요한 문서(계약, 법률, 의료)에는 자동 결과를 그대로 쓰지 마세요.
출처와 확인일
확인일: 2026년 10월 3일
- OpenAI Whisper — https://github.com/openai/whisper
- 소리공방 실측 기록(Google FLEURS 한국어 낭독 샘플 4개, 2026-10-03)
이 글은 일반 정보예요. 장비·서비스는 시간이 지나면 달라질 수 있어요.