AI 음성 인식이 한국어에서 틀리는 이유와 모델 고르는 법

작은 모델에서 한국어 인식이 틀리는 이유, 소리공방에서 잰 정확도, 정확도를 올리는 방법이에요.

읽는 데 6분 · 업데이트 2026-10-03

소리공방의 음성 인식은 OpenAI의 Whisper 모델을 내 브라우저 안에서 돌려요. 같은 Whisper라도 모델 크기에 따라 결과가 크게 달라요.

소리공방에서 직접 잰 결과

공개 한국어 낭독 샘플 4개(문장당 약 9~12초)로 시험했어요. 글자 오류율은 띄어쓰기와 문장부호를 뺀 글자 기준이에요.

모델평균 글자 오류율처리 시간비고
tiny사용 어려움음성 길이의 약 0.3~1.4배같은 말을 반복하거나 엉뚱한 글이 나왔어요
base문장에 따라 12~67%약 0.6~1.3배한 문장은 중간에서 끊겼어요
small약 4%약 1.4~4배(첫 실행은 모델 내려받기 포함)가장 안정적이었어요

표본이 4문장뿐이고 또박또박 읽은 녹음이라, 실제 회의나 통화 녹음에서는 오류가 더 클 수 있어요. 이 수치는 이 PC 한 대에서 잰 값이에요.

광고 (guide-mid)

틀리는 이유

결과를 더 낫게 하려면

  1. PC에서 큰 모델(small) 을 쓰세요.
  2. 잡음이 많으면 노이즈 제거를 먼저 해요.
  3. 결과는 편집기에서 직접 듣고 고쳐요.
  4. 중요한 문서(계약, 법률, 의료)에는 자동 결과를 그대로 쓰지 마세요.

출처와 확인일

확인일: 2026년 10월 3일

이 글은 일반 정보예요. 장비·서비스는 시간이 지나면 달라질 수 있어요.

함께 쓰면 좋은 도구

광고 (guide-end)