녹음 → 회의록 만들기 (화자 구분 + 자동 정리, 무료)
회의, 인터뷰, 통화 녹음을 올리면 이 기기 안에서 누가 말했는지 구분하고 회의록 초안까지 만들어요. 파일은 서버로 가지 않아요. 결과는 초안이라 아래에서 고쳐 쓰세요.
이용 전 확인
- 본인이 이용할 권리가 있는 파일만 올려 주세요. 다른 사람의 녹음·영상을 허락 없이 복제·배포하면 저작권법 등에 따라 책임이 따를 수 있어요. 소리공방은 올린 파일을 서버에 저장하지 않아요.
- 대화 당사자가 아닌 사람이 타인 간의 대화를 몰래 녹음한 파일은 올리지 마세요. 통신비밀보호법에 따라 처벌될 수 있어요. 회의 전 참석자에게 녹음 사실을 알리고 동의를 받으세요.
도구를 불러오는 중이에요...
회의가 끝나면 녹음만 남고 회의록 정리는 자꾸 미뤄지기 쉬워요. 이 도구는 음성 인식 AI(Whisper)로 녹음을 글로 바꾸고, 화자 구분 AI(pyannote)로 누가 말했는지 나눈 뒤, 핵심 문장·키워드·할 일·결정 사항을 규칙 기반으로 뽑아 회의록 초안을 만들어요. 모든 계산은 이 브라우저 안에서 이뤄져서 녹음 파일이 서버로 올라가지 않아요. 먼저 Whisper 모델이 녹음을 30초 단위로 나눠 겹치게 처리하면서 문장과 시간을 뽑고, 이어서 화자 구분 모델이 10초 창을 5초씩 겹쳐 가며 각 구간에서 몇 명이 말했는지 추정해요. 창마다 다르게 매겨지는 화자 번호는 겹치는 구간에서 말하는 시간이 가장 비슷한 쪽끼리 이어 붙여서 녹음 전체에서 같은 사람이 같은 번호를 갖게 맞춰요. 너무 짧게(3초 미만) 잡힌 화자는 가장 가까운 화자에 합치고, 설정한 최대 인원보다 많이 잡히면 말을 가장 적게 한 화자부터 순서대로 합쳐서 인원수를 맞춰요. 마지막으로 각 문장이 어느 화자 구간과 가장 많이 겹치는지 비교해서 문장마다 화자를 배정해요.
자동 정리는 생성형 AI가 새 문장을 쓰는 게 아니라, 단어가 얼마나 자주 나오는지(키워드), 자주 나온 단어가 많이 들어간 문장(핵심 문장), "해야·하기로·마감·부탁·담당" 같은 표현이 들어간 문장(할 일 후보), "결정·확정·합의" 같은 표현이 들어간 문장(결정 사항 후보)을 규칙으로 찾아내는 방식이에요. 그래서 빠르고 기기 밖으로 내용이 나가지 않지만, 실제 회의 맥락과 다르게 뽑힐 수 있어 참고용 초안으로만 쓰고 꼭 확인해야 해요.
이럴 때 쓰세요
- 회의 녹음에서 누가 무슨 말을 했는지 구분된 회의록 초안이 필요할 때
- 여러 명이 참여한 인터뷰나 좌담 녹음을 정리할 때
- 팀 회의의 할 일과 결정 사항을 빠르게 뽑아보고 싶을 때
- 직접 녹음하면서 바로 회의록으로 옮기고 싶을 때
- 화상회의를 녹음한 파일을 글로 남겨 검색 가능하게 만들고 싶을 때
사용 방법
- 녹음 파일을 끌어다 놓거나, 마이크로 바로 녹음해요. mp3, m4a, wav, webm, mp4 등을 지원해요.
- 모델 크기, 언어, 화자 수(자동 또는 2~5명), 화자 구분 사용 여부를 골라요. 처음 한 번은 모델을 내려받아요(큰 모델 약 250MB + 화자 구분 모델 약 2MB).
- 진행률과 남은 시간 예상치를 보며 기다려요. 언제든 취소할 수 있어요.
- 결과에서 화자 이름을 바꾸거나 두 화자를 합치고, ▶ 버튼으로 들으며 문장을 고쳐요.
- 자동 정리(핵심 문장·키워드·할 일·결정 사항)를 확인하고, TXT·회의록 MD·SRT로 저장하거나 전체 복사해요.
지원 형식과 제한
- 입력: mp3 · wav · m4a · ogg · mp4 · webm · mov · aac · flac · amr 등, 또는 마이크 녹음
- 모델: 작은 모델 tiny(약 41MB) · 중간 모델 base(약 77MB) · 큰 모델 small(약 250MB), 모두 OpenAI Whisper를 브라우저에서 돌리는 ONNX 변환 버전이에요
- 화자 구분: onnx-community/pyannote-segmentation-3.0 (약 1.5MB), 자동 또는 2~5명 중 선택
- 언어: 한국어 · 영어 · 자동 감지 중 선택
- 출력: TXT · 회의록 형식 MD · SRT, 전체 복사
- 녹음 길이가 2시간을 넘으면 기기에 따라 매우 오래 걸릴 수 있어요. 나눠서 올리는 걸 권해요
더 잘 쓰는 팁
- 마이크를 말하는 사람들 가까이에 두고, 한 사람씩 말하도록 하면 화자 구분이 훨씬 잘 돼요. 여러 명이 동시에 말하면 구분이 어려워요.
- 한국어는 모델이 작을수록 오류가 늘어나요. PC라면 큰 모델(small)을 권장해요.
- 잡음이 많다면 노이즈 제거 도구로 먼저 다듬어 보세요.
- 실제 참석자 수를 안다면 화자 수를 직접 2~5명으로 지정하면 더 정확해질 수 있어요.
- 자동 정리는 초안이에요. 핵심 문장과 할 일, 결정 사항은 반드시 원본 녹음과 대조해서 확인하세요.
문제 해결
- 모델 다운로드가 오래 걸리거나 실패하면 네트워크 상태를 확인하고 다시 시도하세요. 한 번 받은 모델은 브라우저에 저장돼요.
- 화자가 실제보다 많이 잡히면 결과 화면에서 두 화자를 합치거나, 화자 수를 직접 지정해서 다시 처리해 보세요.
- 화자 구분 모델을 불러오지 못하면 화자 구분 없이 글로만 바꾼 결과를 보여줘요. 다시 시도하거나 화자 구분 없이 써도 괜찮아요.
- 처리 중 브라우저가 느려지면 모바일에서 큰 모델이나 화자 구분을 함께 돌리고 있을 수 있어요. PC로 시도하거나 더 작은 모델을 선택하세요.
자주 묻는 질문
정말 서버로 안 보내나요?
네. 음성 인식과 화자 구분 모두 이 브라우저 안에서 계산해요. 모델 파일만 처음 한 번 인터넷에서 내려받고, 녹음 파일 자체는 서버로 올라가지 않아요.
화자 구분은 얼마나 정확한가요?
겹쳐 말하거나 잡음이 많으면 틀리기 쉬워요. 조용한 곳에서 한 사람씩 또박또박 말할수록 구분이 잘 돼요. 화자 이름과 구분은 결과에서 직접 고치고 합칠 수 있어요.
몇 명까지 화자를 구분할 수 있나요?
자동 감지 또는 2~5명 중에서 고를 수 있어요. 실제 인원보다 많이 잡히면 결과 화면에서 두 화자를 합칠 수 있고, 적게 잡히면 자동 감지로 다시 시도해 보세요.
자동 정리(핵심 문장, 할 일, 결정 사항)는 AI가 작성하나요?
아니요. 생성형 AI가 글을 새로 쓰지 않아요. 단어 빈도와 문장 패턴(해야, 하기로, 결정, 확정 등)을 찾는 규칙 기반 추출이라 실제 회의 내용과 다를 수 있어요. 참고용 초안으로만 쓰고 꼭 확인하세요.
처리 시간이 얼마나 걸리나요?
기기와 녹음 길이에 따라 달라요. 화자 구분까지 켜면 글로만 바꿀 때보다 시간이 더 걸려요. 진행률 화면에 남은 시간 예상치가 표시돼요. 2시간이 넘는 긴 녹음은 나눠서 올리는 걸 권해요.
회의를 녹음해도 되나요?
대화 당사자가 아닌 사람이 몰래 녹음하면 통신비밀보호법에 따라 처벌될 수 있어요. 회의 시작 전 참석자들에게 녹음한다고 알리고 동의를 받으세요.
사용한 오픈소스
- OpenAI Whisper (MIT 라이선스) — 음성 인식
- pyannote segmentation-3.0 (MIT 라이선스, onnx-community 변환) — 화자 구분
- Transformers.js (Apache-2.0 라이선스) — 모델을 브라우저에서 돌리는 라이브러리
- ONNX Runtime Web (MIT 라이선스) — 브라우저 추론 엔진
더 알아보기
더 자세한 녹음 요령과 회의록 양식은 가이드에서 확인하세요: 회의 녹음으로 화자 구분 회의록 자동으로 만드는 법, 녹음 파일을 글로 바꾸는 방법, AI 음성 인식이 한국어에서 틀리는 이유.