음성 텍스트 변환
한국어 녹음과 영상을, 소리가 기기 밖으로 나가지 않은 채 녹취록과 자막으로.
여기에 파일을 끌어다 놓으세요
또는 클릭해서 기기에서 선택지원 형식: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
1회 최대 3개 파일파일당 최대 20MB하루 10회Pro로 제한 해제✓ 오프라인에서도 사용 가능
파일은 내 기기 밖으로 나가지 않습니다
이 도구는 브라우저 안에서만 작동합니다. 업로드도 저장도 하지 않으므로, 시작하기 전에 인터넷 연결을 끊어도 그대로 작동합니다.
사용 방법
- 오디오나 동영상 파일을 넣습니다. MP3, M4A, WAV, MP4, OPUS 등 브라우저가 재생할 수 있는 파일이면 대부분 됩니다.
- 언어는 한국어로 되어 있습니다. 녹취록에 시간을 넣고 싶으면 ‘줄마다 앞에 시간 넣기’를 켭니다.
- 여러 사람이 말한다면 ‘화자 구분’을 켭니다. 그러면 각 줄이 화자1, 화자2처럼 시작합니다.
- ‘텍스트로 변환’을 누릅니다. 처음 한 번만 음성 모델(약 250 MB)을 내려받고, 그다음부터는 바로 시작합니다.
- 녹취록을 복사하거나 SRT 자막과 함께 텍스트 파일로 내려받습니다.
자주 묻는 질문
- 얼마나 정확한가요?
- Whisper small(OpenAI, Apache 2.0)을 씁니다. 또박또박 읽은 한국어(FLEURS)에서 저희 시험 결과 글자 기준으로 약 7~8%가 틀렸습니다. 띄어쓰기는 원문과 다르게 나오기도 합니다. 잡음, 사투리, 여러 사람이 겹쳐 말하는 부분, 전문 용어와 드문 이름에서 오류가 늘어납니다.
- 문장 부호도 붙나요?
- 붙습니다. Whisper가 마침표와 쉼표를 스스로 씁니다. 줄은 그래도 말이 멈춘 곳에서 바뀌고, 자막도 같은 자리에서 나뉩니다.
- 내려받는 용량이 왜 이렇게 큰가요?
- 더 작은 모델로는 한국어가 충분하지 않았기 때문입니다. 영어에는 충분한 Whisper base는 같은 한국어 녹음에서 글자 오류가 두 배 이상이었습니다. 약 250 MB는 한 번만 내려받고 그 뒤로는 브라우저에 남아 있습니다.
- 누가 말했는지 구분하나요?
- ‘화자 구분’을 켜면 각 줄이 화자1, 화자2처럼 시작합니다. 이때 녹음을 두 번째로 읽는데, 단어가 아니라 목소리를 듣는 모델 두 개가 따로 돕니다. 처음에는 34 MB를 더 내려받고, 기다리는 시간은 대략 두 배가 됩니다. 녹음 안에 누가 누구인지 알려 주는 정보가 없으므로 이름 대신 번호로 적습니다. 또렷하게 녹음된 두 사람은 잘 나뉘지만, 회의실 마이크 하나, 비슷한 목소리, 오래 겹쳐 말하는 부분은 약합니다.
- 녹음이 업로드되나요?
- 되지 않습니다. 인식은 이 페이지 안, 내 기기에서 돌아가므로 회의나 인터뷰처럼 밖으로 나가면 안 되는 녹음에 쓸 수 있습니다. 모델을 한 번 내려받은 뒤에는 오프라인에서도 됩니다.
- 시간은 얼마나 걸리나요?
- 컴퓨터에서는 녹음 길이의 절반 정도입니다. 한 시간짜리면 30분쯤 걸립니다. 휴대폰은 더 느리고, 긴 녹음은 메모리가 모자랄 수 있으니 미리 짧게 나누세요.
- 어떤 언어를 지원하나요?
- 한국어, 영어, 일본어, 독일어, 프랑스어, 스페인어, 포르투갈어, 이탈리아어, 튀르키예어 아홉 가지입니다. 녹음 언어를 고르면 모델에게 그 언어를 알려 주므로, 한국어 녹음이 번역되어 나오는 일이 없습니다.