Nouplo

음성 텍스트 변환

한국어 녹음과 영상을, 소리가 기기 밖으로 나가지 않은 채 녹취록과 자막으로.

여기에 파일을 끌어다 놓으세요

또는 클릭해서 기기에서 선택지원 형식: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

1회 최대 3개 파일파일당 최대 20MB하루 10회Pro로 제한 해제✓ 오프라인에서도 사용 가능

파일은 내 기기 밖으로 나가지 않습니다

이 도구는 브라우저 안에서만 작동합니다. 업로드도 저장도 하지 않으므로, 시작하기 전에 인터넷 연결을 끊어도 그대로 작동합니다.

사용 방법

  1. 오디오나 동영상 파일을 넣습니다. MP3, M4A, WAV, MP4, OPUS 등 브라우저가 재생할 수 있는 파일이면 대부분 됩니다.
  2. 언어는 한국어로 되어 있습니다. 녹취록에 시간을 넣고 싶으면 ‘줄마다 앞에 시간 넣기’를 켭니다.
  3. 여러 사람이 말한다면 ‘화자 구분’을 켭니다. 그러면 각 줄이 화자1, 화자2처럼 시작합니다.
  4. ‘텍스트로 변환’을 누릅니다. 처음 한 번만 음성 모델(약 250 MB)을 내려받고, 그다음부터는 바로 시작합니다.
  5. 녹취록을 복사하거나 SRT 자막과 함께 텍스트 파일로 내려받습니다.

자주 묻는 질문

얼마나 정확한가요?
Whisper small(OpenAI, Apache 2.0)을 씁니다. 또박또박 읽은 한국어(FLEURS)에서 저희 시험 결과 글자 기준으로 약 7~8%가 틀렸습니다. 띄어쓰기는 원문과 다르게 나오기도 합니다. 잡음, 사투리, 여러 사람이 겹쳐 말하는 부분, 전문 용어와 드문 이름에서 오류가 늘어납니다.
문장 부호도 붙나요?
붙습니다. Whisper가 마침표와 쉼표를 스스로 씁니다. 줄은 그래도 말이 멈춘 곳에서 바뀌고, 자막도 같은 자리에서 나뉩니다.
내려받는 용량이 왜 이렇게 큰가요?
더 작은 모델로는 한국어가 충분하지 않았기 때문입니다. 영어에는 충분한 Whisper base는 같은 한국어 녹음에서 글자 오류가 두 배 이상이었습니다. 약 250 MB는 한 번만 내려받고 그 뒤로는 브라우저에 남아 있습니다.
누가 말했는지 구분하나요?
‘화자 구분’을 켜면 각 줄이 화자1, 화자2처럼 시작합니다. 이때 녹음을 두 번째로 읽는데, 단어가 아니라 목소리를 듣는 모델 두 개가 따로 돕니다. 처음에는 34 MB를 더 내려받고, 기다리는 시간은 대략 두 배가 됩니다. 녹음 안에 누가 누구인지 알려 주는 정보가 없으므로 이름 대신 번호로 적습니다. 또렷하게 녹음된 두 사람은 잘 나뉘지만, 회의실 마이크 하나, 비슷한 목소리, 오래 겹쳐 말하는 부분은 약합니다.
녹음이 업로드되나요?
되지 않습니다. 인식은 이 페이지 안, 내 기기에서 돌아가므로 회의나 인터뷰처럼 밖으로 나가면 안 되는 녹음에 쓸 수 있습니다. 모델을 한 번 내려받은 뒤에는 오프라인에서도 됩니다.
시간은 얼마나 걸리나요?
컴퓨터에서는 녹음 길이의 절반 정도입니다. 한 시간짜리면 30분쯤 걸립니다. 휴대폰은 더 느리고, 긴 녹음은 메모리가 모자랄 수 있으니 미리 짧게 나누세요.
어떤 언어를 지원하나요?
한국어, 영어, 일본어, 독일어, 프랑스어, 스페인어, 포르투갈어, 이탈리아어, 튀르키예어 아홉 가지입니다. 녹음 언어를 고르면 모델에게 그 언어를 알려 주므로, 한국어 녹음이 번역되어 나오는 일이 없습니다.

용도별 페이지

관련 도구