Nouplo

Transcrever áudio para texto

Gravações e vídeos em português em texto e legendas, sem o som sair do seu aparelho.

Solte os arquivos aqui

ou clique para escolher no seu dispositivoFormatos aceitos: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

Até 3 arquivos por vezAté 20 MB por arquivo10 usos por diaRemova os limites com o Pro✓ Funciona offline

Seus arquivos ficam no seu dispositivo

Esta ferramenta roda inteiramente no seu navegador. Nada é enviado, nada é armazenado, e você pode até desligar a internet antes de começar.

Como funciona

  1. Adicione um arquivo de áudio ou de vídeo: MP3, M4A, WAV, MP4, OPUS e quase tudo o que um navegador consegue tocar.
  2. O idioma já está em português. Marque “Pôr o horário no começo de cada linha” se quiser marcações de tempo na transcrição.
  3. Se mais de uma pessoa fala, marque “Separar os falantes”; cada linha passa a começar com Falante 1, Falante 2 e assim por diante.
  4. Clique em Transcrever. Na primeira vez o modelo de voz (cerca de 250 MB) é baixado uma vez só; depois começa na hora.
  5. Copie a transcrição ou baixe-a como arquivo de texto junto com as legendas SRT.

Perguntas frequentes

É preciso?
Usa o Whisper small (OpenAI, Apache 2.0). Em audiolivros antigos, lidos em português europeu (Multilingual LibriSpeech), cerca de uma palavra em cada sete saiu errada nos nossos testes; na fala brasileira lida de hoje (FLEURS), o resultado publicado do modelo é de cerca de 7 % de palavras erradas. Ruído, sotaque forte, gente falando ao mesmo tempo, jargão e nomes pouco comuns trazem mais erros.
Tem pontuação?
Tem. O Whisper coloca sozinho maiúsculas, pontos e vírgulas. As linhas mesmo assim começam nas pausas de quem fala, e as legendas são cortadas nos mesmos pontos.
Por que o download é tão grande?
Porque um modelo menor não dava conta do português: o Whisper base, que serve para o inglês, errou o dobro nas mesmas gravações. Os cerca de 250 MB são baixados uma vez e ficam no navegador.
Ele sabe quem está falando?
Marque “Separar os falantes” e cada linha começa com Falante 1, Falante 2 e assim por diante. A gravação é lida uma segunda vez por outros dois modelos, que escutam as vozes e não as palavras: na primeira vez são mais 34 MB, e a espera mais ou menos dobra. Números em vez de nomes, porque nada na gravação diz quem é quem. Duas vozes bem gravadas saem certas; um microfone só numa sala, vozes parecidas e longos trechos de gente falando junto são os pontos fracos.
Minha gravação é enviada?
Não. O reconhecimento roda nesta página, no seu próprio aparelho, o que serve para reuniões, entrevistas e tudo o que não deve sair dele. Depois que o modelo foi baixado, funciona também sem internet.
Quanto tempo leva?
Num computador, mais ou menos metade da duração da gravação: meia hora para uma hora. Celulares são mais lentos e podem ficar sem memória numa gravação longa; corte em partes antes.
Quais idiomas?
Nove: português, inglês, alemão, francês, espanhol, italiano, coreano, turco e japonês. Escolha o idioma da gravação: ele é informado ao modelo em vez de adivinhado, para uma gravação em português não sair traduzida.

Para um uso específico

Ferramentas relacionadas