Transcrever áudio para texto
Gravações e vídeos em português em texto e legendas, sem o som sair do seu aparelho.
Solte os arquivos aqui
ou clique para escolher no seu dispositivoFormatos aceitos: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
Até 3 arquivos por vezAté 20 MB por arquivo10 usos por diaRemova os limites com o Pro✓ Funciona offline
Seus arquivos ficam no seu dispositivo
Esta ferramenta roda inteiramente no seu navegador. Nada é enviado, nada é armazenado, e você pode até desligar a internet antes de começar.
Como funciona
- Adicione um arquivo de áudio ou de vídeo: MP3, M4A, WAV, MP4, OPUS e quase tudo o que um navegador consegue tocar.
- O idioma já está em português. Marque “Pôr o horário no começo de cada linha” se quiser marcações de tempo na transcrição.
- Se mais de uma pessoa fala, marque “Separar os falantes”; cada linha passa a começar com Falante 1, Falante 2 e assim por diante.
- Clique em Transcrever. Na primeira vez o modelo de voz (cerca de 250 MB) é baixado uma vez só; depois começa na hora.
- Copie a transcrição ou baixe-a como arquivo de texto junto com as legendas SRT.
Perguntas frequentes
- É preciso?
- Usa o Whisper small (OpenAI, Apache 2.0). Em audiolivros antigos, lidos em português europeu (Multilingual LibriSpeech), cerca de uma palavra em cada sete saiu errada nos nossos testes; na fala brasileira lida de hoje (FLEURS), o resultado publicado do modelo é de cerca de 7 % de palavras erradas. Ruído, sotaque forte, gente falando ao mesmo tempo, jargão e nomes pouco comuns trazem mais erros.
- Tem pontuação?
- Tem. O Whisper coloca sozinho maiúsculas, pontos e vírgulas. As linhas mesmo assim começam nas pausas de quem fala, e as legendas são cortadas nos mesmos pontos.
- Por que o download é tão grande?
- Porque um modelo menor não dava conta do português: o Whisper base, que serve para o inglês, errou o dobro nas mesmas gravações. Os cerca de 250 MB são baixados uma vez e ficam no navegador.
- Ele sabe quem está falando?
- Marque “Separar os falantes” e cada linha começa com Falante 1, Falante 2 e assim por diante. A gravação é lida uma segunda vez por outros dois modelos, que escutam as vozes e não as palavras: na primeira vez são mais 34 MB, e a espera mais ou menos dobra. Números em vez de nomes, porque nada na gravação diz quem é quem. Duas vozes bem gravadas saem certas; um microfone só numa sala, vozes parecidas e longos trechos de gente falando junto são os pontos fracos.
- Minha gravação é enviada?
- Não. O reconhecimento roda nesta página, no seu próprio aparelho, o que serve para reuniões, entrevistas e tudo o que não deve sair dele. Depois que o modelo foi baixado, funciona também sem internet.
- Quanto tempo leva?
- Num computador, mais ou menos metade da duração da gravação: meia hora para uma hora. Celulares são mais lentos e podem ficar sem memória numa gravação longa; corte em partes antes.
- Quais idiomas?
- Nove: português, inglês, alemão, francês, espanhol, italiano, coreano, turco e japonês. Escolha o idioma da gravação: ele é informado ao modelo em vez de adivinhado, para uma gravação em português não sair traduzida.
Para um uso específico
Ferramentas relacionadas
❝ Gravação de reunião para ata Quem disse, quando disse, e os títulos prontos para o que vocês decidirem que aquilo significa. ▭ Adicionar legendas a um vídeo Um arquivo SRT gravado na imagem, para as palavras aparecerem em toda tela. ≋ Remover ruído de fundo Ventiladores, chiado e zumbido tirados de baixo da voz. ♪ Vídeo para MP3 O som do seu vídeo em MP3, feito no seu aparelho.