Nouplo

Transcribir audio a texto

Grabaciones y vídeos en español pasados a texto y subtítulos sin que el sonido salga de tu dispositivo.

Arrastra tus archivos aquí

o haz clic para elegirlos desde tu dispositivoFormatos admitidos: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

Hasta 3 archivos por operaciónHasta 20 MB por archivo10 operaciones al díaQuita los límites con Pro✓ Funciona sin conexión

Tus archivos se quedan en tu dispositivo

Esta herramienta se ejecuta por completo en tu navegador. No se sube nada, no se guarda nada, e incluso puedes desconectarte de internet antes de empezar.

Cómo funciona

  1. Añade un archivo de audio o de vídeo: MP3, M4A, WAV, MP4, OPUS y casi todo lo que un navegador puede reproducir.
  2. El idioma está en español. Marca «Poner la hora al principio de cada línea» si quieres marcas de tiempo en la transcripción.
  3. Si habla más de una persona, marca «Separar a los hablantes»; cada línea empezará entonces por Hablante 1, Hablante 2, etc.
  4. Pulsa Transcribir. La primera vez se descarga una sola vez el modelo de voz (unos 250 MB); después empieza al momento.
  5. Copia la transcripción o descárgala como archivo de texto junto con los subtítulos SRT.

Preguntas frecuentes

¿Es preciso?
Usa Whisper small (OpenAI, Apache 2.0). En audiolibros leídos en español (Multilingual LibriSpeech) acertó alrededor del 94 % de las palabras en nuestras pruebas, es decir, una de cada diecisiete salió mal. El ruido, los acentos muy marcados, la gente que se pisa al hablar, la jerga y los nombres poco comunes traen más errores.
¿Pone signos de puntuación?
Sí. Whisper escribe él mismo mayúsculas, puntos y comas. Aun así, las líneas empiezan en las pausas de quien habla, y los subtítulos se cortan en los mismos puntos.
¿Por qué la descarga es tan grande?
Porque un modelo más pequeño no bastaba: Whisper base, que sirve para el inglés, cometió casi el doble de errores con las mismas grabaciones en español. Los unos 250 MB se descargan una vez y se quedan en el navegador.
¿Distingue quién habla?
Marca «Separar a los hablantes» y cada línea empezará por Hablante 1, Hablante 2, etc. La grabación se lee entonces una segunda vez con dos modelos más, que escuchan las voces y no las palabras: la primera vez se descargan 34 MB más y la espera se duplica más o menos. Números en lugar de nombres, porque nada en la grabación dice quién es quién. Dos voces bien grabadas salen bien; un solo micrófono en una sala, voces parecidas y largos ratos hablando a la vez son sus puntos débiles.
¿Se sube mi grabación?
No. El reconocimiento se hace en esta página, en tu propio dispositivo, así que sirve para reuniones, entrevistas y cualquier cosa que no deba salir de él. Una vez descargado el modelo, funciona también sin conexión.
¿Cuánto tarda?
En un ordenador, más o menos la mitad de lo que dura la grabación: media hora para una hora. Los móviles son más lentos y con una grabación larga pueden quedarse sin memoria; córtala antes en partes.
¿Qué idiomas admite?
Nueve: español, inglés, alemán, francés, portugués, italiano, coreano, turco y japonés. Elige el idioma de la grabación: se le dice al modelo en vez de dejar que lo adivine, para que una grabación en español no salga traducida.

Para un uso concreto

Herramientas relacionadas