Transcribir audio a texto
Grabaciones y vídeos en español pasados a texto y subtítulos sin que el sonido salga de tu dispositivo.
Arrastra tus archivos aquí
o haz clic para elegirlos desde tu dispositivoFormatos admitidos: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
Hasta 3 archivos por operaciónHasta 20 MB por archivo10 operaciones al díaQuita los límites con Pro✓ Funciona sin conexión
Tus archivos se quedan en tu dispositivo
Esta herramienta se ejecuta por completo en tu navegador. No se sube nada, no se guarda nada, e incluso puedes desconectarte de internet antes de empezar.
Cómo funciona
- Añade un archivo de audio o de vídeo: MP3, M4A, WAV, MP4, OPUS y casi todo lo que un navegador puede reproducir.
- El idioma está en español. Marca «Poner la hora al principio de cada línea» si quieres marcas de tiempo en la transcripción.
- Si habla más de una persona, marca «Separar a los hablantes»; cada línea empezará entonces por Hablante 1, Hablante 2, etc.
- Pulsa Transcribir. La primera vez se descarga una sola vez el modelo de voz (unos 250 MB); después empieza al momento.
- Copia la transcripción o descárgala como archivo de texto junto con los subtítulos SRT.
Preguntas frecuentes
- ¿Es preciso?
- Usa Whisper small (OpenAI, Apache 2.0). En audiolibros leídos en español (Multilingual LibriSpeech) acertó alrededor del 94 % de las palabras en nuestras pruebas, es decir, una de cada diecisiete salió mal. El ruido, los acentos muy marcados, la gente que se pisa al hablar, la jerga y los nombres poco comunes traen más errores.
- ¿Pone signos de puntuación?
- Sí. Whisper escribe él mismo mayúsculas, puntos y comas. Aun así, las líneas empiezan en las pausas de quien habla, y los subtítulos se cortan en los mismos puntos.
- ¿Por qué la descarga es tan grande?
- Porque un modelo más pequeño no bastaba: Whisper base, que sirve para el inglés, cometió casi el doble de errores con las mismas grabaciones en español. Los unos 250 MB se descargan una vez y se quedan en el navegador.
- ¿Distingue quién habla?
- Marca «Separar a los hablantes» y cada línea empezará por Hablante 1, Hablante 2, etc. La grabación se lee entonces una segunda vez con dos modelos más, que escuchan las voces y no las palabras: la primera vez se descargan 34 MB más y la espera se duplica más o menos. Números en lugar de nombres, porque nada en la grabación dice quién es quién. Dos voces bien grabadas salen bien; un solo micrófono en una sala, voces parecidas y largos ratos hablando a la vez son sus puntos débiles.
- ¿Se sube mi grabación?
- No. El reconocimiento se hace en esta página, en tu propio dispositivo, así que sirve para reuniones, entrevistas y cualquier cosa que no deba salir de él. Una vez descargado el modelo, funciona también sin conexión.
- ¿Cuánto tarda?
- En un ordenador, más o menos la mitad de lo que dura la grabación: media hora para una hora. Los móviles son más lentos y con una grabación larga pueden quedarse sin memoria; córtala antes en partes.
- ¿Qué idiomas admite?
- Nueve: español, inglés, alemán, francés, portugués, italiano, coreano, turco y japonés. Elige el idioma de la grabación: se le dice al modelo en vez de dejar que lo adivine, para que una grabación en español no salga traducida.
Para un uso concreto
Herramientas relacionadas
❝ Grabación de reunión a acta Quién lo dijo, cuándo lo dijo, y los apartados listos para lo que decidáis que significa. ▭ Agregar subtítulos a un vídeo Un archivo SRT incrustado en la imagen, para que las palabras se vean en cualquier pantalla. ≋ Quitar ruido de fondo Ventiladores, siseo y zumbidos quitados de debajo de la voz. ♪ Vídeo a MP3 El sonido de tu vídeo como MP3, hecho en tu dispositivo.