Trascrivere audio in testo
Registrazioni e video in italiano in testo e sottotitoli, senza che l’audio lasci il tuo dispositivo.
Trascina qui i file
oppure clicca per sceglierli dal tuo dispositivoFormati accettati: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
Fino a 3 file per operazioneFino a 20 MB per file10 operazioni al giornoRimuovi i limiti con Pro✓ Funziona offline
I tuoi file restano sul tuo dispositivo
Questo strumento viene eseguito interamente nel tuo browser. Nulla viene caricato, nulla viene salvato, e puoi persino disattivare la connessione a internet prima di iniziare.
Come funziona
- Aggiungi un file audio o video: MP3, M4A, WAV, MP4, OPUS e quasi tutto ciò che un browser sa riprodurre.
- La lingua è già l’italiano. Spunta «Mettere l’orario all’inizio di ogni riga» se vuoi i tempi nella trascrizione.
- Se parla più di una persona, spunta «Distinguere gli interlocutori»; ogni riga comincia allora con Interlocutore 1, Interlocutore 2 e così via.
- Premi Trascrivi. La prima volta il modello vocale (circa 250 MB) si scarica una volta sola; poi parte subito.
- Copia la trascrizione o scaricala come file di testo insieme ai sottotitoli SRT.
Domande frequenti
- Quanto è preciso?
- Usa Whisper small (OpenAI, Apache 2.0). Su audiolibri di italiano letterario (Multilingual LibriSpeech, Dante compreso) circa una parola su cinque è uscita sbagliata nelle nostre prove; sull’italiano moderno letto (FLEURS) il risultato pubblicato del modello è di circa una su dieci. Rumore, accenti marcati, persone che si parlano sopra, gergo e nomi rari portano altri errori.
- Mette la punteggiatura?
- Sì. Whisper scrive da sé maiuscole, punti e virgole. Le righe cominciano comunque alle pause di chi parla, e i sottotitoli sono tagliati negli stessi punti.
- Perché il download è così grande?
- Perché un modello più piccolo non bastava per l’italiano: Whisper base, che per l’inglese va bene, sbagliava molto di più sulle stesse registrazioni. I circa 250 MB si scaricano una volta e restano nel browser.
- Riconosce chi parla?
- Spunta «Distinguere gli interlocutori» e ogni riga comincia con Interlocutore 1, Interlocutore 2 e così via. La registrazione viene letta una seconda volta da altri due modelli, che ascoltano le voci e non le parole: la prima volta sono 34 MB in più, e l’attesa quasi raddoppia. Numeri invece di nomi, perché niente nella registrazione dice chi è chi. Due voci registrate bene escono giuste; un solo microfono in una sala, voci simili e lunghi tratti in cui si parla insieme sono i punti deboli.
- La mia registrazione viene caricata?
- No. Il riconoscimento avviene in questa pagina, sul tuo dispositivo, quindi va bene per riunioni, interviste e tutto ciò che non deve uscirne. Una volta scaricato il modello, funziona anche offline.
- Quanto ci mette?
- Su un computer, più o meno la metà della durata della registrazione: mezz’ora per un’ora. I telefoni sono più lenti e con una registrazione lunga possono esaurire la memoria; dividila prima in parti.
- Quali lingue?
- Nove: italiano, inglese, tedesco, francese, spagnolo, portoghese, coreano, turco e giapponese. Scegli la lingua della registrazione: viene detta al modello invece di lasciargliela indovinare, perché una registrazione italiana non esca tradotta.
Per un uso specifico
Strumenti correlati
❝ Registrazione di riunione in verbale Chi l’ha detto, quando, e le voci pronte per ciò che deciderete che significa. ▭ Aggiungere sottotitoli a un video Un file SRT impresso nell’immagine, così le parole si vedono su ogni schermo. ≋ Rimuovere il rumore di fondo Ventilatori, fruscio e ronzio tolti da sotto la voce. ♪ Video in MP3 L’audio del tuo video come MP3, creato sul tuo dispositivo.