Nouplo

Trascrivere audio in testo

Registrazioni e video in italiano in testo e sottotitoli, senza che l’audio lasci il tuo dispositivo.

Trascina qui i file

oppure clicca per sceglierli dal tuo dispositivoFormati accettati: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

Fino a 3 file per operazioneFino a 20 MB per file10 operazioni al giornoRimuovi i limiti con Pro✓ Funziona offline

I tuoi file restano sul tuo dispositivo

Questo strumento viene eseguito interamente nel tuo browser. Nulla viene caricato, nulla viene salvato, e puoi persino disattivare la connessione a internet prima di iniziare.

Come funziona

  1. Aggiungi un file audio o video: MP3, M4A, WAV, MP4, OPUS e quasi tutto ciò che un browser sa riprodurre.
  2. La lingua è già l’italiano. Spunta «Mettere l’orario all’inizio di ogni riga» se vuoi i tempi nella trascrizione.
  3. Se parla più di una persona, spunta «Distinguere gli interlocutori»; ogni riga comincia allora con Interlocutore 1, Interlocutore 2 e così via.
  4. Premi Trascrivi. La prima volta il modello vocale (circa 250 MB) si scarica una volta sola; poi parte subito.
  5. Copia la trascrizione o scaricala come file di testo insieme ai sottotitoli SRT.

Domande frequenti

Quanto è preciso?
Usa Whisper small (OpenAI, Apache 2.0). Su audiolibri di italiano letterario (Multilingual LibriSpeech, Dante compreso) circa una parola su cinque è uscita sbagliata nelle nostre prove; sull’italiano moderno letto (FLEURS) il risultato pubblicato del modello è di circa una su dieci. Rumore, accenti marcati, persone che si parlano sopra, gergo e nomi rari portano altri errori.
Mette la punteggiatura?
Sì. Whisper scrive da sé maiuscole, punti e virgole. Le righe cominciano comunque alle pause di chi parla, e i sottotitoli sono tagliati negli stessi punti.
Perché il download è così grande?
Perché un modello più piccolo non bastava per l’italiano: Whisper base, che per l’inglese va bene, sbagliava molto di più sulle stesse registrazioni. I circa 250 MB si scaricano una volta e restano nel browser.
Riconosce chi parla?
Spunta «Distinguere gli interlocutori» e ogni riga comincia con Interlocutore 1, Interlocutore 2 e così via. La registrazione viene letta una seconda volta da altri due modelli, che ascoltano le voci e non le parole: la prima volta sono 34 MB in più, e l’attesa quasi raddoppia. Numeri invece di nomi, perché niente nella registrazione dice chi è chi. Due voci registrate bene escono giuste; un solo microfono in una sala, voci simili e lunghi tratti in cui si parla insieme sono i punti deboli.
La mia registrazione viene caricata?
No. Il riconoscimento avviene in questa pagina, sul tuo dispositivo, quindi va bene per riunioni, interviste e tutto ciò che non deve uscirne. Una volta scaricato il modello, funziona anche offline.
Quanto ci mette?
Su un computer, più o meno la metà della durata della registrazione: mezz’ora per un’ora. I telefoni sono più lenti e con una registrazione lunga possono esaurire la memoria; dividila prima in parti.
Quali lingue?
Nove: italiano, inglese, tedesco, francese, spagnolo, portoghese, coreano, turco e giapponese. Scegli la lingua della registrazione: viene detta al modello invece di lasciargliela indovinare, perché una registrazione italiana non esca tradotta.

Per un uso specifico

Strumenti correlati