Nouplo

Transcrire un audio en texte

Vos enregistrements et vidéos en français, transcrits et sous-titrés sans que le son quitte votre appareil.

Déposez vos fichiers ici

ou cliquez pour les choisir sur votre appareilFormats acceptés : MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

Jusqu'à 3 fichiers par opérationJusqu'à 20 Mo par fichier10 opérations par jourSupprimer les limites avec Pro✓ Fonctionne hors ligne

Vos fichiers restent sur votre appareil

Cet outil fonctionne entièrement dans votre navigateur. Rien n'est envoyé, rien n'est stocké, et vous pouvez même couper votre connexion internet avant de commencer.

Comment ça marche

  1. Ajoutez un fichier audio ou vidéo : MP3, M4A, WAV, MP4, OPUS et presque tout ce qu’un navigateur sait lire.
  2. La langue est réglée sur le français. Cochez « Mettre l’heure au début de chaque ligne » si vous voulez des repères de temps dans la transcription.
  3. Si plusieurs personnes parlent, cochez « Séparer les intervenants » ; chaque ligne commence alors par Intervenant 1, Intervenant 2, etc.
  4. Cliquez sur Transcrire. La première fois, le modèle de parole (environ 250 Mo) se télécharge une fois ; ensuite il démarre aussitôt.
  5. Copiez la transcription, ou téléchargez-la en fichier texte avec les sous-titres SRT.

Questions fréquentes

Est-ce précis ?
Il utilise Whisper small (OpenAI, Apache 2.0). Sur des livres audio lus en français (Multilingual LibriSpeech), environ un mot sur six était faux dans nos essais – des enregistrements anciens et une langue littéraire, plus difficiles qu’une réunion bien captée. Le bruit, les accents marqués, les gens qui se coupent la parole, le jargon et les noms rares ajoutent des erreurs.
Y a-t-il de la ponctuation ?
Oui. Whisper met lui-même les majuscules, les points et les virgules. Les lignes commencent tout de même aux pauses de l’orateur, et les sous-titres sont coupés aux mêmes endroits.
Pourquoi le téléchargement est-il si gros ?
Parce qu’un modèle plus petit ne suffisait pas pour le français : Whisper base, qui convient à l’anglais, faisait nettement plus d’erreurs sur les mêmes enregistrements. Les quelque 250 Mo se chargent une fois et restent ensuite dans le navigateur.
Sait-il qui parle ?
Cochez « Séparer les intervenants » : chaque ligne commence par Intervenant 1, Intervenant 2, etc. L’enregistrement est alors relu une seconde fois par deux autres modèles, qui écoutent les voix et non les mots – 34 Mo de plus la première fois, et l’attente double à peu près. Des numéros plutôt que des noms, parce que rien dans l’enregistrement ne dit qui est qui. Deux voix bien enregistrées sortent justes ; un seul micro dans une salle, des voix proches et de longs passages où l’on parle en même temps sont ses points faibles.
Mon enregistrement est-il envoyé ?
Non. La reconnaissance tourne dans cette page, sur votre appareil, ce qui la rend adaptée aux réunions, aux entretiens et à tout ce qui ne doit pas en sortir. Une fois le modèle téléchargé, elle fonctionne aussi hors ligne.
Combien de temps faut-il ?
Sur un ordinateur, environ la moitié de la durée de l’enregistrement : une demi-heure pour une heure. Les téléphones sont plus lents et peuvent manquer de mémoire sur un long enregistrement ; coupez-le d’abord en morceaux.
Quelles langues ?
Neuf : français, anglais, allemand, espagnol, portugais, italien, coréen, turc et japonais. Choisissez la langue de l’enregistrement – elle est indiquée au modèle, pas devinée, pour qu’un enregistrement français ne ressorte pas traduit.

Pour un usage précis

Outils associés