Nouplo

英語の文字起こし

英語の音声を、句読点付きのテキストと字幕に。端末の中だけで。

ここにファイルをドロップ

またはクリックして端末から選択対応形式: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

1回あたり3ファイルまで1ファイル20 MBまで1日10回までProで制限を解除✓ オフラインでも利用可能

ファイルは端末の外に出ません

このツールはブラウザ内だけで動作します。アップロードも保存も行わないため、処理を始める前にインターネット接続を切っても問題ありません。

使い方

  1. 音声または動画ファイルを追加します。MP3・M4A・WAV・MP4など、ブラウザで再生できるものに対応しています。
  2. 文字起こしに時刻を入れたい場合は「行の頭に時刻を付ける」をオンにします。
  3. インタビューや会議のように複数の人が話す録音では「話者を分ける」にチェックを入れます。各行の頭に話者1・話者2…が付きます。
  4. 「文字起こし」を押します。初回だけ音声認識モデル(約78MB)をダウンロードし、2回目からはすぐに始まります。
  5. テキストをコピーするか、SRT字幕と一緒にファイルとして保存します。

よくある質問

精度はどのくらいですか?
Whisper base(OpenAI、Apache 2.0)を使っています。はっきり読み上げた英語(LibriSpeechのテストセット)では、単語の誤りは約5%でした。なまり、雑音、話し声の重なり、専門用語があると誤りが増えます。雑音の多い録音は、先に「音声ノイズ除去」を試してください。
句読点は入りますか?
入ります。Whisperが大文字、カンマ、ピリオドを自分で書きます。文字起こしは話の区切りごとに1行になり、字幕も同じ位置で区切ります。
誰が話したかを分けられますか?
「話者を分ける」にチェックを入れると、各行の頭に話者1・話者2…が付きます。このとき、声の変わり目を見つけるモデルと、話し声のひと区切りを声の特徴を表す数値に変えるモデルの2つで、録音をもう一度読み直します。そのため初回はさらに約34MBのダウンロードが必要で、処理時間もおよそ2倍になります。名前ではなく番号なのは、録音自体には誰なのかという手がかりがないためです。あとから「話者1」を名前に置き換えるのは一瞬です。1人ずつ別のマイクで録った音声はきれいに分かれますが、会議室に1本だけ置いたマイク、声質の似た人どうし、長く重なって話す場面では間違えます。
録音はアップロードされますか?
いいえ。認識はこのページの中、端末の上で行うので、外に出したくない会議やインタビューにも使えます。モデルのダウンロード後はオフラインでも使えます。
どのくらい時間がかかりますか?
パソコンでは録音の長さの4分の1〜半分くらいです。スマートフォンは遅く、長い録音はメモリが足りなくなることがあるので、分けてから使ってください。
日本語も書き起こせますか?
できます。言語を「日本語」に切り替えるか、「音声文字起こし」を使ってください。日本語は日本語専用のモデル(ReazonSpeech)で読み取ります。

用途別ページ

関連ツール