英語の文字起こし
英語の音声を、句読点付きのテキストと字幕に。端末の中だけで。
ここにファイルをドロップ
またはクリックして端末から選択対応形式: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
1回あたり3ファイルまで1ファイル20 MBまで1日10回までProで制限を解除✓ オフラインでも利用可能
ファイルは端末の外に出ません
このツールはブラウザ内だけで動作します。アップロードも保存も行わないため、処理を始める前にインターネット接続を切っても問題ありません。
使い方
- 音声または動画ファイルを追加します。MP3・M4A・WAV・MP4など、ブラウザで再生できるものに対応しています。
- 文字起こしに時刻を入れたい場合は「行の頭に時刻を付ける」をオンにします。
- インタビューや会議のように複数の人が話す録音では「話者を分ける」にチェックを入れます。各行の頭に話者1・話者2…が付きます。
- 「文字起こし」を押します。初回だけ音声認識モデル(約78MB)をダウンロードし、2回目からはすぐに始まります。
- テキストをコピーするか、SRT字幕と一緒にファイルとして保存します。
よくある質問
- 精度はどのくらいですか?
- Whisper base(OpenAI、Apache 2.0)を使っています。はっきり読み上げた英語(LibriSpeechのテストセット)では、単語の誤りは約5%でした。なまり、雑音、話し声の重なり、専門用語があると誤りが増えます。雑音の多い録音は、先に「音声ノイズ除去」を試してください。
- 句読点は入りますか?
- 入ります。Whisperが大文字、カンマ、ピリオドを自分で書きます。文字起こしは話の区切りごとに1行になり、字幕も同じ位置で区切ります。
- 誰が話したかを分けられますか?
- 「話者を分ける」にチェックを入れると、各行の頭に話者1・話者2…が付きます。このとき、声の変わり目を見つけるモデルと、話し声のひと区切りを声の特徴を表す数値に変えるモデルの2つで、録音をもう一度読み直します。そのため初回はさらに約34MBのダウンロードが必要で、処理時間もおよそ2倍になります。名前ではなく番号なのは、録音自体には誰なのかという手がかりがないためです。あとから「話者1」を名前に置き換えるのは一瞬です。1人ずつ別のマイクで録った音声はきれいに分かれますが、会議室に1本だけ置いたマイク、声質の似た人どうし、長く重なって話す場面では間違えます。
- 録音はアップロードされますか?
- いいえ。認識はこのページの中、端末の上で行うので、外に出したくない会議やインタビューにも使えます。モデルのダウンロード後はオフラインでも使えます。
- どのくらい時間がかかりますか?
- パソコンでは録音の長さの4分の1〜半分くらいです。スマートフォンは遅く、長い録音はメモリが足りなくなることがあるので、分けてから使ってください。
- 日本語も書き起こせますか?
- できます。言語を「日本語」に切り替えるか、「音声文字起こし」を使ってください。日本語は日本語専用のモデル(ReazonSpeech)で読み取ります。