音声を文字起こしする
日本語の録音や動画を、テキストとSRT字幕に。音声は端末の外に出ません。
ここにファイルをドロップ
またはクリックして端末から選択対応形式: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
1回あたり3ファイルまで1ファイル20 MBまで1日10回までProで制限を解除✓ オフラインでも利用可能
ファイルは端末の外に出ません
このツールはブラウザ内だけで動作します。アップロードも保存も行わないため、処理を始める前にインターネット接続を切っても問題ありません。
使い方
- 音声か動画のファイルを追加します(MP3・M4A・WAV・MP4など)。
- 行の頭に時刻を付けたい場合は「行の頭に時刻を付ける」にチェックを入れます。
- 複数の人が話している録音なら「話者を分ける」にチェックを入れます。各行の頭に話者1・話者2…が付きます。
- 「文字起こし」を押します。初回だけ音声認識モデル(約160MB)をダウンロードし、2回目からはすぐに始まります。
- 書き起こしをコピーするか、テキストファイルとSRT字幕をダウンロードします。
よくある質問
- 精度はどのくらいですか?
- 音声認識には ReazonSpeech(Reazon Research、Apache 2.0)の日本語モデルを使っています。私たちのテストでは、文字の誤りは朗読音声で約6%、テレビ放送の音声で約4%でした(「私/わたし」のような表記の違いも誤りに数えています)。はっきり話された音声ほど正確で、雑音の多い録音、何人かが同時に話す場面、専門用語や珍しい固有名詞では誤りが増えます。
- 句読点は入りますか?
- 入りません。このモデルは句読点を出力しないため、話し手が間を取ったところで改行し、読みやすくしています。字幕(SRT)も同じ区切りで作ります。
- 誰が話したかを分けられますか?
- 「話者を分ける」にチェックを入れると、各行の頭に話者1・話者2…が付きます。このとき、声の変わり目を見つけるモデルと、話し声のひと区切りを声の特徴を表す数値に変えるモデルの2つで、録音をもう一度読み直します。そのため初回はさらに約34MBのダウンロードが必要で、処理時間もおよそ2倍になります。名前ではなく番号なのは、録音自体には誰なのかという手がかりがないためです。あとから「話者1」を名前に置き換えるのは一瞬です。1人ずつ別のマイクで録った音声はきれいに分かれますが、会議室に1本だけ置いたマイク、声質の似た人どうし、長く重なって話す場面では間違えます。
- 録音はアップロードされますか?
- いいえ。音声認識はこのページの中、お使いの端末の上で動きます。会議やインタビュー、面談の録音など、外に出したくない音声にも使えます。モデルのダウンロード後は、オフラインでも動きます。
- どのくらい時間がかかりますか?
- パソコンなら、録音の長さの1割ほどが目安です(1時間の録音で数分)。スマートフォンではそれより時間がかかり、長い録音ではメモリが足りなくなることがあります。その場合は音声を短く切ってから書き起こしてください。
- 英語にも対応していますか?
- 英語は、言語を「英語」に切り替えるか「英語の文字起こし」で書き起こせます(英語はWhisperという別のモデルで読み取ります)。ドイツ語・フランス語・スペイン語・ポルトガル語・イタリア語・韓国語・トルコ語も、言語を切り替えれば書き起こせます(こちらは初回に約250 MBのモデルを読み込みます)。