Nouplo

音声を文字起こしする

日本語の録音や動画を、テキストとSRT字幕に。音声は端末の外に出ません。

ここにファイルをドロップ

またはクリックして端末から選択対応形式: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

1回あたり3ファイルまで1ファイル20 MBまで1日10回までProで制限を解除✓ オフラインでも利用可能

ファイルは端末の外に出ません

このツールはブラウザ内だけで動作します。アップロードも保存も行わないため、処理を始める前にインターネット接続を切っても問題ありません。

使い方

  1. 音声か動画のファイルを追加します(MP3・M4A・WAV・MP4など)。
  2. 行の頭に時刻を付けたい場合は「行の頭に時刻を付ける」にチェックを入れます。
  3. 複数の人が話している録音なら「話者を分ける」にチェックを入れます。各行の頭に話者1・話者2…が付きます。
  4. 「文字起こし」を押します。初回だけ音声認識モデル(約160MB)をダウンロードし、2回目からはすぐに始まります。
  5. 書き起こしをコピーするか、テキストファイルとSRT字幕をダウンロードします。

よくある質問

精度はどのくらいですか?
音声認識には ReazonSpeech(Reazon Research、Apache 2.0)の日本語モデルを使っています。私たちのテストでは、文字の誤りは朗読音声で約6%、テレビ放送の音声で約4%でした(「私/わたし」のような表記の違いも誤りに数えています)。はっきり話された音声ほど正確で、雑音の多い録音、何人かが同時に話す場面、専門用語や珍しい固有名詞では誤りが増えます。
句読点は入りますか?
入りません。このモデルは句読点を出力しないため、話し手が間を取ったところで改行し、読みやすくしています。字幕(SRT)も同じ区切りで作ります。
誰が話したかを分けられますか?
「話者を分ける」にチェックを入れると、各行の頭に話者1・話者2…が付きます。このとき、声の変わり目を見つけるモデルと、話し声のひと区切りを声の特徴を表す数値に変えるモデルの2つで、録音をもう一度読み直します。そのため初回はさらに約34MBのダウンロードが必要で、処理時間もおよそ2倍になります。名前ではなく番号なのは、録音自体には誰なのかという手がかりがないためです。あとから「話者1」を名前に置き換えるのは一瞬です。1人ずつ別のマイクで録った音声はきれいに分かれますが、会議室に1本だけ置いたマイク、声質の似た人どうし、長く重なって話す場面では間違えます。
録音はアップロードされますか?
いいえ。音声認識はこのページの中、お使いの端末の上で動きます。会議やインタビュー、面談の録音など、外に出したくない音声にも使えます。モデルのダウンロード後は、オフラインでも動きます。
どのくらい時間がかかりますか?
パソコンなら、録音の長さの1割ほどが目安です(1時間の録音で数分)。スマートフォンではそれより時間がかかり、長い録音ではメモリが足りなくなることがあります。その場合は音声を短く切ってから書き起こしてください。
英語にも対応していますか?
英語は、言語を「英語」に切り替えるか「英語の文字起こし」で書き起こせます(英語はWhisperという別のモデルで読み取ります)。ドイツ語・フランス語・スペイン語・ポルトガル語・イタリア語・韓国語・トルコ語も、言語を切り替えれば書き起こせます(こちらは初回に約250 MBのモデルを読み込みます)。

用途別ページ

関連ツール