Nouplo

動画の字幕自動作成

話した言葉を認識し、時間を付けて字幕ファイルに。

ここにファイルをドロップ

またはクリックして端末から選択対応形式: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV

1回あたり3ファイルまで1ファイル20 MBまで1日10回までProで制限を解除✓ オフラインでも利用可能

ファイルは端末の外に出ません

このツールはブラウザ内だけで動作します。アップロードも保存も行わないため、処理を始める前にインターネット接続を切っても問題ありません。

使い方

  1. 動画や音声を追加します。読み取るのは音声だけで、映像には手を加えません。
  2. 話されている言語(日本語・英語など9言語から)と、必要な字幕の形式を選びます。
  3. 複数の人が話す場合は「話者を分ける」にチェックを入れます。各字幕の頭に話者の番号が付きます。
  4. 認識モデルが一度だけダウンロードされ、そのあと解析が始まります。長い動画は時間がかかります。
  5. SRTをダウンロードし、編集ソフトやプレーヤーに読み込ませるか、「動画に字幕を焼き込む」に渡します。

よくある質問

表示のタイミングはどこから決まりますか。
話し声そのものからです。録音を無音のところで区切り、その一区切りずつを認識して、その区間の開始と終了をそのまま字幕の時間にしています。だから一定の間隔ではなく、話したときに出ます。
SRTとWebVTTのどちらを選べばよいですか。
動画編集ソフト、プレーヤー、投稿フォームならSRTです。WebVTTはブラウザの字幕トラックがそのまま読める形式なので、自分のWebページに載せる動画ならこちらです。
精度はどのくらいですか。
1人がはっきり話している音声なら実用になります。複数人の重なり、大きな雑音、固有名詞は苦手なので、公開前に一度目を通してください。ただのテキストファイルなので、どのエディタでも直せます。
字幕に話者を出せますか。
「話者を分ける」にチェックを入れると、各字幕の頭に話者1・話者2…が付きます。このとき、声の変わり目を見つけるモデルと、話し声のひと区切りを声の特徴を表す数値に変えるモデルの2つで、録音をもう一度読み直します。そのため初回はさらに約34MBのダウンロードが必要で、処理時間もおよそ2倍になります。名前ではなく番号なのは、録音自体には誰なのかという手がかりがないためです。あとから「話者1」を名前に置き換えるのは一瞬です。1人ずつ別のマイクで録った音声はきれいに分かれますが、会議室に1本だけ置いたマイク、声質の似た人どうし、長く重なって話す場面では間違えます。
動画はアップロードされますか。
されません。モデルがブラウザに配信され、認識もブラウザの中で行われます。動画は端末から出ません。

用途別ページ

関連ツール