ビデオから SRT 字幕を作成する方法
著者: Hushscript 公開日: 最終確認日:
SRT ファイルは、プレーヤーが画像と一緒に読み込む小さなサイドカー テキストファイルとして、字幕がビデオとは別に送信される方法です。音声を文字起こしし、結果をタイムスタンプ付きでエクスポートすることで作成します。以前は午後をかけてフレームに合わせて各行のタイミングを計る作業が、今では完了しています。残っているのは、読みやすくするための短い編集パスです。このガイドでは、形式に実際に含まれるもの、ビデオから実際の順序で SRT を作成する方法、キャプションが読みやすくなるように SRT をクリーンアップする方法について説明します。
始める前に必要なもの
ビデオファイルと数分が必要です。 MP4、MOV、MKV、WebM、AVI などの一般的なコンテナが機能します。 SRT を作成するために編集ソフトウェアは必要ありません。また、最初にビデオを変換する必要もありません。字幕エディタはオプションであり、後でタイミングを微調整するときにタイムラインビューが必要な場合にのみ役立ちます。
文字起こしそのものについてはサインアップすると、30 分間の無料試用が可能になります。最初にレンダリングされる 30 秒のプレビューにはアカウントが必要ないため、何かをコミットする前に品質を確認できます。
SRT ファイルとは
SRT は SubRip Text の略です。形式は意図的に単純になっています。番号付きのブロックのシーケンスであり、各ブロックは 3 つの部分で構成され、別々の行に積み重ねられています。最初にインデックス番号、次にstart --> endタイムスタンプ、その後 1 行または 2 行の字幕テキスト。空白行はブロックと次のブロックを区切ります。
1
00:00:02,340 --> 00:00:05,810
音声はブラウザで抽出されます。
2
00:00:06,100 --> 00:00:09,440
音声のみがサーバーに到達し、ビデオには到達しません。
ファイルを読み取ったり手動で編集したりする場合は、いくつかの詳細が重要です。タイムスタンプの形式は、HH:MM:SS,mmm(時間からミリ秒まで) で、ミリ秒の前の区切り文字はピリオドではなくカンマです。 2 つの時刻の間の矢印は、正確に 2 つのハイフンと不等号です。インデックス番号は、隙間なく 1 から順に実行する必要があります。これらのいずれかを間違えると、一部のプレーヤーが影響を受けたキューを黙ってドロップしてしまいます。これが、手動で編集した SRT が途中で「動作しなくなる」最も一般的な理由です。
SRT のサポートは、デスクトッププレーヤー、エディター、ホスティングプラットフォームにわたって幅広く行われていますが、普遍的ではありません。 米国議会図書館の形式の説明では、SRT を番号付きの時間指定されたテキストキューの単純なシーケンスとして文書化しています。どのキャプション形式をインポートするかは、各宛先によって決定されます。ネイティブ HTML<track>要素は、WHATWG リビングスタンダードで定義されているように、時間指定テキストに WebVTT を使用します。これについては、後で説明するクイック変換について説明します。
実際の順序でビデオから SRT を作成する
流れには3つの段階があり、順序は人々が後ろに進む部分です。まずファイルをドロップし、アカウントが存在する前にプレビューします。
- ビデオをドロップすると、無料プレビューが表示されます。/video-to-text に移動するか、ファイルが MP4 の場合は /MP4-to-text に移動し、ビデオをアップロード領域にドロップします。オーディオトラックは、ローカル処理ライブラリを使用してブラウザで抽出され、最初の 30 秒が話者のラベル付きプレビューとして返されます。この手順にはアカウントは必要ありません。また、ビデオ自体がデバイスから離れることはありません。
- **サインアップして残りを文字に起こしてください。**プレビューが正しく表示されたら、ファイル全体を実行するためのアカウントを作成します。サインアップすると、30 分間無料でお試しいただけます。それらを取得する最も簡単な方法は、1 ドルの保留でカードを認証し、承認されてすぐに解放され、請求されることはありません。お住まいの国で利用可能な別の支払い方法を使用したい場合は、最初の購入時に 30 分がかかります。どちらの方法でもカードは必要ありません。文字起こしは最上位の AI で実行されるため有料であり、サブスクリプションなしの従量課金制です。無料分を超える長い動画については、料金ページをご覧ください。ファイルごとではなく、音声の 1 分ごとに料金が発生します。
- **トランスクリプトを取得して SRT をエクスポートします。**トランスクリプトの準備ができたら、エディタで開き、修正を加えてから、エクスポートをクリックして SRT を選択します。話された各発話は、開始タイムスタンプと終了タイムスタンプがすでに設定されている 1 つのキューになります。ダウンロードは、ウォーターマークのないプレーンな
.srtファイルです。
エクスポートする前に、話者ラベルがエディターに表示されます。インタビュー、討論、パネルディスカッションに役立つようにキャプションに名前を含める場合は、まず「話者 1」と「話者 2」の名前を実際の名前に変更します。エクスポートでは、一致するキューの先頭にそれらの名前が書き込まれます。
実際の例
2 人の人物との 12 分間の録音インタビューfounder-chat.mp4があるとします。ページにドロップすると、30 秒間のプレビューで両方の音声がきれいに拾われていることが確認され、サインアップします。完全なトランスクリプトの準備ができたら、2 人の話者の名前を「Maya」と「Devin」に変更し、聞き間違えた 1 つの製品名を修正して、SRT としてエクスポートします。ファイルの冒頭部分は次のようになります。
1
00:00:01,120 --> 00:00:04,460
マヤ: 今日はお時間を割いていただきありがとうございます。
2
00:00:04,800 --> 00:00:08,210
デビン: もちろんです。とても楽しみにしていました。
3
00:00:08,540 --> 00:00:12,900
マヤ: まずは始めましょう。このアイデアはどのようにして生まれたのですか?
注目に値することが 2 つあります。各キューは 1 つの自然な発話にマッピングされるため、タイミングは固定された時計ではなく会話に従います。そして、キュー間のギャップ (ここでは数百ミリ秒) は、話者間の実際の休止状態を反映しています。通常、これはまさに希望通りの内容ですが、次の 1 つの注意点について説明します。
タイミングと行の長さを編集する
ほとんどのエクスポートはそのまま使用できますが、2 つの簡単なチェックを行うと、キャプションが著しく読みやすくなります。この短いパスは、自動生成されたキャプションとプロフェッショナルなキャプションを分けるものです。
行の長さと行数スタイルガイドはさまざまで、SRT 形式自体は普遍的な行の長さや行数を強制するものではありません。長いキューでもテキストの壁になる可能性があります。宛先に現在のルールがある場合は、それに従います。それ以外の場合は、各キューをコンパクトに保ち、自然なフレーズ境界で分割し、最終的なフレームサイズで結果を確認します。
**読み取り速度。**画面上の長さは、キューが表示される長さと一致する必要があります。キューに非常に短時間に大量のテキストが表示される場合は、自然な一時停止で分割するか、後の音声をカバーせずにタイミングを変更します。テキストファイルだけからタイミングを判断するのではなく、通常の再生速度でキャプションをプレビューします。
**タイミングのギャップと重なり。**2 つのキュー間のギャップが約 80 ミリ秒未満であると、一部のプレーヤーが前の行を長く保持しすぎたり、次の行をスキップしたりする可能性があるため、連続するキューの間には少し息を入れておきます。逆の問題はオーバーラップです。2 人がお互いに話すとき、エンジンは各話者に個別のキューを割り当て、それらのキューが時間の経過とともに衝突する可能性があります。真のオーバーラップを完全に解決できる自動ツールはありません。そのため、会話の多い映像の場合は、オーバーラップしているタイムスタンプをスキャンし、手動で 1 つのキューを前後に微調整します。
形式は人間が判読できるため、これらすべてをプレーンテキストエディターで行うことができます。視覚的に作業したい場合は、Windows の Subtitle Edit や任意のプラットフォームの Aegisub などの専用の字幕エディタで波形タイムラインを追加し、一般的な間隔や読み上げ速度の問題を一括で自動修正できます。
SRT と VTT: どちらをエクスポートするか
2 つの形式は似ており、正しい選択はキャプションをどこで再生するかによって決まります。コミットする前に完全な比較が必要な場合は、SRT と VTT: どの字幕形式を使用するかで、各形式の長所を分析します。
デスクトッププレーヤー、ビデオエディタ、および人々が必要としているほとんどのホスティングプラットフォームには SRT をご利用ください。 HTML5<video>要素を使用してカスタム Web ページにキャプションが表示される場合は、WebVTT を使用します。これは、ブラウザが<track>要素に対してネイティブに読み取る唯一の形式であるためです。内容は両者で同一です。 VTT はファイルの先頭にWEBVTT行を追加し、各タイムスタンプのミリ秒の前にカンマの代わりにピリオドを使用します。
違いが非常に小さいため、切り替えるために再転記する必要はありません。 SRT をエクスポートし、後で VTT が必要になった場合は、/tools/SRT-to-VTT にある無料のコンバータを通じて SRT を実行します。アカウントがなくてもブラウザで動作し、何もアップロードされません。
プレーヤー、エディタ、またはプラットフォームに SRT を追加します
ファイルを取得したら、そのファイルを添付する方法は、ビデオが保存されている場所によって異なります。
**デスクトッププレーヤー。**VLC、mpv、およびほとんどのデスクトッププレーヤーは、ビデオのベース名とフォルダーを共有するときにサイドカー SRT を自動的に読み込みます。interview.mp4がinterview.srtとペアになるようにファイルの名前を変更し、同じディレクトリにドロップすると、再生時にキャプションが表示されます。プレーヤーがそれを見逃した場合、その字幕メニューには手動の「字幕ファイルの読み込み」オプションがあります。
ビデオエディタDaVinci Resolve、Premiere Pro、または Final Cut では、SRT を字幕またはキャプショントラックとしてインポートします。エディターは各キューを正しいタイムコードでタイムラインにドロップします。そこから、フォントのスタイルを変更したり、位置を変更したり、キャプションをハードコードしたい場合は最終エクスポートに書き込むことができます。
ホスティングプラットフォームとソーシャルビデオYouTube は、字幕ワークフローで SRT を直接受け入れます。他のプラットフォームでは、サイドカー ファイルを受け入れたり、組み込みのキャプションエディターを必要としたり、ビデオにキャプションが焼き込まれることを期待したりする場合があります。レビューされた SRT を信頼できる情報源として保持し、1 つのアップロード方法がどこでも機能すると仮定するのではなく、宛先の現在の公開フローを使用します。
キャプションを埋め込む。切り替え可能なサイドカーではなく、テキストを画像の一部として永続的に必要な場合は、別のエンコード手順になります。 HandBrake は、SRT をビデオに無料で書き込むことができます。ビデオをロードし、[字幕] タブに SRT を追加し、[焼き付け] にチェックを入れて、エンコードします。別の SRT は編集可能なままですが、焼き付けられたキャプションは編集できないため、宛先がサイドカー ファイルを読み取れない場合にのみこれを実行してください。各プラットフォームでのキャプションの添付と書き込みの詳細なチュートリアルについては、ビデオに字幕を追加する方法をご覧ください。
一般的な問題とその修正方法
**キャプションは最初から同期していません。**すべての行が同じ量だけ早くなったり遅くなったりする一定のオフセットは、通常、意味します。プレーヤーは、タイミングが想定しているフレームレートとはわずかに異なるフレームレートを読み取っています。ほとんどのデスクトッププレーヤーには、トラック全体を一度にシフトする字幕遅延コントロールがあります。最初の行が着地するまで微調整し、残りの行が続きます。
**同期は時間の経過とともにさらに離れていきます。**ビデオの再生につれて増加するドリフトは、ソースとレンダリングされたコピーの間のフレームレートの不一致を示しています。これは、23.976 fps ファイルを 25 fps に変換したり、元に戻したりした後によく見られます。以前のカットではなく、実際に公開するビデオのバージョンに対して SRT を再エクスポートします。
**キャプションに話者の名前がありません。**ラベルの名前を変更したのにプラットフォームに名前が表示されない場合、そのプラットフォームはインポート時に SRT から話者のプレフィックスを削除している可能性があります。これらを強制する SRT 設定はありません。信頼できる解決策は、名前が画像の一部であるキャプションを焼き込むことです。
**英語以外のビデオが間違った言語で返されました。**Hushscriptは、約 99 の言語にわたって話し言葉を自動的に検出しますが、非常に短いクリップやノイズの多いクリップは、場合によっては誤読される可能性があります。よりクリーンなセクションを再実行するか、言語ページをチェックして、その言語がカバーされていることを確認してください。
**長いストレッチは 1 つの巨大な合図として読み取られます。**これは、誰かが明確な休憩なしで長時間話した場合に発生します。文の境界でキューを手動で分割し、1 つのブロックに読み取れるテキストが 2 行を超えることがないようにします。
少ない編集で成果を上げる精度のヒント
キャプションの品質のほとんどは、エディタを開く前に、入力した音声によって決まります。ソースの音声がきれいであれば、聞き間違いが少なく、タイムスタンプが厳密であるため、編集時間が短くなります。パス。
音声を圧縮せずに通常の会話レベルで録音またはエクスポートし、会話中の大音量の BGM をできる限り避けてください。複数の人が参加する場合、それぞれの声が適度に区別できる録音は、話者のラベルの一貫性を保つのに役立ちます。これは、キャプションに名前を含める予定がある場合に重要です。ソースがすでに公開されているビデオの場合、音声はどのようなものでも構いませんが、自分で録画する場合は、後から編集するよりもレベルとマイクの配置に数分間注意する方が、キャプションの品質に大きく役立ちます。
SRT 後: トランスクリプトの残り
SRT を作成すると、完全なトランスクリプトも得られるため、字幕に限定されません。同じセッションから、ショーノート、講演のブログバージョン、またはビデオの横に投稿されたアクセス可能なトランスクリプトとして、テキストを TXT または DOCX としてエクスポートできます。クリーンなトランスクリプトのエクスポートは、ビデオからテキストへのキャプションを付けることと同じです。 SRT は、そこから生成される形式の 1 つにすぎません。
これらのキャプションをビデオに追加し、サイドカー ファイルと焼き付けトラックのどちらかを選択する次のステップについては、ビデオに字幕を追加する方法をご覧ください。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: