動画に字幕を追加する方法
著者: Hushscript 公開日: 最終確認日:
ビデオに字幕を追加するには、1 つの作業ではなく 2 つの作業が必要です。字幕ファイルを作成し、それをビデオに添付します。すべての行を手作業でタイミングを計るのは遅いため、人々は最初の仕事を恐れます。 Hushscript はその部分を自動化します。音声から時間指定のトランスクリプトを生成し、レビューし、SRT をエクスポートし、宛先がサポートしている場所にファイルを添付します。このガイドでは、両方のジョブに加えて、その過程で決定しなければならない 1 つの実際の決定、つまり、別の字幕ファイルを作成するか、画像にトラックを焼き込むかについて説明します。
キャプションと字幕
これらの用語は同じ意味で使用されますが、実際には違いがあります。字幕は、音声は聞こえるが言語が理解できない視聴者のために会話を文字に起こします。キャプションは会話を文字起こしし、音声がまったく聞こえない視聴者のために、[音楽再生]や[ドアがバタンと閉まる]など、音声以外の音声合図を追加します。 第 508 条のキャプションガイダンスには、同等のキャプショントラックにダイアログ、話者の識別、音楽、効果音が含まれていますが、W3C のメディアアクセシビリティガイダンスでは、トランスクリプトだけが同期されたキャプションの代わりにならない理由が説明されています。
実際には、ほとんどのプラットフォームで、両方を行う単一のキャプショントラックが公開されています。それが言葉が曖昧になる理由です。目的に応じて選んでください。アクセシビリティを考慮してキャプションを付ける場合は、意味を伝える音声について括弧で囲まれた短い記述子を追加します。国際的なリーチを目指している場合や、検索エンジンが発言内容をインデックスできる程度の場合は、単純な会話の字幕で十分です。どちらの場合も開始点は同じファイルであるため、生成する前に決定する必要はありません。
開始する前に必要なもの
ソースビデオと字幕ファイルを生成する方法が必要です。すでに SRT をお持ちの場合は、その接続に関するセクションに進んでください。そうでない場合は、タイムスタンプ付きで音声を書き起こす必要があります。これについては次のセクションで説明します。字幕を個別に出荷するのではなく画像に焼き込むには、HandBrake のような無料のエンコーダや、エクスポート時にキャプショントラックをレンダリングできるビデオエディタも必要です。
必要ないものの 1 つは、文字起こしステップで手元にあるオリジナルのビデオです。 Hushscript はブラウザ内のビデオから音声を読み取るため、アップロードは音声のみであり、ビデオファイルがマシンから送信されることはありません。
音声からキャプションを生成する
字幕ファイルがまだない場合は、ビデオのオーディオトラックから作成します。手で入力したり時間を計測したりする必要はありません。
- **ビデオを /video-to-text にドロップします。**アカウントなしで、開始時の 30 秒間の話者ラベル付きプレビューがその場で表示されます。音声は最初にブラウザで抽出されるため、音声のみが送信され、ビデオはデバイスに残ります。次に進む前に、プレビューを使用して音声が正しく聞こえているかを確認してください。
- **ファイル全体にキャプションを付けるにはサインアップしてください。**プレビューを過ぎて文字起こしするには、無料のアカウントが必要です。新しいアカウントは 30 分間無料でお試しいただけます。保留額が 1 ドルのカードを認証するとすぐに解放され、請求されない場合は即座に、または別の方法で支払う場合は最初の数分間の購入ですぐに試用できます。カードは必要ありません。
- **ビデオ全体をアップロードし、SRT としてエクスポートします。**トランスクリプトの準備ができたら、SRT としてダウンロードします。各セリフは、開始タイムスタンプ、終了タイムスタンプ、およびテキストを含むキューとなり、SRT 仕様にフォーマットされ、何もする必要はありません。
エクスポートされた SRT はすぐに添付できるようになります。誰が話しているのかを確認するのに役立つインタビューまたはパネルの場合は、書き出す前にトランスクリプトエディタで話者ラベルの名前を変更すると、その名前が各キューに反映されます。
タイミングの編集方法や長い行のトリミング方法など、ファイル自体の詳細については、ビデオから SRT 字幕を作成する方法を参照してください。
A は機能しました。例
ホストとゲスト 2 人の 12 分間の録画されたディスカッションpanel-talk.mp4があり、そのキャプションを YouTube にアップロードしたいとします。それをビデオからテキストへのページにドロップします。 30 秒のプレビューでは 3 つの話者がすでに分離されているため、オーディオがきれいであることがわかります。サインアップすると、数分で完全なファイルが転写され、「話者 1」の名前をホストの名前に変更し、他の 2 つの名前をゲストの名前に変更します。エクスポートされると、SRT は次のように開きます。
1
00:00:01,200 --> 00:00:04,600
ホスト: おかえりなさい。今日は
オープンソースの資金調達について話します。
2
00:00:04,900 --> 00:00:08,150
ゲスト A: ご招待いただきありがとうございます。これは
まだ誰も実際に解決していない問題です。
そのファイルは YouTube にアップロードするものです。キュー番号、タイムスタンプ、改行がすべて適切に設定されているため、プラットフォームはそれ以上の編集を行わずにキャプションをビデオにマッピングします。
必要に応じて SRT を VTT に変換する
HTML5 Web プレーヤーは、SRT ではなく WebVTT (.vtt) を必要とします。この 2 つは近いものです。VTT はWEBVTTヘッダー行を追加し、タイムスタンプでカンマの代わりにピリオドを使用します。特定のプレーヤーまたはプラットフォームがどちらを期待しているかわからない場合は、SRT と VTT でそれぞれのタイミングを説明します。 /tools/SRT-to-VTT で、一方をもう一方に無料で変換できます。このツールはブラウザで実行され、アカウントは必要なく、何もアップロードされません。 SRT をドラッグインし、VTT をダウンロードします。
バーンイン vs サイドカー SRT
ビデオに字幕を表示するには 2 つの方法があり、これは公開する前に決定する価値があります。
サイドカー SRTは別のファイルです。プレーヤーはビデオと字幕ファイルを一緒に読み取り、再生時にキャプションをオーバーレイします。これは柔軟なオプションです。ビデオを再エンコードせずに SRT のタイプミスを修正でき、1 つのビデオに対して複数の言語を複数の SRT ファイルとして配布できます。これは、YouTube、Vimeo、およびほとんどの編集スイートで使用されるものです。
**焼き付けられた(ハードコードされた)**トラックはその逆です。テキストはビデオフレーム内に永続的にレンダリングされるため、プレーヤーの設定に関係なくすべての視聴者にテキストが表示され、これをオフにする方法はありません。これは、宛先がキャプションファイルを読み取れない場合に必要です。メッセージングアプリを通じて送信されたクリップ、キャプションサポートのない裸のビデオ埋め込み、または受信者が 1 つのビデオファイルしか受信できない場合などです。
ほとんどの用途では、サイドカー アプローチが最適です。ビデオと字幕を独立させておくことで、後でビデオに手を加えずにキャプションを修正または再エクスポートできるためです。焼き付けに手を伸ばすのは、目的地によって強制される場合、または特にオフにできないキャプションが必要な場合(ミュートで自動再生されるソーシャルクリップによくあること)です。
目的地ごとに字幕を添付します
SRT を取得したら、それを添付する方法はビデオの目的地によって異なります。
デスクトップビデオプレーヤー
SRT をビデオと同じフォルダーに置き、同じベース名を付けます。
panel-talk.MP4
panel-talk.SRT
VLC、mpv、およびほとんどのデスクトッププレーヤーは、再生時に SRT を自動的に取得します。そうでない場合は、字幕メニューを開いてファイルを手動で読み込みます。
ビデオエディタ
エディタで、SRT を字幕トラックとしてインポートします。 DaVinci Resolve ではタイムラインを経て、 字幕をインポートします。 Premiere Pro ではウィンドウ、次にキャプションとグラフィックを使用して、SRT をインポートします。どちらも各キューを正しいタイムコードにドロップし、ハードコードされた結果が必要な場合は、そこからキャプションのスタイルを変更してエクスポートに書き込むことができます。
YouTube およびその他の長編プラットフォーム
YouTube Studio でビデオを開き、[字幕] に移動し、言語の追加を選択し、言語の横にある [追加] をクリックしてからファイルをアップロードし、SRT を選択します。 YouTube はタイムコードをビデオにマッピングし、視聴者が切り替えることができるトラックとしてキャプションを表示します。独自の SRT をアップロードすると、その言語の自動生成されたキャプションが置き換えられます。これは、機械キャプションによって乱れた専門用語、名前、または訛った音声が動画に含まれている場合に行われます。
TikTok、Reels、YouTube ショート
短形式のキャプションワークフローは頻繁に変更され、互換性はありません。修正されたトランスクリプトを 1 つソースとして保持し、各宛先の現在の公開フローを確認します。あるアプリは SRT サイドカーを受け入れることができ、別のアプリは組み込みのキャプションエディター、貼り付けられたテキスト、またはすでにキャプションが焼き付けられたビデオを期待する場合があります。Hushscript はレビューされたトランスクリプトと SRT を提供しますが、宛先はそのテキストの添付方法を決定します。
HandBrake による書き込み
HandBrake は、無料のクロスプラットフォームエンコーダーで、 SRT を 1 回のパスで出力ビデオに取り込みます。
- HandBrake を開いてビデオを読み込みます。
- 字幕タブに移動し、外部 SRT の追加を選択して、SRT を選択します。
- その字幕の横にある焼き込みボックスにチェックを入れます。 track.
- エンコードを実行します。出力ビデオには、画像内に字幕が永続的に含まれます。
一般的な問題のトラブルシューティング
**キャプションが同期しません。**ほとんどの場合、これは SRT とビデオが同じ開始点を共有していないことを意味します。これは通常、トランスクリプトが作成された後にビデオがトリミングされたことが原因です。すべてのタイムスタンプを微調整するのではなく、最終カットに対して SRT を再エクスポートします。後ろ半分だけがずれている場合は、エクスポート時にビデオのフレームレートが変更された可能性があり、タイムラインが長くなります。元のレートで再レンダリングするか、最終ファイルからキャプションを再生成します。
**ソーシャル投稿の自動キャプションはエラーだらけです。**これは、アクセント、速度、または英語以外の音声に苦戦しているプラットフォーム独自のエンジンです。アプリ内で一行ずつ修正しないでください。 Hushscript で正確なトランスクリプトを生成し、その SRT をアップロードするか、修正したテキストを機械のキャプションに貼り付けると、プラットフォームはすでに計算されたタイミングを維持します。
**ラインが画面の端からはみ出します。**非常に長い単一ラインを含む SRT キューは、一部のプレーヤーや、安全領域が狭い短い形式のレイアウトによってクリップされます。長いキューを 2 つの短い行に分割するか、1 つの長いキューを 2 つの時間指定されたキューに分割します。書き起こしエディタは、エクスポート後のプラットフォームではなく、エクスポート前にこれを行う場所です。
**アップロード後に話者名が消えます。**一部のプラットフォームでは、SRT をインポートするときに先頭の「Name:」プレフィックスが削除され、話されたテキストのみがキャプションとして扱われます。話者を表示し続けることが重要な場合は、名前を保存するためにインポートに依存するのではなく、キュー テキストに名前を書き込むか、その宛先のプレーンキャプションを受け入れます。
**字幕はまったく表示されません。**デスクトッププレーヤーの場合は、SRT がビデオと同じベース名を持つ同じフォルダーに存在することを確認します。通常は不一致が原因です。 Web プレーヤーの場合、ブラウザーは WebVTT を期待しているため、.vttではなく.srtファイルを渡したことを確認してください。プラットフォームでは、プレーヤーの設定でキャプショントラックが有効になっていて、適切な言語に設定されていることを確認してください。
正確なキャプションを作成するためのヒント
精度は、プラットフォームがファイルを認識するずっと前に、オーディオの段階で決定されます。きれいな録音ではきれいなトランスクリプトが得られ、きれいなトランスクリプトではほとんど触れる必要のないキャプションが得られます。
手持ちの最高品質のオーディオからのキャプション。ビデオが複数のレンダリングに存在する場合は、最も圧縮率の低いレンダリングを転写します。音楽や部屋の騒音の下で音声がかすかに聞こえる場合は、モデルがはっきりと聞き取れる内容しかキャプションできないため、文字起こしする前に会話を上げます。コミットする前に必ず 30 秒のプレビューを読んでください。ソースの修正がまだ安価なうちに、音量が小さい、アクセントが激しい、またはクロストークが早期に表面化します。インタビューやパネルの場合は、無料の話者ラベルを頼りに、各話者に実名を付けてください。名前付きのキャプションは、出典のないテキストの壁よりも視聴者にとってはるかに理解しやすいためです。そして、SRT を真実の情報源として維持してください。各プラットフォームのキャプションツール内で修正するのではなく、そこで編集して再エクスポートするので、すべての出力先が歩調を合わせることになります。
Hushscript がこの特定のタスクに適している理由は、無料枠の誠実さと実際に行われる作業の組み合わせです。 30 分間の無料時間は、いくつかの短いビデオに端から端までキャプションを付けるのに十分です。話者の分離はすべてのトランスクリプトで無料で提供され、SRT エクスポートは仕様に合わせて構築されているため、上記の出力先のいずれかに直接ドロップされます。無料の分を過ぎると、サブスクリプションなしの従量課金制になります。 料金ページには、分単位のパックが記載されています。
字幕付きビデオを保守可能に保つ唯一のルールは、プラットフォームの字幕エディターではなく、SRT を真実の情報源として扱うことです。これをビデオの横に置いておくと、後で再度文字起こしすることなく字幕を更新または再エクスポートできます。マルチ話者の録音から使用可能な SRT を抽出する方法については、Zoom 会議を文字に起こす方法をご覧ください。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: