メインコンテンツへスキップ

動画をアップロードせずに MP4 を文字起こしする方法

著者: 公開日: 最終確認日:

音声認識で必要なのは音声トラックのみであっても、最初にアップロードしたビデオワークフローでは MP4 全体が送信される場合があります。解像度、コーデック、ビットレートによっては、長時間録画すると何ギガバイトにもなる場合があります。Hushscriptはその転送を回避します。ブラウザが最初にオーディオを準備し、ソースビデオがデバイス上に残ります。

Hushscriptは別のパスを使用します。ブラウザはアップロードが開始される前にビデオから音声を抽出するため、元の MP4 はデバイス上に残ります。音声のみが文字に起こされ、文字起こしの準備が整うとすぐに削除されます。このガイドでは、手順、録画されたウェビナーでの実際の例、SRT 字幕の取り出し方法、同様に機能する他のビデオ形式、問題が発生した場合の対処法など、プロセス全体を説明します。

ビデオをアップロードする必要がない理由

ビデオトラックは文字起こしには無関係です。音声エンジンは音声のみを必要とします。写真のアップロードはまったくの無駄です。ネットワーク時間、サーバー ストレージ、そして必要のないプライバシー フットプリントを消費します。

ブラウザ内抽出の仕組みを簡単に説明します

MP4 はコンテナです。内部には、ビデオ (画像)、オーディオ (サウンド)、および一部のメタデータという個別のストリームが存在します。この構造については、MDN のビデオ処理ガイドで説明されています。文字起こしにはオーディオストリームのみが必要です。

Hushscriptは、ページ上で小さなブラウザネイティブメディアツールキットを実行します。 MP4 をドロップすると、そのツールキットはローカルでコンテナーを開き、オーディオストリームをコピーし、そのオーディオをアップロードに渡します。ページがビデオをどこにも送信することはありません。作業はビデオが再生されるのと同じ場所、つまり自分のマシン上で行われます。

実際の結果は次のようになります。

これは、会議、録画されたインタビュー、法的証言録取など、映像自体が機密性の高いものには重要です。また、複数ギガバイトのファイルを使用する低速接続の場合にも重要です。最初に音声を抽出すると、30 分のアップロードが数分に短縮されます。

必要なもの

次の 3 つで、インストールするものは何もありません:

別の音声抽出、コンバータ、またはビデオソフトウェアは必要ありません。 MP4 をドロップするだけで入力全体が完了します。

3 つのステップで MP4 を変換できます

  1. **ページの /MP4-to-text に MP4 をドロップします。**ブラウザは音声トラックを抽出して音声のみをアップロードするため、ビデオ自体はデバイス上に残ります。最初の 30 秒は話者ラベル付きのプレビューとして表示されます。アカウントは必要ありません。
  2. **残りの部分を文字に起こすにはサインアップしてください。**メールアドレスを入力してアカウントを作成してください。ここは新しいですか?お支払い方法を確認すると、最初の 30 分間は、1 ドルのカード保留 (承認後、すぐに解放され、請求されません) か、別の方法でお支払いの場合は最初の 1 分パックのいずれかが無料になります。カードは必要ありません。文字起こしは、ファイルサイズではなく、音声の長さに対して請求されます。
  3. **文字起こしをエクスポートします。**準備ができたら、21 の形式 (キャプションの場合は TXT、SRT、VTT、ドキュメントの場合は DOCX と PDF、データの場合は JSON と CSV など) のいずれかでダウンロードし、さらにパスワードで保護された .husharchive もダウンロードします。話者ラベルは無料で付属しています。

トランスクリプトが配信されると、音声の削除は自動的に行われます。覚えておくべきクリーンアップ手順はありません。

「音声時間に対して課金される」とはどういう意味ですか

1080p で 1 時間の MP4 は 6 GB になる可能性があります。そこから抽出されたオーディオ (通常は 128 ~ 256 kbps の AAC) は約 60 ~ 120 MB です。これがアップロードの対象であり、分単位の料金は 6 GB のファイルではなく、1 時間の音声に基づいています。

結論: フィールドレコーダーから 2 時間の 4K ドキュメンタリーを文字起こしすると、どちらも同じ量の音声を伝送できるため、小さな MP3 と同じ分のコストを支払うことができます。解像度、ビットレート、ファイルサイズは、請求される金額とはまったく関係ありません。

実際の例: 録画されたウェビナー

2 人のプレゼンターで 52 分間のウェビナーを実行し、それを 1 つの MP4 に録画したとします:q3-product-webinar.mp4、1080p で約 3.4 GB。要約メールのクリーンなトランスクリプトと、リプレイに添付する字幕が必要です。

実際の動作は次のとおりです。

  1. /MP4-to-text を開いて、q3-product-webinar.mp4をドロップします。このページはオーディオをローカルに抽出するため、3.4 GB のビデオは約 70 MB のオーディオになります。 70 MB のみがアップロードされます。
  2. 最初の 30 秒はラベル付きで返されるため、52 分全体を書き起こす前に音声品質の健全性をチェックできます。
  3. 完全なトランスクリプトの準備ができると、話者 Aまたは話者 Bのタグが付いた発話に分割されます。話者 Aをクリックして「Priya」と入力し、話者 Bをクリックして「Marcus」と入力すると、両方のラベルがどこでも同時に再設定されます。
  4. 要約メール用に TXT をエクスポートし、リプレイのキャプショントラック用に SRT をエクスポートします。ウェビナーのオリジナルの MP4 はラップトップからは決して出ておらず、音声はすでにサーバーから削除されています。

最初に人々を驚かせるのは、ステップ 1: 数ギガバイトのアップロードですが、これはまったく行われないことです。写真はあなたの心に残ります。

複数人ビデオの話者ラベル

すべてのトランスクリプトには、追加料金なしで自動話者ダイアライゼーションが含まれています。インタビュー、パネル、または会議の記録の場合、各話者には「話者 A」、「話者 B」などのラベルが付けられ、ラベルをクリックして入力することで、エディタで名前を実際の名前に変更できます。

ダイアライゼーションは、きれいに分離することで最適に機能します。静かな部屋でのカメラ音声、または参加者ごとのトラックで録画されたビデオ通話は、エンジンを最大限に活用します。人々が互いに話し合っている混雑した部屋では、どんな話者分離エンジンにとっても困難です。役立つ情報については、以下のトラブルシューティングセクションを参照してください。

ビデオから字幕 (SRT / VTT) を取得する

ビデオを文字起こしする理由がキャプションである場合は、トランスクリプトを SRT としてエクスポートします。すべての発話は、SRT 仕様にフォーマットされた開始タイムスタンプと終了タイムスタンプとともに届きます。

1
00:00:04,210 --> 00:00:07,880
話者 A: 今日はご参加いただきありがとうございます。

2
00:00:08,100 --> 00:00:12,340
話者 B: 来られてうれしいです。

SRT をデスクトッププレーヤー (VLC、QuickTime、およびほとんどの編集者が受け入れます) にサイドロードするか、キャプショントラックとしてアップロードします。それをサポートするプラットフォーム上で。 Hushscript SRT エクスポートでは話者ラベルが保持されるため、複数人のビデオに役立ちます。一部のキャプション形式では名前が削除されます。 SRT はそれらを保持します。

WebVTT (.vtt) を使用する Web プレーヤーの場合、SRT との違いはごくわずかです。WEBVTTヘッダー行と、タイムスタンプの.の代わりに,が含まれます。 /tools/SRT-to-VTT にある無料ツールを使用して、ブラウザで SRT を VTT に変換できます。変換はページ内でローカルに実行されます。

2 つの兄弟ガイドでは、ここで説明できる範囲よりもさらに詳しく説明しています。ビデオから SRT 字幕を作成する方法では、キューのタイミングと行の長さの編集について説明し、ビデオに字幕を追加する方法では、SRT の添付または焼き付けについて説明します。字幕を画像に永続的に書き込む方法は別のものです。エンコードステップ。 SRT を入手したら、HandBrake などの無料ツールでマルチプレクサを処理します。

他のビデオ形式 (MOV、WebM、MKV)

同じブラウザ抽出プロセスが MP4 以外にも適用されます:

これらのコンテナには通常のオーディオコーデック (AAC、MP3、Opus、FLAC) が含まれており、抽出ステップでは MP4 と同じ方法で多重化を解除します。実際には、電話、カメラ、またはスクリーンレコーダーで記録されたものはすべて機能します。ドロップするだけです。

MP3、WAV、M4A などのオーディオのみのファイルを直接フィードすることもできます。ストリップするビデオストリームがない場合、抽出ステップはスキップされ、ファイルはそのままアップロードされます。また、トランスクリプトではなくオーディオファイル自体が必要な場合は、MP4 から MP3 への変換も別のジョブであり、完全にブラウザ内で実行されます。 ビデオからテキストへのページでは、特殊なオーディオコーデックを含むあらゆるビデオ形式のワークフロー全体が説明されています。

トラブルシューティング

一般的な MP4 ファイルは通常、手動で準備する必要はありません。失敗したり弱いテキストが生成された場合は、まずこれらの原因を確認してください。

**ソースビデオが非常に大きい。**このアプリにはファイルサイズの制限がありません。録画が 10 時間以内であれば、非常に大きなビデオからの音声もブラウザで直接準備されます (ブラウザには作業を行うのに十分なローカル容量が必要です)。巨大な 4K ファイルで抽出が停止する場合は、他のタブを閉じて再試行するか、最初にオーディオを抽出してください。無料のオーディオ抽出ツールはブラウザ内でこの作業を行い、直接アップロードできる小さなファイルを生成します。

**オーディオトラックや音声はありません。**無音の画面録画または音楽のみのクリップには、エンジンが文字起こしするものが何もないため、空の結果が得られます。音量を上げて再生して、ビデオに実際に音声が含まれていることを確認します。画面録画の場合は、システムまたはマイクの音声をキャプチャするようにレコーダーが設定されていることを確認してください。多くのデフォルトはビデオのみです。

**サポートされていない、または不明瞭なオーディオコーデック。**ブラウザ内の抽出プログラムは、一般的なコーデック (AAC、MP3、Opus、FLAC) を処理します。通常とは異なるオーディオコーデックまたは独自のオーディオコーデックを使用するコンテナは、きれいに分離できない可能性があり、オーディオは抽出されません。修正するには、まずビデオのオーディオを標準コーデックに再多重化または再エンコードします。ほとんどのコンバータは、標準の MP4 またはプレーンなオーディオファイルを出力できます。通過できない形式が見つかった場合は、support@hushscript.com に電子メールを送信してください。追加を検討させていただきます。

**複数の話者があり、分離が乱雑です。**ダイアライゼーションには、区別可能な音声が必要です。重複する音声、広い部屋での 1 つの遠距離マイク、または激しい背景ノイズはすべて、話者間の境界を曖昧にします。正確なトランスクリプトを取得できます。話者のラベルの精度が低いだけです。録音を制御する場合は、参加者ごとのトラック (ほとんどのビデオ通話ツールでエクスポートできるように) またはマイクを各話者の近くに配置することで、最もきれいな分離が得られます。いずれの場合も、エクスポートする前にエディタでラベルの間違った行を修正できます。

**トランスクリプトには一貫してスペルミスがあります。**繰り返し同じように間違って転写される固有名詞や専門用語は、1 回限りの修正です。エクスポートされたテキスト内の 1 回の検索と置換で、すべてのインスタンスが修正されます。これは、何かを再実行するよりも高速です。

一目でわかるエクスポート形式

形式 結果
TXT プレーンテキスト、話者ラベル、なしタイムスタンプ
SRT タイムスタンプ付きキャプション、あらゆるビデオプレーヤーにサイドロード可能
VTT HTML5 ビデオプレーヤー用のウェブキャプション
CSV 話者とタイミングを含むスプレッドシートに適した行
マークダウン メモおよび公開用の話者ラベル付きテキスト
JSON 構造化データ: 発言ごとに{ speaker, start, end, text }
DOCX Word または Google ドキュメント用の話者ラベル付きトランスクリプト
PDF 共有またはアーカイブ用の固定レイアウトトランスクリプト

30 分の無料分を含むすべてのエクスポート形式がすべてのプランに含まれており、ウォーターマークは含まれません。


会議、インタビュー、証言録取など、プライバシーが重要なビデオの場合、そのビデオは決してアップロードされないという点が重要です。自分で確認することができます。ファイルをドロップする前にブラウザのネットワークタブを開いて、何が送信されるかを確認してください。音声が大きくなり、画像はそのままであることがわかります。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

MP4 ビデオファイルはサーバーにアップロードされますか?

いいえ。ブラウザは、デバイスから何かが送信される前に、ビデオからオーディオトラックを抽出します。音声のみが文字起こしのために送信されます。オリジナルの MP4 はマシン上に残ります。ブラウザのネットワークタブで自分で確認できます。数ギガバイトのビデオではなく、小さなオーディオのアップロードが表示されます。

使用できるビデオの最大サイズはどれくらいですか?

ファイルサイズの制限はありません。ソースビデオがどんなに大きくても、最長 10 時間の録画が受け入れられます。音声のみがアップロードされるため、長いビデオは通常、ディスク上のサイズよりもはるかに少ないデータを送信します。

MP4 の文字起こしにかかる費用はいくらですか?

1 ドルのカード小切手後 (保留は承認され、すぐに解除され、請求されることはありません)、または別の方法でお支払いの場合は最初の購入時に 30 分間無料になります。それ以降は従量課金制となり、ビデオのファイルサイズではなく、オーディオの長さに対して請求されます。パックの料金については、価格ページをご覧ください。

MP4 から SRT 字幕を取得できますか?

はい。転写後、SRTとしてエクスポートします。 SRT ファイルには、すべての発話の開始と終了のタイムスタンプが含まれており、ほとんどのビデオプレーヤーにサイドロードしたり、キャプショントラックとしてアップロードしたりできます。他のキャプション形式では省略される話者ラベルが保持されます。

同じように機能する他のビデオ形式は何ですか?

MOV、WebM、MKV、および標準オーディオコーデック (AAC、MP3、Opus、FLAC) を搭載するほとんどのコンテナ形式。ブラウザ内の抽出ステップで逆多重化が処理されるため、この方法は MP4 と同じです。

私のビデオには音声がありません。まだ文字起こしできますか?

いいえ。文字起こしは音声から機能するため、音声トラックのないビデオやサイレント画面録画には文字起こしするものがありません。 BGM はあっても音声がない場合、エンジンは単語のみを返すため、結果は空かノイズになります。

文字起こし後に音声は削除されますか?

はい。抽出された音声はトランスクリプトの準備ができた瞬間にサーバーから削除され、音声エンジンには何も保持されません。トランスクリプト自体は保存時に暗号化されるため、ストレージリークが発生した場合でも、言葉ではなく判読不能な暗号文が公開される可能性があります。

無料30分からはじめる

はじめる – 無料30分