メインコンテンツへスキップ

長時間の録音(2 時間以上)を書き起こす方法

著者: 公開日: 最終確認日:

長時間録画すると、最大期間、ブラウザの準備、アップロードの信頼性、分単位のバランス、キューの安全対策など、あらゆる制限が表示されます。 3 時間のインタビュー、半日のワークショップ、または役員会議をテキストに変換する場合は、ジョブが失敗した後ではなく、アップロードする前にそれらの境界を確認してください。

Hushscriptのアップロードにはアップロードごとに最大 10 時間かかり、 ファイルサイズの制限はありません– 大きなファイルはブラウザで直接準備されます。プランベースの日当はありません。 40 時間ローリング 24 時間の高い安全上限とアクティブジョブの安全装置がサービスを保護します。ここでは、長いファイルは特別なケースではありません。 2 分間のクリップと同じワークフローで、放置すれば自然に終了します。

開始する前に必要なもの

3 つのものが必要で、おそらく 3 つすべてがすでに揃っています。

無料時間について簡単に説明します。長時間の録音はすぐに使い果たされてしまうため、1 回につき 30 分を無料で利用できます。ロックを解除する最も簡単な方法は、カードを追加することです (1 ドルを保持するとカードが有効になり、すぐに解放され、請求されることはありません)。すると、分がすぐに表示されます。お住まいの国で利用できる別の支払い方法を使用したい場合は、最初の購入時に 30 分がかかります。カードは必要ありません。それはただ最速のルートです。短いセグメントを書き起こして、フルパックを 3 時間のファイルにコミットする前に精度を判断するには、30 分あれば十分です。

長時間アップロードする前に確認すること

4 つのチェックでほとんどの予期せぬ事態を回避できます。

アップロードする前に、これらの境界を確認してください。Hushscriptでは、これらをここに記載しているため、試行錯誤で発見するのではなく、ソースの長さから長いジョブを計画できます。

長い録音を段階的に文字起こしする

オンにする長時間録音モードはありません。このプロセスは短いクリップと同じです。バックグラウンドでの実行時間が長くなるだけです。

  1. コンバータを開いてファイルをドロップします。音声からテキストへに移動し、録音をアップロード領域にドラッグするか、クリックして参照します。一般的なオーディオまたはビデオ形式はすべて受け入れられます。ビデオの場合、この時点でオーディオがブラウザで抽出されるため、重いビデオファイルがマシンから流出することはありません。
  2. **30 秒のプレビューを確認してください。**サインアップする前に、Hushscript がブラウザで短いクリップを準備し、そのクリップを文字起こし用に送信し、話者ラベル付きの出力を表示します。この段階では、完全な録音はローカルに残ります。プレビューを読んで、話者が適切に分割されており、言葉が正しいことを確認すると、音声が完全な実行に十分なほどきれいかどうかがわかります。
  3. **サインインして残りを文字起こしします。**プレビューが適切である場合は、サインアップすると、完全なファイルがアップロードされます。ここで分単位のバランスが重要になります。150 分のファイルには 150 分かかります。所有しているパックがその期間をカバーしていることを確認してください。
  4. **ジョブが自動的に終了するようにします。**処理時間はファイルの長さとサービスの負荷によって異なりますが、ジョブは無人で実行されます。タブにフォーカスを当て続ける必要はありません。
  5. **話者のラベルを変更します。**トランスクリプトには、話者 A話者 Bなどの一般的なラベルが付けられます。エディターで、話者 Aの名前を一度実名に変更すると、文書内のあらゆる場所が更新されるため、3 時間のインタビューが全体を通して正しい名前で読み上げられます。
  6. **必要な形式でエクスポートします。**21 形式 (TXT、SRT、DOCX、PDF、および字幕およびエディター タイムライン形式) のいずれかでダウンロードし、パスワードで保護された形式でダウンロードします。 .husharchive、どれにも透かしはありません。 SRT は、タイムスタンプを使用すると、スクロールせずに任意の瞬間に直接ジャンプできるため、長いファイルの場合に最適です。

結果は、話者ラベル、タイムスタンプ、および完全なエクスポートメニューとともにダッシュボードに表示され、いつでも戻ってくることができます。

実際の例: 2.5 時間の録音されたインタビュー

実際のファイル形式でどのように見えるかは次のとおりです。 2 時間 30 分のインタビューを 1 つの MP3 として録音したとします。1 人は静かで、1 人は騒々しい 2 人の人物がビデオ通話で録音されました。

アップロードエリアに MP3 をドロップします。 30 秒のプレビューでは、オープニングサンプルで 2 つの話者がすでに分離されていることが示されています。サインインします。 150 分のファイルがアップロードされ、ジョブが開始されます。完了すると、00:00:00から02:30:00まで切れ目なく実行されるタイムスタンプを持つ 1 つの連続したドキュメントが作成されます。

生の出力は次のようになります:

[00:00:04] 話者 A: お時間を割いていただきありがとうございます。プロジェクトがどのように始まったかから始めてもいいですか?
[00:00:11] 話者 B: もちろんです。つまり、実際の始まりは 2023 年の初めに遡ります。そのとき...

話者 Aをインタビュアーに、話者 Bを件名に 1 回名前変更すると、すべての行が更新されます。次に、初回パスダイジェスト用のサマライザーに貼り付ける TXT と、直接引用を作成するときにタイムスタンプをクリックして、その内容を正確に聞くことができる SRT の 2 つをエクスポートします。総費用: 残高が 150 分減り、アップロードが 1 回、分割なし、切り詰めなし、2 回目の試行なし。

長時間のセッション中、話者にラベルを付けておく

3 時間の録音でのダイアライゼーションは、10 分のクリップよりも非常に困難です。声が漂い、一時停止が伸び、背景のノイズが入ったり消えたりします。 Hushscript はトランスクリプト全体のラベル付けを一度に実行するため、ラベルはエンドツーエンドで一貫性を保ちますが、録音自体がそれを助けることもあれば損なうこともあります。

録音時:

オーディオ品質:

トランスクリプトが戻ったら、話者 Aに実名でラベルを付け直すのは 1 回限りの編集で、ドキュメント全体に反映されます。ラベル付け自体がどのように機能するかについて詳しくは、話者の識別をご覧ください。

ファイルを分割しますか? それとも全体をアップロードしますか?

ほとんどの人にとっての短い答えは、全体をアップロードするです。長い録音を複数の部分に分割することは避けるべきことであり、すべきことではありません。必要です。

録画が 10 時間以下の場合は、インタビュー、講演、会議、パネルの圧倒的多数をカバーしており、ファイルサイズの上限はありません。 1 つのファイルは、1 つの連続したタイムスタンプセットと 1 つの一貫した話者ラベルセットを意味します。分割すると両方が中断されます。各パートのクロックはゼロから再スタートし、同じ人がパート 2 ではパート 1 とは異なるラベルを取得する可能性があるため、手動でステッチして再マップする必要があります。

音声システムは依然として長い音声を内部で分割する場合があります。最近の長文音声処理に関する IWSLT 2026 研究では、いくつかのセグメンテーション戦略を比較し、その選択が堅牢性に影響を与えることが判明しました。これはエンジンレベルの問題であり、ソースを手動でカットする理由ではありません。1 つのアップロードを保持すると、処理パイプラインが独自の内部境界を処理している間、ユーザーに表示される連続したトランスクリプトが保持されます。

録画が本当に 10 時間を超える場合にのみ分割されます(数日間にわたる会議の録画など)。その場合は、文の途中ではなく自然な沈黙 (セッションの休憩) でカットし、後でタイムスタンプの番号を付け直すことができるようにオフセットをメモしておきます。アップロード前に MP3 をカットする場合は、可変ビットレート (VBR) よりも固定ビットレート (CBR) を選択してください。VBR は一部のエディタで同期ドリフトを引き起こす可能性があるためです。

マルチギガバイトのビデオファイルは問題ありません。 Hushscript はアップロードする前にブラウザで音声を抽出するため、ソースビデオのサイズはアップロードサイズではなく、ソースファイルの大きさに上限はありません。ブラウザとデバイスが準備を処理できる限り、はるかに小さい音声ストリームのみが送信されます。

長い音声の精度に最適な設定

精度の最大の要因は音声です。サンプルレートやファイル形式ではなく、 明瞭度です。特に長時間のセッションの場合:

一般的な長いファイルの問題のトラブルシューティング

**録音の後半で精度が低下します。**これはほとんどの場合、長いセッションの後半でオーディオレベルが低下したり、部屋のノイズが上昇したりすることであり、長さの制限ではありません。エラーが集中しているタイムスタンプ付近の元の記録を確認します。レベルが低下した場合は、正規化して再実行し、再度時間を費やす前に、後のセグメントで 30 秒のプレビューを使用して確認します。

**2 人の人物が 1 人の話者に統合され続けます。**音声の重複とクロストークが通常の原因です。事後の完璧な修正はありませんが、音声間の距離をより離して録音した場合 (チャンネルごとのトラック、またはマイクの距離が離れている場合)、次回はよりきれいに録音されます。現在のトランスクリプトでは、時折発生する間違ったラベルをエディタで手動で修正できます。

**大きなファイルのアップロードは遅いです。**アップロード速度は、ツールではなく接続です。マルチギガバイトのビデオの場合は、最初にオーディオがローカルで抽出されるため、実際のアップロードはディスク上のファイルよりもはるかに小さいことに注意してください。接続が弱い場合は、有線リンクを使用するか、単に実行したままにしておくと、そこに到達します。

録音中のバックグラウンドノイズ定常的なノイズ (空調、交通量、部屋のハム音) により、ファイル全体の精度が低下します。光量の正規化は通常、音声を損なう傾向があるノイズ除去よりも役立ちます。セグメントが深刻な影響を受けている場合でも、タイムスタンプを使用してセグメントを見つけて聞き返すことができます。

**トランスクリプトは早期に終了したようです。**Hushscript では、トランスクリプトはファイル全体をカバーします。サイレントトランケーションはありません。テキストが短いと思われる場合は、最終的なタイムスタンプを録音の実際の長さと比較して確認してください。長い沈黙や音楽は、単に単語が少ないだけであり、「欠落」と解釈される可能性がありますが、実際はそうではありません。

長いトランスクリプトをエクスポートする: どの形式

複数時間のセッションの場合、選択した形式によってトランスクリプトの使いやすさが変わります。

すべてのエクスポートはすべてのプランに含まれており、透かしや字幕のロックを解除するための別途料金はかかりません。


分単位で請求される長時間録画の場合、従量課金制の文字起こしにより、定期的な月額プランを回避できます。高いローリング安全上限と、異常に重いバッチに対するアクティブジョブ制御により、転記した時間に対して料金が発生します。最も一般的な 2 つの長時間録音ジョブには、それぞれ独自のウォークスルーがあります。ポッドキャストの文字起こし方法では、複数のゲストのエピソードやショーノートがカバーされ、講義の文字起こし方法では、リバーブや部屋全体からの聴衆の質問など、教室での音声の癖がカバーされます。また、素材が 1 つの長い録音ではなく、個別のファイルのスタックである場合は、録音フォルダーを転写することで、それらをバッチとして実行できます。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

長時間録画のファイルサイズ制限はありますか?

いいえ。録画は最長 10 時間実行でき、ファイルサイズの制限はありません。大きなファイルはブラウザーで直接準備されます。プランベースの日次または月次の手当はありませんが、40 時間ローリング - 24 時間の高い安全上限と現役の安全対策が適用されます。

長時間の録画をいくつかの部分に分割する必要がありますか?

いいえ。 3 時間または 8 時間のファイルは 1 回のアップロードとして送信され、連続したタイムスタンプを持つ 1 つのトランスクリプトとして返されます。分割する必要があるのは、録音自体が 10 時間を超える場合のみです。

話者のラベルは 3 時間の録音でも一貫性を保ちますか?

はい。話者ダイアライゼーションは、チャンクごとではなくトランスクリプト全体を一度に実行するため、各人が最初の 1 分から最後まで同じラベルを保持します。

音声の代わりに長いビデオファイルをアップロードできますか?

はい。音声は送信される前にブラウザ内のビデオから抽出されるため、音声のみがサーバーに届きます。元のビデオはアップロードされないため、通常、数ギガバイトの講義キャプチャがはるかに小さい音声アップロードに変換されます。

長いファイルの文字起こしにはどのくらい時間がかかりますか?

処理時間は、録画の長さとサービスの負荷によって異なります。長いジョブは無人で実行されるため、ページを離れてトランスクリプトが完了したら戻ることができます。

長いトランスクリプトに最適なエクスポート形式は何ですか?

他のツールへのフィードには TXT、タイムスタンプへのジャンプには SRT、共有と注釈には DOCX、生の話者とタイミングデータには JSON が使用されます。すべてのエクスポート形式は透かしなしで含まれています。

たまにしか文字起こししない場合、議事録は期限切れになりますか?

文字起こしが完了しない、または議事録を購入しないと、180 日後に議事録が期限切れになります。どちらのアクティビティでもウィンドウがリセットされ、期限が切れる前にメールでお知らせします。

無料30分からはじめる

はじめる – 無料30分