長時間の録音(2 時間以上)を書き起こす方法
著者: Hushscript 公開日: 最終確認日:
長時間録画すると、最大期間、ブラウザの準備、アップロードの信頼性、分単位のバランス、キューの安全対策など、あらゆる制限が表示されます。 3 時間のインタビュー、半日のワークショップ、または役員会議をテキストに変換する場合は、ジョブが失敗した後ではなく、アップロードする前にそれらの境界を確認してください。
Hushscriptのアップロードにはアップロードごとに最大 10 時間かかり、 ファイルサイズの制限はありません– 大きなファイルはブラウザで直接準備されます。プランベースの日当はありません。 40 時間ローリング 24 時間の高い安全上限とアクティブジョブの安全装置がサービスを保護します。ここでは、長いファイルは特別なケースではありません。 2 分間のクリップと同じワークフローで、放置すれば自然に終了します。
開始する前に必要なもの
3 つのものが必要で、おそらく 3 つすべてがすでに揃っています。
- 録音自体は、MP3、M4A、WAV、FLAC などの一般的なオーディオまたはビデオ形式で行われます。 AAC、MP4、MOV、MKV、その他。最初に変換する必要はありません。ファイルをドロップするだけです。
- **最新のブラウザ。**最初の 30 秒はブラウザ内でコンパクトなプレビュー クリップとして準備され、プレビューの文字起こしのために送信されます。サインインするまで完全なファイルはアップロードされません。ビデオファイルの場合、ブラウザはソースビデオを送信せずにオーディオも準備します。
- 録音時間をまかなえる残り時間。 事前に確認すべき数字はこれです。2.5 時間のインタビューには 150 分を使うため、5時間(300分)パックなら十分な余裕があります。新規アカウントには、全機能を試せる 30 分の無料枠があります。各パックの料金は料金ページで確認できます。
無料時間について簡単に説明します。長時間の録音はすぐに使い果たされてしまうため、1 回につき 30 分を無料で利用できます。ロックを解除する最も簡単な方法は、カードを追加することです (1 ドルを保持するとカードが有効になり、すぐに解放され、請求されることはありません)。すると、分がすぐに表示されます。お住まいの国で利用できる別の支払い方法を使用したい場合は、最初の購入時に 30 分がかかります。カードは必要ありません。それはただ最速のルートです。短いセグメントを書き起こして、フルパックを 3 時間のファイルにコミットする前に精度を判断するには、30 分あれば十分です。
長時間アップロードする前に確認すること
4 つのチェックでほとんどの予期せぬ事態を回避できます。
- **ファイルごとの継続時間。**Hushscriptは最大 10 時間の録音を受け入れます。長いソースは自然な切れ目で分割する必要があります。
- ブラウザとデバイスの容量製品ファイルサイズの制限はありませんが、ブラウザはローカルソースを読み取って準備する必要があります。非常に大きなファイルには、十分なメモリ、ストレージのヘッドルーム、アップロードを行うデバイス上の時間が必要です。
- 分単位の残高課金は音声の長さに応じて行われます。 150 分の録画では、請求期間を変更するオプションの前に 150 基本分が費やされます。
- サービスの安全対策プランベースの 1 日あたりの手当はありませんが、40 時間ローリング 24 時間の安全上限とアクティブジョブの安全対策は引き続き適用されます。大きなバッチは、すべてのファイルを一度に開始するのではなく、キューに入れることができます。
アップロードする前に、これらの境界を確認してください。Hushscriptでは、これらをここに記載しているため、試行錯誤で発見するのではなく、ソースの長さから長いジョブを計画できます。
長い録音を段階的に文字起こしする
オンにする長時間録音モードはありません。このプロセスは短いクリップと同じです。バックグラウンドでの実行時間が長くなるだけです。
- コンバータを開いてファイルをドロップします。音声からテキストへに移動し、録音をアップロード領域にドラッグするか、クリックして参照します。一般的なオーディオまたはビデオ形式はすべて受け入れられます。ビデオの場合、この時点でオーディオがブラウザで抽出されるため、重いビデオファイルがマシンから流出することはありません。
- **30 秒のプレビューを確認してください。**サインアップする前に、Hushscript がブラウザで短いクリップを準備し、そのクリップを文字起こし用に送信し、話者ラベル付きの出力を表示します。この段階では、完全な録音はローカルに残ります。プレビューを読んで、話者が適切に分割されており、言葉が正しいことを確認すると、音声が完全な実行に十分なほどきれいかどうかがわかります。
- **サインインして残りを文字起こしします。**プレビューが適切である場合は、サインアップすると、完全なファイルがアップロードされます。ここで分単位のバランスが重要になります。150 分のファイルには 150 分かかります。所有しているパックがその期間をカバーしていることを確認してください。
- **ジョブが自動的に終了するようにします。**処理時間はファイルの長さとサービスの負荷によって異なりますが、ジョブは無人で実行されます。タブにフォーカスを当て続ける必要はありません。
- **話者のラベルを変更します。**トランスクリプトには、
話者 Aや話者 Bなどの一般的なラベルが付けられます。エディターで、話者 Aの名前を一度実名に変更すると、文書内のあらゆる場所が更新されるため、3 時間のインタビューが全体を通して正しい名前で読み上げられます。 - **必要な形式でエクスポートします。**21 形式 (TXT、SRT、DOCX、PDF、および字幕およびエディター タイムライン形式) のいずれかでダウンロードし、パスワードで保護された形式でダウンロードします。 .husharchive、どれにも透かしはありません。 SRT は、タイムスタンプを使用すると、スクロールせずに任意の瞬間に直接ジャンプできるため、長いファイルの場合に最適です。
結果は、話者ラベル、タイムスタンプ、および完全なエクスポートメニューとともにダッシュボードに表示され、いつでも戻ってくることができます。
実際の例: 2.5 時間の録音されたインタビュー
実際のファイル形式でどのように見えるかは次のとおりです。 2 時間 30 分のインタビューを 1 つの MP3 として録音したとします。1 人は静かで、1 人は騒々しい 2 人の人物がビデオ通話で録音されました。
アップロードエリアに MP3 をドロップします。 30 秒のプレビューでは、オープニングサンプルで 2 つの話者がすでに分離されていることが示されています。サインインします。 150 分のファイルがアップロードされ、ジョブが開始されます。完了すると、00:00:00から02:30:00まで切れ目なく実行されるタイムスタンプを持つ 1 つの連続したドキュメントが作成されます。
生の出力は次のようになります:
[00:00:04] 話者 A: お時間を割いていただきありがとうございます。プロジェクトがどのように始まったかから始めてもいいですか?
[00:00:11] 話者 B: もちろんです。つまり、実際の始まりは 2023 年の初めに遡ります。そのとき...
話者 Aをインタビュアーに、話者 Bを件名に 1 回名前変更すると、すべての行が更新されます。次に、初回パスダイジェスト用のサマライザーに貼り付ける TXT と、直接引用を作成するときにタイムスタンプをクリックして、その内容を正確に聞くことができる SRT の 2 つをエクスポートします。総費用: 残高が 150 分減り、アップロードが 1 回、分割なし、切り詰めなし、2 回目の試行なし。
長時間のセッション中、話者にラベルを付けておく
3 時間の録音でのダイアライゼーションは、10 分のクリップよりも非常に困難です。声が漂い、一時停止が伸び、背景のノイズが入ったり消えたりします。 Hushscript はトランスクリプト全体のラベル付けを一度に実行するため、ラベルはエンドツーエンドで一貫性を保ちますが、録音自体がそれを助けることもあれば損なうこともあります。
録音時:
- ツールが参加者ごとに個別のトラックをキャプチャできる場合は、それを使用してください。たとえば、Zoom のローカル録音では、設定に応じて、混合トラックまたはチャンネルごとのオーディオを生成できます。通常、ミックスされたステレオトラックはアップロードに最適です。
- 物理的な部屋での録音は困難なケースです。指向性マイクを使用するか、話者をさらに離して設置するだけで、2 つの声が 1 つとして読み取られるクロストークがカットされます。
オーディオ品質:
- 44.1 kHz / 16 ビット WAV、または 128 kbps 以上の高ビットレート MP3 であれば、エンジンには十分です。 96 kHz からは精度の向上はありません。長いファイルが大きくなるだけです。
- 録音が静かだったり不均一な場合は、アップロード前にオーディオエディタで音量を正規化すると、設定を変更するよりも精度が向上することがよくあります。
トランスクリプトが戻ったら、話者 Aに実名でラベルを付け直すのは 1 回限りの編集で、ドキュメント全体に反映されます。ラベル付け自体がどのように機能するかについて詳しくは、話者の識別をご覧ください。
ファイルを分割しますか? それとも全体をアップロードしますか?
ほとんどの人にとっての短い答えは、全体をアップロードするです。長い録音を複数の部分に分割することは避けるべきことであり、すべきことではありません。必要です。
録画が 10 時間以下の場合は、インタビュー、講演、会議、パネルの圧倒的多数をカバーしており、ファイルサイズの上限はありません。 1 つのファイルは、1 つの連続したタイムスタンプセットと 1 つの一貫した話者ラベルセットを意味します。分割すると両方が中断されます。各パートのクロックはゼロから再スタートし、同じ人がパート 2 ではパート 1 とは異なるラベルを取得する可能性があるため、手動でステッチして再マップする必要があります。
音声システムは依然として長い音声を内部で分割する場合があります。最近の長文音声処理に関する IWSLT 2026 研究では、いくつかのセグメンテーション戦略を比較し、その選択が堅牢性に影響を与えることが判明しました。これはエンジンレベルの問題であり、ソースを手動でカットする理由ではありません。1 つのアップロードを保持すると、処理パイプラインが独自の内部境界を処理している間、ユーザーに表示される連続したトランスクリプトが保持されます。
録画が本当に 10 時間を超える場合にのみ分割されます(数日間にわたる会議の録画など)。その場合は、文の途中ではなく自然な沈黙 (セッションの休憩) でカットし、後でタイムスタンプの番号を付け直すことができるようにオフセットをメモしておきます。アップロード前に MP3 をカットする場合は、可変ビットレート (VBR) よりも固定ビットレート (CBR) を選択してください。VBR は一部のエディタで同期ドリフトを引き起こす可能性があるためです。
マルチギガバイトのビデオファイルは問題ありません。 Hushscript はアップロードする前にブラウザで音声を抽出するため、ソースビデオのサイズはアップロードサイズではなく、ソースファイルの大きさに上限はありません。ブラウザとデバイスが準備を処理できる限り、はるかに小さい音声ストリームのみが送信されます。
長い音声の精度に最適な設定
精度の最大の要因は音声です。サンプルレートやファイル形式ではなく、 明瞭度です。特に長時間のセッションの場合:
- 録音側でコンプレッサーを使用し(ファイル圧縮ではなく、ハードウェアまたはソフトウェアの音声コンプレッサー)、大声で話す面接官と静かな対象者との間のギャップを均等にします。これは、レベルのドリフトにより交換全体が失われる可能性がある 10 分間よりも 3 時間の方がはるかに重要です。
- FLAC はロスレスで受け入れられますが、精度の点では優れた MP3 に勝るものではありません。実際の唯一の用途は疑問を取り除くことです。オーディオ品質がボトルネックではないことを確認したい場合は、FLAC を使用すると、より大きなファイルを犠牲にして疑問を解決できます。
- **アップロード前に強力なノイズリダクションを避けてください。**積極的なノイズ除去は子音を破壊し、実際に精度を低下させる可能性があります。ライトの正規化は役に立ちます。
一般的な長いファイルの問題のトラブルシューティング
**録音の後半で精度が低下します。**これはほとんどの場合、長いセッションの後半でオーディオレベルが低下したり、部屋のノイズが上昇したりすることであり、長さの制限ではありません。エラーが集中しているタイムスタンプ付近の元の記録を確認します。レベルが低下した場合は、正規化して再実行し、再度時間を費やす前に、後のセグメントで 30 秒のプレビューを使用して確認します。
**2 人の人物が 1 人の話者に統合され続けます。**音声の重複とクロストークが通常の原因です。事後の完璧な修正はありませんが、音声間の距離をより離して録音した場合 (チャンネルごとのトラック、またはマイクの距離が離れている場合)、次回はよりきれいに録音されます。現在のトランスクリプトでは、時折発生する間違ったラベルをエディタで手動で修正できます。
**大きなファイルのアップロードは遅いです。**アップロード速度は、ツールではなく接続です。マルチギガバイトのビデオの場合は、最初にオーディオがローカルで抽出されるため、実際のアップロードはディスク上のファイルよりもはるかに小さいことに注意してください。接続が弱い場合は、有線リンクを使用するか、単に実行したままにしておくと、そこに到達します。
録音中のバックグラウンドノイズ定常的なノイズ (空調、交通量、部屋のハム音) により、ファイル全体の精度が低下します。光量の正規化は通常、音声を損なう傾向があるノイズ除去よりも役立ちます。セグメントが深刻な影響を受けている場合でも、タイムスタンプを使用してセグメントを見つけて聞き返すことができます。
**トランスクリプトは早期に終了したようです。**Hushscript では、トランスクリプトはファイル全体をカバーします。サイレントトランケーションはありません。テキストが短いと思われる場合は、最終的なタイムスタンプを録音の実際の長さと比較して確認してください。長い沈黙や音楽は、単に単語が少ないだけであり、「欠落」と解釈される可能性がありますが、実際はそうではありません。
長いトランスクリプトをエクスポートする: どの形式
複数時間のセッションの場合、選択した形式によってトランスクリプトの使いやすさが変わります。
- TXTは最も移植性が高く、ファイルに入力するのに適切な入力です。 LLM は、長い会話を要約または分析します。
- SRTには発話レベルのタイムスタンプが含まれるため、スクロールせずに任意の瞬間にジャンプできます。文字起こしの理由が特定の瞬間を見つけることである場合、これがこの形式です。
- DOCXは、話者ラベルとタイムスタンプを Word 互換ファイルに保存します。これは、コメントする必要がある人々と文字起こしを共有するのに最適です。
- JSONは生の構造 (話者、開始、終了、テキスト) を提供します。
すべてのエクスポートはすべてのプランに含まれており、透かしや字幕のロックを解除するための別途料金はかかりません。
分単位で請求される長時間録画の場合、従量課金制の文字起こしにより、定期的な月額プランを回避できます。高いローリング安全上限と、異常に重いバッチに対するアクティブジョブ制御により、転記した時間に対して料金が発生します。最も一般的な 2 つの長時間録音ジョブには、それぞれ独自のウォークスルーがあります。ポッドキャストの文字起こし方法では、複数のゲストのエピソードやショーノートがカバーされ、講義の文字起こし方法では、リバーブや部屋全体からの聴衆の質問など、教室での音声の癖がカバーされます。また、素材が 1 つの長い録音ではなく、個別のファイルのスタックである場合は、録音フォルダーを転写することで、それらをバッチとして実行できます。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: