メインコンテンツへスキップ

ポッドキャストを文字起こしして番組ノートを作る方法

著者: 公開日: 最終確認日:

ポッドキャストのトランスクリプトは 2 回の収入を得られます。これにより、聞くのではなく読むリスナーがエピソードを検索してアクセスできるようになり、録音全体を再生しなくても、ショーノート、引用文、キャプションの生の素材が得られます。プラットフォームのサポートは理論的ではなく具体的​​です。Apple Podcasts ドキュメントのトランスクリプトとクリエイター向けのチャプター ナビゲーション。このガイドでは、エピソードを文字に起こし、すべてのホストとゲストにラベルを付け、出力を使用可能な番組ノートドキュメントに変換する手順を説明します。

最も時間を節約できるのは、話者の分離です。分割されていない 1 つのテキストブロックとして読み取られるトランスクリプトを使用するには、音声自体とほぼ同じくらいの作業が必要です。 Hushscript は各音声に自動的にラベルを付け、すべてのトランスクリプトにそのラベルを無料で含めるので、会話が会話として戻ってきます。

始める前に必要なもの

一般的なオーディオまたはビデオ形式でのエピソードの録音。エディターからプレーンなオーディオファイル (MP3、WAV、M4A) をエクスポートした場合は、それが直接機能します。唯一のコピーが Zoom、Riverside、または Ecamm から録画したビデオである場合も機能します。また、音声はブラウザでそこから取得されるため、ビデオがアップロードされることはありません。

クリーンなソース音声は何よりも役に立ちます。話者ラベルは、それぞれの声が明確であり、人々が常にお互いに話し合っているわけではない場合に最も効果的です。各参加者を別々のトラックに録音した場合は、可能な限りクリーンな入力がすでに得られています。単一のミックストラックは引き続き機能します。音声を区別するために話者分離に重点を置くだけです。可能であれば、音声をドライに録音し、後でエディターでミュージックベッドを追加します。連続音声の下で実行されるジングルは確実に精度を低下させる唯一のものであるためです。

エピソード全体を文字に起こすにはアカウントが必要です。 30 秒のプレビューはアカウントなしのステップなので、サインアップする前に、実際のファイルの話者ラベルとテキストの品質を確認できます。

エピソードを文字に起こす

フローは実際のファネルの順序に従います。最初にプレビュー、次にサインアップ、そして残りを文字に起こします。

  1. **ファイルをドロップします/podcast-transcription にあります。**Hushscriptはブラウザの最初の 30 秒をクリップし、話者のラベルが付いたプレビューを返します。このステップにはアカウントは必要ありません。ホストとゲストがどのように分かれているか、そして自分の音声でテキストがどれほどきれいに読まれているかを正確に確認できます。
  2. **残りを文字に起こすにはサインアップしてください。**メールアドレスを入力してサインインしたら、エピソード全体をアップロードします。新しいアカウントには 30 分間の無料試用が 1 回付与されます。これらを請求する最も簡単な方法は、1 ドルのカード小切手を発行することです。この小切手は承認され、請求されることなくすぐに発行されます。お住まいの国で利用できる別の支払い方法をご希望の場合は、最初の購入時に 30 分がかかります。カードは必要ありません。
  3. **文字起こしを実行してからエクスポートします。**文字起こしには、すべての発話にラベルとタイムスタンプが付けられて返されます。番組ノートに編集するドキュメントの場合は DOCX、CMS に貼り付けるクリーンブロックの場合は TXT、ビデオバージョンのキャプションの場合は SRT、またはポッドキャストホストが発話レベルのトランスクリプトのアップロードを受け入れる場合は JSON をエクスポートします。

30 分間の無料では、短いエピソードまたは長いエピソードの代表的なセクションをカバーできます。 60 分のエピソードでは残高から 60 分が使用されるため、お試し枠を超えた後に補充する必要があります。

すべてのホストとゲストにラベルを付ける

話者のダイアライゼーションは自動的に実行されるため、何もオンにする必要はありません。 2 人のエピソード (ホスト 1 人、ゲスト 1 人) の場合、トランスクリプトはきれいに分割されて返され、すべての行が 2 つのラベルのいずれかに属します。パネルの場合、Hushscript は、話者キャップなしで、聞こえる限りの個別の音声を分離します。

一般的なラベルを実際の名前に置き換えるには:

  1. エディターで話者 Aのインスタンスをクリックします。
  2. 「Alex」などの名前を入力します。 「ホスト」。
  3. そのラベルのすべてのインスタンスは、トランスクリプト全体で一度に更新されます。

各音声のラベルを 1 行ずつではなく 1 回再ラベルします。 2 人のエピソードには約 1 分かかります。 4 人のパネルには数人かかります。ラベルを変更すると、トランスクリプトの一部は次のようになります。

Alex [00:03:12]: その時点ではあなたは会社を経営していたのですね。最初の兆候は何でしたか?
ジェイミー [00:03:19]: 正直に言うと、それは数字でした。ある四半期で 40% 減少しました。
アレックス [00:03:27]: それで、その時は説明できませんでしたか?
ジェイミー [00:03:35]: 何週間もではありませんでした。それが私を支えてくれた部分でした。

これは、引用符を引いたり、タイムスタンプ付きの章を書くために必要な構造です。ラベルはファイル全体に適用されるため、長いエピソードには 1 回だけラベルが付けられます。音声分離の仕組みについては、話者ダイアライゼーションの仕組みをご覧ください。

ラベルが修正を必要とする場合

ダイアライゼーションはクリーンな録音では正確ですが、確実ではありません。すぐに修正できるように、いくつかのパターンを知っておく価値があります。

2 人のゲストの意見が非常に似ている場合音声の場合、時折セリフが間違った話者に聞こえる可能性があります。音声を開いた状態でトランスクリプトをスキャンし、誤って割り当てられたいくつかの行を手動で再割り当てします。これは、例外を修正するだけなので、話者名を最初から入力するよりもはるかに高速です。

ほとんど話さない静かな共同司会者が別のラベルに統合された場合は、最初にメインの話者に実際の名前を付けてから、静かな声に属する数行を検索します。十分に分離された録音では、どちらかのケースに遭遇することはめったにありません。そのため、録音時に各人ごとに別々のトラックを設定する価値はあります。

一般的な問題とその実際の原因

文字起こしの問題のほとんどは、ツールではなく録音に原因があります。番組を公開する前に、いくつかのことを計画する価値があります。

クロストークと人々が互いに話し合うこれは、同じ瞬間の 2 つの音声をきれいに分割できないため、話者分離システムにとって最も難しいことです。通常、テキストは読める状態に保たれますが、重なり合う瞬間が 1 つの話者に到達したり、継ぎ目でぼやけたりすることがあります。ポッドキャストの衛生状態を良好にすることは、ここでもすでに役立ちます。ゲストに終了を許可するホストは、副次的な効果として、よりクリーンなトランスクリプトを生成します。この問題が発生した場合は、音声に対してこれらの数行を手動で修正します。

**リモートゲストは 1 つのトラックに録音されます。**単一の混合ファイルとして録音された通話は、参加者ごとにトラックとしてキャプチャされた同じ通話よりも分離するのが困難です。ツールが参加者ごとのローカル記録をサポートしている場合は、それを使用してください。混合ファイルしかない場合でも、トランスクリプトは引き続き送信されますが、話者分離に依存するだけです。どちらの場合でも、音声は同じアップロードであるため、文字起こし時に行うことは何も変わりません。

**強いアクセントとコードスイッチング。**Hushscript は言語を自動的に検出し、約 99 言語を文字起こしし、そのうち 18 言語では最高レベルの精度を示すため、サポートされている言語で発音されたアクセントを持つゲストは適切に処理されます。ゲストが文の途中で 2 つの言語を切り替える場合は、本当に難しいケースです。切り替えられたフレーズを手動でクリーンアップすることを期待してください。サポートされている言語の完全なリストについては、言語ページをご覧ください。

イントロミュージックとスティンガーセグメント間のミュージックベッドは、ナンセンスとして転写されるのではなく、通常はスキップされます。問題が発生するのは、音楽が長時間連続した音声で流れている場合のみです。きれいな修正は編集によるものです。音声をドライに録音し、後で音楽を挿入するため、文字起こしには音声のみが表示されます。

**名前、専門用語、ブランドの綴り。**専門家のゲストは、モデルが発音的に表現する用語や製品名を使用します。これらは繰り返されるため、すぐに修正できます。また、エクスポートされたドキュメントの検索と置換により、繰り返されるスペルミスが 1 回のパスで処理されます。

正確性のヒント

唯一最大の要因は録音品質であるため、マイクと静かな部屋に費やした労力は文字起こし時に報われます。さらに、システムは 1 つの波形から 2 つの音声を解きほぐす必要がないため、話者ごとのトラックにより、最もきれいなテキストと最もきれいな話者ラベルの両方が得られます。ゲストのマイクを漂わせるのではなく、近くに一貫性を持たせておくと、修正ではなく内容に編集時間を費やすことになります。

校正をするときは、音声を開いた状態で読み、パスごとに修正します。最初に話者のラベル、次に名前や専門用語の聞き間違い、そして時折重複する箇所を修正します。カテゴリごとに作業すると、上から下に読むよりも速く、公開できるほどきれいな文書が完成します。

トランスクリプトからショーノートへ

ショーノートは、話されたことすべてを要約したものではありません。これらはリスナーにとってはナビゲーション補助であり、まだ再生ボタンを押していない人にとっては検索面です。ほとんどのインタビューや会話番組で機能する構造:

エピソードの概要、2 ~ 4 文トランスクリプトから核となるトピックを抽出します。中心的な議論、ストーリー、またはポイントは何ですか?聞くかどうかを決める人のために書きます。

タイムスタンプ付きの章トランスクリプトをスキャンして、トピックの変更を確認します。会話が新しい話題になるたびに、タイムスタンプを記録し、1 行の説明を書きます。タイムスタンプはトランスクリプトから直接取得されるため、タイムスタンプを見つけるために再度聞く必要はありません。

[00:02:15] マーケティング予算なしで会社を立ち上げる
[00:14:30] 40% の収益減少とその原因
[00:28:44]再構築: 内部的に何が変わったのか
[00:51:00] 同じ立場の創業者へのアドバイス

重要な引用エピソードの主な主張や最も引用すべき瞬間を捉えた 2 ~ 3 行を引き出します。トランスクリプトから逐語的に引用し、それぞれの話者を名前で帰属させます。話されたとおりに引用を実行するか、ショーノートをよりクリーンにするためにフィラーと誤った開始をトリミングするかは、意図的に行う価値のある決定であり、ケバ取り対逐語的の両方を検討します。テキストは検索可能なため、半分覚えている行の正確な表現を見つけるのに数秒かかります。

ゲストのリンクとリソースゲストが言及したものをすべて追加します。音声 URL をすばやく見つけるには、トランスクリプトで「ドットコム」や「スラッシュ」などのフラグメントを検索します。ウェブアドレスを大声で言う人は予想以上に多く、逐語的なトランスクリプトがそれをキャプチャします。

**完全なトランスクリプト、オプションですが価値があります。**全文をメモの下に貼り付けるか、別のトランスクリプトページへのリンクを貼り付けます。話されたコンテンツはインデックス可能になるため、ここに検索値が存在します。ホストプラットフォームがトランスクリプトのアップロードを受け入れる場合、JSON エクスポートには発話レベルのデータが含まれます。それ以外の場合は、プレーンテキストで十分です。

実際の例

58 分間の創業者インタビューを 2 つのトラックとして録音し、1 つの MP3 にミックスダウンしたとします。 MP3 を /podcast-transcription にドロップし、ホストとゲストが正しく分割されている 30 秒のプレビューを確認し、サインアップして完全なファイルをアップロードします。記録は話者 A話者 Bで返されます。 2 回クリックするだけで、名前を「Alex」と「Jamie」に変更できます。そこから、要約は冒頭の 2 分間から得られ、上の 4 つの章はトピックの移動を調べて得たもので、2 つの引用はテキスト内で覚えている瞬間を検索して得たものです。番組の開始から終了までのメモはおよそ 15 分で、そのほとんどは待機したり文字起こししたりするのではなく、自分で編集します。

キャプションや字幕を追加します

ビデオホスト、Spotify ビデオ、LinkedIn などのプラットフォームにエピソードのビデオバージョンを公開する場合、SRT エクスポートは、すぐにアップロードできる時間指定された字幕ファイルになります。すでに生成されたトランスクリプトにはタイミングデータが含まれているため、追加の手順はありません。バーンインファイルやサイドカー ファイルなど、クリップにキャプションを追加する広範なワークフローについては、ビデオに字幕を追加する方法をご覧ください。

開始点がオーディオのエクスポートではなくビデオ録画である場合、プロセスは同じです。音声は最初にブラウザで抽出されます。 ビデオからテキストへ ページでは、そのパスが完全に説明されています。

長時間の複数パートのエピソード

長編エピソードまたはライブ録画の場合、Hushscript はファイルサイズの制限なしで最大 10 時間のアップロードを受け付けます。 4 時間のパネルまたはドキュメンタリー形式のエピソードは、複数のチャンクに分割されるのではなく、1 つのファイルとして処理されます。これには 2 つの理由があります。話者のラベルはファイル全体で一貫しているため、一度ラベルを付け直すだけで済みます。また、タイムスタンプは連続しているため、パート 2 でゼロから再開するのではなく、3 時間マークのチャプタは[03:12:40]となります。

複数のパートに分かれたシリーズを 1 つのセッションで録画する場合は、セッション全体を 1 つのファイルとして転記し、後でショーノートをパートごとに分割します。最初に音声をカットしても、再ラベル付けの作業が倍増するだけです。

これが高速になる理由

毎週または週に 2 回の定期的な出版ペースの場合、文字起こしからショーノートへのルーチンは、ファイルのドロップ、話者の再ラベル付け、チャプターのスキャン、引用符の取得、エクスポートを数回実行すると、エピソードあたり数分に圧縮されます。話者ラベルが無料でアトリビューションを行うことで、面倒な部分が解消されます。誰が何を言ったかを把握することではなく、ショーノートが実際に必要とする編集上の判断に時間を費やします。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

文字起こしでホストと各ゲストにラベルを付けるにはどうすればよいですか?

Hushscriptは、話者を「話者 A」や「話者 B」などのラベルで自動的に分離します。文字起こし後、エディターで任意のラベルをクリックし、実際の名前を入力すると、その話者が表示されるすべての場所で更新されます。 2 人のエピソードのラベルの再設定には約 1 分かかります。 4 つの音声を含むパネルには数分かかります。

話者ラベルは追加料金がかかりますか?

いいえ。話者ラベルは、Hushscript が生成するすべてのトランスクリプトに無料で含まれており、話者ごとの料金や音声数の上限はありません。多くのツールはこれを上位層の背後でゲートします。ここでは標準出力の一部です。

ポッドキャストのビデオ録画を文字に起こしてもいいですか?

はい。 MP4、MOV、MKV などのビデオファイルがある場合は、アップロードする前にオーディオがブラウザで抽出されるため、ビデオはデバイス上に残ります。抽出された音声のみがサーバーに到達するため、大きなビデオファイルによって接続が詰まることもありません。

エピソードを一度に文字起こしできる時間はどのくらいですか?

アップロードごとに最大 10 時間、ファイルサイズの制限はありません。 60 分のエピソード、2 時間のディープダイブ、または 4 時間のライブ録音はすべて 1 つのファイルとして処理されるため、パーツをつなぎ合わせるのではなく、話者のラベルを 1 回変更するだけで済みます。

Hushscript はどのようなエクスポート形式を生成しますか?

TXT、SRT、VTT、CSV、TSV、Markdown、HTML、RTF、XML、JSON、DOCX、 PDF、およびパスワードで保護された .husharchive (透かしなし)。ショーノートの場合、DOCX は直接編集できるフォーマットされたドキュメントを提供します。 SRT では、ビデオバージョンを公開すると、時間指定のキャプションが表示されます。トランスクリプトのアップロードを受け入れるポッドキャストホストにフィードすると、JSON は発話レベルのデータを提供します。

ショーノートを書くためにエピソード全体をトランスクリプトする必要がありますか?

正確なタイムスタンプと逐語的な引用については、はい。記憶から大まかなメモをスケッチすることはできますが、章のマーカー、正確な引用、検索可能な完全なトランスクリプトはすべて完全なテキストから得られます。エピソード全体を視聴する前に、30 秒のプレビューで品質を確認できます。

バックグラウンドミュージックやイントロのジングルが文字起こしを混乱させますか?

セグメント間の音楽は通常、スキップされるか文字起こしされないままであり、音声の下にある短いジングルが問題を引き起こすことはほとんどありません。音楽ベッドが連続音声の下で動作する場合、その部分の精度が低下する可能性があります。音声をクリーンに録音し、後からエディタで音楽を追加すると、最高のトランスクリプトが得られます。

クリアに録音されたポッドキャストのトランスクリプトはどの程度正確ですか?

クロストークがほとんどないクリーンな 2 マイク録音では、テキストは簡単な校正後に公開できるほど正確です。精度は主に、アップロードするファイル形式ではなく、録音品質、アクセント、ゲスト同士の会話の頻度によって決まります。

無料30分からはじめる

はじめる – 無料30分