メインコンテンツへスキップ

話者分離の仕組み:話者ラベルはどう付くのか

著者: 公開日: 最終確認日:

話者ダイアライゼーションは、録音を話者ごとにセグメントに分割し、「誰がいつ話したか?」に答える自動プロセスです。人間が転写物を読む前に。現在の ACL アンソロジーの話者ダイアライゼーション研究では、多者間の会話に対する同じタスクについて説明しています。これが、言葉の壁と構造化された会話の違いであり、2 人によるインタビューの記録が 1 つの長い段落ではなく、読みやすい対話として返される理由です。

分かりやすく言うと、録音をアップロードすると、話者分離エンジンが音声が変化するポイントを見つけ、同じ人物のように聞こえるセグメントをグループ化し、台本のように読めるトランスクリプトを返します。つまり、1 ターンにつき 1 行ずつ音声でラベル付けされます。この投稿では、その仕組み、ダイアライゼーションが音声の認識と同じではない理由、および一般的なラベルを実際の名前に変換する方法について説明します。

わかりやすくの話者ダイアライゼーション

90 分間のインタビューを手書きで文字に起こした画像。スピーチをテキストに変換した後、次に行うことは、音声が変わるたびに「インタビュアー:」、「件名:」という属性を前後に追加することです。特定の瞬間に誰が話しているのかを判断するという帰属作業は、まさに話者分離が行うことです。

出力は対話形式のトランスクリプトです。

話者 A [00:00:12]: まず理解すべきことは、データは一瞬しか存在しないということです。
話者 B [00:00:27]: そうです、そしてそれはほとんどの人が手遅れになるまで気づかない部分です。
話者 A [00:00:34]: その通りです。したがって、本当の問題は、そのウィンドウで何をするかということになります。

各発話は、話者とタイムスタンプに関連付けられています。その後、話者 A話者 Bの名前を本名に変更できます。話者ごとに 1 回の編集で、表示されるすべての場所でラベルが更新されます。

代替手段であるダイアライゼーションのない単純なトランスクリプトは、連続したテキストのブロックであり、誰が何を言ったかを把握するために音声を再生する必要があります。 2 つ以上の音声で数分を超える場合、それは実際の手動作業であり、ダイアライゼーションパスによって削除される作業です。

開始する前に必要なもの

構成する設定やインストールするものはありません。ダイアライゼーションは録音自体で実行されるため、唯一の実際の前提条件は、話者が適度に区別できるオーディオです。

それだけです。マイクの登録、音声サンプル、話者ごとの設定は必要ありません。

自動話者識別の仕組み

ダイアライゼーションは、いくつかの異なる段階に分かれています。これらを理解すると、出力が読みやすくなり、問題が発生した場合の修正が容易になります。

特徴抽出オーディオは、通常はそれぞれ 10 ~ 40 ミリ秒の短いフレームに分割され、エンジンは各フレームで音響特徴を測定します。話者を区別するために重要な特徴は、周波数領域にあります。ピッチ、フォルマント、スペクトルパターンは、一人の人の声内で一貫性を保ち、人によって異なる傾向があります。

セグメンテーションエンジンは話者の変化点、つまり音声の特徴が変化する瞬間を探します。ここが難しい部分です。誰かが中断したときに文の途中で変更が発生する可能性があり、ノイズや重複した音声によって実際の境界が隠蔽されたり、偽の境界がでっち上げられたりする可能性があります。

**クラスタリング。**同じ声のように聞こえるセグメントがグループ化されます。エンジンには部屋に何人いるかはわかりません。音声から話者の数を推測します。事前にカウントがわかっている場合、一部のセットアップではそれを指定できます。そうでない場合、エンジンはそれを推定します。これが、「1 人を 2 人に分割する」および「2 人を 1 人にマージする」エラーのほとんどが発生する場所です。

ラベル付け各クラスターにはラベルが付けられます:話者 A話者 B話者 C、または話者 0話者 1。ラベルは任意のプレースホルダーです。背後にアイデンティティはなく、録音全体にわたる 1 つの音声の安定したハンドルだけです。

パイプライン全体が文字起こしと並行して自動パスとして実行されるため、話者ラベル付けジョブを個別に実行する必要はありません。

ダイアライゼーションと音声認識

これら 2 つは常に混同されますが、答えは異なります。質問。

ダイアライゼーションは次のように尋ねます: このファイル内の他の音声と比較して、この時点で誰が話していますか? 音声は分離されますが、それらが誰に属しているかはわかりません。事前の知識は必要なく、ジョブの完了後に音声の記録は保持されません。

音声認識は話者識別とも呼ばれ、これは既知の参照録音と同一人物ですか? と尋ねます。比較するには登録された音声サンプルが必要で、これは「音声による身元確認」システムの背後にあるテクノロジーです。

Hushscriptは使用します。音声認識ではなく話者分離。登録された音声のデータベースはなく、あなたの録音が他の人と比較されることはありません。話者ラベルは、その 1 つのファイル内の音声の特徴から純粋に派生します。

この区別が、話者分離で人物の名前を指定できない理由です。 「同じ人が 1 時間に 200 ターン話した」と自信を持って言うことはできますが、 その人がであるかを言うことはできません。そのステップはあなたのものであり、話者ごとに 1 回クリックするだけで済みます。 Hushscript がマルチ話者の録音をエンドツーエンドで処理する方法を詳しく知りたい場合は、話者識別ページで説明しています。

実際の例: 3 人会議

1 つの部屋で 3 人で 40 分間のプロジェクトミーティングを録音し、1 つのラップトップマイクを共有し、単一のファイルとして保存するとします。.m4aファイル。これをドロップすると、文字起こし後の出力は次のようになります。

話者 A [00:00:04]: さて、発売日から始めましょう。ここはどこですか?
話者 B [00:00:09]: デザインは完了しました。月曜日に最終画面を引き渡しました。
話者 C [00:00:14]: エンジニアリングの支払いフローにはあと 2 週間ほど必要です。
話者 A [00:00:21]: マーケティングの約束をした日を 2 週間過ぎてしまいます。
話者 B [00:00:27]: 新しい支払いフローやフォローアップなしで発送できますか?
話者 C [00:00:33]: きれいにはいきません。古いフローは新しい価格設定で中断されます。

3 つの音声が分離され、ラベルが付けられ、各ターンにタイムスタンプが付けられます。ここで、ラベルを変更します。話者 Aは「Priya」 (彼女は会議を運営しています)、話者 Bは「Tom」、話者 Cは「Dana」になります。 3 回クリックすると、すべての行に実名が表示され、記録は全体を通して正しい帰属で会議メモに貼り付けることができます。

同じ形式が 2 人によるインタビュー、4 人によるポッドキャスト、または双方向の電話にも当てはまります。エンジンが聞いた内容を分離し、ユーザーが名前を入力します。

話者のラベルを変更する方法Hushscript

ラベルは意図的に汎用的に到着します。名前を付けるのは編集者の簡単な手順です。そこに到達するまでのフローは次のとおりです。ファイルをドロップすると、アカウント不要で 30 秒間の話者ラベル付きプレビューが表示され、サインアップして残りを文字起こしし、完成した文字起こしを開きます。そこから:

  1. トランスクリプトエディタで、話者 Bなどの話者ラベルをクリックします。
  2. 実際の名前 (「Tom」など) を入力します。
  3. 最初の行から最後まで、その話者のすべてのインスタンスが一度に更新されます。

名前の変更はグローバルなので、編集する必要はありません。同じラベルが 2 回あります。 2 人の話者による 90 分のインタビューの場合、完全なラベルの再設定には 1 分もかかりません。最終的には、すべての行の属性が正しく記載された引用可能なトランスクリプトが完成します。その後、名前を焼き付けた状態で、TXT、SRT、DOCX、PDF、JSON などの 21 の形式のいずれかに加え、パスワードで保護された .husharchive を付けてエクスポートできます。

ダイアライゼーションの一般的な問題のトラブルシューティング

ダイアライゼーションは、きれいな録音では信頼性が高く、音声が乱雑になると困難になります。一般的な問題とその対処方法:

音声の重複2 人が同時に話す場合、エンジンは重複する音声を 1 人の話者に割り当てる必要があり、クロスオーバーに誤ったラベルが付けられたり、いくつかの単語が欠落したりする可能性があります。ソフトウェアで修正することはできません。オーディオには実際に同じ瞬間に 2 つの声が含まれています。予防が鍵です。人々が交代で録音する方が、中断が多い録音よりもはるかにきれいに話者分離されます。重複が発生した場合は、音声をざっと読むと、影響を受けたいくつかの行が見つかります。

似たような声の声ピッチとアクセントが近い 2 人の話者 (たとえば、同じ年齢の男性 2 人、または兄弟) は、声の特徴が真に重なっているため、対照的なペアよりも区別するのが困難です。エンジンは時々それらの間で回転を交換することがあります。トランスクリプトをスキャンして、割り当てられた話者にとって奇妙に読める行を探します。それらは手動で再割り当てするものです。

**1 人が 2 つのラベルに分割されます。**誰かの音声が録音中に変更された場合(マイクに近づく、ヘッドセットからスピーカーフォンに切り替える、または接続が低下する)、エンジンは後半を新しい音声として読み取り、追加のラベルを作成できます。両方を同じ名前に再ラベル付けして、2 つをマージします。

**2 人が 1 つのラベルに統合されます。**2 つの静かな声または遠くの声がエンジンを分割できないほど似ている場合は、その逆が起こります。これは事後に修復するのが最も難しいため、予防する価値があります。マイクを話者に近づけ、広い部屋の向こう側から録音することは避けてください。

遠方の音声やノイズの多い音声。会議テーブルの端にあるラップトップのマイク、グループチャット中のテーブル上の電話、または部屋の重いエコーはすべて、音声間の境界を曖昧にします。マイクの配置を近づけることですべての話者が役立ち、背景ノイズ (ファン、車の騒音、音楽) を減らすことで分離が鮮明になります。ダイアライゼーションの品質は、音声品質を厳密に追跡します。

**通話は 2 つの別個のファイルとして記録されます。**レコーダーが通話の両側を独自のモノラルファイルとして保存した場合、どちらかのファイル単独でのダイアライゼーションでは 1 つの音声のみが表示されます。まず 2 つを 1 つの混合録音に結合して、両方の音声が 1 つのファイルに存在するようにしてから、それを文字に起こします。

実際に針を動かす正確さのヒント

いくつかの習慣により、ダイアライゼーションが著しく改善されます。そのほとんどは、ソフトウェアではなく録音に関するものです。

これはどれも完璧である必要はありません。明確なターンと適切なマイクの位置により、ほとんどの録音はラベルをきれいにすることができ、残りは編集者が処理します。

インタビューや会議で重要な理由

ダイアライゼーションがなければ、複数人での会話の記録は最も一般的な仕事にはほとんど使用できなくなります。

話者分離を使用すると、これらはそれぞれ簡単であり、トランスクリプトは生のテキストではなく文書になります。ジャーナリズム、研究、ポッドキャスト番組のメモなど、出版または引用されるものについては、正確な帰属は必須ではありません。音声から再構成するのではなく、トランスクリプトから帰属を取得することで時間を節約できます。会議メモ、インタビュー調査、人事記録などの社内作業の場合も、ラベル付きの構造は同様に価値があります。会話をスキャンする方が、壁のテキストを読むよりもはるかに高速です。

状況に応じた完全なチュートリアルについては、ジャーナリズムと研究のための記録、書き起こし、ラベルの再設定と書き起こしの方法について説明するインタビューを書き起こす方法をご覧ください。エピソード全体でホストとゲストにラベルを付けるためのポッドキャスト。

話者のラベルはすべての Hushscript トランスクリプトに無料で使用できます。

話者のダイアライゼーションは、追加料金なしですべての Hushscript トランスクリプトに含まれます。ダイアライゼーションアドオンや個別のプラン階層はなく、録音に使用できる話者の数に制限はありません。 Hushscript 自体は従量課金制であり、サブスクリプションはありません。 30 分間は無料でお試しいただけます。料金は、その後使用した分に対してのみお支払いいただきます。詳細については、料金ページをご覧ください。

話者の分離は無料です。これがなければ、会話のトランスクリプトは半分のトランスクリプトにすぎず、誰が言ったのか分からない可読テキストとなります。録音をドロップし、ラベルを自動的に取得し、クリックするだけでラベルの名前を変更し、結果をエクスポートします。すべてがどのように組み合わされるかについて詳しくは、音声をテキストに変換 ページをご覧ください。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

話者ダイアライゼーションとは何ですか?

話者ダイアライゼーションは、音声録音を個別の話者に対応する部分にセグメント化するプロセスです。その結果、未分化のテキストブロックではなく、各行が話者に帰属するトランスクリプト (「話者 A はこう言った、話者 B はこう言った」) が作成されます。 「誰がいつ話したか?」という質問に答えます。

話者のダイアライゼーションは音声認識と同じですか?

いいえ。ダイアライゼーションでは、1 つの録音内の音声を分割し、同じ人がこれらのセグメントを発言したことがわかりますが、その人が誰であるかはわかりません。音声認識 (話者識別) は、音声を既知の参照サンプルと比較して名前を付けます。ダイアライゼーションにはリファレンスは必要なく、音声プロファイルも構築されません。これが、話者に名前ではなく「話者 A」と「話者 B」というラベルを付ける理由です。

ダイアライゼーションは何人の話者に対応できますか?

Hushscriptには話者数に有料の上限はありませんが、ダイアライゼーションが同等の精度を保つための普遍的な数値はありません。重複する声、似たような音声、マイクの距離、室内の騒音がすべて重要です。きれいなパネルは、騒がしい 2 人による通話よりも分離しやすいため、帰属が重要になる場合は必ずラベルを確認してください。

トランスクリプトで 1 人の人物が 2 人の話者に分割されたのはなぜですか?

通常、途中でその人の聞こえ方が大きく変化したことが考えられます。つまり、マイクに近づいたり遠ざかったり、ヘッドセットからスピーカーフォンに切り替えたり、回線品質が変化したりしたためです。エンジンは音声の特徴に基づいてクラスタリングするため、それらの特徴の大きな変化は新しい音声として読み取られます。エディターで 2 つのラベルをマージすると、この問題は 1 回のパスで修正されます。

話者分離をつけると話者の名前がわかりますか?

いいえ。ダイアライゼーションでは話者を分離しますが、名前で特定することはありません。それらに「話者 A」、「話者 B」などのラベルが付けられます。トランスクリプトの生成後にエディターで実際の名前を自分で割り当て、それぞれの名前変更が話者が発言したすべてのセリフに適用されます。

話者のダイアライゼーションは通話録音に機能しますか?

はい、通話の両側がキャプチャされている場合は機能します。録音が両方の声を含む単一の混合トラックである場合、他の 2 人の話者のファイルと同様に、ダイアライゼーションによってそれらが分離されます。それぞれの面が個別のモノラルファイルとして保存されている場合は、最初にそれらを 1 つのミックスに結合して、両方の声が同じ録音内に存在するようにします。

話者のダイアライゼーションはすべての Hushscript トランスクリプトに含まれていますか?

はい。すべてのトランスクリプトには追加料金なしで話者ラベルが含まれており、個別のアドオンや上位層は必要ありません。文字起こし後、ワンクリックでラベルの名前を実際の名前に変更でき、文字起こし全体で新しい名前が更新されます。

無料30分からはじめる

はじめる – 無料30分