文字起こしに専門用語を覚えさせる方法
著者: Hushscript 公開日: 最終確認日:
汎用音声エンジンでは、チームが会議で 10 回使用する製品コード名、地域の姓、または内部略語のコンテキストが少なくなります。研究では、認識を予想される用語に向けて誘導する手法をコンテキストバイアスと呼んでおり、2025 W3C Web Speech セッションでは、これが Chrome に搭載されている機能であると説明されています。 Hushscript は、そのアイデアを 4 つのボキャブラリコントロールに変換します。これは、1 つのファイルへの 1 回限りの追加から、再利用できる常設のセットアップまで多岐にわたります。
カスタムボキャブラリが最も役立つ場所
汎用モデルによる認識ミスのほとんどは、3 つのカテゴリが原因です。人の名前、特に最も一般的ではないスペルが最初に表示されます。モデルは、その名前が関係していると何かが知らせない限り、音声が「Nguyen」と言ったか、それともほぼ同音異義語を言ったかを推測する方法がありません。製品名とブランド名が 2 番目です。「FlowBridge」のような名前は、特定の企業が選んだ固有名詞ではなく、その響きが普通の 2 つの単語として聞こえます。 3 番目は社内専門用語と頭字語です。これは、1 つのチームまたは業界内でのみ意味を持ち、一般的な語彙には決して含まれない用語です。臨床現場での薬剤名と処置名は、より大きな規模では同じ問題であり、医療転写では、これらの語彙ツールと並行して専用のモードを使用して処理します。会議中に 10 回繰り返された頭字語は、10 回間違って転写されるか、10 回正しく転写されるかのどちらかです。部分的なクレジットはないため、キー用語リストまたは辞書で一度修正すると、そのファイル内のすべての出現箇所が自動的に修正されます。
単一ファイルの場合: キー用語とカスタムプロンプト
通常とは異なる録音を文字起こししていて、永続的なセットアップが必要ない場合は、そのジョブにキータームを直接追加します。そのファイルだけで、最大 1,000 個のキーワード (名前、ブランド、頭字語) によって、ユーザーが実際に話した単語に対して認識が偏ります。これらに加えて、最大 2,000 文字のカスタムプロンプトにより、音声だけでは表現できないコンテキスト (誰が話しているのか、録音内容、状況に特有の用語など) がエンジンに提供されます。どちらもジョブ後に消えます。再度追加しない限り、次のファイルには何も引き継がれません。
繰り返しの作業の場合: 保存された辞書とプロンプトプリセット
ファイルごとに同じ名前や専門用語が出現すると、1 回限りのリストは再入力する価値がなくなります。保存された辞書は、CSV または TSV ファイルから用語を一括でインポートし、カテゴリに整理し、各正規用語にスペルのバリエーションを添付して、ソース音声が「MacAlister」または「McAllaster」のように聞こえるかどうかに関係なく「McAllister」が認識されるようにする問題を解決します。プロンプトプリセットはコンテキストに対しても同様に機能し、毎回再入力する必要があった背景を保存します。辞書またはプリセットのいずれかをデフォルトとしてマークすると、次回文字起こしするときに自動的に事前選択されるため、常設のセットアップではファイルごとに再選択する必要はありません。
これらは結合され、互いに置き換えられることはありません
常駐の辞書と 1 回限りの追加は、2 つのオプションの間で選択するものではありません。彼らは一緒に同じ仕事に応募します。チームの製品名のデフォルトの辞書と、通常の録音内容を説明するデフォルトのプロンプトを保持してから、今週のファイルにのみ関連するゲストの名前に 1 回限りのキータームを追加します。スタンディングセットアップでは、繰り返し出てくる語彙をカバーします。 1 回限りの追加では、この録音に特有の内容がカバーされています。どちらも、もう一方がすでに処理している内容を考慮する必要はありません。
触れないもの
4 つの形式のいずれかのカスタム語彙は、文字起こし中にエンジンが聞く内容を形成し、後の Insights ジョブを構成するものではありません。Insightsは、結果として得られるトランスクリプトに対して実行されます。したがって、語彙を早期に適切に取得すると、Insights が生成する内容を変更することなく、Insights が読み取るソーステキストを改善できます。
実際の例
毎週のポッドキャストでは、エピソードごとに異なるゲストにインタビューしますが、常に同じ 3 つの製品ラインを名前で取り上げます。ホストは保存済みの辞書を一度作成し、製品名とチーム自身の名前のスプレッドシートからインポートし、番組で実際に言う方法で綴り、それをデフォルトとしてマークします。毎週のエピソードが自動的に特典として付与されます。その週のゲストについては、既存の辞書に知られる理由がない名前であるため、ホストはアップロードする前に、そのファイルに固有のキータームを 1 つ追加します。常設辞書と 1 回限りのキーワードは両方とも同じトランスクリプトに適用され、どちらも他方に触れる必要はありません。
設定場所
語彙オプションは、1 回限りのキーワードを 1 回のアップロードに追加する場合でも、保存された辞書を管理する場合でも、音声からテキストへの他のファイルごとの設定と並行して使用できます。繰り返しの仕事。 Hushscript が記録内で自動検出するおよそ 99 の言語に関係なく、同じように機能します。言語ページには完全なリストがあり、どの言語が最高レベルの精度を得るのかが示されています。語彙を心配する前に文字起こし自体を正しく行う方法については、この例で説明する定期ゲストのワークフローのポッドキャストを文字起こしする方法をご覧ください。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: