音声をテキストに変換する仕組みと方法
著者: Hushscript 公開日: 最終確認日:
Speech to text は、話された音声を書き言葉に変換するソフトウェアです。この用語は、似ているように思えますが、動作が異なる 2 つの異なる仕事をカバーしています。つまり、話すとテキストが表示されるライブディクテーションと、録音を渡して完成したトランスクリプトを受け取るトランスクリプションです。核となる考え方はどちらも同じです。ワークフロー、精度、結果に対して何ができるかは異なります。
このガイドでは、音声からテキストへの変換とは実際どのようなものなのか、エンジンが音声から単語にどのように変換するのか、および 2 つのモードの違いについて、わかりやすく説明します。次に、Hushscript で録音をテキストに変換する手順を、実際の例、人々をつまずかせる問題、最後に短い FAQ を示しながら説明します。
音声をテキストに変換する実際とは
最も単純に、自動音声認識 (ASR) は音波を取得して一連の単語を生成します。マイクは音声を連続波形、つまり時間の経過とともに変化する気圧を表す揺れる線として捉えます。その波形には、言葉、話者の声、部屋、エアコンのハム音など、あらゆるものが含まれています。エンジンのタスクは、そのミックスから単語を取り出して書き留めることです。
これを行うために、エンジンはオーディオを小さなスライス (通常はそれぞれ 10 ~ 30 ミリ秒) に分割し、すべてのスライスでサウンドを測定します。これらの測定値は、音のパターンを言語の音声単位、次に単語、そしてフレーズ全体にマッピングするトレーニング済みモデルに供給されます。これは何も表示されません。録音が開始され、トランスクリプトが出力されるのがわかります。しかし、内部で何が起こっているかを大まかに知れば、一部の録音がきれいに転写され、他の録音が粗く戻ってくる理由が説明されます。
2 つの知識層が連携して機能します。 1 つは音響的なものです。つまり、言語の音がどのようなもので、さまざまな声やアクセントでどのように発音される傾向があるのかということです。もう 1 つは言語的なもので、どの単語シーケンスがもっともらしいかということです。言語層は、たとえ 2 つの言葉が同じに聞こえるにもかかわらず、優れたエンジンが「そこの車が故障した」ではなく「彼らの車が故障した」と書く理由です。コンテキストを使用して人間が行うスペルを選択します。
古い音声認識は手書きのルールと小規模なトレーニングセットに依存しており、脆弱でした。最新のエンジンは、多くの話者、アクセント、録音条件から録音された数千時間の音声に基づいてトレーニングされた大規模な AI モデルです。この幅の広さが、今日のトランスクリプトが使用できる理由のすべてです。まともな録音での明瞭な音声の場合、現在のモデルの単語精度は約 90 ~ 97 パーセントです。残りの数パーセントは、このガイドで後述するトラブルシューティングが重要な部分です。
録音された音声とライブディクテーション
実際に最も重要な分割は、音声がライブで処理されるか、事後処理されるかです。
ライブディクテーションはリアルタイムで実行されます。電話、音声アシスタント、またはワードプロセッサの音声入力機能に向かって話すと、発声とほぼ同じ速度で単語が表示されます。追いつくために、エンジンは文のほとんど部分を頼りにして各単語にコミットする必要があります。これは厳しい制約であり、ディクテーションが単語を推測し、次のいくつかの単語が到着すると静かに書き直す場合があるのはこのためです。ライブディクテーションは、ハンズフリーでメモを作成したり、音声でメールを作成したり、デバイスを制御したりするなど、自分のスピーチを録音することが重要な場合に最適なツールです。
文字起こしは完全な録音に対して機能します。完成したオーディオまたはビデオファイルをエンジンに与えると、エンジンがすべてを処理し、完全なトランスクリプトが返されます。リアルタイムで何も起こる必要がないため、エンジンは単語を決定する前に先を読んで文全体を確認できるため、精度が向上します。ライブディクテーションではできない作業も可能です。話者を分離して、各行を誰が発言したかを特定し、タイムスタンプを添付できるので、テキスト行から音声のその瞬間に直接ジャンプできます。
会議、インタビュー、講義、ポッドキャストのエピソード、または録音した電話を扱う場合、ライブのディクテーションではなく、保存されたファイルから文字起こしを行っていることになります。どちらも「音声テキスト変換」として販売されているため、この 2 つは混同されます。ただし、すでに所有している録音は、ディクテーションツールとしては間違った形式であり、文字起こし者にとっては適切な形式です。 Hushscript は録音用に構築されています。ライブディクテーションモードはありません。その焦点は意図的です。完全なファイルから作業することで、精度を高めるために先読みし、同じパス内の話者にラベルを付けることができます。
録音された音声をテキストに変換する方法
ここでは、Hushscript の実際のフローを、満たす順序で示します。サインアップするには、デバイス上のファイルとしての録音、一般的な形式のオーディオまたはビデオファイル、および電子メールアドレスが必要です。それがリスト全体です。インストールするものは何もありません。
- ファイルをドロップしてプレビューを確認します。audio-to-text ページ を開いて、そこにファイルをドロップします。 Hushscript は最初の 30 秒をすぐに文字起こしし、話者がすでに分離されている状態で結果を表示します。このステップにはアカウントは必要ありません。プレビューがあるので、何かをコミットする前に自分の録音の正確さを判断できます。
- **残りを文字に起こすにはサインアップしてください。**プレビューが正しく見える場合は、メールでサインアップしてください。ファイル全体の文字起こしは制限されているため、このステップでアカウントが登場します。新しいアカウントには、サービスを適切に試すために 30 分間の無料時間が与えられます。
- **完全なファイルをアップロードします。**開始したら、録音全体をアップロードします。ビデオの場合は、最初にブラウザで音声が抽出され、音声のみが送信されるため、ビデオ自体はデバイス上に残ります。
- 読み取り、再ラベル付け、およびエクスポートします。トランスクリプトは、各ターンで話者 (話者 A、話者 B など) に帰属され、タイムスタンプが付けられて返されます。話者のラベルをクリックして名前を変更すると、その話者が話したすべての場所で新しい名前が更新されます。希望どおりに読み上げられたら、プレーンテキストの場合は TXT、字幕の場合は SRT または VTT、構造化データの場合は CSV または JSON、メモの公開の場合は Markdown、編集の場合は DOCX、共有の場合は PDF にエクスポートします。
短いインタビュー、10 分間の講義クリップ、またはさらに先に進む前に精度を確認したい場合は、長い録音の最初の部分を書き写すには 30 分もあれば十分です。無料分のロックは簡単なカードチェックですぐに解除されます。1 ドルの保留はカードをチェックするために承認され、すぐに解除され、請求されることはありません。別のお支払い方法を使用すると、最初の購入時に商品が届きます。カードは必要ありません。それはボーナスへの最短ルートにすぎません。無料の分数が終了した後は、サブスクリプションなしで、文字起こしした分だけ料金を支払います。 料金ページには、現在の料金が記載されています。
実際の例
携帯電話で 38 分間の顧客インタビューを録音したとします。通常の会議室で録音された 2 つの音声、時折コーヒー カップがカタカタする音を M4A として保存しました。
音声からテキストへのページに M4A をドロップします。 30 秒のプレビューは短い会話として表示されます。
話者 A 00:00 お時間を割いていただきありがとうございます。まず、
このようなツールを探したきっかけを教えていただけますか?
話者 B 00:11 そうですね。私たちはサポートチケットでいっぱいになり、古い
システムでは対応できなくなったので、周囲を調べ始めました。
これは未編集のプレビューです。 2 つの音声が分割され、各行にタイムスタンプが付けられ、言葉遣いもきれいです。サインアップして 38 分のファイル全体をアップロードすると、数分後には同じ形式の完全なトランスクリプトが完成します。 話者 A はあなたで、話者 B はインタビュー対象者です。そのため、「話者 A」ラベルをクリックして自分の名前を入力し、「話者 B」をクリックして名前を入力します。どちらも 1 回のパスでドキュメント全体の名前を変更します。 DOCX にエクスポートし、ワードプロセッサで開き、製品名が発音的に綴られていた 2 か所または 3 か所を修正すると、インタビューの記録が完成します。 38 分は余裕がありません。そのため、無料の 30 分は、単なるテストクリップではなく、最初の実際の仕事に便利です。
一般的な問題とその修正方法
残念なトランスクリプトのほとんどは、エンジンではなく録音に遡ります。これらは最もよく起こる問題とそれぞれの対処法です。
録音が静かである、または濁っている声がかすかであったり、部屋がブーブー聞こえる場合、エンジンの働きが低下し、精度が低下します。マイクを話者の近くに置くか、ラペルマイクやヘッドセットを口から 10 ~ 20 センチメートル以内に置くかによって、どの設定よりも大きな違いが生じます。広くて何もない部屋ではエコーが加わり、音の境界が曖昧になります。小さいスペースや家具付きのスペースの方が、より良い記録が得られます。これを事後的に修正することはできないため、次回録音する直前に修正する価値があります。
二人が同時に話します声が重なると、2 つのサウンドのセットがオーディオの同じスライス内で競合するため、言葉遣いと誰が何を言ったかの両方が難しくなります。純正のオーバーラップを修正するクリーンなソフトウェアはありません。あなたがコントロールする録音では、ターン間にビートを残しておくと、後で効果が得られます。やり直すことができないものでは、中断部分の周囲にいくつかの交差線があることを想定して、手で整えてください。
**専門用語が間違っている場合があります。**汎用モデルは日常用語をよく知っていますが、業界の専門用語、珍しい姓、製品名を必ずしも見たことがありません。これらは、綴りではなく発音によって転写される傾向があります。エクスポートされた DOCX の検索と置換により、繰り返し現れる用語が数秒でクリアされます。これが、DOCX がエクスポートで修正するのが最も簡単である理由の 1 つです。
**ファイルは読み込まれません。**ほとんどの標準的なオーディオファイルとビデオファイルは正常に機能します。拒否した場合、それは通常、珍しいコンテナか非常に古いコンテナです。無料のブラウザ内ツールを使用してファイルを通常の MP3 または WAV に変換すると、ほとんどの場合、この問題は解決されます。このツールはデバイス上で実行され、何もアップロードされません。それでもフォーマットが通過しない場合は、support@hushscript.com に電子メールを送信してください。チームがフォーマットを追加します。
1 人の話者が 2 人に分割される場合によっては、同じ人が 2 人の話者としてラベル付けされることがあります。通常は、マイクに近づいたり、ヘッドセットからスピーカーフォンに切り替えたり、回線品質が変化したりするなど、途中で声が変わったことが原因です。エンジンは声の聞こえ方に基づいてグループ化するため、大きな変化を新しい人として読み取ることができます。エディターで 2 つのラベルをマージすると、1 つのステップで問題が修正されます。この仕組みについては、話者ダイアライゼーションの仕組みに関するガイドに記載されています。
精度とアクセント
アクセントの範囲はモデルと言語によって異なります。英語の場合、広範なデータセットでトレーニングされたモデルは米国、英国、オーストラリア、インドの英語を適切に処理し、Hushscript は 4 つの異なる英語のアクセントを提供します。地域の方言が多かった場合や、アクセントの種類が少なかった場合は、さらに修正が必要になりますが、何もない状態から入力するのではなく、下書きを編集していることになります。
いくつかの習慣により、アクセントが何であれ、あらゆる録音の精度が向上します。マイクを近づけて録音します。次の作業が始まる前に、各人が作業を終了できるようにします。反響の大きい大きな部屋は避けてください。適度なペースで話すほうが、1 分あたり 200 語を超えて全力で話すよりも文字に書き起こすことができます。また、適切なビットレートも重要です。128 kbps MP3 は問題ありませんが、狭帯域で高度に圧縮されたボイスメッセージオーディオでは、エンジンが必要とするディテールが失われます。形式とそれぞれの特徴について詳しくは、音声ファイルを文字に起こす方法をご覧ください。
Hushscript は言語を自動的に検出し、約 99 の言語を文字に変換し、そのうち 18 言語ではトップクラスの精度を実現します。 1 つの言語に留まる録音は、最もきれいに転写されます。文の途中で言語を切り替えることは、どのエンジンにとっても困難です。
同じパスでの話者ラベル
話者の分離(正式には話者ダイアライゼーションと呼ばれます)は、追加料金を支払う二次的な作業としてではなく、音声認識と並行して実行されます。すべてのトランスクリプトで単語と帰属を無料で取得できます。 2 人によるインタビューや小規模な会議の場合、通常、この分離は正確であり、すべての行に手作業でタグを付けるという面倒な作業を省くことができます。ファイルに含めることができる話者の数に制限はありませんが、音声が区別でき、重複せず、似ていない場合に精度が最も高くなります。話者のラベル付けがすべてのトランスクリプトに追加料金なしで付属しているということは、このアプローチ全体がデフォルトで構築されている正直な詳細のようなものです。つまり、有用な部分が含まれており、上位層の背後に隠されているわけではありません。
押さえておくべき明白な違いはこれです。話しているときの音声入力やディクテーションをキャプチャしたい場合は、デバイスまたはワードプロセッサに組み込まれているライブツールを使用してください。テキストとして必要な録音がすでにある場合は、音声からテキストへのページからそれを文字に起こすと、より速く、より正確になり、話者ラベルとエクスポート可能な出力を 1 つのステップで作成できます。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: