MP3 をテキストに変換する方法(無料・話者ラベル付き)
著者: Hushscript 公開日: 最終確認日:
MP3 をテキストに変換することは、最も一般的な文字起こしジョブの 1 つであり、その手順はソースによって変わりません。ポッドキャストのエピソード、録音されたインタビュー、講義、または携帯電話のボイスメモはすべて同じフローを経ます。ファイルをアップロードし、トランスクリプトを待ち、必要な形式でエクスポートします。
何が変わるかというと、MP3 自体が結果にどのように影響するかです。ほとんどのガイドはそれをスキップします。 MP3 は非可逆圧縮ファイルであり、保存されたビットレートによって、音声エンジンがどの程度の詳細を処理する必要があるかが決まります。このガイドでは 3 つのステップを説明し、その後、実際の話者でラベル付けされた出力を使用した実際の例、精度を表すビットレートの実際の意味、および粗い録音を修正する方法について詳しく説明します。
必要なもの
- MP3 ファイル。任意のビットレートが読み込まれます。正確性を考えると、64 kbps が実用的な下限であり、128 kbps は数値が重要なポイントを余裕で超えています (詳細は後述します)。
- **Hushscript アカウント。**30 分間無料でお試しいただけます。ロックを解除する最も簡単な方法は、カードを追加することです。1 ドルを保持するとカードが認証され、すぐに解放され、請求されることはありません。カードを使用したくない場合は、別の支払い方法も利用できます。最初の購入時は 30 分以内に完了します。どちらの方法でもカードは必要ありません。
インストールするものは何もありません。デスクトップアプリもブラウザ拡張機能もありません。すべてがブラウザとアカウントで実行されます。
無料の分数を超えて、文字起こしは従量課金制です。サブスクリプションなしで、必要な場合にのみ分数を購入できます。料金は料金ページに記載されています。
3 つのステップで MP3 をテキストに変換します。
- ファイルをアップロードします。/audio-to-text を開き、MP3 をドロップゾーンにドラッグするか、クリックして参照します。ファイルサイズの制限なしで、最大 10 時間のファイルが受け入れられます。サインインする前にブラウザーで最初の 30 秒間プレビューが表示されるため、コミットする前に話者ラベルのスタイルを確認できます。
- **文字起こししましょう。**サインインしてファイルがアップロードされると、音声エンジンがそれを処理し、話者がすでに分離されたトランスクリプトを返します。処理時間は変化し、ジョブはバックグラウンドで実行されるため、タブを開いたままにする必要はありません。
- **エクスポート。**結果を 21 の形式のいずれかでダウンロードします。これには、プレーン TXT、タイムスタンプ付き SRT、Word DOCX、PDF、字幕およびエディターのタイムライン形式、さらにパスワードで保護された .husharchive が含まれます。すべての形式が含まれており、エクスポートにペイウォールや透かしはありません。
完成したトランスクリプトがダッシュボードで開きます。話者は、話者 A、話者 Bなどとして表示され、任意のラベルをクリックして実際の名前に変更でき、話者のすべての行が更新されます。
実際の例: 2 人によるインタビュー
founder-interview.mp3があるとします。 42 分間の録音、128 kbps、インタビュアー 1 名とゲスト 1 名、通話で録音。アップロードすると、トランスクリプトが話者の順番ごとにセグメント化され、それぞれにタイムスタンプが付けられて返されます。
[00:00:04] 話者 A: お時間を割いていただきありがとうございます。最初から始めましょう –
そのアイデアは実際どこから来たのですか?
[00:00:11] 話者 B: 正直に言うと、それは私たち自身が抱えていた問題から生まれました。私たちは
録音された通話に溺れており、どれも検索できませんでした。
[00:00:23] 話者 A: それで、必要なものを構築したのですね。
[00:00:25] 話者 B: かなりですね。最初のバージョンはテープでまとめてありました。
そこからは編集が軽くなります。話者 Aをインタビュアーに、話者 Bをゲストに 1 回名前を変更すると、すべての行が更新されます。製品名や人の姓など、エンジンが推測したいくつかの固有名詞をざっと調べて、すべてのインスタンスを 1 回のパスで修正する検索と置換を使用して修正します。このようなクリーンな 128 kbps インタビューの場合、トランスクリプトを引用可能にする前に必要なクリーンアップは通常、そのスキムだけで済みます。
ここで、無料で話者にラベルを付けるトランスクリプトが活躍します。インタビューの分割されていないテキストの壁は、誰が何を言ったかを遡ってマークするまではほとんど役に立ちません。すでに複数のターンに分割されて到着したトランスクリプトは、すぐに引用できるものです。
精度にとってのビットレートの意味
MP3 は非可逆形式です。エンコードでは、ファイルのサイズを小さくするために、最も聞こえにくいと判断された音声の部分が破棄されます。ビットレートは、エンコーダーがその処理に費やす 1 秒あたりのキロビット数です。値が低いほど、より多くのものが破棄されます。 MDN の現在の MP3 コーデックリファレンス には、この形式でサポートされているビットレートとサンプルレートが記載されており、その圧縮が非可逆圧縮であることが特定されています。
音声認識は、子音の高周波の詳細に大きく依存します。 「15」と「16」、または「できる」と「できない」の違いはそこにあります。積極的な圧縮は、まさにその詳細が最初に行われる場所です。したがって、ビットレートによってトランスクリプトが均等に劣化するわけではありません。
実際には:
- **32 kbps 以下:**人間の耳にも顕著に圧縮され、エンジンは同じように反応します。単語の間違いが増えます。文字起こしが必要な場合はこれを避けてください。
- **64 kbps:**信頼性の高い音声テキスト変換の現実的な下限です。クリアでマイクに近い音声には適しています。
- **128 kbps 以上:**文字起こしには十分快適です。値を上げてもトランスクリプトは改善されません。エンジンには、それまでに使用できるすべての詳細が含まれています。
不必要な再エンコードを節約するためのいくつかの明確化。可変ビットレート (VBR)は問題ありません。音声の固定ビットレート (CBR) よりも精度が低下することはありませんので、「修正」するためだけに VBR ファイルを変換しないでください。また、 音声には 2 つのチャンネルが必要ないため、 文字起こしにはモノラルでもステレオと同様に機能します。どちらかというと、以下のステレオダブルエンダーに関する注記を参照してください。
MP3 とロスレス: 代わりに再録音する場合
当然の疑問は、まず MP3 を WAV などのロスレス形式に変換することが役立つかどうかです。そうはなりません。オーディオが 128 kbps MP3 として保存されると、欠落していた細部は失われます。同じオーディオを WAV コンテナにラップすると、余分な情報を含まない大きなファイルが作成されるだけです。新しく録音し、選択できる場合は、ロスレスまたは高ビットレートのソースを開始点として最適です (その場合については、WAV からテキストへのガイドを参照) が、既存の MP3 を上方変換しても何も変わりません。
正直な決定ルール: 唯一のコピーが適切なビットレートの MP3 である場合は、そのまま転写します。録音が本当に悪いもの (クリップされている、ノイズに埋もれている、または 32 kbps で保存されている) で、再度キャプチャできる場合は、いかなる変換よりも再録音の方がはるかに役立ちます。新しく録音するときは、ビットレートよりも 2 つの習慣が重要です。マイクを話している人の近くに置くことと、できれば各人に自分のマイクを与えることです。ソースでのきれいな分離が単語と話者ラベルの両方を正しく伝えるためです。
一般的な問題の解決
大まかなトランスクリプトのほとんどは、ツールではなく録音に遡ります。ここでは、一般的な原因に対する対処法を示します。
**音量が小さい。**波形が平坦に見える場合 (非常に静かな録音)、エンジンが処理できる信号が少なくなり、精度が低下します。まずオーディオエディタでオーディオを正規化または増幅してから、より大きな音量のバージョンをアップロードします。レベルを上げることは、弱い録音に対する最も効果の高い修正の 1 つです。
**バックグラウンドノイズ。**定常的なノイズ (エアコン、道路のハム音) は適度に適切に処理されます。ドア、咳、カトラリーなど、音声に重なる突然の騒音が言葉落ちの原因となります。アップロード前に軽いノイズリダクションパスを実行できる場合は実行してください。ただし、過剰な処理は行わないでください。大量のノイズ除去により、ノイズよりも精度が損なわれるアーティファクトが生じます。
**重いアクセントや専門用語。**最新のエンジンは、幅広い英語のアクセントを適切に処理します。信頼できるミスとは、医薬品名、法的引用、ニッチなブランド名など、エンジンが予期する理由のないドメイン用語です。これらを見つけるには、エクスポート後に 1 回のスキムを計画し、検索と置換に頼ってください。会社名が毎回同じように間違っている場合は、1 回の修正でファイル全体が掃除されます。
**非常に長い MP3。**6 時間の録音自体は問題ありません。 10 時間の上限はほぼすべてをカバーしており、その上にファイルサイズの制限はないため、最初に長いファイルを細かく分割する必要はありません。実際に長いファイルを劣化させるのは、ファイル全体の録音品質の変動です。話者がマイクから離れたり、最初の 1 時間後にレベルが低下したり、会場が満員になり騒がしくなったりします。できる限り、ソースを安定させてください。それができない場合は、きれいなストレッチよりも粗いストレッチの方が編集が必要になることが予想されます。タイムスタンプを使用すると管理が簡単になります。全体を聞き直すのではなく、読み取り不良のパッチに直接ジャンプできます。
話者の重なり2 人が同時に話す場合、エンジンは単語を大きい方の声に割り当てます。これは、1 つのツールによるものではなく、一般に話者の分離の制限です。アップロード側の修正はありません。
話者をきれいに分離する
話者の分離 (ダイアライゼーション) は、すべてのトランスクリプトに対して追加コストなしで実行されます。MP3 レベルのいくつかの要素が、音声がどの程度きれいに出力されるかに影響します。内部でどのように機能するかについて詳しく知りたい場合は、話者ダイアライゼーションとはをご覧ください。ここでの実際的なポイント:
- **ステレオダブルエンダー。**一部のポッドキャストおよび通話セットアップでは、各話者が個別のステレオチャネルで録音されます。直感に反しますが、アップロードする前にそれを 1 つのモノラルトラックにミックスすると効果的です。エンジンは 2 つの独立したストリームではなく、1 つの混合された会話を聞きます。ほとんどの編集者はモノラルの「ミックスダウン」をエクスポートします。
- 素早いやりとり非常に短いやりとり (2 秒未満のターン) が、1 つのラベル付き発話にマージされることがあります。可読性が損なわれることはほとんどなく、特定の引用で必要な場合は手動でターンを分割できます。
- クリーンなターンが最も役立ちます。話者間のハンドオフが明確であればあるほど (中断が少なく、クロストークが少なく)、ラベルの信頼性が高くなります。設定するものは何もありません。これは純粋に録音のプロパティです。
トランスクリプトのエクスポート
適切な形式は、テキストをどのように扱うかによって異なります。以下の表は、提供されている 21 形式のうち、人々が最も利用する形式を示しています。完全なトレードオフについては、実際に必要なトランスクリプト形式をご覧ください。
| 形式 | 最適な形式 |
|---|---|
| TXT | メモ、コピー&ペースト、別のテキストへのフィードツール |
| SRT | ビデオのキャプション、またはタイムスタンプによるナビゲーション。ソースが MP4 などのビデオファイル |
| VTT | ウェブキャプションとブラウザネイティブのビデオプレーヤー |
| CSV | スプレッドシートのレビューと軽量データの引き渡し |
| マークダウン | メモ、README 形式のファイル、編集可能な下書きの公開 |
| JSON | プログラムによる処理とカスタムツール |
| DOCX | Word で作業する編集者または注釈作成者との共有 |
| 読み取り専用の共有とアーカイブ |
すべてのエクスポートには話者ラベルが含まれます
タイムスタンプと編集
エディターには、各発話がその開始時刻、話者ラベル、テキストとともに表示されます。任意の行をクリックすると、テキストに対して音声のそのセグメントが再生されます。これは、ファイル全体を手動でスクラブせずに、扱いにくいパッセージをチェックするのに便利です。
SRT エクスポートのタイムスタンプは発話レベルにあります。単語ごとではなく、話者のターンごとに 1 つのエントリです。キャプション、ナビゲーション、タイムスタンプ付きの引用の場合、これが適切な粒度です。コードで処理する単語レベルの構造が必要な場合は、JSON をエクスポートします。各エントリには、話者ラベル、ミリ秒単位の開始時刻と終了時刻、およびそのターンのテキストが表示されます。
アップロード、文字起こし、エクスポート: これがすべての作業であり、MP3 固有の詳細が結果のきれいさを決定します。 MP3-to-text ページ には完全な機能の概要が記載されており、別のコンテナ内の録音を操作している場合は、audio-to-text ページ ですべての形式を同じようにカバーしています。ショー全体をやるのですか? ポッドキャスト文字起こしガイドでは、文字起こしを番組ノートに変換する手順が説明されています。ファイルが MP3 ではなく WAV の場合、WAV からテキストへの変換ガイドには、大きなロスレスファイルの処理に関する注意事項が記載されています。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: