あらゆる音声ファイルをテキスト化する方法
著者: Hushscript 公開日: 最終確認日:
ポッドキャストエディターからの MP3、iPhone からの M4A、フィールドレコーダーからの WAV、ボイスレコーダー アプリからの不明瞭な CAF。それらのいずれかをトランスクリプトする場合は、同じことを行います。ファイルをドロップし、話者がすでに分離されているトランスクリプトを取得し、必要な形式でエクスポートします。オーディオが入っているコンテナによって手順は変わりません。
形式が影響するのは、もう少し下の方にあります。ファイルの大きさ、どの程度きれいに転写されるか、まれにファイルが読み込まれない場合の対処方法などです。このガイドでは、どのオーディオ形式が機能するか、すべてのオーディオ形式を処理する 1 つの方法、選択肢がある場合に最適な形式を選択する方法、および粗いファイルを修正する方法について説明します。
必要なもの
- **オーディオ (またはビデオ) ファイル。**以下の一般的な形式のいずれか。デスクトップアプリや拡張機能など、インストールするものは何もありません。すべてがブラウザとアカウントで実行されます。
- **全文トランスクリプト用の Hushscript アカウント。**30 分間無料でお試しいただけます。ロックを解除する最も簡単な方法は、カードを追加することです。1 ドルを保持するとカードが認証され、すぐに解放され、請求されることはありません。カードを使用したくない場合は、別の支払い方法も利用できます。最初の購入時に 30 分が適用されます。
30 秒のプレビューにはアカウントは必要ありません。サインアップする前に、ファイルをドロップして話者ラベルのスタイルを確認することができます。これは、何かをコミットする前に出力が適合しているかどうかを確認するための正直な方法です。無料の分を超えて、文字起こしは従量課金制です。サブスクリプションなしで、必要な場合にのみ分を購入します。料金は料金ページに記載されています。
使用できる音声形式
Hushscript はすべての標準音声形式を使用します。それぞれの傾向がどこから来たのかを次に示します。そうすることで、自分が何を取得しているのかを認識できるようになります。
名前は単なるファイル名規則ではありません。現在のIANA メディアタイプレジストリは、audio/aac、audio/mp4、audio/mpeg、audio/ogg、audio/opusなどの標準化されたタイプを記録しています。そのため、コンテナとコンテナ内のオーディオエンコーディングは分離されています。
| 形式 | 一般的なソース |
|---|---|
| MP3 | ポッドキャスト、電話録音、ほとんどの録音からのエクスポートアプリ |
| M4A / AAC | iPhone ボイスメモ、WhatsApp ボイスメモ、Apple エクスポート |
| WAV | デジタルレコーダー、DAW エクスポート、Windows ボイスレコーダー |
| FLAC | アーカイブ録音、DAW エクスポート、ロスレスリッピング |
| OGG | Android ボイスメモ、オープンソース録音ツール |
| AIFF / CAF | Mac および iOS オーディオ、GarageBand |
ビデオファイルは同じように機能します。 MP4、MOV、WebM、または MKV をドロップすると、アップロード前にオーディオトラックがブラウザで抽出されるため、ビデオ自体がデバイスから離れることはありません。音声のみがサーバーに到達します。
上記のリストは柵ではありません。この約束は、サポートされている形式のテーブルよりも簡単です。ファイルをドロップするだけで変換され、転写されます。本当に珍しいもの (古い Nokia の AMR ファイル、10 年前の Android の.3gp、RealAudio クリップ) がある場合は、とにかくアップロードしてみてください。ブラウザはほとんどの標準コンテナを読み取ることができます。それができない場合は、2 つのフォールバックがあります。/tools にある無料のブラウザ内ツールを使用して MP3 または WAV に変換し、それをアップロードするか、support@hushscript.com にメールで送信してください。フォーマットを追加します。ファイルが対象となるかどうかを事前に判断する必要はありません。
3 つのステップで音声ファイルを文字起こしする
どの形式で開始しても、フローは同じです。最初のステップは、アカウントを取得する前に行われます。
- ファイルをドロップしてプレビューします。/audio-to-text に移動し、ファイルをドロップゾーンにドラッグするか、クリックして参照します。最初の 30 秒は、アカウントを必要とせずに、話者でラベル付けされてブラウザーですぐに文字起こしされます。これは、何かにサインアップする前に、出力が希望どおりに読み取られるかどうかを確認するためのチェックです。
- **残りを文字に起こすにはサインアップしてください。**アカウントを作成するには、メールアドレスを入力してください。カードを追加して認証するとき (上記の 1 ドルの保留)、または別の方法でお支払いの場合は最初の購入時に、30 分の無料ロックが解除されます。完全なファイルはここからアップロードされます。録画は最大 10 時間実行でき、ファイルサイズの制限はありません。非常に大きなファイルでもブラウザーで直接準備されます。サービスの安全性とアクティブなジョブの保護措置も適用されます。
- **トランスクリプトを取得してエクスポートします。**音声エンジンはファイルを処理し、話者がすでに分離されているトランスクリプトを返します。必要に応じて話者の名前を変更し、21 の形式 (TXT、SRT、DOCX、PDF に加え、字幕とエディターのタイムライン形式) のいずれか、またはパスワードで保護された .husharchive でダウンロードします。すべてのエクスポートが含まれています: ペイウォールやウォーターマークはありません。
処理はバックグラウンドで実行され、オーディオの長さに応じて調整されます (録音時間あたり約数分)。そのため、長いファイルが終了する間タブを開いたままにする必要はありません。
実際の例: 1 つの録音、2 つのフォーマット
録音したとします。 38 分間の会話がレコーダーに 2 回保存されました。フル品質のmeeting.wavと、携帯電話で同時に作成されたmeeting.m4aです。どちらも同じ 3 つのステップを経て、トランスクリプトは話者の順番ごとにセグメント化され、それぞれにタイムスタンプが付けられて返されます。
[00:00:06] 話者 A: 始める前に、私が送った数字は皆さん受け取りましたか?
[00:00:10] 話者 B: 今朝受け取りました。 Q3 の番号は、私が
詳しく掘り下げたい番号です。
[00:00:17] 話者 A: そうですね、それが移動した行です。
[00:00:21] 話者 C: その間、後で雇用に戻ってもいいですか?
2 つのファイルは、基本的に同じトランスクリプトを作成します。 WAV ははるかに大きなアップロードであり、M4A は小さなアップロードですが、どちらも同じ基礎となる音声を伝えているため、単語と話者ラベルは同じように着地します。ここからの編集は簡単です。話者 Aを 1 回クリックして名前を変更すると、話者が持つすべての行が更新されます。エンジンが推測したいくつかの固有名詞 (姓、製品名) をざっと読み取って、検索と置換を使用して修正します。これにより、すべてのインスタンスが 1 回のパスで修正されます。
これが、すべての形式に対して 1 つのメソッドを実行した実質的な結果です。 WAV、M4A、MP3 ごとに別のツールや別のメンタルチェックリストを保持する必要はありません。レコーダー、携帯電話、または他の人からエクスポートされたものが何であれ、同じドロップゾーンを通過し、同じ種類のトランスクリプトとして出力されます。
正確性のために最適な形式を選択する
ほとんどの場合、選択することはできません。渡されたファイルを転記すれば大丈夫です。ただし、オーディオの録音またはエクスポートの方法を制御する場合、いくつかの選択肢によって、結果がどれだけきれいにできるかが決まります。
**録音品質は、はるかに大きな差で最優先されます。**適切なマイクからの 128 kbps MP3 は、ラップトップの内蔵マイクで部屋全体で録音されたロスレス WAV よりも常に優れています。形式を考える前に、マイクを話している人の近くに置くことを考えてください。コンテナは 2 番目に遠いです。
**非常に低いビットレートの MP3 は避けてください。**MP3 は非可逆性です。エンコードでは、ファイルを小さく保つためにオーディオの一部が破棄され、ビットレートが低いほど、破棄される量が多くなります。音声認識は、「15」と「16」、または「できる」と「できない」の間のギャップが存在する子音の高周波の詳細に依存しています。積極的な圧縮では、最初にその細部が正確に取り込まれます。約 64 kbps を下回ると、ワードエラーが増加します。 128 kbps 以上では、数値が重要になる段階はすでに過ぎています。ビットレートが高くてもトランスクリプトが改善されるわけではありません。
**ロスレスはフォーマットを変数として削除します。**WAV、FLAC、AIFF は非圧縮オーディオをエンジンに渡します。クリーンな録音の場合、良好な MP3 よりも精度が向上するのはわずかですが、圧縮は完全に不要になります。 MDN のデジタルオーディオガイド では、根本的なトレードオフについて説明しています。ロスレスではより大きなサイズでディテールが保持されますが、非可逆エンコーディングでは情報が破棄されるため、オーディオがさらに圧縮されます。これは、録音が貴重で、そのフォーマットに費用がかかるかどうかを後から考えたくない場合に便利なコンテキストです。
**モノラルでも問題ありません。ステレオは必要ありません。**エンジンは音声用に内部でステレオをモノラルにミックスするため、モノラルファイルも同様に文字起こしされ、低速接続でもより速くアップロードされます。微妙な点が 1 つあります。設定で各人物が別々のステレオチャンネル (「ダブルエンダー」) で録音されている場合、アップロードする前に単一のモノラルトラックにミックスダウンすると、話者のラベル付けが容易になる傾向があります。これは、エンジンが 2 つの独立したストリームではなく 1 つの混合された会話を聞くためです。
**サンプルレートが 16 kHz を超えていても、音声としては何も役に立ちません。**16 kHz から 48 kHz までは機能し、ビデオエディターからの 48 kHz WAV は、基になる音声が同じであれば、電話アプリからの 16 kHz モノラルファイルと同じものを文字起こしします。モデルは音楽ではなく音声でトレーニングされるため、レートを高くしても精度が向上することはありません。
可逆性と非可逆性、および変換が役立つ場合
よくある質問: MP3 を WAV に変換するとまず精度が向上しますか?そうはなりません。オーディオを 128 kbps MP3 として保存すると、破棄されたディテールは永久に失われます。同じオーディオを WAV にラップすると、余分な情報のない、より大きなファイルが作成されるだけです。上向き変換は、読み込まれない形式の回避策としてのみ役立ち、精度向上には決して役に立ちません。
下向き変換は、本当に役立つケースです。数時間にわたる WAV は非常に大きなファイルになる可能性があります。アップロードする前に 128 kbps MP3 に再エンコードすると、精度を大幅に犠牲にすることなく大幅に圧縮され、低速リンクでのアップロードが高速化されます。無料のブラウザ内コンバータは、音声をデバイスから出力することなくこれを行います。正直なルール: ファイルがすでに読み込まれていて、極小ビットレートではない場合は、そのまま転記します。ファイルが開かない、ファイルが大きすぎて快適にアップロードできないなど、実際の問題を解決する場合にのみ変換してください。
話者ラベル、無料で付属
すべての Hushscript トランスクリプトには、追加料金なしで自動話者分離 (ダイアライゼーション) が付属しています。エンジンは個別の音声を選択し、話者 A、話者 Bなどのラベルを付けます。エディターで話者ごとに 1 回クリックするだけで、名前を実際の名前に変更できます。これは、ソース形式に関係なくデフォルトでオンになり、個別の話者ラベル層はありません。
ラベルがどの程度きれいに出力されるかは、ファイルタイプではなく録音によって決まります。
- **明確な順番が最も効果的です。**人々が順番に交代し、お互いに話し合わない場合、ラベルは信頼できます。 2 人によるインタビューは通常、きれいに分離されます。
- **重なり合うのは難しいケースです。**2 つの声が同時に届くと、エンジンはその言葉を大きい方に割り当てます。これは話者分離一般の制限であり、特定のツールの制限ではありません。活発なグループ通話のクロストークのために少し編集時間を確保してください。
- **似たような声はぼやける可能性があります。**非常によく似た音域を持つ 2 人 (同性の兄弟など) は、どんなダイアライゼーションエンジンにも挑戦するでしょう。適度な信号対ノイズ比は、全体の分離に役立ちます。
ほとんどのインタビュー、ポッドキャスト、会議では、ラベルはせいぜい数回再割り当てするだけで使用できるようになります。内部でダイアライゼーションがどのように機能するかについて詳しく知りたい場合は、話者ダイアライゼーションとはを参照するか、機能の概要については話者識別ページをご覧ください。
粗いファイルを修正する
大まかなトランスクリプトのほとんどは、形式や音声ではなく、録音に遡ります。ツール。一般的な原因とその対処法:
ファイルが読み込まれないまれですが、異常なコンテナまたは破損したコンテナで発生します。無料のブラウザ内コンバータを試して、最初に MP3 または WAV として再ラップすると、ほとんどの頑固なファイルが修正されます。それでも解決しない場合は、support@hushscript.com まで電子メールを送信してください。フォーマットサポートの追加は、私たちが行っていることです。
**音量が小さい。**録音が非常に静かな場合、エンジンが処理できる信号が少なくなり、精度が低下します。アップロードする前に、エディタでオーディオを正規化または増幅します。弱い録音のレベルを上げることは、最も効果の高い修正の 1 つです。
バックグラウンドノイズ定常的なノイズ (エアコン、道路のハム音) は適度に適切に処理されます。音声に重なる突然の騒音(ドア、咳、食器類)が言葉を落とす原因となります。アップロード前に軽いノイズリダクションを行うと効果的ですが、やりすぎないように注意してください。大量のノイズ除去により、ノイズよりも精度を損なうアーティファクトが追加されます。
重いアクセントや専門用語最新のエンジンは、幅広いアクセントを適切に処理します。信頼性の高いミスは、エンジンが予期する理由のないドメイン用語です (医薬品名、法的引用、ニッチなブランド名など)。エクスポート後に 1 回のスキムを計画し、検索と置換を重視します。名前が毎回同じように間違っている場合は、1 回の修正でファイル全体が処理されます。
**非常に大きいファイルまたは非常に長いファイル。**10 時間の上限はほぼすべてをカバーしており、ファイルサイズの制限はないため、長い録音を分割する必要はありません。ロスレスファイルがブラウザで準備するには扱いにくいほど大きい場合は、処理を高速化するために、最初に 128 kbps MP3 に再エンコードします (実際の精度コストはかかりません)。長時間のセッションの詳細については、長時間録音ガイドで詳しく説明しています。
ファイルに何が起こるか
音声は、トランスクリプトの準備ができた瞬間にサーバーから削除されます。クラウドストレージはなく、モデルのトレーニングに使用されず、保存期間もありません。ビデオファイルをドロップした場合、抽出された音声のみがサーバーに到達し (ビデオはデバイスに残ります)、必要に応じていつでもワンクリックでトランスクリプト自体をダッシュボードから削除できます。
トランスクリプトのエクスポート
トランスクリプトを作成した後、テキストの処理に適した形式を選択します。 実際に必要なトランスクリプト形式がわからない場合は、以下の一般的な選択肢から始めてください。
| 形式 | 含まれるもの | 最適用 |
|---|---|---|
| TXT | 話者ラベル、プレーンテキスト | メモ、検索、別のツールへのフィード |
| SRT | 発話ごとのタイムスタンプ、話者ラベル | ビデオキャプション、時間による長時間録画のナビゲート |
| VTT | ウェブキャプションのタイムスタンプ、話者ラベル | HTML5 ビデオプレーヤーとウェブパブリッシング |
| CSV | 話者、タイミング、テキストフィールドを含む行 | スプレッドシートのレビューと軽量のデータ引き渡し |
| Markdown | Markdown での話者ラベル付きトランスクリプト | メモ、ドキュメント、公開ワークフロー、静的サイト |
| DOCX | Word または Google ドキュメント用にフォーマット済み | 編集、共有、注釈 |
| JSON | { speaker, start, end, text }アイテムごと | パイプラインとカスタムツール |
| 読み取り可能な固定レイアウトのトランスクリプト | 読み取り専用の共有とアーカイブ |
すべてのエクスポートには、透かしのない話者ラベルが付けられます。また、すべてのエクスポート形式がすべてのプランに含まれており、その中には 30 分間の無料時間が含まれます。 SRT のタイムスタンプは発話レベル (話者のターンごとに 1 つのエントリ) にあり、これはキャプションと引用に適切な粒度です。コードで処理する単語レベルの構造が必要な場合、JSON を使用すると、各ターンの開始時刻と終了時刻がミリ秒単位で表示されます。
言語
Hushscriptは、約 99 の言語を文字起こしし、手動で設定するのではなく、自動的に検出されます。精度は 18 で最も高く、これには 4 つの英語 (グローバル、イギリス、オーストラリア、アメリカ)、スペイン語、フランス語、ドイツ語、日本語、中国語、ヒンディー語、アラビア語が含まれます。完全なリストは言語のページにあります。
同じ言語のトランスクリプトと翻訳されたトランスクリプトのどちらを使用するかを決定する場合は、「音声をテキストに翻訳する」 ガイドで違いが説明されています。
これがすべての作業 (ドロップ、文字起こし、エクスポート) です。どの形式で開始しても同じように読み取られます。形式固有のメモについては、兄弟ガイドで最も一般的なケースである MP3、WAV、M4A / Apple Voice Memo が取り上げられています。 audio-to-text ページ には完全な機能の概要があり、すべての形式が同じ方法でそこに表示されます。ファイルをドロップするだけです。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: