ブログ
録音を文字起こしする方法:手法と手順
著者: Hushscript 公開日: 最終確認日:
録音は、テキストになって初めて役に立ちます。会議、電話、ボイスメモ、1対1のインタビュー — 何が音源であれ、直面する課題は同じです。検索でき、引用でき、その場にいなかった人にも渡せる文章が必要になります。このガイドは数分から数時間程度の一般的な録音を対象に、手法選びから最終的なエクスポートまでを扱います。2時間を超える録音については長い録音を文字起こしする方法を、複数ファイルをまとめて扱う場合は録音フォルダーを文字起こしするをご覧ください。
手動、自動、ハイブリッド
音声をテキストにする方法は3通りあり、たいていの人は録音の種類に応じてこれらを使い分けています。
手動での文字起こしとは、自分で聞きながら一言一句タイプすることです。完全にコントロールでき、第三者が関与しませんが、時間がかかります。再生・タイプ・校正を含めると、クリアな音声1時間分でも丁寧に進めれば簡単に数時間かかります。短いクリップ、自動ツールが苦手とする言語の録音、あるいは絶対に手元から出せない資料には理にかなっています。
自動音声認識は、同じ作業を数時間ではなく数分で終わらせます。モデルが波形を読み取り、最も可能性の高い単語を予測し、句読点と話者ラベルが付いたドラフトを返します。ドラフトは完璧ではありませんが、日常的な録音の大半では、軽く読み直すだけで残りの誤りを拾えるくらい十分な精度です。
ハイブリッド文字起こしは、自動ドラフトに自分でレビューを加えたものです。繰り返し発生する文字起こし業務の多くはここに落ち着きます。タイピングの大部分はモデルが担い、名前・専門用語・聞き間違えた箇所は自分で対応します。手動作業のごく一部のコストで、レビューなしの自動ドラフトより仕上がりのきれいな結果が得られます。
どちらが向いているかは、録音の長さよりも、そのトランスクリプトを後でどう使うかで決まります。記事用の引用であれば、方法にかかわらず一言一句を音声と照らし合わせて確認する必要があります。自分用の大まかな会議メモであれば、レビューがほぼ不要な場合も珍しくありません。
精度を実際に左右するもの
文字起こしの精度を最も左右するのは、読み取るソフトウェアではなく録音そのものです。クリアで、話者に近い位置で収録され、一人ずつ話している音声なら、ほぼどの自動システムでもきれいなドラフトになります。部屋の反対側から録った音声、状態の悪い電話回線、3人が同時にしゃべっている状況では、どのツールを使っても誤りが出ます。W3Cによる正確なトランスクリプト作成のガイダンスもアクセシビリティの観点から同じ点を指摘しています。トランスクリプトは音声の代わりを務めるものであり、その場にいた人にとって元の録音がどれほど聞き取りやすかったかとは関係なく、それ自体で精度が成立していなければなりません。
アップロード前に自分で決められることのうち、後からの設定よりも重要なものがいくつかあります。
- 部屋の反対側からではなく、話者の近くで録音する。
- 同じ会話に2台のマイクを向けないこと。信号を増やさずに部屋の雑音だけが二重になります。
- ファイル側で選べるなら、小さいファイルよりも高いビットレートを優先する。圧縮によるアーティファクトは、人の耳にとってのノイズと同じように音声モデルにも読み取られます。
自動音声認識に関する最近の研究、たとえば2024年のディープラーニング手法によるASRのサーベイは、クリアな音声での精度がどこまで向上したか、そして特定のアクセント・分野・ノイズ環境に対する学習データへの依存度がまだどれほど大きいかを追っています。どのシステムもあらゆる録音を等しく読み取れるわけではないため、重要な案件で結果を信頼する前に、自分自身の音声でテストしておくのが依然として安全な習慣です。
録音を文字起こしする手順
- ファイルをアップロードする。音声からテキストへに録音をドロップします。一般的な音声・動画形式はそのまま受け付けられます。動画の場合、何かがアップロードされる前にブラウザ内で音声が抽出されます。
- **プレビューを確認する。**サインインする前に、最初の数分が話者ラベル付きで文字起こしされて返ってくるので、音声が十分にクリアかどうか、話者の分割が理にかなっているかを判断できます。
- **サインインして実行させる。**フルファイルがアップロードされ、ジョブは自動的に完了します。タブを開いたままにしておく必要はありません。
- **話者名を変更する。**話者Aのような仮のラベルは、一度編集するだけで実名になり、トランスクリプト全体に反映されます。
- **重要な箇所は音声と照らし合わせて読む。**名前・数字・専門用語など、モデルが誤認しやすい箇所を中心に目を通します。
- **エクスポートする。**最初に読み込まれた形式ではなく、次の工程で必要な形式を選びます。
話者ラベル、複数人が話している場合
複数の声が含まれる録音は、話者を分離しないとトランスクリプトが実際には読みにくくなります。話者の区切りがない一枚岩のテキストは、音声そのものとほとんど変わりません。話者識別は声ごとに会話を分割し、仮のラベルを一度リネームすれば、その話者が登場するすべての箇所に反映されます。各人の声が十分に異なり、常に他の人の発言を遮っていない場合にうまく機能します。似た声の2人が重なって話すケースは、自動化されたシステムに限らず、どのシステムにとっても依然として難所です。
次の工程に合わせてエクスポート形式を選ぶ
適切なエクスポート形式は、一見最も完成度が高く見えるものではなく、そのテキストがどこに向かうかで決まります。
- プレーンテキスト — 別の文書に貼り付けたり、要約ツールに読み込ませたりする場合。
- SRTまたはVTT — 動画に字幕を付ける際、プレイヤーが読み取れるタイムスタンプが必要な場合。
- DOCX — コメントや編集をしたい相手と共有する場合。
- JSON — 話者情報やタイミングデータを保持したまま、自前のツールに流し込む場合。
同じジョブから複数の形式をエクスポートしても追加費用はかからないため、最初から1つの正解を推測する必要はなく、実際に使う2つか3つの形式をまとめて取得できます。
プライバシー、録音を残したくない場合
すべての録音が恒久的なアーカイブに向いているわけではありません。機密性の高い通話、デリケートなインタビュー、文字起こし後は消えてほしい一回限りのメモ — こうした場合は普段の作業とは異なる設定が必要です。プライベート文字起こしはアカウントへの保存を一切スキップします。結果は、履歴に無期限に残るのではなく、パスワードで保護されたダウンロードとして返され、一度も開かなければ期限切れになります。
迷う場合は、プライベートモードを既定にするのが安全な選択です。次のトランスクリプトは後からいつでも保存する側に切り替えられますが、今回の録音をさかのぼって「保存しなかったこと」にはできません。
一般的な録音にかかる費用
料金は音声の分数に応じて決まり、ファイル・形式・話者数は関係ありません。45分の電話通話と45分のボイスメモは、同じ料金で文字起こしできます。5時間(300分)パック($5.99)に対して、45分の録音はその残高からおよそ45分を消費するだけで、パックのごく一部にすぎず、残りは次の録音のために残ります。使っても使わなくてもサブスクリプションは発生しません。パックがどのように広がっていくかは従量課金制の文字起こしをご覧ください。
1件の録音をテキストに変換するかどうかは、見た目ほど大きな決断ではありません。トランスクリプトに何が求められるかに応じて手動・自動・ハイブリッドを選び、録音に対して少しでもコントロールがあればクリアな音声をモデルに渡し、実際に重要な部分を結果と照らし合わせて確認する。このガイドが対象外とした長さや件数のケースについては、長い録音を文字起こしする方法と録音フォルダーを文字起こしするで詳しく扱っています。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: