メインコンテンツへスキップ

ブログ

録音を文字起こしする方法:手法と手順

著者: 公開日: 最終確認日:

録音は、テキストになって初めて役に立ちます。会議、電話、ボイスメモ、1対1のインタビュー — 何が音源であれ、直面する課題は同じです。検索でき、引用でき、その場にいなかった人にも渡せる文章が必要になります。このガイドは数分から数時間程度の一般的な録音を対象に、手法選びから最終的なエクスポートまでを扱います。2時間を超える録音については長い録音を文字起こしする方法を、複数ファイルをまとめて扱う場合は録音フォルダーを文字起こしするをご覧ください。

手動、自動、ハイブリッド

音声をテキストにする方法は3通りあり、たいていの人は録音の種類に応じてこれらを使い分けています。

手動での文字起こしとは、自分で聞きながら一言一句タイプすることです。完全にコントロールでき、第三者が関与しませんが、時間がかかります。再生・タイプ・校正を含めると、クリアな音声1時間分でも丁寧に進めれば簡単に数時間かかります。短いクリップ、自動ツールが苦手とする言語の録音、あるいは絶対に手元から出せない資料には理にかなっています。

自動音声認識は、同じ作業を数時間ではなく数分で終わらせます。モデルが波形を読み取り、最も可能性の高い単語を予測し、句読点と話者ラベルが付いたドラフトを返します。ドラフトは完璧ではありませんが、日常的な録音の大半では、軽く読み直すだけで残りの誤りを拾えるくらい十分な精度です。

ハイブリッド文字起こしは、自動ドラフトに自分でレビューを加えたものです。繰り返し発生する文字起こし業務の多くはここに落ち着きます。タイピングの大部分はモデルが担い、名前・専門用語・聞き間違えた箇所は自分で対応します。手動作業のごく一部のコストで、レビューなしの自動ドラフトより仕上がりのきれいな結果が得られます。

どちらが向いているかは、録音の長さよりも、そのトランスクリプトを後でどう使うかで決まります。記事用の引用であれば、方法にかかわらず一言一句を音声と照らし合わせて確認する必要があります。自分用の大まかな会議メモであれば、レビューがほぼ不要な場合も珍しくありません。

精度を実際に左右するもの

文字起こしの精度を最も左右するのは、読み取るソフトウェアではなく録音そのものです。クリアで、話者に近い位置で収録され、一人ずつ話している音声なら、ほぼどの自動システムでもきれいなドラフトになります。部屋の反対側から録った音声、状態の悪い電話回線、3人が同時にしゃべっている状況では、どのツールを使っても誤りが出ます。W3Cによる正確なトランスクリプト作成のガイダンスもアクセシビリティの観点から同じ点を指摘しています。トランスクリプトは音声の代わりを務めるものであり、その場にいた人にとって元の録音がどれほど聞き取りやすかったかとは関係なく、それ自体で精度が成立していなければなりません。

アップロード前に自分で決められることのうち、後からの設定よりも重要なものがいくつかあります。

自動音声認識に関する最近の研究、たとえば2024年のディープラーニング手法によるASRのサーベイは、クリアな音声での精度がどこまで向上したか、そして特定のアクセント・分野・ノイズ環境に対する学習データへの依存度がまだどれほど大きいかを追っています。どのシステムもあらゆる録音を等しく読み取れるわけではないため、重要な案件で結果を信頼する前に、自分自身の音声でテストしておくのが依然として安全な習慣です。

録音を文字起こしする手順

  1. ファイルをアップロードする。音声からテキストへに録音をドロップします。一般的な音声・動画形式はそのまま受け付けられます。動画の場合、何かがアップロードされる前にブラウザ内で音声が抽出されます。
  2. **プレビューを確認する。**サインインする前に、最初の数分が話者ラベル付きで文字起こしされて返ってくるので、音声が十分にクリアかどうか、話者の分割が理にかなっているかを判断できます。
  3. **サインインして実行させる。**フルファイルがアップロードされ、ジョブは自動的に完了します。タブを開いたままにしておく必要はありません。
  4. **話者名を変更する。**話者Aのような仮のラベルは、一度編集するだけで実名になり、トランスクリプト全体に反映されます。
  5. **重要な箇所は音声と照らし合わせて読む。**名前・数字・専門用語など、モデルが誤認しやすい箇所を中心に目を通します。
  6. **エクスポートする。**最初に読み込まれた形式ではなく、次の工程で必要な形式を選びます。

話者ラベル、複数人が話している場合

複数の声が含まれる録音は、話者を分離しないとトランスクリプトが実際には読みにくくなります。話者の区切りがない一枚岩のテキストは、音声そのものとほとんど変わりません。話者識別は声ごとに会話を分割し、仮のラベルを一度リネームすれば、その話者が登場するすべての箇所に反映されます。各人の声が十分に異なり、常に他の人の発言を遮っていない場合にうまく機能します。似た声の2人が重なって話すケースは、自動化されたシステムに限らず、どのシステムにとっても依然として難所です。

次の工程に合わせてエクスポート形式を選ぶ

適切なエクスポート形式は、一見最も完成度が高く見えるものではなく、そのテキストがどこに向かうかで決まります。

同じジョブから複数の形式をエクスポートしても追加費用はかからないため、最初から1つの正解を推測する必要はなく、実際に使う2つか3つの形式をまとめて取得できます。

プライバシー、録音を残したくない場合

すべての録音が恒久的なアーカイブに向いているわけではありません。機密性の高い通話、デリケートなインタビュー、文字起こし後は消えてほしい一回限りのメモ — こうした場合は普段の作業とは異なる設定が必要です。プライベート文字起こしはアカウントへの保存を一切スキップします。結果は、履歴に無期限に残るのではなく、パスワードで保護されたダウンロードとして返され、一度も開かなければ期限切れになります。

迷う場合は、プライベートモードを既定にするのが安全な選択です。次のトランスクリプトは後からいつでも保存する側に切り替えられますが、今回の録音をさかのぼって「保存しなかったこと」にはできません。

一般的な録音にかかる費用

料金は音声の分数に応じて決まり、ファイル・形式・話者数は関係ありません。45分の電話通話と45分のボイスメモは、同じ料金で文字起こしできます。5時間(300分)パック($5.99)に対して、45分の録音はその残高からおよそ45分を消費するだけで、パックのごく一部にすぎず、残りは次の録音のために残ります。使っても使わなくてもサブスクリプションは発生しません。パックがどのように広がっていくかは従量課金制の文字起こしをご覧ください。


1件の録音をテキストに変換するかどうかは、見た目ほど大きな決断ではありません。トランスクリプトに何が求められるかに応じて手動・自動・ハイブリッドを選び、録音に対して少しでもコントロールがあればクリアな音声をモデルに渡し、実際に重要な部分を結果と照らし合わせて確認する。このガイドが対象外とした長さや件数のケースについては、長い録音を文字起こしする方法録音フォルダーを文字起こしするで詳しく扱っています。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

録音は手動で文字起こしすべきですか、それとも自動音声認識を使うべきですか?

ほぼすべてのケースで自動文字起こしをおすすめします。手動作業が音声1時間あたり数時間かかるのに対し、自動なら数分でドラフトが返ってきます。手動タイピングは、短いクリップや、自動ツールが苦手とする言語、あるいは絶対に手元から出せない資料に限って選びましょう。

自動トランスクリプトは使う前にレビューが必要ですか?

内部メモ用なら、多くの場合不要です。引用、法的記録、公開するもの全般には必要です。ドラフトを音声と照らし合わせて読み、特に名前・数字・専門用語を確認してください。モデルが誤認しやすいのはそこだからです。

複数の声が含まれる録音では、話者ラベルはどう機能しますか?

トランスクリプトは声ごとに分割され、話者Aや話者Bといった仮のラベルが付いた状態で返ってきます。ラベルを一度変更すれば、その話者が登場するすべての箇所に反映されます。精度が最も高いのは、各人の声がはっきり異なり、常に他の人と重なって話していない場合です。

文字起こし後、録音はどうなりますか?

選んだモードによります。標準設定ではトランスクリプトがアカウントに残り、いつでも戻って確認できます。プライベートモードではアカウントへの保存を完全にスキップし、結果はパスワードで保護されたダウンロードとして返され、一度も開かなければ期限切れになります。

録音1件の文字起こしにかかる費用は?

料金は音声の分数に応じて決まり、ファイル形式や話者の人数は関係ありません。45分の録音は、それが小さいパックから来た分数でも大きいパックから来た分数でも、プリペイド残高から45分を消費します。サブスクリプションは一切発生しません。

アップロードできるファイル形式は?

MP3、WAV、M4A、FLAC、MP4を含む一般的な音声・動画形式がそのまま利用できます。動画をアップロードした場合、何かが送信される前にブラウザ内で音声が抽出されるため、元の動画ファイルがアップロードされることはありません。

無料30分からはじめる

$1の仮承認でカードを確認し、即座に解除されます。請求は一切なく、30分の無料分もすぐに付与されます。

はじめる – 無料30分