通話録音を文字に起こす方法
著者: Hushscript 公開日: 最終確認日:
音声ファイルを入手すれば、通話録音の文字起こしは簡単です。より困難な部分は、それよりも前にあります。双方のクリーンな記録を取得し、それを法律の範囲内で行うことです。このガイドでは、通話録音が実際にどこから来たのか、通話録音を話者ラベル付きのトランスクリプトに変換する方法、他の人に読まれたくない内容が含まれる録音の処理方法など、法的な問題について説明します。
通話は、人々が保管する音声の中で最も機密性の高いものの 1 つです。録音された交渉、医師の電話、人事上の会話、情報源からの引用など、その内容は、入力するほとんどの内容よりもプライベートなものになる傾向があります。その繊細さがガイド全体を貫いているテーマであり、ファイルを静かに保持するツールよりも、プライバシー優先のアップロードベースのツールの方がこの仕事に適している理由はここにあります。
必要なもの
設定するものはそれほど多くありません。
- ブラウザを備えたデバイス上の音声ファイルとしての通話の録音。 MP3 と M4A は通話レコーダー アプリの一般的な形式で、どちらも変換せずに機能します。
- 最新のブラウザ。文字起こしはブラウザとクラウドで実行されるため、携帯電話やコンピュータにインストールするものはありません。
- アカウントが必要ですが、ファイル全体を文字起こしする準備ができている場合に限ります。 30 秒のプレビューには何も説明する必要はありません。
コストについては、正直に伝えることが重要なので、簡単に説明します。 Hushscript は無料ではありません。これは、1 分あたりの実質コストが発生するトップレベルの文字起こし AI で実行されるためです。サブスクリプションなしの従量課金制で、30 分間無料でお試しいただけます。これらの分は、1 ドルの保留が許可されたカードを認証すると即座に到着し、その後すぐに解放され、請求されることはありません。別の方法で支払いたい場合は、最初の 1 分間の購入後に 30 分が 1 回付与され、カードは必要ありません。パックの価格は料金ページに記載されています。
合法的に通話を録音する
録音する前に法律を知ってください。録音ルールは国、州、地方によって異なり、場合によっては通話の種類によっても異なります。したがって、安全な方法は、思い込みではなく、自分に適用されるルールを確認することです。 記者委員会の録音ガイドは米国での出発点として役立ちますが、特定の通話に関するアドバイスに代わるものではありません。最も重要な区別は、一方当事者の同意と当事者全員の同意の区別です。
一方当事者の同意では、一方の当事者であり同意しているため、相手に告げることなく自分が参加している通話を録音できます。二者同意とも呼ばれる全員の同意では、通話に参加しているすべての人が通話が録音されていることを知り、それに同意する必要があります。ある規則に従う管轄区域もあれば、別の規則に従う管轄区域もあり、国境を越える通話は両方の側に適用される可能性があります。
トラブルを避ける最も簡単な方法は、声を大にして言うことです。 「メモ用にこの通話を録音しているんですが、大丈夫ですか?」のようなセリフ。全当事者の管轄範囲内でカバーされており、実際には問題になることはほとんどありません。録音が、紛争や証拠となる可能性のあるものなど、法的に機密性の高い内容のものである場合は、最初に適用される特定のルールを確認してください。このガイドは情報提供であり、法的なアドバイスではありません。
通話録音はどこから行われるのか
携帯電話のオペレーティングシステムによって何が可能になるかが決まるため、適切なアプローチはお使いのデバイスによって異なります。
iPhoneでは、サポートされているデバイスと地域でネイティブ通話録音が利用できます。 Apple の現在の指示では、電話と FaceTime 音声通話が対象となっており、両方の参加者に録音通知が聞こえると説明されています。録音はメモに保存されます。現在地でコントロールを使用できない場合は、マイク専用アプリがリモート話者をキャプチャすると想定するのではなく、双方向を明確に録音する合法的な代替手段を使用してください。
Androidでは、ネイティブ通話録音が利用できるかどうかは、デバイス、通信事業者、地域、電話アプリによって異なります。コントロールが存在する場合は、その参加者通知フローに従います。そうでない場合は、デバイスと管轄区域で承認されているオプションを使用し、それに依存する前に、エクスポートされたファイルに両面が含まれていることを確認してください。
固定電話、VoIP 通話、またはデスクトップ通話の場合、多くの場合、録音のほうがきれいです。専用の録画アダプターは固定電話を処理できるほか、Google Meet、Microsoft Teams、Zoom などの会議プラットフォームでは対象となるアカウントや会議の録画が可能です。この機能を利用する前に、プラットフォームの現在の権限と参加者への通知を確認してください。
ボイスメールも重要です。メッセージを転送したり、通信事業者のエクスポートオプションを使用したり、再生を録音したりして、メッセージを音声ファイルとして保存またはエクスポートすると、他の録音と同様に文字起こしできます。
ソースが何であれ、最終的には 1 つの音声ファイルになります。ここからのプロセスはすべて同じです。
3 つのステップで録音を文字に起こします。
フローは、何かをコミットする前に品質を聞くことができるように構築されています。
- ファイルをドロップしてプレビューを確認します。テキストへの音声録音に移動してドラッグします。録画をアップロード領域に追加するか、クリックして参照します。 Hushscript は最初の 30 秒を文字起こしし、話者ラベルとともに表示します。アカウントも支払いも何も入力する必要はありません。ここで、両側が聞こえること、および 2 つの音声が期待どおりに分離されていることを確認します。
- **残りを文字に起こすにはサインアップしてください。**プレビューが正しく表示されたら、電子メールを入力してアカウントを作成します。このステップにより完全な文字起こしが可能になり、ここから 30 分の無料時間が生まれます。ファイルサイズの制限はなく、最長 10 時間のファイルを受け入れます。
- **トランスクリプトを取得、再ラベル付け、エクスポートします。**完全な録音をアップロードして処理します。完了すると、話者がマークされた状態でトランスクリプトがダッシュボードに表示されます。クリックするだけで「話者 A」の名前を実際の名前に変更し、ジョブに必要な形式 (TXT、SRT、DOCX、PDF など) から選択できる 21 か、パスワードで保護された .husharchive でエクスポートします。
トランスクリプトの準備が完了すると、音声はサーバーから削除されます。これを保持する設定はなく、何かのトレーニングに使用されることもありません。あなたは記録を保管します。
成功した例: 双方向通話
契約更新に関するベンダーとの 12 分間の通話を録音し、双方の声が聞こえ、通話録音アプリによってrenewal-call.m4aとして保存されたとします。それをプレビューにドロップすると、最初の 30 秒が 2 つのラベルとともに表示され、分離がきれいに見えます。サインアップして、すべてを文字に起こし、完了したら話者の名前を変更し、次のような TXT をエクスポートします。
話者 A 00:00:08 こんにちは、サラ、折り返しお電話いただきありがとうございます。何かに署名する前に、
更新条件について確認したかったのです。
話者 B 00:00:14 もちろんです。契約書は開いています。
どこから始めますか?
話者 A 00:00:19 終了条項。現在の 90 日前の通知は
私たちにとって長く感じられます。
話者 B 00:00:26 それは当然です。 60 日間を検討することもできますが、
割引レベルがわずかに変化します。
各ターンには話者タグとタイムスタンプが含まれます。通話記録の価値は通常、何が合意され、誰がそれに同意したかの記録であるため、これはほとんどの録音よりも通話において重要です。誰かが図にコミットした正確な行を見つけるには、オーディオを前後にスクラブするのではなく、タイムスタンプをスキャンする必要があります。代わりに SRT をエクスポートすると、同じコンテンツが時間指定されたキャプションブロックに分割されて取得されます。
双方向通話、2 人の話者
通話では話者の分離が重要になります。両方の当事者が 1 つのファイルで聞こえる場合、Hushscript はそれらを自動的に分離し、話者 A と話者 B を 2 つの音声にマッピングします。そのため、トランスクリプトは 1 つの結合されたブロックではなく、実際に前後したものとして読み取られます。
実名を入力するには、話者ラベルをクリックして名前を入力すると、その話者に帰するすべての行がトランスクリプト全体で更新されます。 2 人間の通話では 2 回だけ実行します。ラベル付けがどのように生成されるか、および似たような音声にどのように対処するかについては、話者の識別についてさらに詳しく説明します。
分離がどのように機能するかは、いくつかの要素によって決まります。
- 1 つのトラックに両側が含まれることは、ほとんどのコールレコーダー アプリが生成するものであり、両方の通話者を運ぶステレオまたはモノラルミックスです。話者の分離はきれいに機能します。
- 片側のみは、レコーダーがデバイスのマイクだけをキャプチャした場合に発生するため、自分の声はクリアで、相手の声はかすかであるか聞こえません。これにより、ラベル付けする 1 人の話者を含む片面のトランスクリプトが生成されます。このような場合は、イヤホンとマイクの両方をキャプチャするようにアプリを設定するか、次回からスピーカーフォンを使用して、電話のマイクが両方の人の声を聞くようにします。
- 片面ごとにファイルを分けることはまれですが、1 人あたり 1 つずつ、2 つのモノラル録音になった場合は、アップロードする前にそれらを 1 つのファイルに結合します。音声編集者なら誰でもそうするか、それぞれの面を独自のファイルとして書き起こして、後で 2 つのトランスクリプトを結合します。
通話録音を非公開に保つ
電話の通話には、個人的、法的、ビジネス上の機密事項が含まれます。そのため、ここでは、たとえば公開しようとしているポッドキャストよりもツールがファイルをどのように扱うかが重要です。 Hushscript を使用した通話録音は 3 つの方法で保護されます。
まず、アップロードベースであり、それ以外は何もありません。 Hushscript は電話システムや通話プラットフォームには接続しません。録音はデバイス上にあるので、準備ができたらアップロードします。ライブタップやボットが通話に参加することはなく、バックグラウンドで通話を確認する統合もありません。同じ原則が会議にも当てはまります。自分で録音するため、セッションには何も参加せず、ボットを使用しない会議の文字起こしは完全に実行されます。
2 番目に、音声は文字起こしの準備ができた瞬間に削除されます。法律相談や人事電話の場合、これが重要です。録音は、その 1 つの仕事を終えた後、ストレージに残らないのです。残るのは音声のコピーではなく、トランスクリプトです。
第三に、残るトランスクリプトは保存時に暗号化されます。私たちのストレージが漏洩した場合、その内容はあなたの言葉ではなく、判読不能な暗号文として表面化するでしょう。それは、はっきり言って漏れの防止です。キーはあなた一人ではなくサーバー上に保持されているため、私たちの側の誰もトランスクリプトを読むことができないという主張ではありません。正直なバージョンは便利です。侵害によって暗号文が公開され、ワンクリックでトランスクリプトを自分で削除できます。パイプラインによる音声の処理方法の詳細については、非公開文字起こし ページをご覧ください。
通話が実際にビデオ通話であった場合、カメラがオンになっている FaceTime、WhatsApp、または Zoom では、アップロードする前にブラウザ内のビデオファイルから音声が抽出されます。ビデオ自体はデバイス上に残ります。
一般的な問題のトラブルシューティング
ほとんどの通話録音は手間をかけずに文字起こしされます。結果が異なる場合、原因は通常これらのいずれかであり、ほとんどは修正可能です。
話者が 1 つしか表示されない
これは通話録音で最も一般的な問題であり、ファイルが自分側だけをキャプチャしたことを意味します。転写は正確ですが、声は一つです。解決策は録音側にあります。受話口とマイクの両方をキャプチャするレコーダーを選択するか、電話のマイクで両方の人が聞こえるように通話をスピーカーフォンに設定します。
音声が圧縮されているか、ノイズが多い
通話には、対面録音では発生しないアーティファクトが含まれます。電話および VoIP コーデックは大幅に圧縮されるため、両方の人が同時に話すときは多くの場合、音量が下がります。結果として、精度は通常、対面での録音よりも若干低くなります。そのため、固有名詞、数字、および静かな部分を盲目的に信じるのではなく、音声に照らして流し読みするように計画してください。
強いアクセントまたは速いスピーチ
アクセントは適切に処理されますが、高速で重複するスピーチの上に強いアクセントがある場合は、どの文字起こしエンジンにとっても最も困難なケースであり、通話の圧縮がさらに困難になります。時折言葉が入れ替わることを期待してください。名前や専門用語はよくあることなので、最初に校正してください。
2 人が話し合っている
声が重なると、話者間の境界があいまいになり、いくつかの単語が間違ったタグに分類される可能性があります。すでに存在する録音におけるクロストークを完全に修正する方法はありません。次の通話を制御する場合は、どの設定よりもお互いに話さない方がトランスクリプトには効果的です。
ファイルが大きいか長い
長時間の通話は問題ありません。アップロードごとに最大 10 時間まではファイルサイズの制限はありませんが、ファイルが大きい場合は処理に時間がかかります。ページが表示されるまで待つ必要はありません。開始して終了し、ダッシュボードからトランスクリプトを収集します。ファイルがアップロードを拒否した場合、その原因は通常、ファイルではなく不安定な接続であり、安定したネットワークで再試行すると、通常は問題が解決されます。
異常なファイル形式
レコーダーが AMR、OGG、または MP3 や M4A 以外のものを生成した場合は、まずそのままドロップしてください。何も変換する必要はありません。形式が実際に受け入れられない場合は、support@hushscript.com に電子メールを送信してください。追加します。
最初にプレビューしますか、それとも文字に起こすだけですか?
30 秒のプレビューは無料でアカウントも必要ないため、ルールは簡単です。音声品質に疑問があり、通話が録音されている場合は、まずプレビューしてください。 30 秒以内に、時間を費やす前に、双方の意見が分かれるかどうか、そして言葉が着地するかどうかがわかります。録音がきれいで、双方の通話がクリアでマイクの近くにあることがすでにわかっている場合は、すぐにサインアップして通話全体を文字に起こすことができます。
通話録音の精度に関するヒント
いくつかの習慣を使用すると、単一の設定よりも通話トランスクリプトの品質が向上します。
- **両方の通話を 1 つのファイルにキャプチャします。**これは、通話記録を使用できるようにするための最大の要素です。受話口とマイクの両方をタップするレコーダーや、会議スタイルの録音ラインでは、毎回一方的なキャプチャよりも優れています。
- **静かな場所で録音してください。**どちらの側でも背景ノイズが発生するため、言葉を失います。自分の側の静かな部屋は、あなたがコントロールできる部分です。
- **プレビューでファイルを精査しましょう。**これは最も安価な精度チェックです。無料、アカウントなし、コミットする前に 30 秒かかります。
- **最初に固有名詞と数字を校正してください。**契約やスケジュールについての電話では、数字と名前がそのままです。間違うことは許されず、まさにエラーが集中する場所です。
文字起こし後
通話記録は主に記録として役立ちます。これを DOCX としてエクスポートすると、属性付きの話者行を含む書式設定された文書が作成されます。これは、交渉後にファイルしたり、フォローアップ電子メールに添付したりするようなものです。タイムスタンプを使用すると、何かがいつ発言されたかを正確に示すことができ、これは論争やタイミングが重要な記録にとって重要です。また、電話インタビューは対面でのインタビューと同じ方法で書き起こされるため、ワークフローはそのまま引き継がれます。
多くの通話録音は M4A であり、その形式を書き込む Apple ボイスメモやレコーダー アプリを特に使用して作業している場合は、M4A をテキストに変換する方法も形式固有の詳細と同じ内容をカバーします。一般に、複数話者による録音の場合、インタビューを文字に起こす方法では、同じ話者分離ワークフローを研究の観点から説明します。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: