メインコンテンツへスキップ

インタビューを安全に文字起こしする方法

著者: 公開日: 最終確認日:

インタビューをうまく文字に起こすことは、正確なテキストと明確な帰属という 2 つのことを同時に意味します。誰が何を言ったか分からない言葉の壁は、生の録音とほぼ同じくらいの労力を必要とします。そして、会話が機密性の高いものである場合、法的問題、機密情報源、人事状況など、音声の処理方法は、トランスクリプト自体と同じくらい重要です。このガイドでは、録音前にきれいな音声を取得すること、文字起こしを実行すること、インタビュアーと被験者を離すこと、タイムスタンプを使用して正確に引用すること、全体を非公開に保つことなど、全体をカバーしています。

始める前に必要なもの

リストは短いものです。インタビューを音声またはビデオファイルとして記録する必要があります。 Hushscript は一般的な形式を受け入れるため、電話のボイスメモ、Zoom 録音、専用レコーダーの WAV、または MP4 スクリーンキャプチャはすべて変換せずに機能します。記録されている全員の同意が必要です。これについては以下で説明しますが、任意ではありません。そして、トランスクリプトを表示および編集する方法が必要です。これは、ブラウザーの Hushscript アプリです。インストールやプラグインは必要ありません。

言語を選択する必要はありません。 Hushscript は約 99 の言語にわたってこれを自動的に検出するため、バイリンガルのインタビューや文の途中で切り替わる対象者は、何も設定せずに処理されます。完全なリストを確認したい場合は、言語ページにあります。

録音する前に

録音時の音声品質は、トランスクリプトの精度を左右する唯一の最大の要素です。自動でも人間でも、マイクではっきりと捉えられなかった単語を文字起こしエンジンで復元することはできません。いくつかの具体的な内容は、後で何をするよりも効果的です。

**マイクの配置:**対面インタビューの場合、両方の話者から等距離にあるテーブルに置かれた小型レコーダーは、ポケットに入れられた電話よりも優れています。各人に独自のマイクを与えることができる場合は、そうしてください。2 つのクリーンな入力は、混合された 1 つの部屋よりも分離しやすいのです。ビデオ通話でのリモートインタビューの場合は、プラットフォームで許可されている場合は、それぞれの側を独自のトラックとして録音します。2 つのトラックが 1 つのダウンミックスストリームよりもきれいに分離されているためです。

静かな環境HVAC のハム音、窓を通る車の流れ、カフェの背景のおしゃべり、裸の部屋の残響はすべて正確に除去されます。カーペット敷きの小さな部屋、または洋服が吊るされたクローゼットの方が、オープンオフィスよりも優れているように思えます。現場では、指向性マイクを被写体に向けることで、周囲よりも声を大きくすることができます。

何よりもまず同意する本人の知らないうちに人物を録音することは、多くの場所で違法であり、どこでも受け入れられません。開始する前に、録音していることを被写体に伝えてください。一部の管轄区域では一当事者の同意が必要ですが、米国の多くの州や多くの国を含むいくつかの管轄区域では、出席者全員の同意が必要です。疑わしい場合は、録音を開始した直後に、録音自体で「はい」とはっきりと口頭で伝えてください。これにより、合意がファイルの一部になります。

**適切な形式設定。**スタジオ品質は必要ありません。 128 kbps 以上の WAV または MP3 で十分であり、16 kHz 以上のサンプルレートが快適です。避けるべき 1 つの方法は、電話品質 (8 kHz 付近) まで圧縮することです。この周波数では、子音が混ざり合って精度が著しく低下します。

インタビューを段階的に文字起こしする

フローは、コミットする前に品質を確認できるように構築されています。実際の順序は次のとおりです。

  1. **録画を /audio-to-text にドロップします。**ビデオの場合は、最初にオーディオがブラウザで抽出されるため、ビデオファイル自体がデバイスから送信されることはありません。ここからは音声のみが関係します。
  2. **30 秒のプレビューをお読みください。**アカウントを作成する前に、Hushscriptが最初の 30 秒を文字起こしし、話者ラベルがすでに適用された状態で表示されます。これはアカウントなしのステップです。デモではなく、実際のファイルで話者の分離と文言を判断することになります。
  3. **残りを文字起こしするにはサインアップしてください。**アカウントを作成すると、完全な文字起こしのロックが解除されます。新しいアカウントには 30 分間無料でお試しいただけます。これは、短いインタビューや長いインタビューの一部を読むのに十分です。 Hushscript はその後はサブスクリプションなしで従量課金制なので、必要なときにのみ分を購入します。
  4. **ラベルを変更してエクスポートします。**完成したトランスクリプトは発話ごとに 1 行として返され、それぞれに話者ラベルとタイムスタンプがタグ付けされます。ラベルの名前を実際の名前に変更して、エクスポートします。

「無料」部分がどのように機能するか尋ねられるため、無料分についてのメモ。与えられる時間は1回30分です。ロックを解除する最も簡単な方法は、簡単なカードチェックです。カードを確認するために 1 ドルの保留が許可され、その後すぐに解放され、請求されることはありません。別の方法で支払いたい場合は、お住まいの国で利用できる別の方法でもご利用いただけます。初回購入時は 30 分かかります。どちらの場合もカードは必要ありません。

面接官と対象者を分けてください。

ここで、インタビューの記録を再度聞く必要があるのではなく、インタビューの記録を使用できるようになります。 話者識別 機能は、設定や追加コストを必要とせず、すべての個別の音声に独自のラベルを割り当てます。 2 人によるインタビューの場合、次のような会話になります:

話者 A [00:00:07]: プロジェクトが問題に陥っていることに最初に気づいたときのことを教えてもらえますか?
話者 B [00:00:13]: 2019 年の初めのことでした。ロールアウトを実行していましたが、数字が加算されなくなりました。
話者 A [00:00:28]: それで、あなたはそれについて何をしましたか?
話者 B [00:00:31]: 正直に言うと、最初は何もしませんでした。それが私が後悔している部分です。

実名を載せるには:

  1. トランスクリプト内の話者 Aのいずれかのインスタンスをクリックします。
  2. 希望の名前、たとえば「インタビュアー」または対象者の名前を入力します。
  3. その話者のすべての行

これは話者ごとに 1 回ずつ実行します。 90 分間の 2 人によるインタビューの場合、パス全体は 1 分未満で完了し、すべての行が特定の人物によるものであると見積もられる文書が完成します。この分離が内部で実際にどのように機能するかについて詳しく知りたい場合は、話者ダイアライゼーションの仕組みをわかりやすく説明します。

実際の例: 1 時間の調査インタビュー

58 分間の調査インタビューを携帯電話で.m4aファイルとして録音したとします。部屋は静かで、二人とも電話の近くにいて、被写体がアニメーションするときはいつものように少し重複します。

ファイルを/audio-to-textにドロップします。 30 秒のプレビューでは、最初の質問が話者 A として表示され、被験者の最初の回答が話者 B として表示され、分離が明確であることがわかります。サインアップして、完全なファイルを転写させます。 58 分のインタビューでは残高から 58 分が使用されるため、無料の 30 分で半分強をカバーし、残りを補充します。

トランスクリプトでは、きれいなやり取りが行われているように見えます。最初の話者 Aをクリックして自分の名前を入力し、最初の話者 Bをクリックして件名の名前を入力すると、文書全体が更新されます。ざっと読んでみると、主題が携帯電話から離れていたため、エンジンが主題を 2 番目のラベルに分割した 3 つの短い区間があることに気付きました。そのため、これらを結合して戻します。メモ用に DOCX にエクスポートし、分析スクリプトで開始時刻、終了時刻、話者を含むすべての発話を取得できるように、JSON にエクスポートします。アップロード後の合計実践時間: 数分。

タイムスタンプを使用して正確に引用する

トランスクリプト内のすべての発話にはタイムスタンプが付いているため、出力を安全に引用できます。記事、レポート、または論文の引用を取得するときは、その横にあるタイムスタンプに注目してください。これにより、事実確認の際に聞き返すべき正確なポイントが得られ、編集者が引用を検証する方法が得られ、後で情報源が発言内容に異議を唱えた場合に指摘すべき点が得られます。引用を取得したら、どの程度整理するか、間違った始まりをすべて残すか、言葉遣いをきれいな散文に滑らかにするかは、意図的に行う価値のあるスタイルの選択であり、きれいな逐語的対素起こしという点で、両方の慣習が明らかになります。

DOCX エクスポートでは、タイムスタンプがインラインに保持されます。生の構造が必要な場合は、JSON エクスポートによって発話レベルのデータが渡されます。各エントリには開始時刻、終了時刻、話者、テキストが含まれており、プログラムで処理できます。 TXT エクスポートはクリーンな読み上げコピーであり、インタビューがビデオの下に置かれる場合、SRT は時間指定されたキャプションラインを提供します。

知っておく価値のある制限の 1 つ: タイムスタンプは個々の単語ではなく発話レベルです。ほとんどのインタビュー作業では、音節ではなく文を引用しているため、これがまさにあなたが望んでいることです。映像に字幕を書き込むためのワードレベルのタイミングが特に必要な場合、SRT ラインのタイミングはほぼすべての目的に十分近いものです。

一般的な問題とその解決方法

ほとんどのインタビュー録音はきれいに文字化されます。何かがうまくいかないときは、ほとんどの場合、いくつかの問題のうちの 1 つであり、それぞれに簡単な修正方法があります。

1 つの話者が 2 つのラベルに分かれている最もよくある想定外の結果です。これは通常、相手の音が途中で変化したことを意味します。つまり、マイクに近づいたり遠ざかったり、ヘッドセットからスピーカーフォンに切り替えたり、通話中に回線品質が変化したりしたことです。エンジンは声の聞こえ方によってクラスター化されるため、大きな変化が新しい声として読み取られます。エディターで 2 つのラベルをマージすると、上記の例のように 1 回のパスで修正されます。

**2 人が 1 つのラベルにマージされます。**逆です。これは、2 つの声が本当に似ている場合、または録音が静かで違いが聞き取りにくい場合に発生します。事後的にきれいに修正するのは難しいため、録音時に 2 つの別々の入力を 1 人につき 1 つずつ行うことが、この問題に対する唯一の最善の保険となります。

クロストークと人々がお互いに話し合う両方が同時に話すと、音声内で単語が物理的に重なっているため、自動または人間の文字起こし者は苦労します。白熱したインタビューの最も忙しい瞬間には、手動で聞き返す必要があることを想定してください。タイムスタンプを使用すると、その瞬間をすばやく見つけることができます。

**強いアクセントや専門用語。**アクセントが異なっても精度は十分に保たれますが、馴染みのない固有名詞、専門用語、名前などは、自動文字起こしが最も失敗する可能性が高くなります。面接に特有のいくつかの名前と用語について検索と置換パスを実行し、引用するつもりのものを確認します。インタビューが専門用語が豊富な臨床または研究上の会話である場合、ディクテーションおよびインタビュー用の医療文字起こしでは、これらの用語の処理方法をカバーしています。

静かな録音または遠くからの録音。対象者がマイクから遠かったり、小さな声で話したりした場合、精度は全体的に低下し、事後のソフトウェア修正はありません。これを防ぐために「録音前」セクションが存在します。録音が弱い場合は、とにかく下書きとして書き起こしてから、音声に合わせて修正してください。

**非常に長いファイルまたは大きなファイル。**録画は最大 10 時間実行でき、ファイルサイズの制限はありません。非常に大きなファイルでもブラウザで直接準備されます。 10 時間の制限を超える録音のみを自然な一時停止を使用して分割し、各部分を文字に起こします。

音声ソースまたはビデオソース: どちらをアップロードするか

同じインタビューの音声ファイルとビデオの両方がある場合は、どちらかをアップロードします。どちらの場合も Hushscript は音声から機能するため、トランスクリプトは同一です。実際の違いはプライバシーです。ビデオを与えると、音声がブラウザで抽出され、その音声だけが送信されるため、多くの場合、より識別性が高く機密性の高いアーティファクトであるビデオがマシンから離れることはありません。機密性の高いインタビューの場合は、デフォルトの方が適切です。すでにクリーンな音声のみのファイルがある場合は、それをアップロードするのが最も簡単です。

機密性の高いインタビューを非公開に保つ

法的問題、機密情報源、人事事件、または個人情報開示に関わるインタビューの場合、音声の処理方法はトランスクリプトの品質以上に重要です。 Hushscript はまさにこれを目的として構築されています。

音声はトランスクリプトの準備ができた瞬間にサーバーから削除されます。保存期間はなく、記録のバックアップコピーがその後どこかに残ることもありません。ビデオをアップロードした場合、抽出された音声のみが送信されていましたが、それも送信されなくなりました。音声エンジンは録音に対してトレーニングを行わないため、送信された内容はモデルにフィードされません。

トランスクリプト自体は保存時に暗号化されます。わかりやすく言うと、ストレージが侵害された場合、攻撃者が発見するのは対象者の言葉ではなく、判読できない暗号文です。これは漏洩防止のためであり、当社があなたのトランスクリプトを読み取ることができないという主張ではありません。製品があなた自身の作品を表示できるように、キーは当社側に保持されています。これは、あらゆるクラウドツールにとって現実的な脅威であるデータ漏洩が、読み取り可能なインタビュー コンテンツを引き渡さないことを意味します。

ジャーナリズムにおける情報源の保護、特権的な法的資料などの最も強力なケースの場合は、標準的な予防策を講じてください。音声のオフラインコピーと完成したトランスクリプトを管理するデバイスに保存し、これを含むクラウドサービスを唯一のコピーとして扱いません。データ処理の全体像が必要な場合は、プライベート文字起こし ページにその詳細が記載されています。

録音が 1 対 1 のインタビューではなくマルチホストのポッドキャストである場合、ワークフローは同じで、ポッドキャストの文字起こし方法でマルチ音声の詳細が説明されています。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

トランスクリプト内でインタビュアーと被験者を分けておくにはどうすればよいですか?

Hushscriptは各話者に自動的にラベルを付けるため、設定なしで 2 人によるインタビューは「話者 A」と「話者 B」として返されます。文字起こし後、いずれかのラベルをクリックし、実際の名前 (「インタビュアー」または対象者の名前など) を入力すると、話者が発言するすべての行で名前が更新されます。 90 分のインタビューの完全なラベル変更パスは 1 分もかかりません。

機密性の高いインタビューにはHushscriptのプライベート性が十分ですか?

音声はトランスクリプトの準備ができた瞬間にサーバーから削除され、保存期間やバックアップコピーはありません。録画がビデオの場合、音声が最初にブラウザで抽出されるため、ビデオファイルはアップロードされません。トランスクリプトは保存時にも暗号化されます。つまり、ストレージリークが発生すると、対象者の言葉ではなく、判読不能な暗号文が公開される可能性があります。

どのオーディオ形式と設定が最高の精度を実現しますか?

一般的なオーディオファイルまたはビデオファイルはどれでも機能するため、録音をそのままドロップできます。正確性を考えると、16 kHz 以上の WAV または FLAC が理想的で、ほとんどのインタビューでは 128 kbps 以上の MP3 で問題ありません。形式は、マイクの配置や静かな部屋よりもはるかに重要ではありません。これらは、きれいな文字起こしを実現するための真の要因です。

インタビューの長さはどのくらいですか?

最長 10 時間で、ファイルサイズの制限はありません。 2 時間のリサーチインタビューまたは 4 時間のオーラルヒストリーセッションが 1 つのファイルとして保存されます。録音が 10 時間を超える場合は、自然な休憩で分割し、各部分を文字に起こします。

インタビューの録音と文字起こしには同意が必要ですか?

録音には同意が必要です。多くの管轄区域では一方側の同意が必要ですが、一部の管轄区域では通話に参加するすべての人が同意する必要があり、知らないうちに誰かを録音することは法律に関係なく容認できません。開始する前に対象者に録音中であることを伝え、リモート通話では録音が開始されたらはっきりと「はい」と伝えます。

機密性が重要なジャーナリズムにこれを使用できますか?

Hushscriptは最小限の保存を中心に構築されています。つまり、音声は完了時に削除され、ビデオはアップロードされず、トランスクリプトは暗号化され、録音に関するトレーニングは行われません。正式なコンプライアンス認定はありません。そのため、一か八かのソース保護のために、音声とトランスクリプトのオフラインコピーを独自に保管し、クラウドツールを唯一のコピーとして扱わないようにしてください。

インタビューの文字起こしにかかる費用はどれくらいですか?

Hushscript はサブスクリプションなしで従量課金制です。短いインタビューまたは長いインタビューの一部をカバーする 30 分を無料でお試しいただけます。その後、必要な分だけ分を購入できます。現在のパックの価格ページをご覧ください。

自信を持ってトランスクリプトから直接引用できますか?

はい。すべての発話にはタイムスタンプが付いているため、録音内の正確な箇所を引用して引用することができます。機密性の高い引用を公開する前に、そのタイムスタンプを一度聞いて文言を確認してください。自動文字起こしは正確ですが、クロストークや馴染みのない名前の場合は確実ではないためです。

無料30分からはじめる

はじめる – 無料30分