メインコンテンツへスキップ

ブログ

インタビュー・フォーカスグループの研究文字起こし

著者: 公開日: 最終確認日:

録音はまだデータではありません。何を書き起こすか、話者をどう記すか、どの識別情報を出すか、そしてファイルがコーディングソフトに届いたときにどんな形をしているか、誰かがそれを決めて初めてデータになります。この4つの決定が調査文字起こしであり、そのどれもが事務的な作業ではなく方法論上の決定です。

最初のインタビューより前にこれらを決めておく方が、14件目のインタビューで決めるよりはるかに安上がりです。ここでは、それぞれの決定が何を変え、方法セクションに何を書くべきか、そして自動文字起こしが単にフォルダを完成したように見せるのではなく、研究に本当に役立つのはどこかを説明します。

最初のセッション前に決める文字起こしの種類

中立な文字起こしは存在しません。どの慣習も、あるものを見えるようにし、別のものを隠します。だからこそ、実際に行う分析に合わせて選んでください。

文字起こしの種類 保持されるもの 適した用途
逐語 フィラー、言い直し、間、重複発話 会話分析・談話分析
インテリジェント逐語 フィラーと言い直しを除いた発言内容 テーマ分析、グラウンデッド・セオリー
クリーン 文法と読みやすさを整えたもの 出版物や報告書での引用
標準化(デナチュラライズド) コーパス全体で文法を統一したもの ケース間比較、大規模サンプル

高くつく失敗は、選び方を間違えることではなく、二度選んでしまうことです。コーパスの半分が逐語で半分がクリーンだと一貫してコーディングできず、20件のインタビューを取り直してその差を修復するのは、誰も予算していない1か月分の作業になります。笑い声や割り込み、聞き取れない箇所をどう記すかも含めて、慣習を事前に書き留めておいてください。

機械が得意なこと、見落とすこと

自動文字起こしは、ほぼどんな研究でも下書きとして使えるほど優れていますが、最終版として使えるほどではありません。Pew Research Centerは録音された説教で人間と機械の文字起こしを比較し、機械は明瞭で途切れない発話には人間に追いついている一方、固有名詞や専門用語、話者が口調や声量を変える箇所では後れを取ることを明らかにしました。そしてまさにそこが、質的研究者が引用したがる箇所です。

つまり実用的なやり方は、自分でタイプしていない下書きに、自分で行うレビューを重ねることです。音声に合わせて一度通して読み、名前や用語を修正し、クロストーク全体で話者の帰属を直し、そこで止めます。レビューこそが本当に時間のかかる部分であり、省略できない部分です。

話者ラベルはすでに仮名

自動話者分離は録音を声ごとに分割し、結果にSpeaker 1Speaker 2のようなラベルを付けます。これは人物ではなく声を認識するものであり、これが地味に役立ちます。つまりラベルはデフォルトで仮名であり、誰かが実名を入力しない限りそのままです。

その状態を保ってください。Speaker 1P07や役割ラベルに一度リネームすれば、その変更は文字起こし全体とすべてのエクスポートに反映されるため、参加者ID方式を40箇所で手作業で適用するのではなく、一貫して適用できます。話者ラベルはHushscriptのすべての文字起こしで無料であり、声の数に上限はありません。これは6人のフォーカスグループに必要なものです。

正直な限界はクロストークです。参加者が互いに発言をかぶせると、分離には人の手による確認が必要になり、タイムコードがどの部分を聞き直せばよいかを教えてくれます。

論文に書くべき文字起こしの手法

査読者は、何が書かれているかだけでなく、そのテキストがどう作られたかをますます尋ねるようになっています。APAのJournal Article Reporting Standardsは、質的研究の著者に対して、データがどのように記録され変換されたかを説明するよう求めており、文字起こしは前提とすることではなく報告すべきことになっています。

これらに答える方法段落を1つ用意すれば、たいてい十分です。

文字起こし後ではなく最中に行う匿名化

識別情報は文の途中に現れます。勤務先、病棟、通りの名前、裁判の日付、その話に気づいてしまう同僚一人。後から取り除こうとするとコーパス全体をもう一度読むことになるため、代わりに文字起こしの工程に組み込んでください。

それをエクスポートしたコピーではなく文字起こし自体の中で行うことで、流通するのは仮名化されたバージョンだけになります。検索と置換を使えば、文書全体で繰り返し出てくる地名を一度の操作で修正でき、保存した辞書に研究の名称・地名・専門用語を登録しておけば、そもそも認識で間違って返ってくる数を減らせます。

伏字処理と同じくらい、プラットフォームについて何を言えるかも重要です。Hushscriptは各文字起こしの準備が整った瞬間に音声を削除し、モデルの学習に使うことは一切ありません。文字起こしは設定した保持期間のもとで保存時に暗号化され、7日から365日まで文字起こしごとの上書きも可能で、削除の流れでは受領証が返されます。EU、EEA、スイス、英国からの音声はEU内で処理されます。文字起こしをまったく保存させたくない録音には、プライベート文字起こしがパスワード保護された.husharchiveファイルを代わりに返します。

受け取り先のソフトウェアに合わせたエクスポート

文字起こしが作られた場所にとどまることはめったにありません。NVivo、ATLAS.ti、MAXQDA、あるいは表計算ソフトへ移り、その後は原稿へと移っていきます。プレーンテキストは話者ラベルとタイムコードが失われる場所なので、行き先に合わせて形式を選んでください。

Hushscriptはウォーターマークなしで21形式をエクスポートでき、関連する形式をResearch packとしてまとめています。タイムコードがエクスポート後も残ることで、研究結果の中の引用が、それが実際に話された瞬間まで遡れるようになります。これが、引用可能な文字起こしと単なる長い文書との違いです。

国ごとにベンダーを変えずに行う多言語フィールドワーク

比較研究では、拠点ごとに異なる文字起こし業者を用意する必要はないはずです。認識は自動検出で約99言語をカバーしており、精度が最も高い18の言語バリアントの主要セットがあるため、1つのワークフローでサンプル全体をまかなえます。

翻訳は文字起こしとは別の判断であり、順序が重要です。話されている言語で文字起こしをしてから翻訳します。翻訳先を1つ追加するごとに録音時間の25%のコストがかかり、原文と作業言語は同じ文書のタブに並び、それぞれ単独でエクスポートできるため、参加者の言葉を自分が考える言語で引用しコーディングできます。2人の翻訳者が同じフレーズを同じようには訳さないため、誰が翻訳し、不一致をどう解決したかを報告してください。

助成金の予算に対するコスト見積もり

手作業の文字起こしは研究者の作業時間で価格が決まり、1時間のインタビュー20件はいつの間にか学期をまるごと消費してしまう類の数字です。自動文字起こしはそれを、サンプルサイズの制約にならないほど小さな予算項目に変えます。

Hushscriptはサブスクリプションではなく前払いの分数を販売しているため、フィールドワークの月は使った分だけの費用がかかり、執筆の月は費用がかかりません。最大のパックでは100時間で$49.99なので、1時間のインタビュー20件でおよそ$10、90分のフォーカスグループで約$0.75です。分数は365日間有効で、文字起こしまたは購入のたびにその期限がリセットされるため、倫理審査で一時中断する研究にも向いています。新規アカウントには30分の無料分数が付与され、これは認証されて即座に解除され請求されることのない$1のカード確認、または別の方法で支払う場合は初回購入によって解放されます。

始め方

きれいなテスト用ファイルではなく、実際に録音した直近のインタビューを使ってください。それを研究文字起こしにかけ、返ってきた最初の5分を読んでみましょう。それによって、あなたの参加者、部屋、アクセントに対して話者識別がどう振る舞うかがわかり、それこそがあなたの研究にとって意味のある唯一の精度の指標です。

そして、まだ30件のインタビューが残っているうちに、その慣習をプロトコルに書き込んでください。

独立した情報源と規格

Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。

情報源の確認日:

よくある質問

自動文字起こしは質的研究に十分な精度がありますか?

下書きとしては十分です。最終的な文字起こしとしては、それだけでは不十分です。機械認識は明瞭で途切れない発話には対応できますが、固有名詞や専門用語、話者が口調を変える瞬間で精度が落ちます。そしてその瞬間こそ、研究者が引用したい箇所です。実用的なやり方は、自動下書きに音声と照合する1回のレビューを重ねることです。

文字起こしの中で参加者はどのように匿名のまま保たれますか?

話者ラベルには身元の情報は含まれません。自動分離は声を認識するのであって人物を認識するわけではないため、ラベルは話者1・話者2として届き、実名を入力しない限り仮名のままです。参加者IDの命名規則に一度だけ変更すれば、文字起こしとすべてのエクスポートにその名前が反映されます。

倫理委員会にはこのプラットフォームについて何を説明できますか?

事実だけであれば、説明は短くて済みます。Hushscriptは各文字起こしの準備が整った瞬間に音声を削除し、モデルの学習に使うことは一切ありません。文字起こしは保存時に暗号化され、保持期間は7日から365日までご自身で設定でき、文字起こしごとの上書きも可能で、削除には受領証が発行されます。EU、EEA、スイス、英国の音声はEU内で処理されます。これらはコンプライアンス認証ではなく、あなたのプロトコルと照らし合わせて確認すべき機能です。

NVivoやATLAS.tiで使えるエクスポート形式はどれですか?

プレーンテキストではなく構造化された形式を使ってください。プレーンテキストは話者ラベルとタイムコードを失うためです。CSV、TSV、XLSXはどちらも列として保持するため、表計算ソフトやコーディングソフトでの作業に向いています。JSONはスクリプトによる処理に適しています。Hushscriptはウォーターマークなしで21形式をエクスポートでき、便利な形式をResearch packとしてまとめています。

研究の文字起こしにはどれくらい費用がかかりますか?

最大のプリペイドパックは100時間で$49.99なので、1時間のインタビュー20件でおよそ$10、90分のフォーカスグループで約$0.75です。サブスクリプションも学術向け料金プランもなく、分数は前払いでファイルを文字起こしした分だけ消費され、文字起こしまたは購入のたびにリセットされながら365日間有効です。

コーパス全体に取り組む前に、自分の録音でまず確認できますか?

はい。ファイルの最初の5分は、アカウントなしで話者ラベル付きの結果が返ってきます。実際の参加者、部屋、アクセントで話者分離を判断するにはこれで十分です。コーパス全体を文字起こしするにはアカウントが必要です。

複数の言語にまたがるインタビューはどう扱えばよいですか?

まず話されている言語で文字起こしをし、その後翻訳します。認識は自動検出で約99言語をカバーしており、翻訳先を追加すると録音時間の25%のコストがかかり、原文と作業言語が同じ文書内のタブに並びます。一文の中でのコードスイッチングは依然として難しいケースであり、バイリンガルのレビュアーによる確認が解決策です。

無料30分からはじめる

$1の仮承認でカードを確認し、即座に解除されます。請求は一切なく、30分の無料分もすぐに付与されます。

はじめる – 無料30分