「音声をテキストに翻訳」: 実際の意味
著者: Hushscript 公開日: 最終確認日:
「音声をテキストに翻訳」は、2 つの異なるジョブをカバーする 1 つの検索フレーズです。キーボードを入力するほとんどの人は、自分が理解できる言語で音声が聞こえており、そのスピーチを書き留めておきたいと考えています。少人数のグループは、自分たちが話せない言語で音声が聞こえており、別の言語で意味を知りたいと考えています。最初の仕事は文字起こしです。 2 番目は上に翻訳を追加します。ツールと手順は同じではないため、実際にどれが必要かを知ることで、多くの混乱を避けることができます。
このガイドでは、この 2 つを区別し、別の言語で書かれた音声を文字に起こす方法を示し、本当に翻訳が必要な場合の対処方法について説明します。 Hushscript は、同じ言語のトランスクリプトを返すことも、アップロード前にターゲットを選択したときに、ソース音声を文字に起こして、選択したターゲット言語の翻訳を追加することもできます。翻訳はアップロードオプションの一部であり、トランスクリプトビューで事後的に切り替えるものではありません。
トランスクリプトと翻訳
トランスクリプトは、音声を同じ言語のテキストに変換します。英語のインタビューを録音し、英語のテキスト文書を受け取ります。フランス語のポッドキャストがあり、フランス語のトランスクリプトを取得します。ページ上の言葉は話された言葉です。言語を変更するものはありません。
翻訳では、テキストをある言語から別の言語に変換します。フランス語のテキストが英語のテキストになります。音声ではなくテキストから機能し、ソース言語とターゲット言語の両方を知っている必要があります。欧州委員会は翻訳を音声言語の通訳とは区別しています。同じ区別は、「音声をテキストに翻訳する」という作業が 2 つの別々の仕事を隠す理由を説明するのに役立ちます。
では、文字起こしを意味するのに、なぜこれほど多くの人が「翻訳」と言うのでしょうか。この言葉は大まかに使われており、実際には形式を変換するだけであるにもかかわらず、PDF を Word ファイルに「変換」する必要があると言うときに使われます。音声からテキストへの移行は、言語が変わっていないにもかかわらず、2 種類のメディア間で翻訳しているように感じます。この非公式な使用法が、この検索フレーズが非常に一般的である理由であり、この検索フレーズを入力している人のほとんどが文字起こしツールを探している理由です。
どの仕事が必要かを判断する簡単な方法: 録音内容を理解できますか。可能であれば、それを書き留めるだけであれば、それが文字起こしです。理解できず、母国語で意味を知りたい場合は、文字起こしと翻訳を行います。
同じ言語の音声は文字起こしです。
英語の録音があり、それをテキストとして表示したい場合は、文字起こしです。スペイン語の録音があり、スペイン語のトランスクリプトが必要な場合、それもトランスクリプトになります。言語を変えているわけではありません。ページ上の音声から単語へ、形式を変更します。
これは検索の背後にある最も一般的な意図であり、まさにそれを目的として Hushscript が構築されています。最初から最後までの仕組みは次のとおりです。
- ファイルを /audio-to-text にドロップします。 30 秒間の話者ラベル付きプレビューは、アカウントを必要とせずにブラウザーで直接表示されるため、何かを行う前に品質を確認できます。
- 残りの部分を文字に起こすには、メールでサインアップしてください。最初の 30 分は 1 回限り無料です。カードを追加するのが最も早い方法です。1 ドルの保留でカードが確認され、すぐに決済され、請求されることはありません。お住まいの国で利用可能な別の支払い方法を使用したい場合は、最初の購入時に無料分の時間が提供されます。どちらの方法でもカードは必要ありません。
- 完全なファイルをアップロードしてください。ビデオの場合、最初に音声がブラウザで抽出されるため、ビデオ自体はデバイス上に残り、音声だけがサーバーに届きます。
- 文字起こしオプションを選択します。ソース言語を自動検出のままにするか、自分で選択し、必要に応じてアップロードする前にターゲット言語の翻訳を選択します。
- 読み取り、ラベル変更、エクスポートを行います。 「話者 A」の名前を実際の名前に変更し、トランスクリプトを 21 のエクスポート形式 (TXT、SRT、VTT、DOCX、PDF など) のいずれか、またはパスワードで保護された .husharchive としてダウンロードします。翻訳されたトランスクリプトは言語タブとして表示され、言語ごとにエクスポートできます。
言語に関係なく、話者のラベルとタイムスタンプが自動的に返されます。アップロードする前に翻訳対象を選択しない場合、文字起こしは音声と同じ言語になります。
実際の例
ポルトガル語を話す同僚との 40 分間のインタビューを録音し、二人ともポルトガル語を理解するとします。後で引用するために文書による記録が必要です。
ファイルを /audio-to-text にドロップすると、プレビューには最初の 30 秒が表示され、すでに話者 A と話者 B に分割されています。アクセントとポルトガル語がきれいに伝わってくるので、サインアップして録音全体をアップロードします。ジョブが完了すると、話者ごとに次のようなポルトガル語のトランスクリプトが作成されます。
話者 A [00:02]: Então, conta-me como Começou o projeto. 話者 B [00:05]: Começou quase por acaso, no ano passado.
話者の名前を実際の名前に変更し、DOCX または別の形式にエクスポートすれば完了です。どの時点でも言語は変更されませんでした。これは純粋な文字起こしの仕事であり、「音声をテキストに翻訳する」というフレーズで説明されることがほとんどです。
ここで、詳細を 1 つ変更します。あなたはポルトガル語を話せず、英語での面接が必要だとします。完全なアップロードを開始する前に、翻訳対象として英語を選択します。ジョブが完了すると、ポルトガル語の原文トランスクリプトと英語の翻訳トランスクリプトが別の言語タブとして表示され、どちらかをエクスポートできます。
本当に翻訳が必要な場合
フランス語のインタビュー、ドイツ語の講義、またはスペイン語の録音など、話せない言語の音声があり、コンテンツを英語にしたい場合でも、同じ区別が依然として重要です。音声を最初に文字に起こし、次に音声を書き起こす必要があります。テキストは翻訳できます。
Hushscript では、完全なアップロードを開始する前にこれを選択します。ソース言語を自動検出のままにするか、自分で選択してから、必要なターゲット言語を追加します。翻訳ターゲットでは請求される分数が追加されるため、アプリにはアップロード前に推定請求される分数が表示されます。ターゲット言語をスキップすると、ジョブは同じ言語のトランスクリプトのみを返します。
ジョブが終了すると、ソーストランスクリプトと翻訳されたトランスクリプトが言語タブとして取得されます。必要なタブを開き、その言語を必要な 21 形式 (TXT、SRT、DOCX を含む) でエクスポートするか、パスワードで保護された .husharchive としてエクスポートします。法律、医学、ジャーナリズム、または出版物の表現に重みがあるものについては、翻訳されたトランスクリプトを信頼する前に、人間の翻訳者にレビューしてもらいます。
エクスポートに関する実用的な注意事項: 次のステップに合った形式を選択してください。 TXT はプレーンテキストのレビューに適しており、DOCX または PDF は他のユーザーと共有しやすく、SRT または VTT は字幕に適しており、CSV と JSON は構造化されたワークフローに役立ち、Markdown はメモや下書きの公開に便利です。トランスクリプト内の話者ラベルにより、レビュー担当者は誰が話しているのかがわかり、インタビューでよくある推測の原因が排除されます。
境界について明確にしておきます: 1 つのアップロードで両方をリクエストできる場合でも、トランスクリプトと翻訳は依然として別の仕事です。 Hushscript にはまずソースのトランスクリプトが必要で、その後、アップロード前に選択したターゲット言語のトランスクリプトを提供できます。この分離は、何かが間違っていると思われる場合に、ソーストランスクリプト、翻訳済みタブ、またはその両方を確認する必要があることがわかるため、役に立ちます。
ソース言語が Hushscript がサポートするおよそ 99 の言語から外れている場合は、ステップ 1 で別のトランスクリプションツールが必要になり、そこから翻訳することになります。
区別が重要な理由
扱い転写と翻訳を同じものとして行うと、いくつかの予測可能な間違いが発生します。
ターゲット言語を選択せずにスペイン語の音声をアップロードすると、文字起こしによってスペイン語のテキストが生成されます。アップロードする前に英語を選択すると、Hushscript がスペイン語のソーストランスクリプトと一緒に英語に翻訳されたトランスクリプトを追加できます。いずれにせよ、最終的な英語の品質は、スペイン語がどれだけ正確に転写されたか、そしてそれがどれだけ正確に翻訳されたかという 2 つの要素の積み重ねによって決まります。最初の段階での間違いが、2 番目の段階でも間違いになる可能性があります。
それが、区別が重要である理由です。ソースと翻訳されたタブが表示されるので、問題が文字起こしによるものなのか、言語の変更によるものなのかを確認できます。両方の段階を非表示にするワークフローでは、これがさらに困難になります。
簡単な要点、短い非公式のメール、または話された内容の大まかな感覚を得るには、機械翻訳で十分かもしれません。法的手続き、ジャーナリズム、正式な文書など、間違った単語が重要な場合は、ソースのトランスクリプトを確認し、人間の翻訳者に最終的な表現をチェックしてもらいます。
正確性と品質のヒント
クリーンな録音は、どの言語でもより適切にトランスクリプトされ、言語そのものよりも重要です。話している人の近くにマイクを置き、静かな場所で録音し、お互いに話し合わないようお願いします。マイクの距離とバックグラウンドノイズは、作業している約 99 言語のどれよりも結果に大きく影響します。
単一言語の録音が最も簡単です。話者が文の途中で 2 つの言語を切り替えると、どのエンジンも追従することが難しくなり、トランスクリプトが言語間でズレてしまう可能性があります。可能であれば、1 つの言語で 1 つの録音を維持してください。会話が本当にバイリンガルで行われている場合は、翻訳する前に、最後まで読んでいくつかの部分を手作業で修正することを想定してください。
固有名詞はもう一度見る価値があります。人、場所、会社の名前は、トランスクリプトで最も頻繁にわずかな間違いが発生する箇所であり、そこに小さな間違いがあると、後の翻訳が台無しになる可能性があります。テキストが翻訳段階に移る前に、音声がまだ頭の中に残っているうちに、それらのトランスクリプトをざっと確認し、修正してください。
アップロード前にターゲット言語の翻訳を選択した場合、ソーストランスクリプトの精度が、下流のすべての上限を設定します。翻訳されたトランスクリプトは、その背後にあるソーステキストと同等の品質にしかならないため、クリーンな録音とトランスクリプトのチェックに費やした時間は 2 倍の効果があります。
パスの選択
これを使用して、迅速に決定します。音声を理解して書き留めておきたい場合は、文字に起こしてそこで終了します。これで完了です。音声が理解できず、自分の言語で意味を理解したい場合は、アップロードする前に翻訳対象を選択し、ジョブの終了時にソースと翻訳済みのタブを確認します。大まかな要点がすぐに必要で、正確さが重要ではない場合は、機械翻訳で十分かもしれません。正確さが重要な場合は、トランスクリプトをチェックし、翻訳された文言を人間がレビューします。
これらのパスのいずれにおいても、トランスクリプトのステップが基礎であり、Hushscript が開始する部分です。つまり、約 99 の言語で話者が分離されたソーストランスクリプトが自動的に検出されるか、アップロード前に選択されます。
あなたのケースが一般的な場合1 つ目は、単に書き留めたいと理解している音声の場合、/audio-to-text がツールです。ファイルをドロップし、最初の 30 秒をプレビューし、サインアップしてトランスクリプトをエクスポートします。すべてのファイルタイプをカバーする詳しい手順については、音声ファイルを文字起こしする方法をご覧ください。そもそも音声をテキストに変換するテクノロジーを理解したい場合は、音声からテキストへ: その仕組みでわかりやすく説明しています。
独立した情報源と規格
Hushscript は、競合関係にない独立した情報源を参照しています。これらは研究、規格、プラットフォームの仕組みを説明するもので、Hushscript を推奨するものではありません。
情報源の確認日: