跳至主要內容

語音轉文字:工作原理與操作方法

作者: 發布: 最後審閱:

語音轉文字是將口頭音訊轉換為書面文字的軟體。這個術語涵蓋了兩種感覺相似但工作方式不同的不同工作:現場聽寫,你說話時文字就會出現,而轉錄,你交出錄音並拿回完成的逐字稿。兩者的核心思想是相同的。工作流程、準確性以及您可以對結果做什麼都不是。

本指南以淺白方式解釋了語音到文字的實際含義、引擎如何從聲音到單詞,以及兩種模式有何不同。然後,它逐步介紹如何在 Hushscript 上將錄音轉換為文字,並提供一個可行的範例、令人困惑的問題以及最後的簡短常見問題解答。

語音到文字實際上是什麼

最簡單的是,自動語音辨識 (ASR) 會接收聲波並產生一系列單字。麥克風將語音擷取為連續波形,即代表氣壓隨時間變化的擺動線。這個波形包含了一切:文字、說話者的聲音、房間、空調的嗡嗡聲。引擎的任務是從混音中提取單字並將其寫下來。

為此,引擎將音訊切成小片(通常每個片為 10 到 30 毫秒),並測量每個影片中的聲音。這些測量結果提供給訓練有素的模型,該模型將聲音模式映射到語言的語音單元,然後映射到單詞,然後映射到整個短語。這些你都看不到。您會看到錄音進入並出現逐字稿。但大致了解內部發生的情況就可以解釋為什麼有些錄音轉錄清晰,而有些錄音則粗糙。

有兩層知識共同作用。一是聲學:一種語言的聲音是什麼,以及它們在不同聲音和口音中的發音方式。另一個是語言方面的:哪些單字序列是合理的。語言層就是為什麼一個好的引擎會寫“他們的車壞了”而不是“那裡的車壞了”,儘管兩者聽起來相同。它使用上下文來選擇人類的拼字。

較早的語音辨識依賴手寫規則和小型訓練集,而且很脆弱。現代引擎是大型人工智慧模型,經過數千小時錄製的許多說話者的語音、口音和錄音條件的訓練。這種廣度正是今天的逐字稿可用的全部原因。對於清晰的語音和良好的錄音,目前模型的單字準確率約為 90% 至 97%。剩下的百分之幾是本指南後面的故障排除的重點。

錄製語音與即時聽寫

實踐中最重要的區別是音訊是即時處理還是事後處理。

即時聽寫即時運行。當你對著電話、語音助理或文字處理器中的語音輸入功能說話時,單字的出現速度幾乎和你說的一樣快。為了跟上,引擎必須致力於每個單詞,而幾乎不需要依賴句子。這是一個嚴格的限制,這就是為什麼聽寫有時會猜測一個單詞,然後在接下來的幾個單詞到達時悄悄地重寫它。當需要隨時捕捉自己的演講時,即時聽寫是正確的工具:免持筆記、透過語音起草電子郵件、控制設備。

轉錄可處理完整的錄音。你給引擎一個完成的音訊或視訊文件,它處理整個事情,然後你得到一個完整的逐字稿作為回報。由於不需要即時發生任何事情,因此引擎可以在決定任何單字之前提前閱讀並查看整個句子,從而提高準確性。它還可以完成現場聽寫無法完成的工作。它可以將說話者分開,將每一行歸因於說這句話的人,並且它可以附加時間戳,以便您可以從一行文字直接跳到音訊中的該時刻。

如果您正在處理會議、訪談、講座、播客片段或錄製的電話,您將根據已儲存的檔案進行轉錄,而不是即時聽寫。兩者會感到困惑,因為兩者都被宣傳為“語音到文字”,但您已有的錄音對於聽寫工具來說是錯誤的形狀,而對於轉錄器來說是正確的形狀。 Hushscript 專為錄音設計。沒有即時聽寫模式,重點是經過深思熟慮的:從完整文件開始工作,可以讓它提前讀取準確性並在同一次傳遞中標記說話者。

如何將錄製的語音轉換為文字

這是 Hushscript 上的實際流程,按照您遇到的順序排列。您需要將錄音作為設備上的文件、任何常見格式的音訊或視訊檔案以及用於註冊的電子郵件地址。這就是整個清單。無需安裝任何內容。

  1. **拖放文件並觀看預覽。**開啟音訊轉文字頁面並將檔案拖曳到上面。 Hushscript 會立即轉錄前 30 秒,並在說話者已經分開的情況下向您顯示結果。此步驟不需要帳戶。預覽就在那裡,因此您可以在提交任何內容之前判斷自己錄製的準確性。
  2. **註冊轉錄其餘部分。**如果預覽看起來正確,請使用您的電子郵件註冊。轉錄完整文件是有門控的,因此這一步是帳戶發揮作用的地方。新帳戶有 30 分鐘免費時間來正確試用該服務。
  3. **上傳完整檔案。**進入後,上傳整個錄音。如果是影片,則首先在您的瀏覽器中提取音訊,然後僅發送音訊,因此影片本身會保留在您的設備上。
  4. **讀取、重新標記和匯出。**每次都會返回逐字稿,歸因於說話者(說話者 A、說話者 B 等)並帶有時間戳。點擊任何說話者標籤即可對其進行重命名,新名稱將在該人發言的所有位置更新。當它以您想要的方式讀取時,匯出為 TXT 為純文字、SRT 或 VTT 為字幕、CSV 或 JSON 為結構化資料、Markdown 為發布筆記、DOCX 為編輯或 PDF 為共享。

如果您想在進一步操作之前檢查準確性,30 分鐘足以轉錄一個簡短的訪談、10 分鐘的講座剪輯或較長錄音的第一段。透過快速卡片檢查即可立即解鎖免費分鐘數:持有 1 美元即可授權檢查卡,然後立即取消且無需付費。使用其他付款方式,它們會隨您的第一次購買一起到達。不需要卡片;這只是獲得獎金的最快途徑。免費分鐘數過後,您只需為轉錄的分鐘數付費,無需訂閱。 定價頁面顯示目前費率。

有效範例

假設您在手機上錄製了 38 分鐘的客戶訪談。它保存為 M4A,兩個聲音,咖啡杯偶爾發出的碰撞聲,在普通會議室中錄製。

您將 M4A 放在音訊轉文字頁面上。 30 秒預覽顯示為簡短對話:

說話者 A 00:00 感謝您抽出時間。您能先告訴我
                    是什麼讓您第一次尋找這樣的工具嗎?
說話者 B 00:11 當然。我們淹沒在支援請求中,而舊的
                    系統無法跟上,所以我開始四處尋找。

這是未經編輯的預覽。兩個聲音分開,每一行都有時間戳,措辭乾淨。您註冊並上傳完整的 38 分鐘文件,幾分鐘後,完整的逐字稿就以相同的形式準備好了。 說話者 A 是您,說話者 B 是您的受訪者,因此您點擊「說話者 A」標籤,輸入您的姓名,然後點擊「說話者 B」輸入他們的姓名。兩者都一次重命名整個文件。您匯出到 DOCX,在文字處理程式中開啟它,修復產品名稱按語音拼寫的兩到三個位置,然後您就得到了一份完成的訪談記錄。 38 分鐘超出了您的平衡,這就是為什麼免費的 30 分鐘對於第一份真正的工作很方便,而不僅僅是測試剪輯。

常見問題以及如何解決它們

最令人失望的逐字稿可以追溯到錄音,而不是引擎。這些是最常出現的問題,以及如何解決每個問題。

**錄音安靜或渾濁。**如果聲音微弱或房間聽起來很吵,引擎的工作量就會減少,準確性也會下降。靠近說話者的麥克風、領夾麥克風或距離嘴巴 10 到 20 公分以內的耳機,比任何設定都會產生更大的差異。一個大而空曠的房間增加了迴聲,模糊了聲音之間的界限;較小或軟裝飾的空間記錄效果更好。您無法在事後修復此問題,因此值得在下次錄製之前解決。

**兩個人同時說話。**當聲音重疊時,措辭和誰說了什麼都會變得更加困難,因為兩組聲音在同一音訊片段中競爭。對於真正的重疊,沒有乾淨的軟體修復。在您控制的錄音中,在回合之間留下節拍會在以後得到回報。在無法重做的情況下,預計中斷周圍會出現一些交叉線,然後手動整理它們。

**專業術語出現錯誤。**通用模型非常了解日常用語,但不一定見過您所在行業的行話、不尋常的姓氏或產品名稱。這些往往是根據它們的發音而不是它們的拼寫來轉錄的。匯出的 DOCX 中的查找和替換可在幾秒鐘內清除重複出現的術語,這就是 DOCX 是最容易糾正的匯出的原因之一。

**檔案將無法載入。**大多數標準音訊和視訊檔案都可以正常運作。如果有人拒絕,通常是一個不尋常或非常舊的容器。使用免費的瀏覽器內工具將其轉換為純 MP3 或 WAV(該工具在您的裝置上運行且不上傳任何內容)幾乎總是可以解決問題。如果格式仍然無法通過,請發送電子郵件至 support@hushscript.com,團隊將添加它。

**一個說話者會被分成兩個。**有時同一個人會被標記為兩個說話者,通常是因為他們的聲音在中途發生了變化:他們靠近麥克風,從耳機切換到擴音模式,或者線路品質發生了變化。引擎會依照聲音特徵進行分組,因此較大的變化可能被判定為另一位說話者。在編輯器中合併兩個標籤一步即可修復此問題。此機制位於說話者分離如何運作的指引中。

準確度和重音

口音覆蓋範圍取決於型號和語言。對於英語,在廣泛資料集上訓練的模型可以很好地處理美國、英國、澳洲和印度英語,而 Hushscript 提供四種不同的英語口音。較重的地方方言或較少代表性的口音需要進行更多修正,但您仍然是在編輯草稿,而不是從頭開始打字。

一些習慣可以提高任何錄音的準確性,無論口音是什麼。用近距離麥克風錄音。讓每個人在下一個開始之前完成。避免大的迴聲房間。適度的說話速度比一分鐘衝刺超過 200 個字的轉錄效果更好。合理的位元率很重要:128 kbps MP3 就可以了,而窄頻中嚴重壓縮的語音訊息音訊會失去引擎所需的細節。要更全面地了解每種格式和怪癖,請參閱如何轉錄任何音訊檔案

Hushscript 會自動偵測語言並轉錄大約 99 種語言,其中 18 種語言的準確性最高。使用一種語言的錄音轉錄起來最為清晰;對於任何引擎來說,在句子中切換語言都是困難的。

說話者標籤,在同一個過程中

分離說話人,正式稱為說話者分離,與語音識別一起運行,而不是作為您支付額外費用的第二項工作。您可以將單字和歸屬放在一起,在每份逐字稿上都是免費的。對於兩人面試或小型會議,這種分隔通常是準確的,並且省去了手動標記每一行的繁瑣工作。一個文件可以容納的說話者數量沒有上限,但當聲音清晰、不重疊且聽起來不相似時,準確度最高。每個逐字稿中都會免費提供說話者標籤,這是整個方法所建立的預設誠實細節:有用的部分被包含在內,而不是被隱藏在更高的層後面。

要堅持的明顯差異就是這一點。如果您想在說話、語音輸入或聽寫時捕捉語音,請使用裝置或文字處理器中內建的即時工具。如果您已有所需的文字錄音,則從音訊轉文字頁面進行轉錄會更快、更準確,並且只需一步即可為您提供說話者標籤和可匯出的輸出。

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

什麼是語音轉文字?

語音轉文字,也稱為自動語音辨識或 ASR,是一種將口頭音訊轉換為書面文字的軟體。它聆聽語音,找出所說的單字,並產生逐字稿。現代版本運行在經過數千小時錄製語音訓練的人工智慧模型上,這就是為什麼它們處理口音和背景噪音的能力比十年前的聽寫工具要好得多。

即時聽寫和轉錄錄音有什麼不同?

即時聽寫會在您說話時將語音即時轉換為文字,就像在手機或文字處理器中進行語音輸入一樣。轉錄錄音適用於事後儲存的音訊或視訊檔案。錄音通常會更準確,因為引擎可以在輸入單字之前看到整個句子,並且可以標記誰在何時說話。 Hushscript 處理的是錄音,而不是即時聽寫。

自動語音轉文字的準確度如何?

為了在安靜的房間裡發出清晰的語音,目前的 AI 模型在支援良好的語言上可達到大約 90% 到 97% 的單字準確度。嚴重的背景噪音、兩個人互相交談、模型沒有聽過太多的濃重口音或藥物名稱或法律拉丁語等專業詞彙都會導致準確性下降。清理錄音比任何單一設定都更能提高準確性。

語音轉文字是否支援重音?

可以,而且比舊系統好得多。在大型、多樣化的資料集上訓練的模型可以輕鬆處理美國、英國、澳洲和印度英語,而 Hushscript 提供四種不同的英語口音。之後,濃重的地方方言或較少代表性的口音需要進行更多修正,但逐字稿仍然是可用的初稿,而不是從頭開始重新輸入的內容。

如何在 Hushscript 上將錄製的語音轉換為文字?

將音訊或視訊檔案拖曳到音訊轉文字頁面上,然後會出現 30 秒的說話者標記預覽,無需帳戶。使用您的電子郵件註冊以轉錄其餘部分,然後上傳完整文件。完成的逐字稿會帶有說話者標籤和時間戳,您可以重命名說話者並以 21 種格式匯出,從 TXT、SRT 和 DOCX 到 PDF,或作為受密碼保護的 .husharchive。

語音到文字免費嗎?

Hushscript 不是免費的,因為其背後的 AI 運行需要真錢,所以它是即用即付的,沒有任何費用。訂閱。您確實有 30 分鐘免費試用時間。當您驗證一張持有 1 美元的卡時,它們會立即解鎖,該卡會立即釋放且從未收費,或者如果您以其他方式付款,則在您首次購買時解鎖。 30 秒預覽和瀏覽器內工具完全免費,無需帳戶。

Hushscript 可以轉錄哪些語言?

它會自動偵測語言並轉錄約 99 種語言,其中 18 種語言的準確性最高,包括全球英語、英國語、澳洲語和美國英語、西班牙語、法語、德語、日語、普通話、印地語和阿拉伯語。語言頁面列出了每一種語言。採用單一語言的錄音轉錄效果最好。

從 30 分鐘免費額度開始

開始––30 分鐘免費