如何將任何音訊檔案轉錄為文字
作者: Hushscript 發布: 最後審閱:
來自播客編輯器的 MP3、來自 iPhone 的 M4A、來自現場錄音機的 WAV、來自錄音機應用程式的不起眼的 CAF:要轉錄其中任何一個,您只需執行相同的操作。拖入檔案,取得已分離說話者的逐字稿,以您需要的格式匯出。音訊所在的容器不會更改步驟。
格式所影響的內容更進一步:文件有多大、轉錄的乾淨程度以及在極少數情況下文件無法加載時應採取的措施。本指南介紹了哪些音訊格式有效、處理所有這些格式的一種方法、如何在有選擇的情況下選擇最佳格式以及如何修復出現問題的檔案。
您需要什麼
- **音訊(或視訊)檔案。**以下任何常見格式。無需安裝任何內容:沒有桌面應用程序,沒有擴充功能。一切都在瀏覽器和您的帳戶中運行。
- **Hushscript 帳戶,可查看完整記錄。**您有 30 分鐘的免費試用時間。解鎖它們的最快方法是添加一張卡:持有 1 美元即可驗證該卡,然後立即釋放且無需付費。如果您不想使用銀行卡,也可以選擇其他付款方式,首次購買即可享受 30 分鐘的體驗。
30 秒預覽無需帳戶。您可以在註冊之前刪除一個檔案並查看說話者標記的樣式,這是在提交任何內容之前檢查輸出是否合適的誠實方法。除了免費分鐘數之外,轉錄是按需付費的:您僅在需要時購買分鐘數,無需訂閱。費用位於定價頁面。
哪些音訊格式適用
Hushscript 採用所有標準音訊格式。以下是每個檔案的來源,以便您可以識別自己所擁有的內容:
這些名稱不只是檔名慣例。目前的 IANA 媒體類型登錄表收錄了 audio/aac、audio/mp4、audio/mpeg、audio/ogg 和 audio/opus 等標準化類型。
| 格式 | 常見來源 |
|---|---|
| MP3 | 播客、電話錄音、大多數錄音應用程式的匯出 |
| M4A / AAC | iPhone 語音備忘錄、WhatsApp 語音記事、Apple 匯出 |
| WAV | 數位錄音機、DAW 匯出、Windows 錄音機 |
| FLAC | 存檔錄音、DAW 匯出、無損翻錄 |
| OGG | Android 語音筆記、開源錄音工具 |
| AIFF / CAF | Mac 和 iOS 音訊、GarageBand |
影片檔案的工作方式相同。放置 MP4、MOV、WebM 或 MKV,音軌會在上傳任何內容之前在瀏覽器中提取,因此視訊本身永遠不會離開您的裝置;只有音訊到達伺服器。
上面的清單不是柵欄。這個承諾比支援的格式表更簡單:只需放置您的文件,它就會被轉換和轉錄。如果您確實有一些不尋常的東西(來自舊諾基亞的 AMR 檔案、來自十年前 Android 的.3gp、RealAudio 剪輯),請嘗試上傳它。瀏覽器可以讀取大多數標準容器,如果不能,您有兩個後備方案:使用 /tools 中的免費瀏覽器內工具將其轉換為 MP3 或 WAV 並上傳,或發送電子郵件至 support@hushscript.com,我們將添加該格式。您不必提前確定您的文件是否符合要求。
分三步驟轉錄音訊檔案
無論您從哪種格式開始,流程都是相同的。第一步發生在您擁有帳戶之前。
- **拖放文件進行預覽。**前往 /audio-to-text 並將檔案拖曳到拖放區域,或按一下瀏覽。前 30 秒直接在瀏覽器中轉錄,並標有說話者標籤,無需帳戶。這是您在註冊任何內容之前檢查輸出是否按照您想要的方式讀取的。
- **註冊以轉錄其餘內容。**輸入您的電子郵件以建立帳戶。當您新增並驗證卡片(上述 1 美元保留)或首次購買(如果您以其他方式付款)時,您的 30 分鐘免費時間將解鎖。完整文件從此處上傳。錄製時間最長可達 10 小時,沒有檔案大小限制––即使是非常大的檔案也可以直接在瀏覽器中準備。服務安全和積極工作保障也適用。
- **取得並匯出逐字稿。**語音引擎處理文件並傳回說話者已分開的逐字稿。如果您願意,可以重新命名說話者,然後以 21 種格式中的任何一種(TXT、SRT、DOCX 和 PDF,以及字幕和編輯器時間軸格式)或受密碼保護的 .husharchive 格式下載。包括每次匯出:無付費牆、無浮水印。
處理在背景運行,並根據音訊長度進行縮放(錄製每小時約幾分鐘),因此您不必在長文件完成時保持選項卡開啟。
一個有效範例:一次錄音,兩種格式
假設您錄下了一段 38 分鐘的對話,錄音裝置同時儲存了兩個版本:完整品質的 meeting.wav,以及手機建立的 meeting.m4a。兩者都依照相同的三個步驟處理,完成後的逐字稿會依說話者輪次分段,並為每段加上時間戳記:
[00:00:06] 說話者 A:開始之前,大家都收到我寄過來的資料了嗎?
[00:00:10] 說話者 B:今天早上收到了。 Q3 號碼就是我想要的號碼
深入挖掘。
[00:00:17] 說話者 A:對,所以這就是移動的線。讓我把它拉起來。
[00:00:21] 說話者 C:當您這樣做時,我們可以稍後再回來招募嗎?
這兩個檔案產生的逐字稿基本上相同。 WAV 是一個較大的上傳文件,而 M4A 是一個較小的上傳文件,但單字和說話者標籤的著陸方式相同,因為兩者都攜帶相同的底層語音。從這裡開始,編輯就很輕鬆了:您按一下說話者 A一次即可對其進行重命名,並且該說話者的每一行都會更新;您可以瀏覽引擎猜測的少數專有名詞(姓氏、產品名稱),並使用查找和替換來修復它們,這樣可以一次糾正每個實例。
這是針對每種格式的一種方法的實際結果。您不必為 WAV、M4A 和 MP3 使用不同的工具或不同的心理清單。無論您的錄音機、手機或其他人的匯出檔案交給您什麼,它都會經過相同的放置區域並以相同類型的逐字稿形式輸出。
選擇最準確的格式
大多數時候您無法選擇。您轉錄給您的文件,就可以了。但是,如果您控制音訊的錄製或匯出方式,則有幾個選擇會限制結果的乾淨程度。
**錄音品質是第一位的,而且遠遠領先。**來自良好近距離麥克風的 128 kbps MP3 每次都會擊敗房間內筆記型電腦內建麥克風錄製的無損 WAV。在考慮格式之前,請考慮將麥克風靠近說話者。容器遠遠落後於第二位。
**避免比特率非常低的 MP3。**MP3 是有損的:編碼會丟棄部分音訊以保持檔案較小,位元率越低,丟棄的越多。語音識別依賴於輔音的高頻細節,其中存在“十五”和“十六”或“可以”和“不能”之間的差距。激進的壓縮首先會吃掉這個細節。低於 64 kbps 左右時,字錯誤就會攀升。在 128 kbps 及以上,您已經超過了數字的重要性;較高的位元率並不會使轉錄效果更好。
**無損刪除作為變數的格式。**WAV、FLAC 和 AIFF 向引擎提供未壓縮的音訊。對於乾淨的錄音來說,與好的 MP3 相比,精確度增益是微不足道的,但它完全消除了壓縮。 MDN 的數位音訊指南解釋了潛在的權衡:無損編碼可以更大尺寸地保留細節,而有損編碼可以透過丟棄資訊來進一步縮小音訊。當錄音很珍貴並且您不想稍後想知道該格式是否會花費您任何費用時,這是有用的上下文。
**單聲道可以;您不需要立體聲。**引擎在內部將立體聲混合為單聲道以進行語音,因此單聲道檔案的轉錄效果同樣好,並且在連接速度較慢時上傳速度更快。一個細微差別是:如果您的設定在單獨的立體聲通道(“雙聲道”)上錄製每個人,則在上傳之前將其混合到單個單聲道軌道往往有助於說話者標籤,因為引擎聽到的是一個混合對話而不是兩個獨立的流。
**高於 16 kHz 的取樣率對語音沒有任何作用。**從 16 kHz 到 48 kHz 的任何頻率都可以工作,48 kHz視訊編輯器中的 WAV 轉錄與手機應用程式中的 16 kHz 單聲道檔案相同,並且底層語音相同。該模型是針對語音而不是音樂進行訓練的,因此較高的速率不會提高準確性。
無損與有損,以及何時轉換有幫助
一個常見問題:首先將 MP3 轉換為 WAV 會提高準確性嗎?不會的。一旦音訊被儲存為 128 kbps MP3,丟棄的細節就永遠消失了。將相同的音訊封裝在 WAV 中只會產生一個更大的文件,而沒有額外的資訊。向上轉換只能作為無法載入格式的解決方法,而不能提高準確性。
真正有用的情況是向下轉換。數小時的 WAV 檔可能非常龐大;上傳前將它重新編碼成 128 kbps MP3,可以大幅縮小檔案,幾乎不影響準確度,也能在慢速連線下加快上傳。免費的瀏覽器內轉換器會直接在您的裝置上處理,音訊不會離開裝置。簡單原則是:如果檔案已能正常載入,位元率也不至於過低,就直接轉錄;只有在解決實際問題時才轉換,例如檔案無法開啟,或大到難以上傳。
免費提供說話者標籤
每份 Hushscript 轉錄內容都帶有自動說話者分離(說話者分離)功能,無需額外付費。引擎會挑選出不同的聲音並將其標記為說話者 A、說話者 B等,然後您只需在編輯器中按每個說話者一鍵即可將它們重命名為真實姓名。無論來源格式如何,它都預設為啟用狀態,沒有單獨的說話者標籤層。
標籤的乾淨程度取決於錄音,而不是檔案類型:
- **不同的輪流最有幫助。**當人們輪流並且不互相交談時,標籤是可靠的。兩人採訪通常會完全分開。
- **重疊是最困難的情況。**當兩個聲音同時出現時,引擎會將單字分配給聲音較大的一個。這通常是說話者分離的限制,而不是任何一種工具的限制。為熱鬧的群組通話中的串擾預留一點編輯時間。
- **相似的聲音可能會變得模糊。**兩個擁有非常相似語域的人(例如同性兄弟姐妹)將挑戰任何說話者分離引擎。合理的信噪比有助於全程分離。
對於大多數訪談、播客和會議,標籤最多只需進行幾次重新分配即可使用。如果您想詳細了解說話者分離的工作原理,請參閱什麼是說話者分離,或查看說話者識別頁面以了解功能概述。
修復粗略的檔案
最粗略的逐字稿可追溯到錄音,而不是格式或工具。通常的罪魁禍首以及如何處理它們:
**無法載入的檔案。**很少見,但它會發生在不尋常或損壞的容器中。首先嘗試使用免費的瀏覽器內轉換器將其重新包裝為 MP3 或 WAV,這可以修復大多數頑固檔案。如果仍然不行,請發送電子郵件至 support@hushscript.com。我們所做的就是添加格式支援。
**低音量。**如果錄音非常安靜,引擎需要處理的訊號就會減少,準確性也會下降。上傳之前在任何編輯器中標準化或放大音訊。提高弱錄音的電平是回報最高的修復方法之一。
**背景噪音。**穩定的噪音(空調、道路嗡嗡聲)處理得相當好。與言語重疊的突然噪音(門聲、咳嗽聲、餐具聲)會導致言語喪失。上傳前進行輕微的降噪處理會有所幫助,但不要過度:重度降噪會增加偽影,比雜訊對準確度的影響更大。
**重口音或專業詞彙。**現代引擎可以很好地處理各種口音。可靠的遺漏是引擎沒有理由預期的領域術語:藥物名稱、法律引用、利基品牌名稱。計劃匯出後進行一次瀏覽,並依靠查找和替換;如果名稱每次都以相同的方式出現錯誤,則一次更正將覆蓋整個文件。
**非常大或非常長的檔案。**10 小時的上限幾乎涵蓋了所有內容,而且沒有文件大小限制,因此無需將長錄音切成碎片。如果無損檔案太大而無法在瀏覽器中準備,請先將其重新編碼為 128 kbps MP3(沒有真正的準確性成本)以加快速度。對於較長會話的具體訊息,長錄音指南會更深入。
您的檔案會發生什麼
轉錄完成後,音訊將從伺服器中刪除。沒有雲端儲存,無法用於模型訓練,也沒有保留期。如果您刪除了視訊文件,則只有提取的音訊到達伺服器(視訊保留在您的裝置上),並且您可以隨時從儀表板中一鍵刪除逐字稿本身。
匯出您的逐字稿
轉錄後,選擇適合您對文字執行的操作的格式。如果您不確定您實際需要哪種逐字稿格式,請從以下常見選擇開始:
| 格式 | 包含的內容 | 最適合 |
|---|---|---|
| TXT | 說話者標籤、純文字 | 筆記、搜尋、輸入其他工具 |
| SRT | 每句話時間戳記、說話者標籤 | 視訊字幕,按時間導航長錄音 |
| VTT | 網頁字幕時間戳記、說話者標籤 | HTML5 影片播放器與網頁發佈 |
| CSV | 包含說話者、計時和文字欄位的行 | 電子表格審閱和輕量級資料移交 |
| Markdown | Markdown 格式的說話者標記逐字稿 | 註釋、文件、發布工作流程和靜態網站 |
| DOCX | 針對 Word 或 Google 文件設定格式 | 編輯、分享、註解 |
| JSON | { speaker, start, end, text } | 管道和自訂工具 |
| 可讀的固定佈局逐字稿 | 只讀共享和存檔 |
每個匯出都帶有說話者標籤,其中任何一個都沒有水印,並且每個計劃都包含所有匯出格式,其中包括 30 分鐘免費。 SRT 中的時間戳位於話語層級(每個說話者輪流一個條目),這是字幕和引用的正確粒度;如果您需要在程式碼中處理字級結構,JSON 會為您提供每輪的開始和結束時間(以毫秒為單位)。
語言
Hushscript 轉錄約 99 種語言,自動偵測,無需手動設定。準確度在 18 種語言中最高,包括四種英語變體(全球、英國、澳洲、美國)、西班牙語、法語、德語、日語、普通話、印地語和阿拉伯語。完整清單位於語言頁面。
如果您要在同語言逐字稿和翻譯逐字稿之間做出選擇,「將音訊翻譯為文字」指南會解釋其中的差異。
這就是整個工作(拖入、轉錄、匯出),上面寫著無論您開始使用什麼格式都相同。對於特定格式的筆記,同級指南涵蓋了最常見的情況:MP3、WAV 和 M4A / Apple Voice Memo。 音訊轉文字頁面具有完整的功能概述,每種格式都以相同的方式到達那裡:只需拖入檔案即可。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: