如何將 WAV 檔案轉換為文字(免費試用)
作者: Hushscript 發布: 最後審閱:
WAV 檔案是未壓縮的音訊,這使其成為準確轉錄的有力起點。權衡是大小:WAV 檔案很大,但沒有檔案大小限制––即使是非常大的檔案也只是為您準備好的。本指南涵蓋了整個工作:將 WAV 文件轉換為文字、獲取乾淨的說話者標籤、處理大文件以及以您實際需要的格式匯出逐字稿。
WAV 出現在品質重要的任何地方:現場錄音機保存到 SD 卡、從 DAW 混音和匯出音訊、Windows 錄音機輸出以及廣播採訪設備。逐字稿身的工作方式與任何其他格式相同:上傳、轉錄、匯出。首先值得了解的是為什麼無損音訊有幫助,以及如何保持檔案大小易於管理。
為什麼 WAV 的準確度很高
WAV 是未壓縮的容器。與 MP3 或 M4A 不同,它沒有有損壓縮步驟,因此引擎接收的音訊與錄製的音訊相同,沒有添加和丟棄任何編碼偽影。
實際上,這在兩種情況下最重要:
- 來源錄音已經處於臨界狀態:安靜的說話者、吵雜的房間、廉價的麥克風。每一位訊號都很重要,有損編解碼器會丟棄其中的一些訊號。
- 您已在 DAW 中處理了音訊並重新匯出了它。每個 MP3 通道都會添加自己的工件;在編輯之間將檔案保留為 WAV 可以避免堆疊它們。
對於乾淨的錄音室錄音或精心設定的採訪,來自同一來源的 128 kbps MP3 可提供幾乎相同的準確性。 WAV 的優勢是真實的,但除非條件困難,否則是有限的。因此,「我應該以 WAV 格式錄製以獲得更好的轉錄結果」的誠實答案是:它有一點幫助,而且錄製環境越差,幫助越大。
引擎實際使用的內容
語音模型主要在 16 kHz 單聲道音訊上進行訓練。當您上傳 48 kHz 立體聲 WAV 時,引擎會先進行下取樣並混合為單聲道,然後再執行其他操作。語音的有用範圍大致位於 300 Hz 到 8 kHz(電話頻帶)之間。乾淨利落地捕捉該範圍是最重要的,任何 16 kHz 或以上的像樣麥克風都已經做到了。
實際結果:同一語音的 48 kHz WAV 和 16 kHz WAV 會產生相同的轉錄內容。高取樣率不會有什麼壞處,但對文字也沒有幫助。他們只是使文件更大。如果您控制錄音設定並希望在不放棄任何內容的情況下實現最小上傳,那麼 16 kHz 單聲道是最低選擇。
您需要什麼
- 長達 10 小時的 WAV 文件,沒有文件大小限制。大多數文件直接按原樣上傳;一個非常大的項目已在您的瀏覽器中上演和準備。
- Hushscript 帳號。註冊並添加付款方式後,您將獲得 30 分鐘免費時間:添加卡時立即獲得(1 美元的保留驗證它,然後立即釋放,並且永遠不會收費),或者如果您使用您所在國家/地區可用的其他付款方式,則與您的第一分鐘套餐一起獲得。不需要卡;這只是獲得免費時間的更快途徑。
- 無需安裝。整個作業在瀏覽器中運行,因此無需設定應用程式、插件或擴充功能。
轉錄按音訊持續時間計費,而不是檔案大小。 44.1 kHz、16 位元的一小時 WAV 大小約為 600 MB,但成本與一小時 MP3 相同。免費時間足以在您提交完整批次之前轉錄一個簡短的樣本並檢查您自己的錄音的準確性。
只需三個步驟即可將 WAV 檔案轉換為文字
- **開啟轉換器並登入。**前往 /audio-to-text 並登入。新帳戶付款後即可獲得 30 分鐘免費時間添加了方法,足以測試端到端的錄音。
- **上傳WAV檔案。**將其拖曳到上傳區域或按一下瀏覽。大多數文件都遵循直接路徑。更大的文件會直接在您的瀏覽器中暫存和準備,具體取決於設備容量;僅當文件無法按原樣上傳時,才會使用本地 16 kHz 單聲道 FLAC 轉換。
- **下載逐字稿。**處理完成後,逐字稿會出現在儀表板中,並已套用說話者標籤和時間戳記。以 21 種格式中的任一種匯出,包括 TXT、SRT、VTT、DOCX 和 PDF,或作為受密碼保護的 .husharchive。
說話者標籤顯示為說話者 A、說話者 B等。按一下標籤可將其重新命名。一旦您將“說話者 A”設為真名,該說話者的每一行都會更新。
一個有效的範例:現場錄音訪談
假設您用手持式現場錄音機錄製了一段 40 分鐘的採訪,兩個人,保存為 44.1 kHz / 16 位立體聲 WAV,名為field-interview.wav。該檔案大約有 400 MB。以下是工作的實際過程。
該檔案是正常大小,因此無需轉換任何內容;您按原樣上傳。由於房間裡有一些空調嗡嗡聲,您首先在音訊編輯器中運行 80 Hz 的高通濾波器並重新匯出;消除了引擎會讀取為噪音的低隆隆聲,並且重新匯出到 WAV 可以保持音訊無損。您上傳清理後的文件。
處理完成後,傳回的逐字稿會分為說話者 A(您)和說話者 B(您的主題),每輪都有時間戳記。您重新命名兩個說話者,瀏覽一次引擎猜測的專有名詞,例如公司名稱或地點,然後透過尋找和替換修復重複的錯誤。然後匯出:DOCX 用於可讀的採訪,如果您還需要與視訊剪輯對齊的時間戳,則匯出 SRT。
此模式(輕度預處理、上傳、重新標記、略讀、匯出)適用於幾乎所有訪談或會議 WAV。對於更長或更大的文件,唯一改變的是您是否先壓縮它。
處理大型 WAV 檔案
44.1 kHz / 16 位元立體聲 WAV 每分鐘運行約 10 MB。兩個小時的會話大約為 1.2 GB,長時間的多軌匯出可能會更大。有兩件事值得規劃。
**沒有檔案大小限制可供規劃。**您通常不需要手動縮小較大的 WAV – Hushscript 可以直接在瀏覽器中階段和準備非常大的文件,僅當文件無法遵循直接上傳路徑時才使用本地 16 kHz 單聲道 FLAC 回退。如果您的裝置無法輕鬆準備來源,可以使用瀏覽器內的免費WAV 到 MP3 轉換器或音訊編輯器先製作較小的檔案。
上傳時間。在 10 Mbps 連線上傳 1 GB WAV 大約需要十五分鐘。在慢速連結上,上傳前進行壓縮可以顯著縮短等待時間。如果您不需要逐位無損,壓縮音訊工具會以較小的、通常聽不見的品質成本進一步縮小文件,這對於語音來說很少是問題。
**攜帶單聲道內容的立體聲。**大量錄音保存為立體聲,但實際上在兩個通道上包含相同的音訊:左右聲道複製一個麥克風。將其轉換為單聲道 WAV 或 FLAC 可以將檔案大小減半,而不會損失準確性,因為引擎無論如何都會混合為單聲道。這是應用時最簡單的尺寸勝利。
對困難錄音進行預處理
在上傳邊界檔案之前,在音訊編輯器中進行兩次快速編輯會得到回報:
- **標準化安靜的音訊。**如果波形檢視器中的峰值未達到大約 -12 dBFS 以上,則表示錄音太安靜,準確性受到影響。歸一化會提升電平,通常會顯著改善逐字稿。
- **對嗡嗡作響的房間進行高通處理。**持續的低頻噪音(暖通空調、筆記型電腦風扇、交通隆隆聲)會使引擎感到困惑。 80 Hz 的高通濾波器可消除低音嗡嗡聲並保持語音不變。大多數編輯器將其作為一鍵式過濾器提供。
這兩個步驟都不需要乾淨的錄音。它們是針對需要幫助的錄音的有針對性的修復,並且在任何編輯後重新匯出為 WAV 都可以保持音訊無損。
WAV 與 MP3 進行轉錄:無損真的有幫助嗎?
這是大多數 WAV 決策背後的問題,所以這裡是純版本。
對於準確性,無損有一點幫助,而且有更多幫助源頭越差。在乾淨的錄音中,WAV 和優質 128 kbps MP3 之間的差異很難在轉錄中察覺。在安靜或吵雜的錄音中,WAV 的額外保真度為引擎提供了更多的支援。不管怎樣,格式很少是你和可用的逐字稿之間的障礙。錄音品質為。
對於工作流程,MP3 在大小和上傳速度方面勝出,而 WAV 作為您在編輯之間保留的工作母帶勝出。常見的中間路徑:將編輯後的母帶保留為 WAV 或 FLAC,如果需要透過慢速連接上傳,請傳送高位元速率 MP3。您在逐字稿中幾乎不會丟失任何內容,並節省大量上傳時間。 MP3 到文字指南完整地涵蓋了該路徑。
簡短版本:如果品質很重要,請以 WAV 格式錄製和存檔,但當 100 MB 的檔案也能轉錄時,不必上傳 1 GB 檔案。
WAV 的準確度提示
- **乾淨地擷取語音訊帶。**任何高於 16 kHz 的聲音都會浪費在轉錄上,但乾淨的 300 Hz-8 kHz 就足夠了。靠近說話者的優質麥克風每次都能獲得高取樣率。
- **盡可能為每個說話者配備麥克風。**兩個人使用一個共用麥克風比兩個人使用自己的軌道更難分開。如果您的現場錄音機支援,請將每個說話者錄製到一個通道。
- **每個檔案保留一種語言。**每個檔案運行偵測;中途切換語言的錄音比兩個乾淨的單語言檔案更難。
- **匯出後瀏覽一次。**專有名詞(名稱、地點、品牌、技術術語)是任何引擎猜測的地方。一次尋找和替換即可在幾分鐘內清理其中的大部分內容。
說話者標籤和時間戳
每個 WAV 轉錄內容都包含自動說話者分離,這是每項工作的免費福利,而不是付費等級或按說話者追加銷售。兩人錄音(例如訪談者和拍攝對象)或錄製到立體聲軌道的兩側通話,會清晰地呈現出來。對於任何說話者分離引擎來說,較大的團體錄音(會議桌旁有四個或更多人)都比較困難,因此需要對嘈雜的房間錄音進行一些標籤清理。
SRT 匯出對於來自影片製作的 WAV 檔案特別有用。如果您單獨錄製音訊(在後期同步的吊桿麥克風或 lav 音軌),SRT 時間戳可讓您將逐字稿重新排列到圖片,而無需手動擦除音訊。
匯出選項
| 格式 | 註解 |
|---|---|
| TXT | 帶有說話者標籤的純逐字稿,沒有時間戳。適合搜尋、引用和輸入其他工具。 |
| SRT | 每句的時間戳記。可在 VLC、影片編輯器和字幕工具中開啟的標準字幕和字幕格式。 |
| VTT | 適用於 HTML5 視訊和發布工作流程的 Web 字幕格式。 |
| CSV | 支援電子表格匯出,包括說話者、計時和文字欄位。 |
| Markdown | 用於註釋、文件和發布的可編輯純文字結構。 |
| JSON | 用於自訂處理管道的結構化輸出(每個話語{ speaker, start, end, text })。 |
| DOCX | 與 Word 相容,在可讀佈局中包含說話者標籤和時間戳,以便共用或註解。 |
| 用於共享或存檔的固定佈局轉錄。 |
任何格式都沒有浮水印,並且每個轉錄都包含匯出內容。更高層後面沒有東西。
如果您的 WAV 是邊緣錄製且準確性是首要考慮因素,則MP3 到文字指南涵蓋了同樣適用於此處的標準化和其他預處理步驟。如果您希望將其轉換為 MP3 並轉錄,免費轉換器將在您的瀏覽器中運行,而無需上傳檔案。要在一個地方獲取可接受的格式和功能的完整列表,音訊轉文字頁面擁有一切。
獨立來源與標準
Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。
來源審閱日期: