跳至主要內容

如何從影片建立 SRT 字幕

作者: 發布: 最後審閱:

SRT 檔案是字幕與影片分開傳輸的方式,作為播放器與圖片一起讀取的小邊車文字檔案。您可以透過轉錄音訊並匯出帶有時間戳的結果來製作一個。過去需要一個下午的工作,為每條線計時到框架,現在已經為您完成了;剩下的是一個簡短的編輯過程以提高可讀性。本指南解釋了該格式實際包含的內容、如何按實際順序從影片建立 SRT,以及如何對其進行清理以使字幕清晰易讀。

開始之前您需要什麼

您需要視訊檔案和幾分鐘的時間。任何常見容器都可以使用:MP4、MOV、MKV、WebM、AVI 等。您不需要編輯軟體來建立 SRT,也不需要先轉換影片。字幕編輯器是可選的,只有在稍後您需要在微調時間時使用時間軸視圖時才有用。

對於您註冊的逐字稿身,可解鎖 30 分鐘的免費試用時間。首先渲染的 30 秒預覽不需要帳戶,因此您可以在提交任何內容之前查看品質。

什麼是 SRT 檔案

SRT 是 SubRip Text 的縮寫。它的格式刻意保持簡單:由一連串編號區塊組成,每個區塊分成三個部分並各自佔一行,依序為索引編號、start --> end 時間戳記,以及一到兩行字幕文字。區塊之間以空白行分隔。

1
00:00:02,340 --> 00:00:05,810
音訊在瀏覽器中擷取。

2
00:00:06,100 --> 00:00:09,440
只有音訊到達伺服器,而不是視訊。

當您閱讀或手動編輯文件時,一些細節很重要。時間戳格式為HH:MM:SS,mmm,小時到毫秒,毫秒之前的分隔符號是逗號,而不是句點。兩個時間之間的箭頭恰好是兩個連字元和一個大於號。索引號碼應從 1 開始依序排列,中間沒有間隙。如果出現任何錯誤,有些玩家會默默地放棄受影響的提示,這是手工編輯的 SRT 中途「停止工作」的最常見原因。

SRT 支援在桌面播放器、編輯器和託管平台上廣泛,但並不普遍。 國會圖書館格式說明將 SRT 記錄為一個簡單的編號、定時文字提示序列;每個目的地仍決定其匯入的字幕格式。原生 HTML<track>元素使用 WebVTT 進行定時文字,如WHATWG 生活標準中所定義,這是一種快速轉換,將在下面介紹。

以真實順序從影片建立 SRT

該流程分為三個階段,順序為人們倒退的部分。您先拖放文件並在任何帳戶存在之前進行預覽。

  1. **拖放您的影片即可免費預覽。**前往 /video-to-text/MP4-to-text(如果您的檔案是 MP4),然後將影片拖曳到上傳區域。使用本地處理庫在瀏覽器中提取音軌,然後前 30 秒作為說話者標記的預覽返回。此步驟不需要帳戶,影片本身永遠不會離開您的裝置。
  2. **註冊以轉錄其餘部分。**預覽看起來正確後,建立一個帳戶來執行完整文件。註冊即可獲得 30 分鐘免費試用時間。獲得它們的最快方法是驗證一張持有一美元的卡,該卡獲得授權後立即釋放,無需付費;如果您想使用您所在國家/地區可用的其他付款方式,則在您首次購買時將有 30 分鐘的時間。無論哪種方式都不需要卡片。轉錄是付費的,因為它運行在頂級人工智慧上,因此它是按需付費,無需訂閱。對於超過免費分鐘數的較長影片,請參閱定價頁面;您按音訊分鐘付費,而不是按文件付費。
  3. **取得腳本並匯出 SRT。**腳本準備好後,在編輯器中將其打開,進行任何更正,然後按一下「匯出」並選擇 SRT。每個口頭表達都成為一個提示,其開始和結束時間戳已經就位。下載的是一個普通的.srt文件,沒有浮水印。

在匯出之前,說話者標籤會出現在編輯器中。如果您希望標題中出現姓名,以便對訪談、辯論或小組討論有用,請先將「說話者 1」和「說話者 2」重新命名為真實姓名;然後匯出將這些名稱寫入匹配提示的開頭。

一個有效範例

假設您有一個 12 分鐘的錄音採訪,founder-chat.mp4,採訪對像是兩個人。您將其放在頁面上,30 秒的預覽確認兩種聲音均已清晰拾取,然後您就可以註冊。完整的逐字稿準備好後,您將兩位說話者重新命名為“Maya”和“Devin”,修復一個聽錯的產品名稱,然後匯出為 SRT。檔案的開啟方式如下所示:

1
00:00:01,120 --> 00:00:04,460
Maya:感謝您今天抽出時間。

2
00:00:04,800 --> 00:00:08,210
Devin:當然。我一直很期待這件事。

3
00:00:08,540 --> 00:00:12,900
Maya:讓我們從頭開始。這個想法是如何產生的?

有兩件事值得注意。每個提示都映射到一個自然的話語,因此時間遵循對話而不是固定的時鐘。提示之間的間隙(此處為幾百毫秒)反映了說話者之間的真實停頓。這通常正是您想要的,接下來會介紹一個注意事項。

編輯時間和行長度

大多數匯出都可以原樣使用,但兩個快速檢查使標題明顯更易於閱讀。這種簡短的方式將自動產生的字幕與專業的字幕區分開來。

**行長度和行數。**樣式指南各不相同,而且 SRT 格式本身並不會強制執行通用的行長度或行數。長提示仍然可以成為大段文字。當目的地有規定時,遵循該目的地的現行規定;否則,保持每個提示緊湊,在自然短語邊界處分割,並檢查最終幀大小的結果。

**閱讀速度。**螢幕上的長度必須與提示顯示的時間相符。如果提示在很短的時間內顯示大量文字,請在自然停頓時將其拆分或重新計時,而不要覆蓋後面的語音。以正常播放速度預覽字幕,而不是僅根據文字檔案判斷時間。

**時間間隙和重疊。**兩個提示之間的間隙短於約 80 毫秒,可能會使某些玩家在上一行上停留太久或跳過下一行,因此在背靠背提示之間留出一小段喘息時間。相反的問題是重疊:當兩個人互相交談時,引擎會為每個說話者分配一個單獨的提示,並且這些提示可能會及時發生衝突。沒有自動工具可以完美地解決真正的重疊問題,因此對於對話較多的素材,請掃描重疊的時間戳並手動提前或推遲一個提示。

您可以在任何純文字編輯器中完成所有這些操作,因為該格式是人類可讀的。如果您喜歡視覺工作,專用的字幕編輯器(例如 Windows 上的 Subtitle Edit 或任何平台上的 Aegisub)會添加波形時間線,並可以大量自動修復常見的間距和閱讀速度問題。

SRT 與 VTT:匯出哪一種

這兩種格式非常相似,正確的選擇取決於字幕的播放位置。如果您想在提交之前進行全面比較,SRT 與 VTT:使用哪種字幕格式詳細介紹了每種格式的優勢。

為桌上播放器、影片編輯器和絕大多數託管平台提供 SRT,這是人們最需要的。當標題使用 HTML5<video>元素出現在自訂網頁上時,請使用 WebVTT,因為這是瀏覽器原生讀取<track>元素的唯一格式。它們之間的內容是相同的。 VTT 只是在文件頂部添加一行WEBVTT,並在每個時間戳的毫秒前使用句點而不是逗號。

因為差異很小,所以不需要重新轉錄來切換。匯出 SRT,如果您以後需要 VTT,請透過 /tools/SRT-to-VTT 中的免費轉換器來執行它。它可以在您的瀏覽器中運行,無需帳戶,也無需上傳任何內容。

將 SRT 新增至播放器、編輯器或平台

取得檔案後,依照影片所在位置附加該檔案。

**桌上播放器。**VLC、mpv 和大多數桌面播放器在共用影片的基本名稱和資料夾時會自動載入 sidecar SRT。重新命名您的文件,使interview.mp4interview.srt配對,將它們放在同一目錄中,字幕將出現在播放時。如果播放器錯過了它,其字幕選單有一個手動「載入字幕檔案」選項。

**影片編輯器。**在 DaVinci Resolve、Premiere Pro 或 Final Cut 中,匯入 SRT 作為字幕或字幕軌道。編輯器將每個提示放在正確的時間碼上的時間軸上,然後您可以重新設定字體樣式、更改位置,如果您希望硬編碼字幕,則可以將字幕刻錄到最終匯出中。

**託管平台和社群影片。**YouTube 在其字幕工作流程中直接接受 SRT。其他平台可能接受 sidecar 文件,需要內建字幕編輯器,或期望將字幕刻錄到影片中。將經過審查的 SRT 作為事實來源,然後使用目標的當前發布流程,而不是假設一種上傳方法在任何地方都適用。

**刻錄字幕。**如果您需要文字永久成為圖片的一部分而不是可切換的 sidecar,則這是一個單獨的編碼步驟。 HandBrake 可以免費將 SRT 刻錄到影片中:加載影片,在“字幕”選項卡下添加 SRT,勾選“刻錄”,然後進行編碼。僅當目標無法讀取 sidecar 檔案時才需要執行此操作,因為單獨的 SRT 保持可編輯狀態,而燒錄字幕則不然。有關在每個平台上附加和刻錄字幕的更完整演練,請參閱如何為影片新增字幕

常見問題及解決方法

**字幕從一開始就不同步。**恆定的偏移量(每行早或晚相同的量)通常意味著播放器讀取的幀速率與計時假設的幀速率略有不同。大多數桌面播放器都有字幕延遲控制,可以立即移動整個軌道;輕推它,直到第一行落地,其餘部分隨之而來。

**隨著時間的推移,同步會進一步偏離。**隨著視訊播放而增加的漂移表明來源和渲染副本之間的幀速率不匹配,這在將 23.976 fps 檔案轉換為 25 fps 或返回後很常見。根據您實際要發布的影片版本(而不是早期剪輯版本)重新匯出 SRT。

**字幕中缺少說話者姓名。**如果您重新命名了標籤,但平台未顯示任何名稱,則該平台可能會在匯入時從 SRT 中刪除說話者前綴。沒有 SRT 設定來強制它們;可靠的解決方法是刻錄字幕,其中名稱是圖片的一部分。

**非英語影片以錯誤的語言傳回。**Hushscript 會自動偵測大約 99 種語言的口語,但非常短或吵雜的剪輯有時可能會被誤讀。重新運行一個更清晰的部分,或檢查語言頁面以確認語言已被覆蓋。

**長篇大論讀起來就像一個巨大的提示。**當有人長時間講話而沒有明顯停頓時,就會發生這種情況。在句子邊界處手動分割提示,這樣單一區塊就不會包含超過兩行的可讀文字。

以更少的編輯次數獲得回報的準確性提示

大部分的字幕品質是在打開編輯器之前透過輸入的音訊設定。乾淨的來源音訊意味著更少的誤聽單字和更嚴格的時間戳,這意味著更短的編輯過程。

以正常說話音量錄製或匯出音訊,無需進行大量壓縮,並儘可能避免對話中大聲的背景音樂。當涉及多人時,每個聲音都相當不同的錄音有助於說話者標籤保持一致,如果您打算在字幕中保留姓名,這一點很重要。如果來源是您已經發布的影片,則音訊是什麼,但對於您自己錄製的任何內容,花幾分鐘注意音量和麥克風位置比隨後進行大量編輯更能提高字幕品質。

SRT 之後:腳本的其餘部分

建立 SRT 還會為您提供完整的腳本,因此您不僅限於字幕。在同一會話中,您可以將文字匯出為 TXT 或 DOCX,用於展示筆記、部落格版本的演講或發佈在影片旁邊的可存取的逐字稿。匯出乾淨的逐字稿與將影片轉為文字 新增字幕是一樣的;SRT 只是其中的一種格式。

下一步,將這些字幕加入影片並在附屬文件和燒錄軌道之間進行選擇,請參閱如何為影片新增字幕

獨立來源與標準

Hushscript 參考了這些獨立且非競爭性的資料來源。它們用於說明研究、標準或平台運作方式,並不代表其為 Hushscript 背書。

來源審閱日期:

常見問題

什麼是 SRT 檔案?

SRT(SubRip 文字)文件是一個純文字文件,將編號提示與時間和文字配對。每個區塊都有一個索引、一個以 HH:MM:SS、mmm 形式書寫的開始和結束時間戳以及字幕文字。支援範圍廣泛,但在發布前請檢查目標接受的字幕格式。

如何從影片建立 SRT 檔案?

轉錄影片的音訊,然後將轉錄內容匯出為 SRT。在 Hushscript 中,您可以放置​​影片以獲得 30 秒的免費預覽,註冊以轉錄其餘部分,然後在匯出時選擇 SRT。每個語音台詞都成為一個提示,其開始和結束時間已填好,因此您無需手動輸入時間戳記。

字幕的理想行長和閱讀速度是多少?

由於目的地指南不同,因此沒有通用數字。保持提示緊湊,在自然短語邊界處換行,並以最終幀大小和播放速度對其進行測試。如果目的地提供了規範,請遵循該目的地的當前規範。

我的影片檔案會上傳到伺服器嗎?

不會。在發送任何內容之前,Hushscript 會從瀏覽器中的影片中提取音訊,因此影片本身會保留在您的設備上,只有較小的音訊文件會到達伺服器。逐字稿準備好後,音訊將被刪除。

我可以在 SRT 中包含說話者姓名嗎?

可以。在匯出之前,在腳本編輯器中重新命名每個說話者標籤,這些名稱將顯示在相關提示的開頭。請注意,某些平台在匯入時會從 SRT 中移除說話者前綴,因此如果名稱必須保持可見,請考慮將字幕刻錄到影片中。

SRT 和 VTT 有什麼不同?

它們都帶有定時文字。 WebVTT 新增了 WebVTT 標題行,在時間戳記中使用句點而不是逗號,並支援 Web 提示設定。將 VTT 用於原生 HTML5 軌道;當目的地明確接受時使用 SRT。您無需重新轉錄即可進行轉換。

我可以為多大的影片添加字幕?

長達 10 小時,沒有檔案大小限制 - 即使非常大的影片也可以在客戶端進行轉換,具體取決於瀏覽器和裝置容量。由於音訊在上傳前被提取,因此大視訊發送的資料遠少於其完整檔案大小。

時間戳的準確性如何?

每個提示都是根據語音引擎的計時產生的,但不保證固定偏移。檢查最終影片,尤其是快速對話、音樂和重疊的說話者,並調整早或晚出現的任何提示。

從 30 分鐘免費額度開始

開始––30 分鐘免費