Chuyển đến nội dung chính

Cách tạo phụ đề SRT từ video

Tác giả: Ngày đăng: Rà soát lần cuối:

Tệp SRT là cách phụ đề di chuyển tách biệt khỏi video, dưới dạng một tệp văn bản phụ nhỏ mà trình phát đọc dọc theo hình ảnh. Bạn tạo một cái bằng cách chép lại âm thanh và xuất kết quả kèm theo dấu thời gian. Công việc trước đây mất cả buổi chiều, căn chỉnh từng dòng cho đến khung hình, giờ đây đã được thực hiện cho bạn; những gì còn lại là một đoạn chỉnh sửa ngắn để dễ đọc. Hướng dẫn này giải thích nội dung thực sự của định dạng, cách tạo SRT từ video theo thứ tự thực và cách sắp xếp nó để phụ đề đọc rõ ràng.

Những gì bạn cần trước khi bắt đầu

Bạn cần có tệp video và một vài phút. Bất kỳ vùng chứa thông thường nào cũng hoạt động: MP4, MOV, MKV, WebM, AVI và phần còn lại. Bạn không cần phần mềm chỉnh sửa để tạo SRT và trước tiên bạn không cần phải chuyển đổi video. Trình chỉnh sửa phụ đề là tùy chọn và chỉ hữu ích sau này nếu bạn muốn xem dòng thời gian trong khi tinh chỉnh thời gian.

Bạn đăng ký để có bản ghi âm, bạn sẽ có 30 phút dùng thử miễn phí. Bản xem trước 30 giây hiển thị đầu tiên không cần có tài khoản nên bạn có thể xem chất lượng trước khi thực hiện bất kỳ điều gì.

Tệp SRT là gì

SRT là viết tắt của SubRip Text. Định dạng này rất đơn giản: một chuỗi các khối được đánh số, mỗi khối được tạo thành từ ba phần xếp chồng lên nhau trên các dòng riêng biệt. Đầu tiên là số chỉ mục, sau đó là start --> end dấu thời gian, sau đó là một hoặc hai dòng văn bản phụ đề. Một dòng trống ngăn cách khối này với khối tiếp theo.

1
00:00:02,340 --> 00:00:05,810
Âm thanh được trích xuất trong trình duyệt của bạn.

2
00:00:06,100 --> 00:00:09,440
Chỉ âm thanh đến được máy chủ chứ không phải video.

Một số chi tiết quan trọng khi bạn đọc hoặc chỉnh sửa tệp bằng tay. Định dạng dấu thời gian là HH:MM:SS,mmm, từ giờ đến mili giây và dấu phân cách trước mili giây là dấu phẩy, không phải dấu chấm. Mũi tên giữa hai thời điểm chính xác là hai dấu gạch ngang và dấu lớn hơn. Các số chỉ mục phải chạy theo thứ tự từ 1 và không có khoảng trống. Nếu mắc phải bất kỳ lỗi nào trong số đó và một số người chơi sẽ âm thầm bỏ tín hiệu bị ảnh hưởng. Đây là lý do phổ biến nhất khiến SRT được chỉnh sửa bằng tay “ngưng hoạt động” giữa chừng.

Hỗ trợ SRT được áp dụng rộng rãi trên các trình phát trên máy tính để bàn, trình chỉnh sửa và nền tảng lưu trữ nhưng không phổ biến. Mô tả định dạng của Thư viện Quốc hội ghi lại SRT dưới dạng một chuỗi đơn giản gồm các tín hiệu văn bản được đánh số và hẹn giờ; mỗi đích vẫn quyết định định dạng phụ đề nào nó nhập. Phần tử HTML gốc <track> sử dụng WebVTT cho văn bản được định thời gian, như được định nghĩa trong Tiêu chuẩn sống WHATWG, là một chuyển đổi nhanh được đề cập sâu hơn.

Tạo SRT từ một video theo thứ tự thực

Quy trình có ba giai đoạn và thứ tự là phần mà mọi người bị thụt lùi. Trước tiên, bạn thả tệp và xem trước trước khi có bất kỳ tài khoản nào tồn tại.

  1. Thả video của bạn để xem trước miễn phí. Đi tới /video-to-text hoặc /MP4-to-text nếu tệp của bạn là MP4 và thả video vào khu vực tải lên. Đoạn âm thanh được trích xuất trong trình duyệt của bạn bằng thư viện xử lý cục bộ, sau đó 30 giây đầu tiên sẽ trở lại dưới dạng bản xem trước được gắn nhãn của người nói. Không cần có tài khoản cho bước này và bản thân video sẽ không bao giờ rời khỏi thiết bị của bạn.
  2. Đăng ký để chép lại phần còn lại. Sau khi bản xem trước có vẻ ổn, hãy tạo một tài khoản để chạy toàn bộ tệp. Đăng ký sẽ mở khóa 30 phút miễn phí để dùng thử. Cách nhanh nhất để có được chúng là xác thực một thẻ có khoản giữ một đô la được ủy quyền và sau đó được phát hành ngay lập tức, không bao giờ bị tính phí; nếu bạn muốn sử dụng một phương thức thanh toán khác có sẵn ở quốc gia của mình thì thay vào đó, 30 phút sẽ đến với lần mua hàng đầu tiên của bạn. Một trong hai cách không cần thiết phải có thẻ. Phiên âm được trả phí vì nó chạy trên AI hàng đầu, do đó, nó được trả tiền khi bạn sử dụng mà không cần đăng ký. Để có video dài hơn số phút miễn phí, hãy xem trang định giá; bạn trả tiền cho mỗi phút âm thanh chứ không phải cho mỗi tệp.
  3. Nhận bản ghi và xuất SRT. Khi bản ghi đã sẵn sàng, hãy mở nó trong trình chỉnh sửa, thực hiện bất kỳ chỉnh sửa nào, sau đó nhấp vào xuất và chọn SRT. Mỗi lời nói sẽ trở thành một tín hiệu với dấu thời gian bắt đầu và kết thúc đã có sẵn. Tệp tải xuống là tệp .srt đơn giản không có hình mờ.

Nhãn người nói xuất hiện trong trình chỉnh sửa trước khi bạn xuất. Nếu bạn muốn có tên trong chú thích, hữu ích cho các cuộc phỏng vấn, tranh luận, hội thảo, hãy đổi tên “Người nói 1” và “Người nói 2” thành tên thật trước; sau đó quá trình xuất sẽ ghi những tên đó vào đầu các tín hiệu khớp.

Một ví dụ hoạt động

Giả sử bạn có một cuộc phỏng vấn được ghi âm dài 12 phút,founder-chat.mp4, với hai người. Bạn thả nó lên trang, bản xem trước 30 giây xác nhận cả hai giọng nói đều được chọn rõ ràng và bạn đăng ký. Khi bản ghi đầy đủ đã sẵn sàng, bạn đổi tên hai người nói thành “Maya” và “Devin”, sửa một tên sản phẩm bị nghe nhầm, sau đó xuất dưới dạng SRT. Phần mở đầu của tệp trông như thế này:

1
00:00:01,120 --> 00:00:04,460
Maya: Cảm ơn bạn đã dành thời gian cho ngày hôm nay.

2
00:00:04,800 --> 00:00:08,210
Devin: Tất nhiên rồi. Tôi đã mong đợi điều này từ lâu.

3
00:00:08,540 --> 00:00:12,900
Maya: Chúng ta hãy bắt đầu lại từ đầu. Ý tưởng này xuất hiện như thế nào?

Có hai điều đáng chú ý. Mỗi tín hiệu ánh xạ tới một cách nói tự nhiên, do đó thời gian sẽ tuân theo cuộc trò chuyện chứ không phải theo đồng hồ cố định. Và khoảng cách giữa các tín hiệu, ở đây là vài trăm mili giây, phản ánh khoảng dừng thực sự giữa những người nói. Đó thường chính xác là những gì bạn muốn, kèm theo một lưu ý tiếp theo.

Chỉnh sửa thời gian và độ dài dòng

Hầu hết các bản xuất đều có thể sử dụng được như hiện tại, nhưng hai lần kiểm tra nhanh giúp chú thích dễ đọc hơn đáng kể. Đoạn ngắn này là yếu tố phân biệt phụ đề được tạo tự động với phụ đề mang lại cảm giác chuyên nghiệp.

Độ dài dòng và số lượng dòng. Hướng dẫn về phong cách khác nhau và bản thân định dạng SRT không áp đặt độ dài dòng hoặc số lượng dòng phổ biến. Một tín hiệu dài vẫn có thể trở thành một bức tường văn bản. Thực hiện theo quy tắc hiện tại của điểm đến khi có quy tắc đó; nếu không, hãy giữ mỗi tín hiệu nhỏ gọn, phân tách ở ranh giới cụm từ tự nhiên và kiểm tra kết quả ở kích thước khung hình cuối cùng.

Tốc độ đọc. Độ dài trên màn hình phải khớp với thời lượng tín hiệu được hiển thị. Nếu một gợi ý hiển thị nhiều văn bản trong một thời gian rất ngắn, hãy tách nó ở mức tạm dừng tự nhiên hoặc đặt lại thời gian mà không che đi lời nói sau đó. Xem trước phụ đề ở tốc độ phát lại bình thường thay vì chỉ đánh giá thời gian từ tệp văn bản.

Khoảng cách thời gian và chồng chéo. Khoảng cách ngắn hơn khoảng 80 mili giây giữa hai tín hiệu có thể khiến một số người chơi giữ dòng trước đó quá lâu hoặc bỏ qua dòng tiếp theo, vì vậy, hãy thở nhẹ giữa các tín hiệu quay lại. Vấn đề ngược lại là sự chồng chéo: khi hai người nói chuyện với nhau, hệ thống sẽ gán cho mỗi người một tín hiệu riêng và những tín hiệu đó có thể va chạm kịp thời. Không có công cụ tự động nào giải quyết hoàn toàn sự chồng chéo thực sự, vì vậy, đối với những cảnh quay có nhiều hội thoại, hãy quét dấu thời gian chồng chéo và di chuyển một tín hiệu sớm hơn hoặc muộn hơn bằng tay.

Bạn có thể thực hiện tất cả những điều này trong bất kỳ trình soạn thảo văn bản đơn giản nào vì định dạng này con người có thể đọc được. Nếu bạn muốn làm việc một cách trực quan thì một trình chỉnh sửa phụ đề chuyên dụng như Chỉnh sửa phụ đề trên Windows hoặc Aegisub trên bất kỳ nền tảng nào sẽ thêm dòng thời gian dạng sóng và có thể tự động khắc phục hàng loạt các vấn đề phổ biến về khoảng cách và tốc độ đọc.

SRT và VTT: nên xuất định dạng nào

Hai định dạng này có mối quan hệ gần gũi với nhau và lựa chọn phù hợp phụ thuộc vào vị trí phát phụ đề. Nếu bạn muốn so sánh đầy đủ trước khi cam kết, SRT so với VTT: định dạng phụ đề nào sẽ sử dụng sẽ phân tích điểm mạnh của từng định dạng.

Hãy tiếp cận SRT dành cho trình phát trên máy tính để bàn, trình chỉnh sửa video và phần lớn các nền tảng lưu trữ, đó là hầu hết những gì mọi người cần. Hãy tiếp cận WebVTT khi phụ đề xuất hiện trên một trang web tùy chỉnh bằng cách sử dụng phần tử HTML5 <video>, vì đó là định dạng duy nhất mà trình duyệt đọc tự nhiên cho phần tử <track>. Nội dung giữa chúng giống hệt nhau. VTT chỉ thêm dòng WEBVTT ở đầu tệp và sử dụng dấu chấm thay vì dấu phẩy trước mili giây trong mỗi dấu thời gian.

Vì sự khác biệt là nhỏ nên bạn không cần phải phiên âm lại để chuyển đổi. Xuất SRT và nếu sau này bạn cần VTT, hãy chạy nó thông qua trình chuyển đổi miễn phí tại /tools/SRT-to-VTT. Nó hoạt động trong trình duyệt của bạn mà không cần tài khoản và không cần tải lên gì.

Thêm SRT vào trình phát, trình chỉnh sửa hoặc nền tảng

Sau khi bạn có tệp, việc đính kèm tệp sẽ tùy thuộc vào nơi video xuất hiện.

Trình phát trên máy tính để bàn. VLC, mpv và hầu hết các trình phát trên máy tính để bàn tự động tải SRT sidecar khi nó chia sẻ tên cơ sở và thư mục của video. Đổi tên tệp của bạn để interview.mp4 được ghép nối với interview.srt, thả chúng vào cùng thư mục và chú thích sẽ xuất hiện khi phát lại. Nếu người chơi bỏ lỡ, menu phụ đề của nó sẽ có tùy chọn “tải tệp phụ đề” thủ công.

Trình chỉnh sửa video. Trong DaVinci Resolve, Premiere Pro hoặc Final Cut, hãy nhập SRT làm phụ đề hoặc bản chú thích. Trình chỉnh sửa đưa từng tín hiệu vào dòng thời gian ở đúng mã thời gian và từ đó, bạn có thể định kiểu lại phông chữ, thay đổi vị trí và ghi chú thích vào bản xuất cuối cùng nếu bạn muốn chúng được mã hóa cứng.

Nền tảng lưu trữ và video trên mạng xã hội. YouTube chấp nhận SRT trực tiếp trong quy trình phụ đề của mình. Các nền tảng khác có thể chấp nhận tệp sidecar, yêu cầu trình chỉnh sửa phụ đề tích hợp sẵn hoặc mong đợi phụ đề được ghi vào video. Giữ SRT đã xem xét làm nguồn thông tin đáng tin cậy, sau đó sử dụng luồng xuất bản hiện tại của đích thay vì cho rằng một phương thức tải lên hoạt động ở mọi nơi.

Ghi phụ đề vào. Nếu bạn cần văn bản cố định là một phần của hình ảnh thay vì một sidecar có thể chuyển đổi thì đó là một bước mã hóa riêng biệt. HandBrake có thể ghi SRT thành video miễn phí: tải video, thêm SRT trong tab Phụ đề, đánh dấu vào “Đã ghi” và mã hóa. Chỉ đạt được điều này khi đích đến không thể đọc tệp sidecar vì một SRT riêng biệt vẫn có thể chỉnh sửa được trong khi chú thích cố định thì không. Để có hướng dẫn đầy đủ hơn về cách đính kèm và ghi phụ đề trên mỗi nền tảng, hãy xem cách thêm phụ đề vào video.

Các vấn đề thường gặp và cách khắc phục

Phụ đề không đồng bộ ngay từ đầu. Độ lệch không đổi, trong đó mỗi dòng đều sớm hoặc muộn như nhau, thường có nghĩa là người chơi đang đọc tốc độ khung hình hơi khác nhau hơn thời gian giả định. Hầu hết các trình phát trên máy tính để bàn đều có điều khiển độ trễ phụ đề để chuyển toàn bộ bản nhạc cùng một lúc; di chuyển nó cho đến khi dòng đầu tiên xuất hiện và phần còn lại theo sau.

Đồng bộ hóa ngày càng xa nhau theo thời gian. Độ lệch tăng dần khi video phát cho thấy tốc độ khung hình không khớp giữa nguồn và bản sao được kết xuất, thường xảy ra sau khi chuyển đổi tệp 23,976 khung hình/giây thành 25 khung hình/giây hoặc ngược lại. Xuất lại SRT theo phiên bản video mà bạn thực sự sẽ xuất bản, thay vì bản cắt trước đó.

Tên của người nói bị thiếu trong phụ đề. Nếu bạn đã đổi tên nhãn nhưng một nền tảng không hiển thị tên thì nền tảng đó có thể loại bỏ tiền tố của người nói khỏi SRT khi nhập. Không có cài đặt SRT nào buộc chúng; cách khắc phục đáng tin cậy là ghi chú thích vào, trong đó tên là một phần của hình ảnh.

Một video không phải tiếng Anh hiển thị sai ngôn ngữ. Hushscript tự động phát hiện ngôn ngữ nói trên khoảng 99 ngôn ngữ, nhưng một đoạn clip rất ngắn hoặc ồn ào đôi khi có thể bị đọc sai. Chạy lại phần sạch hơn hoặc kiểm tra trang ngôn ngữ để xác nhận ngôn ngữ đã được sử dụng.

Những đoạn dài được đọc như một tín hiệu khổng lồ. Điều này xảy ra khi ai đó nói trong một thời gian dài mà không có khoảng dừng rõ ràng. Phân chia tín hiệu theo cách thủ công ở một ranh giới câu để không khối đơn nào chứa nhiều hơn hai dòng văn bản có thể đọc được.

Các mẹo về độ chính xác giúp bạn thực hiện ít chỉnh sửa hơn

Hầu hết chất lượng phụ đề của bạn được đặt trước khi bạn mở trình chỉnh sửa, bởi âm thanh bạn nạp vào. Âm thanh nguồn sạch nghĩa là ít từ bị nghe nhầm hơn và dấu thời gian chặt chẽ hơn, nghĩa là thời gian chỉnh sửa ngắn hơn.

Ghi hoặc xuất âm thanh ở mức giọng nói bình thường mà không cần nén quá nhiều và tránh nhạc nền lớn trong đoạn hội thoại nếu có thể. Khi có nhiều người tham gia, bản ghi âm trong đó mỗi giọng nói được phân biệt hợp lý sẽ giúp nhãn của người nói luôn nhất quán, điều này rất quan trọng nếu bạn dự định giữ tên trong chú thích. Nếu nguồn là video bạn đã xuất bản thì âm thanh là bất kỳ thứ gì, nhưng đối với bất kỳ nội dung nào bạn tự ghi, một vài phút chú ý đến mức độ và vị trí micrô sẽ mang lại chất lượng phụ đề nhiều hơn bất kỳ thao tác chỉnh sửa nào sau đó.

Sau SRT: phần còn lại của bản ghi

Việc tạo SRT cũng cung cấp cho bạn bản ghi đầy đủ nên bạn không bị giới hạn ở phụ đề. Từ cùng một phiên, bạn có thể xuất văn bản dưới dạng TXT hoặc DOCX để ghi chú tập, phiên bản blog của bài nói chuyện hoặc bản ghi có thể truy cập được đăng bên cạnh video. Xuất bản ghi rõ ràng cũng giống như sản phẩm tạo phụ đề cho video thành văn bản; SRT chỉ là một trong những định dạng được tạo ra từ nó.

Đối với bước tiếp theo, đặt những chú thích này vào video và chọn giữa tệp sidecar và bản nhạc cố định, hãy xem cách thêm phụ đề vào video.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Tệp SRT là gì?

Tệp SRT (SubRip Text) là một tệp văn bản đơn giản ghép nối với nhau tín hiệu được đánh số với thời gian và văn bản. Mỗi khối có một chỉ mục, dấu thời gian bắt đầu và kết thúc được viết dưới dạng HH:MM:SS,mmm và văn bản phụ đề. Hỗ trợ rất rộng nhưng hãy kiểm tra các định dạng phụ đề được chấp nhận của đích đến trước khi xuất bản.

Làm cách nào để tạo tệp SRT từ video?

Chép lại âm thanh của video, sau đó xuất bản ghi dưới dạng SRT. Trong Hushscript, bạn thả video để có bản xem trước 30 giây miễn phí, đăng ký để chép lại phần còn lại, sau đó chọn SRT khi xuất. Mỗi dòng nói sẽ trở thành một gợi ý với thời gian bắt đầu và kết thúc đã được điền sẵn, do đó, bạn không bao giờ phải nhập dấu thời gian bằng tay.

Độ dài dòng lý tưởng và tốc độ đọc cho phụ đề là bao nhiêu?

Không có con số chung vì hướng dẫn đích đến khác nhau. Giữ các tín hiệu nhỏ gọn, ngắt dòng ở ranh giới cụm từ tự nhiên và kiểm tra chúng ở kích thước khung hình cuối cùng và tốc độ phát lại. Tuân theo thông số kỹ thuật hiện tại của đích đến khi nó cung cấp thông số kỹ thuật.

Tệp video của tôi có được tải lên máy chủ không?

Không. Hushscript trích xuất âm thanh từ video trong trình duyệt của bạn trước khi gửi bất kỳ nội dung nào, do đó video sẽ vẫn ở trên thiết bị của bạn và chỉ tệp âm thanh nhỏ hơn mới đến được máy chủ. Âm thanh sẽ bị xóa sau khi bản chép lời sẵn sàng.

Tôi có thể thêm tên người nói vào SRT không?

Có. Đổi tên từng nhãn người nói trong trình chỉnh sửa bản ghi trước khi bạn xuất và những tên đó sẽ xuất hiện ở đầu các tín hiệu liên quan. Xin lưu ý rằng một số nền tảng sẽ loại bỏ tiền tố người nói khỏi SRT khi nhập, vì vậy, nếu tên vẫn phải hiển thị, hãy cân nhắc việc ghi chú thích vào video.

Sự khác biệt giữa SRT và VTT là gì?

Cả hai đều có văn bản được định thời gian. WebVTT thêm dòng tiêu đề WebVTT, sử dụng dấu chấm thay vì dấu phẩy trong dấu thời gian và hỗ trợ cài đặt tín hiệu web. Sử dụng VTT cho các bản nhạc HTML5 gốc; sử dụng SRT khi đích rõ ràng chấp nhận nó. Bạn có thể chuyển đổi mà không cần phiên âm lại.

Tôi có thể tạo phụ đề cho video có kích thước bao nhiêu?

Thời lượng lên tới 10 giờ, không có giới hạn kích thước tệp – ngay cả một video rất lớn cũng có thể chuyển đổi phía máy khách, tùy thuộc vào dung lượng của trình duyệt và thiết bị. Vì âm thanh được trích xuất trước khi tải lên nên một video lớn sẽ gửi ít dữ liệu hơn nhiều so với kích thước tệp đầy đủ của nó.

Dấu thời gian chính xác đến mức nào?

Mỗi tín hiệu được tạo từ thời gian của công cụ lời nói nhưng không đảm bảo độ lệch cố định. Xem lại video cuối cùng, đặc biệt là đoạn hội thoại nhanh, âm nhạc và những người nói chồng chéo, đồng thời điều chỉnh bất kỳ tín hiệu nào xuất hiện sớm hoặc muộn.

Bắt đầu với 30 phút miễn phí

Bắt đầu – 30 phút miễn phí