Chuyển đến nội dung chính

Cách phiên âm podcast và tạo ghi chú tập

Tác giả: Ngày đăng: Rà soát lần cuối:

Bản ghi podcast có giá trị gấp đôi. Nó làm cho tập có thể tìm kiếm và truy cập được đối với những người nghe đọc thay vì nghe, đồng thời cung cấp cho bạn tài liệu thô để hiển thị ghi chú, trích dẫn và chú thích mà không cần phát lại toàn bộ bản ghi. Hỗ trợ nền tảng là cụ thể chứ không phải lý thuyết: Apple Podcasts ghi lại bản ghi và điều hướng chương cho người sáng tạo. Hướng dẫn này hướng dẫn cách chép lời một tập, gắn nhãn cho từng người dẫn chương trình và khách mời, đồng thời chuyển kết quả đầu ra thành tài liệu ghi chú tập có thể sử dụng được.

Phần tiết kiệm thời gian nhất là tách người nói. Một bản ghi được đọc dưới dạng một khối văn bản không phân chia cũng có nhiều công việc cần sử dụng như chính âm thanh. Hushscript tự động gắn nhãn cho mỗi giọng nói và đưa giọng nói đó miễn phí vào mỗi bản ghi âm để cuộc trò chuyện trở lại dưới dạng cuộc trò chuyện.

Những gì bạn cần trước khi bắt đầu

Bản ghi âm của tập phim ở bất kỳ định dạng âm thanh hoặc video phổ biến nào. Nếu bạn xuất tệp âm thanh đơn giản từ trình chỉnh sửa của mình (MP3, WAV, M4A), tệp đó sẽ hoạt động trực tiếp. Nếu bản sao duy nhất của bạn là bản ghi video từ Zoom, Riverside hoặc Ecamm thì bản đó cũng hoạt động và âm thanh được lấy từ bản ghi đó trong trình duyệt của bạn nên video không bao giờ tải lên.

Âm thanh nguồn sạch sẽ hữu ích hơn bất kỳ điều gì khác. Nhãn người nói hoạt động tốt nhất khi mỗi giọng nói khác nhau và mọi người không liên tục nói chuyện với nhau. Nếu bạn ghi âm từng người tham gia trên một bản nhạc riêng biệt thì bạn đã có được đầu vào rõ ràng nhất có thể. Một bản nhạc hỗn hợp duy nhất vẫn hoạt động; nó chỉ phụ thuộc nhiều hơn vào việc phân tách người nói để phân biệt các giọng nói. Nếu có thể, hãy ghi âm khô giọng nói và thêm nội dung nhạc sau đó vào trình chỉnh sửa của bạn, vì tiếng leng keng chạy trong lời nói liên tục là yếu tố chắc chắn làm giảm độ chính xác.

Bạn sẽ cần một tài khoản để chép lời toàn bộ tập phim. Bản xem trước 30 giây là bước không cần tài khoản nên bạn có thể kiểm tra nhãn người nói và chất lượng văn bản trên tệp thực của mình trước khi đăng ký bất kỳ thứ gì.

Chép lại tập

Quy trình diễn ra theo thứ tự kênh thực: xem trước trước, sau đó đăng ký, sau đó chép lại phần còn lại.

  1. Thả tệp tại /podcast-transcription. Hushscript cắt bớt 30 giây đầu tiên trong trình duyệt của bạn và trả về bản xem trước có gắn nhãn người nói. Không cần tài khoản cho bước này. Bạn biết chính xác cách chủ nhà và khách được phân chia cũng như mức độ rõ ràng của văn bản khi đọc trên âm thanh của chính bạn.
  2. Đăng ký để chép lời phần còn lại. Sau khi nhập email và đăng nhập, bạn tải toàn bộ tập lên. Tài khoản mới nhận được 30 phút dùng thử miễn phí, được cấp một lần. Cách nhanh nhất để yêu cầu chúng là séc thẻ $1 được ủy quyền và sau đó được phát hành ngay lập tức, không bao giờ bị tính phí. Nếu bạn thích một phương thức thanh toán thay thế có sẵn ở quốc gia của mình, thay vào đó, 30 phút sẽ đến với lần mua hàng đầu tiên của bạn; không cần thẻ.
  3. Hãy để bản chép lời chạy rồi xuất. Bản chép lời sẽ xuất hiện kèm theo nhãn và dấu thời gian trên mỗi câu nói. Xuất DOCX cho tài liệu mà bạn sẽ chỉnh sửa thành ghi chú tập, TXT để tạo khối rõ ràng để dán vào CMS, SRT cho phụ đề trên phiên bản video hoặc JSON nếu máy chủ podcast của bạn chấp nhận tải lên bản ghi ở cấp độ phát âm.

30 phút miễn phí có thể bao gồm một tập ngắn hoặc một phần tiêu biểu của một tập dài hơn. Một tập 60 phút sử dụng 60 phút trong số dư của bạn, do đó, tập này cần được nạp tiền sau thời gian dùng thử.

Gắn nhãn cho mọi người dẫn chương trình và khách

tính năng phân tách người nói sẽ tự động chạy nên bạn không cần bật bất cứ thứ gì. Đối với tập dành cho hai người (một người dẫn chương trình, một khách mời), bản ghi sẽ được chia tách rõ ràng, với mỗi dòng được gán cho một trong hai nhãn. Đối với một bảng điều khiển, Hushscript phân tách nhiều giọng nói riêng biệt mà nó nghe được mà không có giới hạn người nói.

Để thay thế nhãn chung bằng tên thật:

  1. Nhấp vào bất kỳ phiên bản Người nói A nào trong trình chỉnh sửa.
  2. Nhập tên, chẳng hạn như “Alex” hoặc “Host”.
  3. Mọi phiên bản của nhãn đó cập nhật trong toàn bộ bản ghi cùng một lúc.

Bạn dán nhãn lại cho từng giọng nói một lần chứ không phải từng dòng. Một tập phim dành cho hai người mất khoảng một phút; một hội đồng bốn người cần một vài người. Sau khi dán nhãn lại, một đoạn bản ghi có nội dung như sau:

Alex [00:03:12]: Vậy là lúc đó bạn đang điều hành công ty. Dấu hiệu đầu tiên là gì?
Jamie [00:03:19]: Thành thật mà nói, đó là những con số. Chúng tôi đã giảm 40% trong một quý.
Alex [00:03:27]: Và bạn không thể giải thích điều đó vào thời điểm đó?
Jamie [00:03:35]: Không phải trong nhiều tuần. Đó là phần khiến tôi tiếp tục.

Đó là cấu trúc bạn cần để lấy trích dẫn và viết các chương có dấu thời gian. Vì các nhãn xuyên suốt toàn bộ tệp nên một tập dài được gắn nhãn chính xác một lần. Để biết cơ chế phân tách giọng nói, hãy xem cách thức hoạt động của tính năng phân tách giọng nói của người nói.

Khi các nhãn cần khắc phục

Tính năng phân tách giọng nói chính xác trên các bản ghi âm rõ ràng nhưng không phải là không mắc lỗi và có một số mẫu đáng lưu ý để bạn có thể sửa chúng nhanh chóng.

Nếu hai khách có giọng nói rất giống nhau thì đôi khi một dòng có thể bị sai. người nói. Quét bản ghi với âm thanh đang mở và gán lại một số dòng bị phân bổ sai bằng tay. Việc này nhanh hơn nhiều so với việc nhập tên người nói từ đầu vì bạn chỉ sửa các trường hợp ngoại lệ.

Nếu một người đồng dẫn chương trình trầm tính ít nói bị sáp nhập vào một nhãn khác, trước tiên hãy đặt tên thật cho người nói chính, sau đó quét tìm một số dòng thuộc về giọng nói trầm lặng. Trên một bản ghi được tách biệt rõ ràng, bạn hiếm khi gặp phải trường hợp nào, đó là lý do tại sao một bản nhạc riêng cho mỗi người đáng để thiết lập thêm một chút vào thời gian ghi.

Các vấn đề thường gặp và nguyên nhân thực sự gây ra chúng

Hầu hết các vấn đề về chép lời đều bắt nguồn từ bản ghi chứ không phải công cụ. Bạn nên lập kế hoạch cân nhắc một số vấn đề trước khi xuất bản một chương trình.

Nhiễu xuyên âm và mọi người nói chuyện với nhau. Đây là điều khó khăn nhất đối với bất kỳ hệ thống phân tách người nói nào vì hai giọng nói cùng lúc không thể được phân tách rõ ràng. Văn bản thường vẫn có thể đọc được nhưng một khoảnh khắc chồng chéo nặng có thể rơi xuống một người nói hoặc bị mờ ở đường nối. Việc vệ sinh podcast tốt đã giúp ích ở đây: người dẫn chương trình cho phép khách hoàn thành sẽ tạo ra một bản ghi rõ ràng hơn như một tác dụng phụ. Nếu điều đó xảy ra, hãy sửa những dòng đó bằng tay đối với âm thanh.

Khách từ xa được ghi lại trên một bản nhạc. Một cuộc gọi được ghi dưới dạng một tệp hỗn hợp sẽ khó phân tách hơn so với cùng một cuộc gọi được ghi dưới dạng bản nhạc của mỗi người tham gia. Nếu công cụ của bạn hỗ trợ ghi âm cục bộ cho mỗi người tham gia, hãy sử dụng nó; nếu bạn chỉ có tệp hỗn hợp, bản ghi vẫn được xử lý, nó chỉ phụ thuộc nhiều hơn vào quá trình phân tách người nói. Dù thế nào thì âm thanh cũng là cùng một nội dung tải lên nên không có gì khác biệt để thực hiện tại thời điểm phiên âm.

Giọng mạnh và chuyển đổi mã. Hushscript tự động phát hiện ngôn ngữ và phiên âm khoảng 99 ngôn ngữ, với độ chính xác cao nhất trong 18 ngôn ngữ trong số đó, do đó, khách có giọng rõ ràng trong ngôn ngữ được hỗ trợ sẽ được xử lý tốt. Một vị khách chuyển đổi giữa hai ngôn ngữ giữa câu là một trường hợp thực sự khó khăn; mong đợi để làm sạch các cụm từ chuyển đổi bằng tay. Để biết danh sách đầy đủ các ngôn ngữ được hỗ trợ, hãy xem trang ngôn ngữ.

Nhạc giới thiệu và nhạc chuông. Phần nhạc đệm giữa các phân đoạn thường được bỏ qua thay vì được phiên âm là vô nghĩa. Rắc rối chỉ bắt đầu khi âm nhạc chạy dưới lời nói liên tục trong một thời gian dài. Cách khắc phục rõ ràng là biên tập: ghi âm giọng nói khô và đưa nhạc vào sau đó, do đó, bản ghi âm chỉ nhìn thấy lời nói.

Tên, biệt ngữ và cách viết thương hiệu. Một vị khách chuyên gia sẽ sử dụng các thuật ngữ và tên sản phẩm mà mô hình có thể kết xuất theo ngữ âm. Những lỗi này được khắc phục nhanh chóng vì chúng lặp lại và tính năng tìm kiếm và thay thế trên tài liệu đã xuất sẽ xử lý lỗi chính tả lặp lại chỉ trong một lần chuyển.

Một số mẹo về độ chính xác

Đòn bẩy lớn nhất là chất lượng ghi âm, do đó, nỗ lực dành cho micrô và căn phòng yên tĩnh sẽ được đền đáp vào thời gian phiên âm. Ngoài ra, một bản nhạc trên mỗi người nói mang lại cả văn bản rõ ràng nhất và nhãn người nói rõ ràng nhất vì hệ thống không bao giờ phải tách hai giọng nói từ một dạng sóng. Giữ micrô của khách gần và nhất quán thay vì bị trôi, và bạn sẽ dành thời gian chỉnh sửa cho nội dung thay vì sửa chữa.

Khi bạn hiệu đính, hãy đọc với âm thanh mở và sửa lần lượt: nhãn người nói trước, sau đó nghe nhầm tên và biệt ngữ, sau đó thỉnh thoảng trùng lặp. Làm việc theo danh mục nhanh hơn đọc từ trên xuống dưới và điều này giúp bạn có một tài liệu đủ rõ ràng để xuất bản.

Từ bản chép lời đến hiển thị ghi chú

Hiển thị ghi chú không phải là bản tóm tắt mọi điều đã nói. Chúng là công cụ hỗ trợ điều hướng cho người nghe và là bề mặt tìm kiếm cho những người chưa nhấn nút phát. Cấu trúc phù hợp với hầu hết các cuộc phỏng vấn và trò chuyện bao gồm:

Tóm tắt từng tập, từ 2 đến 4 câu. Lấy chủ đề cốt lõi từ bản chép lời. Lập luận trung tâm, câu chuyện hoặc bài học rút ra là gì? Viết nó cho người nào đó quyết định có nên nghe hay không.

Các chương có dấu thời gian. Quét bản ghi để tìm sự thay đổi chủ đề. Mỗi khi cuộc trò chuyện chuyển sang chủ đề mới, hãy ghi lại dấu thời gian và viết mô tả một dòng. Dấu thời gian xuất phát trực tiếp từ bản ghi nên bạn không bao giờ phải nghe lại để tìm thấy chúng.

<00:02:15] Thành lập công ty mà không cần ngân sách tiếp thị
[00:14:30] Doanh thu giảm 40% và nguyên nhân dẫn đến điều đó
[00:28:44] Xây dựng lại: những gì đã thay đổi trong nội bộ
[00:51:00] Lời khuyên dành cho những người sáng lập ở vị trí tương tự

Những câu trích dẫn chính. Kéo hai hoặc ba dòng ghi lại những tuyên bố chính của tập hoặc những khoảnh khắc đáng trích dẫn nhất của tập đó. Trích dẫn nguyên văn từ bản ghi âm và gán tên cho từng người nói. Việc chạy một câu trích dẫn chính xác như đã nói hay cắt bỏ phần đệm và phần mở đầu sai để có ghi chú tập rõ ràng hơn là một quyết định đáng được thực hiện có mục đích và bản chép lời đã biên tập và bản chép nguyên văn sẽ xem xét cả hai. Bởi vì văn bản có thể tìm kiếm được nên việc tìm kiếm chính xác từ ngữ của một dòng mà bạn chỉ nhớ được nửa chừng chỉ mất vài giây.

Các liên kết và tài nguyên của khách. Thêm bất cứ điều gì khách đã đề cập. Để tìm nhanh các URL được nói, hãy tìm kiếm bản ghi các đoạn như “dot com” hoặc “slash”; mọi người nói to các địa chỉ web thường xuyên hơn bạn mong đợi và bản ghi nguyên văn sẽ ghi lại chúng.

Bản ghi đầy đủ, tùy chọn nhưng có giá trị. Dán toàn bộ văn bản bên dưới ghi chú hoặc liên kết tới một trang bản ghi riêng. Đây là nơi chứa giá trị tìm kiếm vì nội dung được nói có thể lập chỉ mục được. Nếu nền tảng máy chủ của bạn chấp nhận tải lên bản ghi, thì bản xuất JSON sẽ mang dữ liệu ở cấp độ cách nói; nếu không thì văn bản đơn giản là đủ.

Một ví dụ hoạt động

Giả sử bạn đã ghi âm một cuộc phỏng vấn người sáng lập dài 58 phút thành hai bản nhạc và trộn chúng thành một bản MP3. Bạn thả MP3 tại /podcast-transcription, xem bản xem trước 30 giây phân chia chính xác máy chủ và khách, đăng ký và tải toàn bộ tệp lên. Bản ghi trở lại với Người nói ANgười nói B; bạn đổi tên chúng thành “Alex” và “Jamie” chỉ bằng hai cú nhấp chuột. Từ đó, phần tóm tắt xuất phát từ hai phút mở đầu, bốn chương trên đến từ việc tìm kiếm các thay đổi chủ đề và hai trích dẫn kéo đến từ việc tìm kiếm văn bản để tìm những khoảnh khắc bạn nhớ. Bắt đầu hiển thị xong các ghi chú mất khoảng mười lăm phút, hầu hết là do bạn tự chỉnh sửa thay vì chờ đợi hoặc chép lại.

Thêm chú thích hoặc phụ đề

Nếu bạn xuất bản phiên bản video của tập lên nền tảng như máy chủ video, video Spotify hoặc LinkedIn thì bản xuất SRT là tệp phụ đề được định thời gian sẵn sàng để tải lên. Không có bước bổ sung nào vì bản ghi bạn đã tạo mang dữ liệu thời gian. Để biết quy trình làm việc rộng hơn về đưa phụ đề vào clip, bao gồm cả tệp cố định và tệp sidecar, hãy xem cách thêm phụ đề vào video.

Nếu điểm xuất phát của bạn là quay video thay vì xuất âm thanh thì quy trình này sẽ giống hệt nhau; âm thanh được trích xuất trong trình duyệt của bạn trước tiên. Trang video thành văn bản bao gồm đầy đủ đường dẫn đó.

Các tập dài và nhiều phần

Đối với một tập phim dài tập hoặc một bản ghi trực tiếp, Hushscript tải lên với thời lượng tối đa 10 giờ mà không có giới hạn kích thước tệp. Một bảng điều khiển dài bốn giờ hoặc một tập phim ở định dạng tài liệu sẽ được xử lý dưới dạng một tệp thay vì được chia thành nhiều phần, điều này quan trọng vì hai lý do. Nhãn của người nói luôn nhất quán trong toàn bộ tệp nên bạn có thể dán nhãn lại một lần. Và dấu thời gian là liên tục, do đó, một chương ở mốc ba giờ sẽ đọc [03:12:40] thay vì bắt đầu lại từ 0 trong phần hai.

Nếu bạn ghi một chuỗi nhiều phần trong một phiên, hãy chép lại toàn bộ phiên thành một tệp duy nhất và sau đó chia ghi chú tập theo từng phần. Trước tiên, việc cắt âm thanh chỉ làm tăng thêm công việc dán nhãn lại.

Tại sao việc này diễn ra nhanh

Đối với nhịp xuất bản thông thường, hàng tuần hoặc hai lần mỗi tuần, quy trình chép lời sang ghi chú sẽ nén xuống còn vài phút mỗi tập sau khi bạn thực hiện vài lần: thả tệp, gắn nhãn lại người nói, quét tìm chương, lấy trích dẫn, xuất. Các nhãn diễn giả thực hiện ghi công miễn phí là điều giúp loại bỏ phần tẻ nhạt. Bạn dành thời gian cho việc đánh giá biên tập cho thấy những ghi chú thực sự cần thiết chứ không phải để tìm ra ai đã nói gì.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Làm cách nào để gắn nhãn người dẫn chương trình và từng khách trong bản ghi?

Hushscript tự động phân tách người nói bằng các nhãn như 'Người nói A' và 'Người nói B'. Sau khi phiên âm, hãy nhấp vào bất kỳ nhãn nào trong trình chỉnh sửa, nhập tên thật và nó sẽ cập nhật ở mọi nơi người nói xuất hiện. Một tập dành cho hai người mất khoảng một phút để dán nhãn lại; một bảng điều khiển có bốn giọng nói sẽ mất vài phút.

Nhãn người nói có phải trả thêm phí không?

Không. Nhãn người nói được cung cấp miễn phí trên mỗi bản ghi mà Hushscript tạo ra, không tính phí cho mỗi người nói và không giới hạn số lượng giọng nói. Nhiều công cụ xếp sau cấp cao hơn; ở đây nó là một phần của đầu ra tiêu chuẩn.

Tôi có thể chép lại bản ghi video của podcast không?

Có. Nếu bạn có tệp video như MP4, MOV hoặc MKV, âm thanh sẽ được trích xuất trong trình duyệt của bạn trước khi tải lên bất kỳ nội dung nào, vì vậy video vẫn ở trên thiết bị của bạn. Chỉ âm thanh được trích xuất mới đến được máy chủ, điều này cũng giúp tệp video lớn không làm tắc nghẽn kết nối của bạn.

Tôi có thể chép lại một tập trong bao lâu?

Tối đa 10 giờ mỗi lần tải lên mà không có giới hạn kích thước tệp. Một tập dài 60 phút, một buổi tìm hiểu chuyên sâu kéo dài hai giờ hoặc một bản ghi âm trực tiếp kéo dài bốn giờ đều được thực hiện dưới dạng một tệp duy nhất, do đó, bạn dán nhãn lại những người nói một lần thay vì ghép các phần lại với nhau.

Hushscript tạo ra những định dạng xuất nào?

TXT, SRT, VTT, CSV, TSV, Markdown, HTML, RTF, XML, JSON, DOCX, PDF và được bảo vệ bằng mật khẩu .husharchive, không có hình mờ. Để hiển thị ghi chú, DOCX cung cấp cho bạn tài liệu được định dạng để chỉnh sửa trực tiếp. SRT cung cấp cho bạn phụ đề theo thời gian nếu bạn xuất bản phiên bản video. JSON cung cấp cho bạn dữ liệu ở cấp độ phát âm nếu bạn cung cấp một máy chủ podcast chấp nhận tải lên bản ghi.

Tôi có cần chép lại toàn bộ tập để viết ghi chú tập không?

Có, để có dấu thời gian và trích dẫn nguyên văn chính xác. Bạn có thể phác thảo các ghi chú thô từ trí nhớ, nhưng các điểm đánh dấu chương, trích dẫn chính xác và bản ghi đầy đủ có thể tìm kiếm đều đến từ văn bản hoàn chỉnh. Bản xem trước 30 giây cho bạn thấy chất lượng trước khi bạn xem toàn bộ tập.

Liệu nhạc nền hoặc tiếng leng keng phần giới thiệu có làm nhầm lẫn bản chép lời không?

Nhạc giữa các phân đoạn thường bị bỏ qua hoặc không được chép lời và một đoạn leng keng ngắn dưới giọng nói hiếm khi gây ra sự cố. Nếu một chiếc giường nhạc chạy dưới chế độ nói liên tục, độ chính xác ở đoạn đó có thể giảm xuống. Việc ghi âm giọng nói rõ ràng và thêm nhạc vào trình chỉnh sửa của bạn sau đó sẽ mang lại bản ghi tốt nhất.

Bản ghi âm cho một podcast được ghi rõ ràng có độ chính xác đến mức nào?

Trên bản ghi hai micrô sạch có ít nhiễu xuyên âm, văn bản đủ chính xác để xuất bản sau khi hiệu đính nhanh. Độ chính xác chủ yếu phụ thuộc vào chất lượng ghi âm, giọng nói và tần suất khách nói chuyện với nhau chứ không phụ thuộc vào định dạng tệp bạn tải lên.

Bắt đầu với 30 phút miễn phí

Bắt đầu – 30 phút miễn phí