Cách phiên âm cuộc phỏng vấn riêng tư
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
Ghi chép tốt một cuộc phỏng vấn có nghĩa là hai điều cùng một lúc: văn bản chính xác và ghi nhận tác giả rõ ràng. Một bức tường từ mà bạn không thể biết ai đã nói điều gì gần như cần sử dụng nhiều công sức như bản ghi âm thô. Và khi cuộc trò chuyện mang tính nhạy cảm, vấn đề pháp lý, nguồn bí mật, tình huống nhân sự, cách xử lý âm thanh cũng quan trọng như bản ghi âm. Hướng dẫn này đề cập đến toàn bộ phần: thu thập âm thanh rõ ràng trước khi ghi âm, chạy bản chép lời, tách biệt người phỏng vấn và chủ đề, trích dẫn chính xác bằng dấu thời gian và giữ toàn bộ nội dung ở chế độ riêng tư.
Những điều bạn cần trước khi bắt đầu
Danh sách này rất ngắn. Bạn cần ghi âm cuộc phỏng vấn dưới dạng tệp âm thanh hoặc video. Hushscript chấp nhận mọi định dạng phổ biến, do đó, bản ghi nhớ giọng nói trên điện thoại, bản ghi Zoom, WAV của máy ghi chuyên dụng hoặc bản ghi màn hình MP4 đều hoạt động mà không cần chuyển đổi. Bạn cần có sự đồng ý của tất cả mọi người được ghi lại, điều này được đề cập bên dưới và không phải là tùy chọn. Và bạn cần một cách để xem và chỉnh sửa bản ghi, đó là ứng dụng Hushscript trên trình duyệt của bạn. Không cần cài đặt, không có plugin.
Bạn không cần chọn ngôn ngữ. Hushscript tự động phát hiện nó trên khoảng 99 ngôn ngữ, do đó, một cuộc phỏng vấn song ngữ hoặc một chủ đề chuyển giữa câu sẽ được xử lý mà bạn không cần cài đặt bất cứ điều gì. Nếu bạn muốn xem danh sách đầy đủ, trang ngôn ngữ sẽ có danh sách đó.
Trước khi bạn ghi
Chất lượng âm thanh tại thời điểm ghi là yếu tố lớn nhất quyết định độ chính xác của bản ghi. Không có công cụ phiên âm nào, tự động hay con người, có thể khôi phục một từ mà micrô không bao giờ thu được rõ ràng. Một vài chi tiết cụ thể sẽ mang lại nhiều lợi ích hơn bất cứ điều gì bạn làm sau này.
Vị trí đặt micrô. Đối với một cuộc phỏng vấn trực tiếp, một máy ghi âm nhỏ đặt trên bàn cách đều hai người nói sẽ phát ra âm thanh từ chiếc điện thoại để trong túi của bạn. Nếu bạn có thể cung cấp micrô riêng cho mỗi người, hãy làm như vậy: hai đầu vào sạch sẽ dễ tách biệt hơn so với một phòng hỗn hợp. Đối với các cuộc phỏng vấn từ xa bằng cuộc gọi điện video, hãy ghi âm mỗi bên thành một bản nhạc riêng khi nền tảng cho phép, vì hai bản nhạc tách biệt rõ ràng hơn so với một luồng phát hỗn hợp đơn lẻ.
Môi trường yên tĩnh. Tiếng ồn HVAC, tiếng xe cộ qua cửa sổ, tiếng trò chuyện trong nền quán cà phê và âm vang trong phòng trống đều được loại bỏ một cách chính xác. Một căn phòng nhỏ trải thảm, hay thậm chí là một tủ treo quần áo, nghe có vẻ hay hơn một văn phòng mở. Tại hiện trường, micrô định hướng hướng vào đối tượng của bạn sẽ giúp nâng cao giọng nói của họ so với môi trường xung quanh.
Sự đồng ý, trước khi làm bất cứ điều gì khác. Việc ghi âm một người mà họ không hề biết là bất hợp pháp ở nhiều nơi và không được chấp nhận ở mọi nơi. Nói với chủ đề của bạn rằng bạn đang ghi âm trước khi bắt đầu. Một số khu vực pháp lý có sự đồng ý của một bên, nhưng một số khu vực, bao gồm một số tiểu bang của Hoa Kỳ và nhiều quốc gia, yêu cầu tất cả mọi người có mặt phải đồng ý. Khi nghi ngờ, hãy nói đồng ý rõ ràng trên bản ghi ngay sau khi bạn bắt đầu, để thỏa thuận là một phần của tệp.
Cài đặt định dạng hợp lý. Bạn không cần chất lượng phòng thu. WAV hoặc MP3 ở tốc độ 128 kbps trở lên là đủ và tốc độ mẫu 16 kHz trở lên là thoải mái. Một điều cần tránh là giảm chất lượng điện thoại xuống khoảng 8 kHz, nơi các phụ âm bị nhòe và độ chính xác giảm đáng kể.
Phép âm cuộc phỏng vấn, từng bước một
Quy trình được xây dựng để bạn có thể thấy chất lượng trước khi cam kết. Đây là thứ tự thực sự.
- Thả bản ghi của bạn vào /audio-to-text. Nếu đó là video, âm thanh sẽ được trích xuất trong trình duyệt của bạn trước tiên nên tệp video sẽ không bao giờ rời khỏi thiết bị của bạn. Chỉ có âm thanh được tham gia ở đây.
- Đọc bản xem trước 30 giây. Hushscript chép lại nửa phút đầu tiên và hiển thị lại cho bạn kèm theo nhãn người nói đã được áp dụng trước khi bạn tạo tài khoản. Đây là bước không cần tài khoản: bạn có thể đánh giá sự tách biệt của người nói và cách diễn đạt trên tệp thực của mình chứ không phải bản demo.
- Đăng ký để chép lời phần còn lại. Tạo tài khoản sẽ mở khóa bản chép lời đầy đủ. Các tài khoản mới có 30 phút miễn phí để thử, đủ cho một cuộc phỏng vấn ngắn hoặc một đoạn dài. Sau đó, Hushscript sẽ trả tiền theo mức sử dụng mà không cần đăng ký, vì vậy, bạn chỉ mua số phút khi cần.
- Gắn nhãn lại và xuất. Bản chép lời hoàn chỉnh sẽ trở lại dưới dạng một dòng cho mỗi lần phát âm, mỗi câu được gắn thẻ với nhãn người nói và dấu thời gian. Đổi tên nhãn thành tên thật rồi xuất.
Một lưu ý về số phút miễn phí, vì mọi người hỏi phần “miễn phí” hoạt động như thế nào. 30 phút được cấp một lần. Cách nhanh nhất để mở khóa chúng là kiểm tra thẻ nhanh: khoản giữ 1 USD được phép xác nhận thẻ và sau đó được giải phóng ngay lập tức, không bao giờ bị tính phí. Nếu bạn muốn thanh toán theo cách khác, một phương thức thay thế có sẵn ở quốc gia của bạn cũng hoạt động và 30 phút sẽ đến với lần mua hàng đầu tiên của bạn. Dù thế nào đi nữa, bạn cũng không cần phải có thẻ.
Giữ riêng người phỏng vấn và chủ đề
Đây là lúc bạn có thể sử dụng được bản ghi cuộc phỏng vấn thay vì bản ghi mà bạn vẫn phải nghe lại. Tính năng nhận dạng người nói gán nhãn riêng cho từng giọng nói riêng biệt mà không cần thiết lập và không mất thêm phí. Đối với một cuộc phỏng vấn hai người, điều đó có nghĩa là đối thoại như thế này:
Người nói A [00:00:07]: Bạn có thể kể lại cho tôi về thời điểm lần đầu tiên bạn nhận ra dự án gặp rắc rối không?
Người nói B [00:00:13]: Đó là đầu năm 2019. Tôi đang triển khai và con số ngừng tăng lên.
Người nói A [00:00:28]: Và bạn đã làm gì về việc đó?
Người nói B [00:00:31]: Thành thật mà nói, lúc đầu thì chẳng có gì cả. Đó là phần tôi rất tiếc.
Để đặt tên thật vào đó:
- Nhấp vào bất kỳ trường hợp nào của
Người nói Atrong bản ghi âm. - Nhập tên bạn muốn, ví dụ như “Người phỏng vấn” hoặc tên đối tượng của bạn.
- Mỗi dòng của người nói đó cập nhật cùng một lúc.
Bạn thực hiện việc này một lần cho mỗi người nói. Đối với một cuộc phỏng vấn hai người kéo dài 90 phút, toàn bộ quá trình chỉ mất chưa đầy một phút và bạn kết thúc bằng một tài liệu có sẵn trích dẫn trong đó mỗi dòng đều được gán cho một người được nêu tên. Nếu bạn muốn biết thông tin chi tiết về cách hoạt động thực sự của sự phân tách này, cách hoạt động của tính năng phân tách người nói sẽ xem qua nó bằng ngôn ngữ dễ hiểu.
Một ví dụ hiệu quả: một cuộc phỏng vấn nghiên cứu kéo dài một giờ
Giả sử bạn đã ghi lại một cuộc phỏng vấn nghiên cứu dài 58 phút trên điện thoại của mình dưới dạng tệp .m4a. Căn phòng yên tĩnh, cả hai bạn đều ở gần điện thoại và thường có chút trùng lặp khi chủ thể của bạn chuyển sang hoạt ảnh.
Bạn thả tệp tại /audio-to-text. Bản xem trước 30 giây hiển thị câu hỏi mở đầu của bạn là Người nói A và câu trả lời đầu tiên của chủ đề là Người nói B, cho bạn biết sự phân tách rõ ràng. Bạn đăng ký và để tập tin đầy đủ phiên âm. Một cuộc phỏng vấn kéo dài 58 phút sẽ sử dụng 58 phút trong số dư của bạn, vì vậy 30 phút miễn phí chỉ chiếm hơn một nửa và bạn nạp thêm phần còn lại.
Bản ghi được đọc qua lại rõ ràng. Bạn bấm vào Người nói A đầu tiên, gõ tên của chính bạn, bấm vào Người nói B đầu tiên, gõ tên đối tượng của bạn và toàn bộ tài liệu sẽ được cập nhật. Lướt qua, bạn nhận thấy ba đoạn ngắn trong đó công cụ chia chủ đề của bạn thành nhãn thứ hai vì chúng nghiêng ra khỏi điện thoại, vì vậy bạn hợp nhất chúng lại. Bạn xuất sang DOCX cho ghi chú của mình và sang JSON để tập lệnh phân tích của bạn có thể lấy mọi câu nói theo thời gian bắt đầu, thời gian kết thúc và người nói. Tổng thời gian thực hiện sau khi tải lên: vài phút.
Trích dẫn chính xác bằng dấu thời gian
Mỗi câu nói trong bản ghi đều có dấu thời gian, điều này giúp cho việc trích dẫn đầu ra trở nên an toàn. Khi bạn trích dẫn một bài báo, một báo cáo hoặc một bài báo, hãy lưu ý dấu thời gian bên cạnh nó. Điều đó cung cấp cho bạn một quan điểm chính xác để lắng nghe trong quá trình xác minh tính xác thực, cung cấp cho người biên tập cách xác minh trích dẫn và cung cấp cho bạn điều gì đó để chỉ ra nếu sau đó một nguồn phản đối những gì họ nói. Mức độ sắp xếp gọn gàng một câu trích dẫn khi bạn đã có nó, dù giữ nguyên mọi phần mở đầu sai hay chuyển từ ngữ thành văn xuôi rõ ràng, là một lựa chọn văn phong đáng để thực hiện có mục đích và bản chép lời đã biên tập so với bản chép nguyên văn đặt ra cả hai quy ước.
Việc xuất DOCX giữ nguyên dấu thời gian trong dòng. Nếu bạn cần cấu trúc thô, quá trình xuất JSON sẽ cung cấp cho bạn dữ liệu ở cấp độ phát âm, mỗi mục nhập có thời gian bắt đầu, thời gian kết thúc, người nói và văn bản mà bạn có thể xử lý theo chương trình. Bản xuất TXT là bản sao đọc rõ ràng và SRT cung cấp cho bạn các dòng phụ đề được tính thời gian nếu cuộc phỏng vấn diễn ra dưới một video.
Một giới hạn đáng lưu ý: dấu thời gian nằm ở cấp độ phát âm chứ không phải từng từ riêng lẻ. Đối với hầu hết các cuộc phỏng vấn, đó chính xác là những gì bạn muốn, vì bạn đang trích dẫn một câu chứ không phải một âm tiết. Nếu bạn đặc biệt cần thời gian ở cấp độ từ để ghi phụ đề vào cảnh quay thì thời gian dòng SRT đủ gần cho hầu hết mọi mục đích.
Các vấn đề thường gặp và cách khắc phục
Hầu hết các bản ghi cuộc phỏng vấn đều được chép lại rõ ràng. Khi có sự cố xảy ra, đó hầu như luôn là một trong số ít sự cố và mỗi sự cố đều có cách khắc phục đơn giản.
Một người nói được chia thành hai nhãn. Đây là tình huống ngoài dự kiến thường gặp nhất. Điều này thường có nghĩa là âm thanh của người đó đã thay đổi giữa chừng: họ di chuyển đến gần hoặc xa hơn khỏi micrô, chuyển từ tai nghe sang loa ngoài hoặc chất lượng đường truyền thay đổi trong cuộc gọi. Hệ thống tập trung vào cách âm thanh của giọng nói, do đó, một sự thay đổi lớn có thể được đọc là một giọng nói mới. Hợp nhất hai nhãn trong trình chỉnh sửa và nó được cố định trong một lần chuyển, như trong ví dụ thực tế ở trên.
Hai người đã hợp nhất thành một nhãn. Ngược lại. Điều này xảy ra khi hai giọng nói thực sự giống nhau hoặc khi đoạn ghi âm yên tĩnh và khó có thể nghe thấy sự khác biệt. Sau đó, việc khắc phục một cách rõ ràng sẽ khó khăn hơn, đó là lý do tại sao hai đầu vào riêng biệt tại thời điểm ghi âm, mỗi người một đầu vào, là cách bảo hiểm tốt nhất chống lại vấn đề này.
Nhiễu xuyên âm và mọi người nói chuyện với nhau. Khi cả hai nói cùng một lúc, bất kỳ người ghi âm nào, tự động hoặc con người, đều gặp khó khăn vì các từ chồng chéo về mặt vật lý trong âm thanh. Dự kiến những khoảnh khắc bận rộn nhất của cuộc phỏng vấn sôi nổi sẽ cần nghe lại thủ công. Dấu thời gian giúp bạn tìm thấy những khoảnh khắc đó một cách nhanh chóng.
Giọng mạnh hoặc thuật ngữ chuyên môn. Độ chính xác được duy trì tốt trên các giọng, nhưng những danh từ riêng, biệt ngữ kỹ thuật và tên không quen thuộc là những nơi dễ xảy ra lỗi phiên âm tự động nhất. Thực hiện tìm kiếm và thay thế một số tên và thuật ngữ cụ thể cho cuộc phỏng vấn của bạn và xác nhận bất kỳ điều gì bạn định trích dẫn. Khi cuộc phỏng vấn là một cuộc trò chuyện về lâm sàng hoặc nghiên cứu với lượng từ vựng chuyên môn dày đặc, phiên âm y tế để ghi chính tả và phỏng vấn sẽ trình bày cách xử lý các thuật ngữ đó.
Bản ghi âm yên tĩnh hoặc ở xa. Nếu đối tượng ở xa micrô hoặc nói nhỏ, độ chính xác sẽ giảm xuống trên toàn diện và sau đó không có phần mềm khắc phục. Đây là trường hợp phần “trước khi bạn ghi” tồn tại để ngăn chặn. Nếu bạn gặp khó khăn với một bản ghi yếu, hãy chép lại bản ghi đó dưới dạng bản nháp, sau đó sửa lại âm thanh.
Một tệp rất dài hoặc lớn. Một bản ghi có thể chạy tới 10 giờ mà không có giới hạn kích thước tệp – thậm chí một bản ghi rất lớn cũng được chuẩn bị ngay trong trình duyệt. Chỉ tách các bản ghi vượt quá giới hạn 10 giờ, sử dụng khoảng dừng tự nhiên, sau đó chép lại từng phần.
Nguồn âm thanh hoặc nguồn video: cần tải lên
Nếu bạn có cả tệp âm thanh và video của cùng một cuộc phỏng vấn, hãy tải lên. Bản ghi giống hệt nhau vì Hushscript hoạt động từ âm thanh trong cả hai trường hợp. Sự khác biệt thực tế là sự riêng tư. Khi bạn cung cấp cho nó một video, âm thanh sẽ được trích xuất trong trình duyệt của bạn và chỉ âm thanh đó được gửi, do đó, video, thường là thành phần dễ nhận dạng hơn và nhạy cảm hơn, sẽ không bao giờ rời khỏi máy của bạn. Đối với một cuộc phỏng vấn nhạy cảm thì đó là lựa chọn tốt hơn. Nếu bạn đã có tệp chỉ có âm thanh rõ ràng thì việc tải lên là đơn giản nhất.
Giữ kín các cuộc phỏng vấn nhạy cảm
Đối với các cuộc phỏng vấn liên quan đến vấn đề pháp lý, nguồn bí mật, vụ việc nhân sự hoặc tiết lộ cá nhân, cách xử lý âm thanh là những vấn đề ngoài chất lượng bản ghi. Hushscript được xây dựng cho mục đích chính xác này.
Âm thanh sẽ bị xóa khỏi máy chủ ngay khi bản chép lời sẵn sàng. Không có cửa sổ lưu giữ và không có bản sao lưu của bản ghi ở đâu đó sau đó. Nếu bạn tải một video lên thì chỉ có âm thanh được trích xuất mới được gửi và âm thanh đó cũng không còn nữa. Công cụ giọng nói không đào tạo trên bản ghi âm của bạn nên không có gì bạn gửi cung cấp mô hình.
Bản ghi âm được mã hóa ở trạng thái lưu trữ. Nói một cách dễ hiểu, nếu bộ lưu trữ bị xâm phạm, những gì kẻ tấn công sẽ tìm thấy là văn bản mật mã không thể đọc được chứ không phải từ của chủ đề. Đây là biện pháp bảo vệ chống rò rỉ chứ không phải khẳng định rằng chúng tôi không thể đọc bản ghi của bạn: chìa khóa được giữ ở phía chúng tôi để sản phẩm có thể cho bạn xem tác phẩm của chính bạn. Điều đó có nghĩa là rò rỉ dữ liệu, mối đe dọa thực tế đối với bất kỳ công cụ đám mây nào, sẽ không truyền nội dung phỏng vấn có thể đọc được.
Đối với các trường hợp mạnh nhất, bảo vệ nguồn tin trong báo chí, tài liệu pháp lý đặc quyền, hãy thực hiện biện pháp phòng ngừa tiêu chuẩn: giữ bản sao âm thanh ngoại tuyến và bản ghi hoàn chỉnh của riêng bạn trên thiết bị mà bạn kiểm soát và không coi dịch vụ đám mây nào, kể cả dịch vụ này, là bản sao duy nhất. Nếu bạn muốn có bức tranh toàn cảnh về việc xử lý dữ liệu, trang bản chép lời riêng sẽ trình bày điều đó.
Nếu bản ghi của bạn là một podcast nhiều máy chủ chứ không phải là một cuộc phỏng vấn trực tiếp thì quy trình làm việc cũng giống như vậy và cách chép lời một podcast bao gồm các chi tiết cụ thể về nhiều giọng nói.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: