Blog
Cách phiên âm một bản ghi: phương pháp và các bước
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
Một bản ghi chỉ trở nên hữu ích khi nó biến thành văn bản. Một cuộc họp, một cuộc gọi điện thoại, một ghi chú thoại, một buổi phỏng vấn một khách mời — dù nguồn là gì, vấn đề vẫn giống nhau: bạn cần những từ ngữ mà bạn có thể tìm kiếm, trích dẫn và đưa cho người không có mặt trong phòng. Hướng dẫn này bao quát một bản ghi điển hình, từ vài phút đến vài giờ, từ việc chọn phương pháp cho đến bản xuất hoàn chỉnh. Với bản ghi vượt quá mốc hai giờ, xem cách phiên âm bản ghi dài; với nhiều file cùng lúc, xem phiên âm một thư mục chứa các bản ghi.
Thủ công, tự động hay kết hợp
Có ba cách để chuyển từ âm thanh sang văn bản, và hầu hết mọi người cuối cùng dùng nhiều hơn một cách tùy theo bản ghi.
Phiên âm thủ công nghĩa là bạn tự nghe và gõ lại từng từ. Nó cho bạn toàn quyền kiểm soát và không có bên thứ ba tham gia, nhưng chậm: một lượt nghe kỹ một giờ âm thanh rõ ràng dễ dàng mất nhiều giờ nếu tính cả thời gian phát lại, gõ lại và đọc soát. Nó hợp lý cho một đoạn ngắn, một bản ghi bằng ngôn ngữ mà công cụ tự động của bạn xử lý kém, hoặc tài liệu bạn thực sự không thể để rời khỏi tay mình.
Nhận dạng giọng nói tự động làm cùng công việc đó trong vài phút thay vì vài giờ. Một mô hình nghe dạng sóng, dự đoán các từ có khả năng nhất và trả về bản nháp đã có dấu câu cùng nhãn người nói. Bản nháp không hoàn hảo, nhưng với hầu hết các bản ghi hàng ngày, nó đủ gần để chỉ cần đọc lướt qua là bắt được phần còn thiếu.
Phiên âm kết hợp là bản nháp tự động cộng với lượt xem lại của chính bạn. Đây là cách mà phần lớn công việc phiên âm lặp lại dần ổn định: mô hình xử lý phần lớn việc gõ chữ, bạn xử lý tên riêng, thuật ngữ chuyên ngành và bất cứ chỗ nào nó nghe nhầm. Nó tốn một phần nhỏ chi phí so với làm thủ công và cho kết quả sạch hơn một bản nháp tự động chưa được xem lại.
Cách nào phù hợp phụ thuộc ít vào độ dài của bản ghi hơn là vào việc bản phiên âm sẽ được dùng để làm gì sau đó. Một câu trích dẫn cho bài báo cần từ ngữ chính xác được kiểm tra đối chiếu với âm thanh bất kể dùng phương pháp nào. Một bộ ghi chú họp sơ sài chỉ để bạn tự tham khảo thì hiếm khi cần xem lại chút nào.
Điều thực sự quyết định độ chính xác
Yếu tố lớn nhất quyết định độ chính xác của bản phiên âm là chính bản ghi, không phải phần mềm đọc nó. Âm thanh rõ ràng, ghi gần micro với một người nói tại một thời điểm cho ra bản nháp sạch từ gần như bất kỳ hệ thống tự động nào. Một bản ghi được thực hiện từ xa trong phòng, qua đường dây điện thoại kém, hoặc với ba người nói chồng lên nhau tạo ra lỗi bất kể công cụ nào đọc nó. Hướng dẫn của W3C về việc tạo bản chép lời chính xác đưa ra cùng luận điểm từ góc độ khả năng tiếp cận: một bản chép lời đóng vai trò thay thế cho âm thanh, vì vậy độ chính xác của nó phải tự đứng vững, không phụ thuộc vào việc bản ghi gốc nghe hay đến đâu với người có mặt trong phòng.
Một vài điều bạn kiểm soát được trước khi tải lên quan trọng hơn bất kỳ cài đặt nào sau đó:
- Ghi âm gần người nói, không ghi từ xa trong phòng.
- Tránh chĩa hai micro vào cùng một cuộc trò chuyện; điều đó nhân đôi tiếng ồn trong phòng mà không thêm tín hiệu nào.
- Nếu file cho phép bạn chọn, hãy ưu tiên tốc độ bit cao hơn thay vì file nhỏ hơn. Các lỗi nén nghe với một mô hình giọng nói giống như tiếng rè nghe với tai người vậy.
Nghiên cứu gần đây về nhận dạng giọng nói tự động, bao gồm một khảo sát năm 2024 về các phương pháp học sâu cho ASR, theo dõi độ chính xác đã tiến xa đến đâu trên âm thanh sạch và vẫn còn phụ thuộc nhiều thế nào vào dữ liệu huấn luyện cho một giọng vùng, lĩnh vực hay kiểu tiếng ồn nhất định. Không hệ thống nào đọc mọi bản ghi tốt như nhau, vì vậy việc thử nghiệm trên chính âm thanh của bạn trước khi tin tưởng kết quả cho một việc quan trọng vẫn là thói quen an toàn hơn.
Phiên âm một bản ghi, từng bước một
- Tải file lên. Thả bản ghi vào âm thanh thành văn bản. Các định dạng âm thanh và video phổ biến được chấp nhận trực tiếp; nếu đó là video, âm thanh sẽ được tách ra ngay trong trình duyệt của bạn trước khi bất cứ thứ gì được tải lên.
- Kiểm tra bản xem trước. Vài phút đầu tiên sẽ được phiên âm trước khi bạn đăng nhập, đã kèm nhãn người nói, để bạn đánh giá xem âm thanh có đủ sạch và cách tách người nói có hợp lý hay không.
- Đăng nhập và để nó chạy. Toàn bộ file được tải lên và công việc tự hoàn tất; bạn không cần giữ tab đó mở.
- Đổi tên người nói. Các nhãn chung chung như Người nói A trở thành tên thật chỉ với một lần chỉnh sửa cho mỗi người, áp dụng trên toàn bộ bản phiên âm.
- Đọc đối chiếu với âm thanh với bất cứ chỗ nào quan trọng. Lướt qua để tìm tên riêng, số liệu và thuật ngữ chuyên ngành, những chỗ mô hình dễ đoán sai nhất.
- Xuất bản. Chọn định dạng mà bước tiếp theo cần, không chỉ đơn giản là định dạng nào tải lên trước.
Nhãn người nói, nếu có nhiều hơn một người nói
Bất kỳ bản ghi nào có nhiều hơn một giọng nói đều cần tách người nói trước khi bản phiên âm thực sự có thể đọc được; một khối văn bản đặc kín không có chỗ ngắt người nói gần như không hữu ích hơn chính âm thanh là bao. Nhận dạng người nói tách cuộc trò chuyện theo từng giọng và cho phép bạn đổi tên các nhãn chung chung một lần, thay đổi đó áp dụng ở mọi nơi người nói đó xuất hiện. Nó hoạt động tốt hơn khi mỗi người có giọng khá khác biệt và không liên tục ngắt lời nhau; hai giọng nghe tương tự nói chồng lên nhau vẫn là trường hợp làm khó mọi hệ thống, không chỉ riêng các hệ thống tự động.
Chọn định dạng xuất cho bước tiếp theo
Định dạng xuất phù hợp phụ thuộc vào nơi văn bản sẽ được dùng tiếp theo, không phải định dạng nào trông đầy đủ nhất:
- Văn bản thuần để dán vào tài liệu khác hoặc đưa vào công cụ tóm tắt.
- SRT hoặc VTT nếu bạn đang làm phụ đề cho video và cần dấu thời gian mà trình phát có thể đọc được.
- DOCX để chia sẻ với người muốn bình luận hoặc chỉnh sửa.
- JSON nếu bạn đang đưa bản phiên âm, kèm dữ liệu người nói và thời gian còn nguyên vẹn, vào công cụ riêng của bạn.
Xuất nhiều hơn một định dạng từ cùng một công việc không tốn thêm chi phí gì, vậy nên không có lý do gì phải đoán trước định dạng đúng duy nhất khi bạn có thể lấy hai hoặc ba định dạng mà bạn thực sự sẽ dùng.
Quyền riêng tư, nếu bản ghi không nên được lưu lại
Không phải bản ghi nào cũng thuộc về một kho lưu trữ vĩnh viễn. Một cuộc gọi bảo mật, một buổi phỏng vấn nhạy cảm, một ghi chú một lần cần phiên âm rồi biến mất: những trường hợp này đòi hỏi một chế độ khác so với công việc thường ngày của bạn. Phiên âm riêng tư bỏ qua việc lưu bất cứ thứ gì vào tài khoản của bạn. Kết quả trả về dưới dạng một bản tải xuống được bảo vệ bằng mật khẩu, tự hết hạn nếu bạn không bao giờ mở nó, thay vì nằm vô thời hạn trong lịch sử của bạn.
Với bất cứ điều gì bạn chưa chắc chắn, chế độ riêng tư là lựa chọn mặc định an toàn hơn. Bạn luôn có thể chọn giữ lại bản phiên âm tiếp theo; bạn không thể hồi tố bỏ lưu bản này.
Một bản ghi điển hình tốn bao nhiêu
Chi phí tính theo số phút âm thanh, không theo file, định dạng hay số người nói. Một cuộc gọi điện thoại 45 phút và một ghi chú thoại 45 phút tốn như nhau để phiên âm. So với gói $5.99 cho 5 giờ (300 phút), một bản ghi 45 phút chỉ dùng khoảng 45 phút từ số dư đó, một phần nhỏ trong gói, phần còn lại vẫn dùng được cho bản ghi tiếp theo. Không có subscription nào chạy dù bạn dùng hay không; xem phiên âm trả theo mức dùng để biết các gói mở rộng ra sao từ đó.
Biến một bản ghi đơn lẻ thành văn bản là một quyết định nhỏ hơn vẻ ngoài của nó: chọn thủ công, tự động hay kết hợp dựa trên yêu cầu của bản phiên âm, đưa âm thanh sạch cho mô hình nếu bạn có bất kỳ quyền kiểm soát nào với bản ghi, và kiểm tra kết quả đối chiếu với những phần thực sự quan trọng. Với các trường hợp về độ dài hoặc khối lượng mà hướng dẫn này gác lại, cách phiên âm bản ghi dài và phiên âm một thư mục chứa các bản ghi bao quát chi tiết hơn về những trường hợp đó.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: