Chuyển đến nội dung chính

Blog

Cách phiên âm một bản ghi: phương pháp và các bước

Tác giả: Ngày đăng: Rà soát lần cuối:

Một bản ghi chỉ trở nên hữu ích khi nó biến thành văn bản. Một cuộc họp, một cuộc gọi điện thoại, một ghi chú thoại, một buổi phỏng vấn một khách mời — dù nguồn là gì, vấn đề vẫn giống nhau: bạn cần những từ ngữ mà bạn có thể tìm kiếm, trích dẫn và đưa cho người không có mặt trong phòng. Hướng dẫn này bao quát một bản ghi điển hình, từ vài phút đến vài giờ, từ việc chọn phương pháp cho đến bản xuất hoàn chỉnh. Với bản ghi vượt quá mốc hai giờ, xem cách phiên âm bản ghi dài; với nhiều file cùng lúc, xem phiên âm một thư mục chứa các bản ghi.

Thủ công, tự động hay kết hợp

Có ba cách để chuyển từ âm thanh sang văn bản, và hầu hết mọi người cuối cùng dùng nhiều hơn một cách tùy theo bản ghi.

Phiên âm thủ công nghĩa là bạn tự nghe và gõ lại từng từ. Nó cho bạn toàn quyền kiểm soát và không có bên thứ ba tham gia, nhưng chậm: một lượt nghe kỹ một giờ âm thanh rõ ràng dễ dàng mất nhiều giờ nếu tính cả thời gian phát lại, gõ lại và đọc soát. Nó hợp lý cho một đoạn ngắn, một bản ghi bằng ngôn ngữ mà công cụ tự động của bạn xử lý kém, hoặc tài liệu bạn thực sự không thể để rời khỏi tay mình.

Nhận dạng giọng nói tự động làm cùng công việc đó trong vài phút thay vì vài giờ. Một mô hình nghe dạng sóng, dự đoán các từ có khả năng nhất và trả về bản nháp đã có dấu câu cùng nhãn người nói. Bản nháp không hoàn hảo, nhưng với hầu hết các bản ghi hàng ngày, nó đủ gần để chỉ cần đọc lướt qua là bắt được phần còn thiếu.

Phiên âm kết hợp là bản nháp tự động cộng với lượt xem lại của chính bạn. Đây là cách mà phần lớn công việc phiên âm lặp lại dần ổn định: mô hình xử lý phần lớn việc gõ chữ, bạn xử lý tên riêng, thuật ngữ chuyên ngành và bất cứ chỗ nào nó nghe nhầm. Nó tốn một phần nhỏ chi phí so với làm thủ công và cho kết quả sạch hơn một bản nháp tự động chưa được xem lại.

Cách nào phù hợp phụ thuộc ít vào độ dài của bản ghi hơn là vào việc bản phiên âm sẽ được dùng để làm gì sau đó. Một câu trích dẫn cho bài báo cần từ ngữ chính xác được kiểm tra đối chiếu với âm thanh bất kể dùng phương pháp nào. Một bộ ghi chú họp sơ sài chỉ để bạn tự tham khảo thì hiếm khi cần xem lại chút nào.

Điều thực sự quyết định độ chính xác

Yếu tố lớn nhất quyết định độ chính xác của bản phiên âm là chính bản ghi, không phải phần mềm đọc nó. Âm thanh rõ ràng, ghi gần micro với một người nói tại một thời điểm cho ra bản nháp sạch từ gần như bất kỳ hệ thống tự động nào. Một bản ghi được thực hiện từ xa trong phòng, qua đường dây điện thoại kém, hoặc với ba người nói chồng lên nhau tạo ra lỗi bất kể công cụ nào đọc nó. Hướng dẫn của W3C về việc tạo bản chép lời chính xác đưa ra cùng luận điểm từ góc độ khả năng tiếp cận: một bản chép lời đóng vai trò thay thế cho âm thanh, vì vậy độ chính xác của nó phải tự đứng vững, không phụ thuộc vào việc bản ghi gốc nghe hay đến đâu với người có mặt trong phòng.

Một vài điều bạn kiểm soát được trước khi tải lên quan trọng hơn bất kỳ cài đặt nào sau đó:

Nghiên cứu gần đây về nhận dạng giọng nói tự động, bao gồm một khảo sát năm 2024 về các phương pháp học sâu cho ASR, theo dõi độ chính xác đã tiến xa đến đâu trên âm thanh sạch và vẫn còn phụ thuộc nhiều thế nào vào dữ liệu huấn luyện cho một giọng vùng, lĩnh vực hay kiểu tiếng ồn nhất định. Không hệ thống nào đọc mọi bản ghi tốt như nhau, vì vậy việc thử nghiệm trên chính âm thanh của bạn trước khi tin tưởng kết quả cho một việc quan trọng vẫn là thói quen an toàn hơn.

Phiên âm một bản ghi, từng bước một

  1. Tải file lên. Thả bản ghi vào âm thanh thành văn bản. Các định dạng âm thanh và video phổ biến được chấp nhận trực tiếp; nếu đó là video, âm thanh sẽ được tách ra ngay trong trình duyệt của bạn trước khi bất cứ thứ gì được tải lên.
  2. Kiểm tra bản xem trước. Vài phút đầu tiên sẽ được phiên âm trước khi bạn đăng nhập, đã kèm nhãn người nói, để bạn đánh giá xem âm thanh có đủ sạch và cách tách người nói có hợp lý hay không.
  3. Đăng nhập và để nó chạy. Toàn bộ file được tải lên và công việc tự hoàn tất; bạn không cần giữ tab đó mở.
  4. Đổi tên người nói. Các nhãn chung chung như Người nói A trở thành tên thật chỉ với một lần chỉnh sửa cho mỗi người, áp dụng trên toàn bộ bản phiên âm.
  5. Đọc đối chiếu với âm thanh với bất cứ chỗ nào quan trọng. Lướt qua để tìm tên riêng, số liệu và thuật ngữ chuyên ngành, những chỗ mô hình dễ đoán sai nhất.
  6. Xuất bản. Chọn định dạng mà bước tiếp theo cần, không chỉ đơn giản là định dạng nào tải lên trước.

Nhãn người nói, nếu có nhiều hơn một người nói

Bất kỳ bản ghi nào có nhiều hơn một giọng nói đều cần tách người nói trước khi bản phiên âm thực sự có thể đọc được; một khối văn bản đặc kín không có chỗ ngắt người nói gần như không hữu ích hơn chính âm thanh là bao. Nhận dạng người nói tách cuộc trò chuyện theo từng giọng và cho phép bạn đổi tên các nhãn chung chung một lần, thay đổi đó áp dụng ở mọi nơi người nói đó xuất hiện. Nó hoạt động tốt hơn khi mỗi người có giọng khá khác biệt và không liên tục ngắt lời nhau; hai giọng nghe tương tự nói chồng lên nhau vẫn là trường hợp làm khó mọi hệ thống, không chỉ riêng các hệ thống tự động.

Chọn định dạng xuất cho bước tiếp theo

Định dạng xuất phù hợp phụ thuộc vào nơi văn bản sẽ được dùng tiếp theo, không phải định dạng nào trông đầy đủ nhất:

Xuất nhiều hơn một định dạng từ cùng một công việc không tốn thêm chi phí gì, vậy nên không có lý do gì phải đoán trước định dạng đúng duy nhất khi bạn có thể lấy hai hoặc ba định dạng mà bạn thực sự sẽ dùng.

Quyền riêng tư, nếu bản ghi không nên được lưu lại

Không phải bản ghi nào cũng thuộc về một kho lưu trữ vĩnh viễn. Một cuộc gọi bảo mật, một buổi phỏng vấn nhạy cảm, một ghi chú một lần cần phiên âm rồi biến mất: những trường hợp này đòi hỏi một chế độ khác so với công việc thường ngày của bạn. Phiên âm riêng tư bỏ qua việc lưu bất cứ thứ gì vào tài khoản của bạn. Kết quả trả về dưới dạng một bản tải xuống được bảo vệ bằng mật khẩu, tự hết hạn nếu bạn không bao giờ mở nó, thay vì nằm vô thời hạn trong lịch sử của bạn.

Với bất cứ điều gì bạn chưa chắc chắn, chế độ riêng tư là lựa chọn mặc định an toàn hơn. Bạn luôn có thể chọn giữ lại bản phiên âm tiếp theo; bạn không thể hồi tố bỏ lưu bản này.

Một bản ghi điển hình tốn bao nhiêu

Chi phí tính theo số phút âm thanh, không theo file, định dạng hay số người nói. Một cuộc gọi điện thoại 45 phút và một ghi chú thoại 45 phút tốn như nhau để phiên âm. So với gói $5.99 cho 5 giờ (300 phút), một bản ghi 45 phút chỉ dùng khoảng 45 phút từ số dư đó, một phần nhỏ trong gói, phần còn lại vẫn dùng được cho bản ghi tiếp theo. Không có subscription nào chạy dù bạn dùng hay không; xem phiên âm trả theo mức dùng để biết các gói mở rộng ra sao từ đó.


Biến một bản ghi đơn lẻ thành văn bản là một quyết định nhỏ hơn vẻ ngoài của nó: chọn thủ công, tự động hay kết hợp dựa trên yêu cầu của bản phiên âm, đưa âm thanh sạch cho mô hình nếu bạn có bất kỳ quyền kiểm soát nào với bản ghi, và kiểm tra kết quả đối chiếu với những phần thực sự quan trọng. Với các trường hợp về độ dài hoặc khối lượng mà hướng dẫn này gác lại, cách phiên âm bản ghi dàiphiên âm một thư mục chứa các bản ghi bao quát chi tiết hơn về những trường hợp đó.

Nguồn và tiêu chuẩn độc lập

Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.

Ngày rà soát nguồn:

Câu hỏi thường gặp

Tôi nên phiên âm bản ghi thủ công hay dùng nhận dạng giọng nói tự động?

Phiên âm tự động phù hợp cho gần như mọi trường hợp: nó trả về bản nháp trong vài phút thay vì nhiều giờ cho mỗi giờ âm thanh mà công việc thủ công đòi hỏi. Chỉ dành việc gõ tay cho một đoạn ngắn, một ngôn ngữ mà công cụ tự động của bạn xử lý kém, hoặc tài liệu bạn thực sự không thể để rời khỏi tay mình.

Tôi có cần xem lại bản phiên âm tự động trước khi sử dụng không?

Với ghi chú nội bộ thì thường là không cần. Với một câu trích dẫn, hồ sơ pháp lý hoặc bất cứ thứ gì bạn sắp công bố thì có. Hãy đọc bản nháp đối chiếu với âm thanh và kiểm tra riêng tên, số liệu và thuật ngữ chuyên ngành, vì đó là chỗ mô hình dễ đoán sai nhất.

Việc gắn nhãn người nói hoạt động thế nào với bản ghi có nhiều hơn một giọng nói?

Bản phiên âm trả về với các nhãn chung chung như Người nói A và Người nói B, tách theo từng giọng. Đổi tên một nhãn một lần và nó áp dụng ở mọi nơi người nói đó xuất hiện trong bản phiên âm. Độ chính xác cao nhất khi mỗi người có giọng khác biệt rõ ràng và không liên tục nói chồng lên người khác.

Điều gì xảy ra với bản ghi âm của tôi sau khi phiên âm xong?

Điều đó tùy vào chế độ bạn chọn. Chế độ mặc định giữ bản phiên âm trong tài khoản của bạn để bạn có thể quay lại xem. Chế độ riêng tư bỏ qua hoàn toàn việc lưu vào tài khoản: kết quả trả về dưới dạng một bản tải xuống được bảo vệ bằng mật khẩu, tự hết hạn nếu bạn không bao giờ mở nó.

Phiên âm một bản ghi tốn bao nhiêu tiền?

Chi phí tính theo số phút âm thanh, không theo định dạng file hay số người nói. Một bản ghi 45 phút tiêu tốn 45 phút trong số dư trả trước của bạn, dù số dư đó đến từ một gói nhỏ hay một gói lớn, không có subscription chạy ngầm.

Tôi có thể tải lên những loại file nào?

Các định dạng âm thanh và video phổ biến được chấp nhận trực tiếp, bao gồm MP3, WAV, M4A, FLAC và MP4. Nếu bạn tải lên một video, âm thanh sẽ được trích xuất ngay trong trình duyệt của bạn trước khi bất cứ thứ gì được gửi đi, vì vậy file video gốc không bao giờ được tải lên.

Bắt đầu với 30 phút miễn phí

Khoản giữ tạm thời $1 xác nhận thẻ của bạn và được hoàn trả ngay — bạn không bao giờ bị trừ tiền, và 30 phút miễn phí đến ngay lập tức.

Bắt đầu – 30 phút miễn phí