Phân tách người nói: nhãn người nói hoạt động thế nào
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
phân tách người nói của người nói là quá trình tự động chia bản ghi thành các phân đoạn theo người nói, trả lời “ai đã nói khi nào?” trước khi bất kỳ con người nào đọc bản ghi. Nghiên cứu phân tách người nói trong Tuyển tập ACL hiện tại mô tả nhiệm vụ tương tự đối với các cuộc trò chuyện nhiều bên. Đó là sự khác biệt giữa một bức tường chữ và một cuộc trò chuyện có cấu trúc và đó là lý do tại sao bản ghi lại cuộc phỏng vấn hai người trở lại dưới dạng một đoạn hội thoại có thể đọc được thay vì một đoạn văn dài.
Nói một cách dễ hiểu: bạn tải lên một bản ghi âm, công cụ phân tách người nói sẽ tìm những điểm mà giọng nói thay đổi, nhóm các phân đoạn nghe giống của cùng một người và gửi lại bản ghi có nội dung giống như một tập lệnh: một dòng mỗi lượt, được gắn nhãn bằng giọng nói. Bài đăng này giải thích cách hoạt động của tính năng này, tại sao việc phân tách người nói không giống như nhận dạng giọng nói và cách chuyển các nhãn chung thành tên thật.
tính năng phân tách người nói, bằng ngôn ngữ dễ hiểu
Hình ảnh chép lại một cuộc phỏng vấn dài 90 phút bằng tay. Sau khi chuyển bài phát biểu thành văn bản, việc tiếp theo bạn cần làm là thêm các thuộc tính: “Người phỏng vấn:”, “Chủ đề:”, qua lại, mỗi khi giọng nói thay đổi. Công việc ghi công đó, quyết định ai đang nói vào bất kỳ giây nào, chính là công việc mà tính năng phân tách người nói mang lại cho bạn.
Đầu ra là một bản ghi có định dạng hội thoại:
Người nói A [00:00:12]: Điều đầu tiên cần hiểu là dữ liệu chỉ tồn tại trong một khoảnh khắc.
Người nói B [00:00:27]: Đúng, và đó là phần mà hầu hết mọi người không nhận ra cho đến khi quá muộn.
Người nói A [00:00:34]: Chính xác. Vì vậy, câu hỏi thực sự sẽ trở thành những gì bạn làm trong cửa sổ đó.
Mỗi câu nói được gắn với một người nói và một dấu thời gian. Sau đó bạn có thể đổi tên Người nói A và Người nói B thành tên thật; một chỉnh sửa cho mỗi người nói và nhãn sẽ cập nhật ở mọi nơi nó xuất hiện.
Giải pháp thay thế, một bản ghi đơn giản không có phân tách người nói, là một khối văn bản liên tục trong đó bạn phải phát lại âm thanh để tìm ra ai đã nói gì. Đối với bất cứ điều gì kéo dài vài phút với hai giọng nói trở lên, đó thực sự là công việc thủ công và đó là công việc mà thẻ phân tách người nói sẽ loại bỏ.
Những gì bạn cần trước khi bắt đầu
Không có cài đặt nào để định cấu hình và không có gì để cài đặt. quá trình phân tách người nói diễn ra trên chính bản ghi âm, do đó, điều kiện tiên quyết thực sự duy nhất là âm thanh trong đó những người nói được phân biệt hợp lý:
- Một bản ghi âm có mọi giọng nói trong đó. quá trình phân tách người nói hoạt động trong một tệp duy nhất nên tất cả người nói đều phải có trong tệp đó. Một bàn tròn nơi mọi người chia sẻ một mic trong phòng; hai người, mỗi người ghi âm trên thiết bị riêng của họ, được lưu dưới dạng hai tệp riêng biệt, thì không. Trước tiên, hãy kết hợp những thứ đó thành một bản phối.
- Âm thanh đủ rõ ràng. Không cần phải có chất lượng phòng thu. Nó cần mỗi người có thể nghe được mà không bị căng thẳng, hạn chế tiếng ồn xung quanh và tiếng nói chéo. Sự tách biệt giữa các giọng nói càng rõ ràng thì nhãn càng rõ ràng.
- Ý tưởng sơ bộ về số lượng người đang nói chuyện. Bạn không cần phải cung cấp thông tin này nhưng biết rõ điều đó sẽ giúp bạn tỉnh táo hơn khi kiểm tra kết quả: nếu bạn ghi âm ba người và bản ghi âm hiển thị sáu người nói thì bạn biết cần tìm ở đâu.
Vậy là xong. Không đăng ký micrô, không lấy mẫu giọng nói, không thiết lập từng người nói.
Cách nhận dạng người nói tự động hoạt động
việc phân tách người nói chia thành một số giai đoạn riêng biệt. Việc biết rõ các giá trị này giúp đầu ra dễ đọc hơn và dễ sửa hơn khi có lỗi xảy ra.
Trích xuất tính năng. Âm thanh được chia thành các khung hình ngắn, mỗi khung hình thường từ 10 đến 40 mili giây và công cụ đo lường các đặc điểm âm thanh trong mỗi khung hình. Các đặc điểm quan trọng để phân biệt những người nói nằm trong miền tần số: cao độ, hình thức và mẫu quang phổ có xu hướng nhất quán trong giọng nói của một người và khác nhau giữa những người.
Phân đoạn. Công cụ tìm kiếm các điểm thay đổi của người nói: những khoảnh khắc mà các đặc điểm giọng nói đó thay đổi. Đây là phần khó khăn. Một sự thay đổi có thể xảy ra ở giữa câu khi ai đó ngắt lời, đồng thời tiếng ồn hoặc lời nói chồng chéo có thể che giấu ranh giới thực sự hoặc bịa ra một ranh giới sai lầm.
Phân cụm. Các phân đoạn có âm thanh giống nhau sẽ được nhóm lại với nhau. Hệ thống không cho biết có bao nhiêu người trong phòng; nó suy ra số lượng người nói từ âm thanh. Nếu bạn biết trước số lượng, một số thiết lập cho phép bạn cung cấp số lượng đó; nếu không, công cụ sẽ ước tính điều đó, đây là nơi hầu hết các lỗi “chia một người thành hai” và “hợp nhất hai người thành một”.
Gắn nhãn. Mỗi cụm có một nhãn:Người nói A,Người nói B,Người nói C hoặc Người nói 0,Người nói 1. Các nhãn là phần giữ chỗ tùy ý. Không có danh tính đằng sau chúng, chỉ có một bộ xử lý ổn định cho một giọng nói trong toàn bộ bản ghi.
Toàn bộ quy trình chạy như một quá trình tự động chuyển cùng với phiên âm, do đó bạn không phải thực hiện công việc gắn nhãn người nói riêng biệt.
Diarization và nhận dạng giọng nói
Hai công việc này liên tục được kết hợp với nhau nhưng chúng trả lời các câu hỏi khác nhau.
Diarization hỏi: ai đang nói vào lúc này, so với những giọng nói khác trong tệp này? Nó phân tách các giọng nói nhưng không biết họ thuộc về ai. Nó không cần kiến thức trước và không lưu giữ bất kỳ giọng nói nào sau khi công việc hoàn thành.
Nhận dạng giọng nói, còn gọi là nhận dạng người nói, hỏi: đây có phải là người trong bản ghi âm tham chiếu đã biết không? Nó cần một mẫu giọng nói đã đăng ký để so sánh và đó là công nghệ đằng sau hệ thống “xác minh danh tính của bạn bằng giọng nói”.
Hushscript sử dụng tính năng phân tách người nói chứ không phải nhận dạng giọng nói. Không có cơ sở dữ liệu về giọng nói đã đăng ký và bản ghi âm của bạn không bao giờ được so sánh với bất kỳ ai khác. Nhãn của người nói được lấy hoàn toàn từ đặc điểm giọng nói bên trong một tệp đó.
Sự khác biệt này là lý do khiến phân tách người nói không thể nêu tên mọi người cho bạn. Nó có thể tự tin nói “cùng một người đã nói 200 lượt này trong một giờ”, nhưng nó không thể nói ai người đó là. Bước đó là của bạn và mỗi người nói phải thực hiện một cú nhấp chuột. Nếu bạn muốn tìm hiểu sâu hơn về cách Hushscript xử lý các bản ghi âm nhiều người nói từ đầu đến cuối, trang nhận dạng người nói sẽ trình bày việc đó.
Một ví dụ hoạt động: cuộc họp ba người
Giả sử bạn ghi lại một cuộc họp dự án kéo dài 40 phút với ba người trong một phòng, dùng chung một mic máy tính xách tay, được lưu dưới dạng một tệp .m4a. Bạn thả vào, sau khi phiên âm thì kết quả như sau:
Người nói A [00:00:04]: Được rồi, bắt đầu với ngày ra mắt. Chúng ta đang ở đâu?
Người nói B [00:00:09]: Thiết kế đã xong. Chúng tôi đã bàn giao những màn hình cuối cùng vào thứ Hai.
Người nói C [00:00:14]: Kỹ thuật cần khoảng hai tuần nữa cho quá trình thanh toán.
Người nói A [00:00:21]: Hai tuần đã quá thời hạn chúng tôi đã hứa với tiếp thị.
Người nói B [00:00:27]: Chúng tôi có thể giao hàng mà không có luồng thanh toán mới không? và theo dõi?
Người nói C [00:00:33]: Không sạch sẽ. Quy trình cũ bị phá vỡ khi áp dụng mức giá mới.
Ba giọng nói, được tách biệt và gắn nhãn, có dấu thời gian ở mỗi lượt. Bây giờ bạn đổi tên:Người nói A thành “Priya” (cô ấy đang điều hành cuộc họp),Người nói B thành “Tom”,Người nói C thành “Dana”. Sau ba lần nhấp chuột, mỗi dòng đều có tên thật và bản ghi đã sẵn sàng để dán vào ghi chú cuộc họp với phần ghi công chính xác xuyên suốt.
Hình dạng tương tự áp dụng cho cuộc phỏng vấn hai người, podcast bốn người hoặc cuộc gọi điện thoại hai bên: công cụ sẽ phân tách nội dung nó nghe được và bạn đặt tên vào.
Cách gắn nhãn lại người nói trong Hushscript
Các nhãn được đưa đến có mục đích chung chung; đặt tên cho chúng là một bước soạn thảo nhanh chóng. Quy trình trước khi bạn đến đó là: thả tệp của bạn và bản xem trước có gắn nhãn người nói dài 30 giây sẽ hiển thị mà không cần tài khoản, đăng ký để chép lại phần còn lại, sau đó mở bản ghi hoàn chỉnh. Từ đó:
- Nhấp vào nhãn người nói bất kỳ trong trình chỉnh sửa bản chép lời, chẳng hạn như
Người nói B. - Nhập tên thật, chẳng hạn như “Tom”.
- Mọi phiên bản của người nói đó cập nhật cùng một lúc, từ dòng đầu tiên đến dòng cuối cùng.
Việc đổi tên có tính chất chung nên bạn không bao giờ chỉnh sửa cùng một nhãn hai lần. Đối với một cuộc phỏng vấn kéo dài 90 phút với hai diễn giả, quá trình dán nhãn lại đầy đủ chỉ mất chưa đầy một phút và bạn sẽ có được một bản ghi sẵn có trích dẫn ghi chính xác từng dòng. Sau đó, bạn có thể xuất tệp đó, với các tên đã được đặt sẵn, ở bất kỳ định dạng nào trong số 21 định dạng như TXT, SRT, DOCX, PDF và JSON, cùng với .husharchive được bảo vệ bằng mật khẩu.
Xử lý sự cố thường gặp khi phân tách người nói
tính năng phân tách người nói đáng tin cậy đối với các bản ghi sạch và sẽ khó hơn khi âm thanh trở nên lộn xộn hơn. Các vấn đề thường gặp và cách xử lý:
Lời nói chồng chéo. Khi hai người nói chuyện cùng một lúc, công cụ phải gán âm thanh chồng chéo cho một người nói duy nhất và nó có thể gắn nhãn sai cho phần giao nhau hoặc bỏ đi một vài từ. Không có cách khắc phục nào trong phần mềm; âm thanh thực sự chứa hai giọng nói trong cùng một thời điểm. Phòng ngừa chính là đòn bẩy: một bản ghi trong đó mọi người lần lượt nói một cách rõ ràng hơn nhiều so với một bản ghi đầy gián đoạn. Khi xảy ra hiện tượng chồng chéo, việc đọc nhanh âm thanh sẽ phát hiện được một số dòng bị ảnh hưởng.
Giọng nói có âm vực tương tự. Hai người nói có cao độ và giọng gần giống nhau (chẳng hạn như hai người đàn ông cùng độ tuổi hoặc anh chị em ruột) khó tách biệt hơn so với một cặp tương phản vì đặc điểm giọng nói của họ thực sự trùng lặp. Hệ thống đôi khi có thể hoán đổi lượt giữa chúng. Quét bản ghi để tìm những dòng đọc kỳ lạ đối với người được chỉ định; đó là những nhãn cần gán lại bằng tay.
Một người chia thành hai nhãn. Nếu âm thanh của ai đó thay đổi trong khi ghi (họ di chuyển đến gần micrô hơn, chuyển từ tai nghe sang loa ngoài hoặc kết nối bị suy giảm), công cụ có thể đọc nửa sau dưới dạng giọng nói mới và tạo nhãn bổ sung. Hợp nhất cả hai bằng cách dán nhãn lại cho cả hai cùng tên; các bản sao thu gọn thành một người nói.
Hai người hợp nhất thành một nhãn. Điều ngược lại xảy ra khi hai giọng nói nhỏ hoặc xa xôi phát ra quá giống nhau đến mức hệ thống không thể phân tách được. Thực tế là vấn đề khó khắc phục nhất nên bạn cần ngăn chặn: đặt micrô gần người nói hơn và tránh ghi âm từ phòng lớn.
Âm thanh xa hoặc ồn ào. Mic máy tính xách tay ở cuối bàn hội nghị, điện thoại trên bàn trong khi trò chuyện nhóm hoặc tiếng vang trong phòng nặng nề, tất cả đều làm mờ ranh giới giữa các giọng nói. Vị trí đặt mic gần hơn sẽ giúp ích cho mọi người nói và việc giảm tiếng ồn xung quanh (quạt, giao thông, âm nhạc) giúp tăng cường sự tách biệt. Chất lượng ghi âm theo dõi chặt chẽ chất lượng âm thanh.
Cuộc gọi điện thoại được ghi thành hai tệp riêng biệt. Nếu máy ghi âm của bạn lưu mỗi bên cuộc gọi dưới dạng tệp đơn âm riêng thì việc phân tách người nói trên một trong hai tệp sẽ chỉ thấy một giọng nói. Trước tiên, hãy kết hợp cả hai thành một bản ghi hỗn hợp duy nhất để cả hai giọng nói đều xuất hiện trong một tệp, sau đó chép lại.
Các mẹo về độ chính xác thực sự tác động đến kim
Một số thói quen giúp việc phân tách người nói trở nên tốt hơn rõ rệt và hầu hết trong số đó là về bản ghi âm chứ không phải phần mềm:
- Hãy để mọi người thay phiên nhau. Trao đổi chéo là nguồn gây lỗi phân tách người nói lớn nhất. Một cuộc thảo luận được kiểm duyệt sẽ tốt hơn một cuộc thảo luận miễn phí cho tất cả mọi người.
- Đặt micrô lại gần hơn. Khoảng cách và tiếng vang trong phòng làm mờ các giọng nói cùng nhau. Lý tưởng nhất là một mic gần cho mỗi người; micrô dùng chung ở giữa bàn sẽ đánh bại micrô ở góc.
- Giảm tiếng ồn xung quanh rõ ràng. Âm nhạc, tiếng quạt đang chạy hoặc quán cà phê đông đúc đều cạnh tranh với giọng nói và làm mờ ranh giới.
- Đặt mọi giọng nói vào tệp bạn chép lời. tính năng phân tách người nói so sánh những người nói trong một bản ghi. Nếu máy ghi âm tạo ra các bản nhạc riêng biệt của người tham gia, trước tiên hãy trộn hoặc hợp nhất chúng thành một tệp để quá trình phân tách người nói có thể nghe được toàn bộ cuộc trò chuyện.
Không cần phải hoàn hảo. Các lượt quay rõ ràng và vị trí micrô hợp lý giúp hầu hết các bản ghi được loại bỏ nhãn và biên tập viên sẽ xử lý phần còn lại.
Tại sao điều này lại quan trọng đối với các cuộc phỏng vấn và cuộc họp
Nếu không phân tách người nói, bản ghi của cuộc trò chuyện nhiều người gần như không thể sử dụng được cho các công việc phổ biến nhất:
- Trích dẫn trực tiếp. Bạn không thể trích dẫn ai đó nếu bạn không biết đó là những dòng nào của họ.
- Ghi công tóm tắt. Một bản tóm tắt cuộc họp không cho biết ai đã nói điều gì hữu ích hơn là không có bản tóm tắt nào.
- Tìm kiếm theo diễn giả. Nếu đang tìm kiếm nội dung mà một người đã nói, bạn không thể lọc một khối văn bản không phân biệt duy nhất.
Với tính năng phân tách người nói, mỗi nội dung này đều đơn giản, dễ hiểu. và bản ghi sẽ trở thành một tài liệu chứ không phải là văn bản thô. Đối với bất kỳ nội dung nào sẽ được xuất bản hoặc trích dẫn, cho dù là ghi chú báo chí, nghiên cứu hay chương trình podcast, việc ghi công chính xác không phải là tùy chọn và lấy nó từ bản ghi thay vì xây dựng lại nó từ âm thanh là nơi tiết kiệm thời gian. Đối với công việc nội bộ như ghi chú cuộc họp, nghiên cứu phỏng vấn hoặc hồ sơ nhân sự, cấu trúc được gắn nhãn cũng có giá trị: quét đoạn hội thoại nhanh hơn nhiều so với đọc một bức tường văn bản.
Để có hướng dẫn đầy đủ về ngữ cảnh, hãy xem cách ghi lại một cuộc phỏng vấn, bao gồm việc ghi âm, chép lời và dán nhãn lại cho báo chí và nghiên cứu cũng như cách ghi chép một podcast để ghi nhãn người dẫn chương trình và khách trong một tập.
Nhãn người nói được cung cấp miễn phí trên mọi bản ghi Hushscript
phân tách người nói được đưa vào mỗi bản ghi Hushscript mà không mất thêm phí. Không có tiện ích bổ sung phân tách người nói, không có cấp gói riêng cho nó và không có giới hạn về số lượng người nói mà một bản ghi âm có thể có. Bản thân Hushscript là dịch vụ trả tiền theo mức sử dụng mà không cần đăng ký. Có 30 phút miễn phí để dùng thử và bạn chỉ phải trả tiền cho số phút sử dụng sau đó; hãy xem trang định giá để biết chi tiết.
Việc tách người nói là miễn phí vì bản ghi của cuộc trò chuyện không có nó chỉ là một nửa bản ghi: văn bản có thể đọc được mà không biết ai đã nói. Đưa bản ghi vào, tự động lấy nhãn, đổi tên chúng chỉ bằng một cú nhấp chuột và xuất kết quả. Thông tin thêm về cách tất cả kết hợp với nhau có trên trang âm thanh thành văn bản.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: