Blog
Phiên âm nghiên cứu cho phỏng vấn và nhóm tập trung
Tác giả: Hushscript Ngày đăng: Rà soát lần cuối:
Một bản ghi âm chưa phải là dữ liệu. Nó trở thành dữ liệu khi có người quyết định điều gì được ghi lại, người nói được đánh dấu ra sao, chi tiết nhận dạng nào bị loại bỏ, và file trông như thế nào khi đến phần mềm mã hóa dữ liệu của bạn. Bốn quyết định đó chính là phiên âm nghiên cứu, và mỗi quyết định đều mang tính phương pháp luận chứ không phải việc văn thư đơn thuần.
Đưa ra các quyết định này trước cuộc phỏng vấn đầu tiên rẻ hơn nhiều so với làm điều đó ở cuộc phỏng vấn thứ mười bốn. Dưới đây là những gì mỗi quyết định thay đổi, những gì thuộc phần phương pháp nghiên cứu, và nơi phiên âm tự động thực sự giúp ích cho một nghiên cứu thay vì chỉ khiến thư mục trông có vẻ hoàn tất.
Chọn loại bản phiên âm trước buổi làm việc đầu tiên
Không có bản phiên âm nào trung lập cả. Mỗi quy ước làm nổi bật một số điều và che giấu những điều khác, vì vậy hãy chọn quy ước phù hợp với phân tích bạn thực sự định thực hiện.
| Loại bản phiên âm | Giữ lại gì | Phù hợp với |
|---|---|---|
| Nguyên văn | Từ đệm, câu nói dở dang, khoảng ngừng, chồng lời | Phân tích hội thoại và diễn ngôn |
| Nguyên văn thông minh | Đúng lời nói, bỏ từ đệm và chỗ sửa lời | Phân tích chủ đề, lý thuyết nền |
| Đã biên tập | Chỉnh sửa ngữ pháp và cho dễ đọc | Trích dẫn cho xuất bản và báo cáo |
| Chuẩn hóa | Ngữ pháp thống nhất trên toàn bộ kho dữ liệu | So sánh giữa các trường hợp, mẫu lớn |
Sai lầm tốn kém nhất không phải là chọn sai, mà là chọn hai lần. Một kho dữ liệu nửa nguyên văn nửa đã biên tập không thể mã hóa nhất quán, và phiên âm lại 20 cuộc phỏng vấn để sửa việc đó là một tháng chẳng ai lập ngân sách cho. Hãy viết quy ước ra từ trước, kể cả cách bạn sẽ đánh dấu tiếng cười, chỗ ngắt lời và đoạn không nghe rõ.
Máy làm đúng điều gì, và bỏ sót điều gì
Phiên âm tự động đủ tốt để làm bản nháp đầu tiên cho gần như mọi nghiên cứu, nhưng chưa đủ tốt để làm bản cuối cùng. Trung tâm Nghiên cứu Pew đã so sánh phiên âm của con người và máy móc trên các bài giảng được ghi âm và thấy máy móc theo kịp với lời nói rõ ràng, liên tục, nhưng tụt lại ở tên riêng, thuật ngữ chuyên ngành và những đoạn người nói đổi giọng điệu hoặc âm lượng. Đó chính là những đoạn mà các nhà nghiên cứu định tính thường hay trích dẫn.
Vì vậy quy trình khả thi là một bản nháp bạn không phải gõ, sau đó là một lượt rà soát do chính bạn thực hiện. Nghe lại cùng âm thanh một lần, sửa tên riêng và thuật ngữ, chỉnh lại việc gán người nói ở những đoạn nói chồng lời, rồi dừng ở đó. Lượt rà soát này là phần tốn thời gian thật sự, và cũng là phần không thể bỏ qua.
Nhãn người nói vốn đã là bút danh
Tách người nói tự động chia bản ghi âm theo giọng nói và gán nhãn kết quả là Người nói 1, Người nói 2, và tiếp tục như vậy. Nó nhận diện giọng nói chứ không phải con người, và đây là điểm hữu ích thầm lặng: nhãn mặc định là một bút danh và vẫn giữ nguyên như vậy trừ khi có ai đó gõ vào đó một tên thật.
Hãy giữ nguyên như vậy. Đổi tên Người nói 1 thành P07 hoặc thành một nhãn vai trò một lần duy nhất, và thay đổi đó áp dụng cho toàn bộ bản phiên âm và mọi bản xuất, nhờ đó mã số người tham gia được áp dụng nhất quán thay vì phải sửa tay ở 40 chỗ. Nhãn người nói miễn phí trên mọi bản phiên âm của Hushscript, không giới hạn số giọng nói, đúng như thứ mà một nhóm tập trung sáu người cần.
Giới hạn thực sự là tình trạng nói chồng lời. Khi những người tham gia nói đè lên nhau, việc tách người nói cần một lượt rà soát của con người, và dấu thời gian chính là thứ cho bạn biết cần nghe lại phút nào.
Ghi phương pháp phiên âm vào bài báo
Người phản biện ngày càng hay hỏi văn bản được tạo ra như thế nào, chứ không chỉ nội dung nó nói gì. Tiêu chuẩn báo cáo bài báo trên tạp chí của APA cho nghiên cứu định tính yêu cầu tác giả mô tả cách dữ liệu được ghi lại và chuyển đổi, khiến việc phiên âm trở thành điều bạn phải báo cáo chứ không phải mặc định.
Một đoạn văn trong phần phương pháp trả lời những điều sau thường là đủ:
- Quy ước nào. Nguyên văn, nguyên văn thông minh, đã biên tập, hay chuẩn hóa, và vì sao nó phù hợp với phân tích.
- Ai tạo ra văn bản. Nhà nghiên cứu, dịch vụ phiên âm, nhận dạng tự động, hoặc bản nháp tự động có nhà nghiên cứu rà soát lại.
- Kiểm soát chất lượng nào đã chạy. Ai đã đối chiếu với âm thanh, trên mẫu nào, và các bất đồng được giải quyết ra sao.
- Ngôn ngữ được xử lý ra sao. Phương ngữ, chuyển mã ngôn ngữ, và ai là người dịch khi ngôn ngữ phân tích khác với ngôn ngữ phỏng vấn.
- Điều gì đã bị loại bỏ. Quy tắc ẩn danh, địa điểm và ngày tháng đã được che, nơi làm việc và chức danh đã được khái quát hóa.
Ẩn danh ngay trong lúc phiên âm, không phải sau đó
Chi tiết nhận dạng xuất hiện ngay giữa câu: một nơi làm việc, một khu phố, một con đường, một ngày ra tòa, người đồng nghiệp duy nhất có thể nhận ra câu chuyện. Loại bỏ chúng về sau nghĩa là phải đọc lại toàn bộ kho dữ liệu một lần nữa, vì vậy hãy gộp việc này vào ngay lượt phiên âm.
Làm việc đó ngay trong bản phiên âm thay vì trong các bản đã xuất cũng có nghĩa là phiên bản đã ẩn danh là phiên bản duy nhất từng được lưu hành. Tìm và thay thế sửa một tên địa điểm lặp lại trong toàn bộ tài liệu chỉ bằng một thao tác, và các từ điển đã lưu mang tên riêng, địa điểm và từ vựng chuyên môn của nghiên cứu vào bước nhận dạng nên ngay từ đầu đã có ít lỗi hơn.
Những gì bạn có thể nói với hội đồng đạo đức về nền tảng cũng quan trọng không kém việc che thông tin. Hushscript xóa âm thanh ngay khi mỗi bản phiên âm sẵn sàng và không bao giờ dùng nó để huấn luyện mô hình; bản phiên âm được mã hóa khi lưu trữ theo khoảng thời gian lưu giữ do bạn đặt, từ 7 đến 365 ngày với tùy chỉnh riêng cho từng bản phiên âm; các luồng xóa dữ liệu trả về biên nhận. Âm thanh từ EU, EEA, Thụy Sĩ và Anh được xử lý tại EU. Với một bản ghi âm không nên để lại bất kỳ bản phiên âm lưu trữ nào cả, bản phiên âm riêng tư sẽ trả về một file .husharchive được bảo vệ bằng mật khẩu thay vì vậy.
Xuất theo phần mềm sẽ nhận file
Một bản phiên âm hiếm khi ở yên nơi nó được tạo ra. Nó di chuyển vào NVivo, ATLAS.ti, MAXQDA, hoặc một bảng tính, rồi sau đó vào một bản thảo. Văn bản thuần là nơi nhãn người nói và dấu thời gian biến mất, vì vậy hãy chọn định dạng theo nơi nó sẽ đến.
- Phần mềm mã hóa: CSV, TSV, hoặc XLSX, những định dạng giữ người nói và dấu thời gian dưới dạng cột.
- Quy trình dùng script: JSON, nơi cấu trúc đã được phân tích sẵn cho bạn.
- Viết bài và phụ lục: DOCX hoặc PDF.
- Lưu trữ: văn bản thuần đi kèm một file metadata ghi lại quy ước bạn đã dùng.
Hushscript xuất 21 định dạng, không watermark, và gộp những định dạng liên quan thành một gói Research. Dấu thời gian còn giữ được qua bước xuất chính là thứ giúp một trích dẫn trong phần kết quả của bạn trỏ ngược lại đúng giây nó được nói ra, đó là khác biệt giữa một bản phiên âm có thể trích dẫn và một tài liệu dài.
Thực địa đa ngôn ngữ mà không cần một nhà cung cấp riêng cho mỗi nước
Một nghiên cứu so sánh không nên cần một nhà cung cấp phiên âm khác nhau ở mỗi địa điểm. Nhận dạng bao phủ khoảng 99 ngôn ngữ với phát hiện tự động, độ chính xác cao nhất ở nhóm 18 biến thể ngôn ngữ chủ lực, vì vậy một quy trình duy nhất xử lý được toàn bộ mẫu.
Dịch là một quyết định tách biệt với phiên âm, và thứ tự có ý nghĩa quan trọng: phiên âm bằng ngôn ngữ được nói, rồi mới dịch. Mỗi ngôn ngữ đích khi dịch tốn thêm 25% thời lượng bản ghi và đặt bản gốc cùng ngôn ngữ làm việc của bạn vào các tab của cùng một tài liệu, mỗi tab có thể xuất riêng, nhờ đó bạn trích dẫn đúng lời của người tham gia và mã hóa bằng chính ngôn ngữ bạn tư duy. Hãy ghi rõ ai là người dịch và các bất đồng được giải quyết ra sao, vì hai người dịch sẽ không diễn đạt cùng một câu giống hệt nhau.
Tính chi phí so với hạng mục ngân sách tài trợ
Phiên âm thủ công được tính giá theo số giờ của nhà nghiên cứu, và 20 cuộc phỏng vấn dài một giờ là kiểu con số âm thầm nuốt trọn một học kỳ. Phiên âm tự động đưa chi phí đó vào một hạng mục ngân sách đủ nhỏ để không còn là một ràng buộc lên cỡ mẫu.
Hushscript bán số phút trả trước thay vì subscription, vì vậy các tháng đi thực địa chỉ tốn đúng số phút đã dùng và các tháng viết bài không tốn gì cả. Ở gói lớn nhất, $49.99 cho 100 giờ, 20 cuộc phỏng vấn dài một giờ tốn khoảng $10 và một nhóm tập trung 90 phút tốn khoảng $0.75. Số phút còn hiệu lực trong 365 ngày, và bất kỳ lần phiên âm hay mua thêm nào cũng làm mới lại khoảng thời gian đó, điều này phù hợp với một nghiên cứu tạm dừng để chờ phê duyệt đạo đức. Tài khoản mới được tặng 30 phút miễn phí, mở khóa bằng cách kiểm tra thẻ $1 được xác nhận rồi giải phóng ngay lập tức và không bao giờ bị tính phí, hoặc bằng lần mua đầu tiên của bạn nếu bạn thanh toán theo cách khác.
Bắt đầu từ đâu
Hãy dùng cuộc phỏng vấn gần nhất mà bạn thực sự đã ghi âm, không phải một file thử nghiệm sạch sẽ. Đưa nó qua phiên âm nghiên cứu và đọc 5 phút đầu tiên trả về: điều đó cho bạn thấy nhận dạng người nói hoạt động ra sao với những người tham gia, căn phòng và giọng nói của chính bạn, đây mới là con số chính xác duy nhất có ý nghĩa cho nghiên cứu của bạn.
Sau đó, hãy viết quy ước đó vào đề cương nghiên cứu khi vẫn còn 30 cuộc phỏng vấn nữa để áp dụng.
Nguồn và tiêu chuẩn độc lập
Hushscript đã tham khảo các nguồn độc lập, không cạnh tranh này. Chúng giải thích nghiên cứu, tiêu chuẩn hoặc cách nền tảng hoạt động và không đồng nghĩa với việc ủng hộ Hushscript.
Ngày rà soát nguồn: