บล็อก
วิธีถอดเสียงการบันทึก: วิธีการและขั้นตอน
ผู้เขียน: Hushscript เผยแพร่: ตรวจสอบล่าสุด:
การบันทึกจะมีประโยชน์ก็ต่อเมื่อกลายเป็นข้อความแล้วเท่านั้น การประชุม การโทรศัพท์ บันทึกเสียงสั้นๆ การสัมภาษณ์แขกรับเชิญคนเดียว — ไม่ว่าแหล่งที่มาจะเป็นอะไร ปัญหาก็เหมือนกันเสมอ: คุณต้องการคำที่ค้นหาได้ อ้างอิงได้ และส่งต่อให้คนที่ไม่ได้อยู่ในห้องนั้น คู่มือนี้ครอบคลุมการบันทึกทั่วไป ตั้งแต่ไม่กี่นาทีไปจนถึงสองสามชั่วโมง ตั้งแต่การเลือกวิธีไปจนถึงการส่งออกที่เสร็จสมบูรณ์ สำหรับการบันทึกที่ยาวเกินสองชั่วโมง ดูวิธีถอดเสียงการบันทึกที่มีความยาว สำหรับหลายไฟล์พร้อมกัน ดูการถอดความโฟลเดอร์การบันทึก
ถอดเสียงด้วยตนเอง อัตโนมัติ หรือแบบผสม
มีสามวิธีในการเปลี่ยนเสียงให้เป็นข้อความ และคนส่วนใหญ่มักใช้มากกว่าหนึ่งวิธีขึ้นอยู่กับการบันทึกแต่ละครั้ง
การถอดเสียงด้วยตนเอง หมายถึงการฟังและพิมพ์ทุกคำด้วยตัวเอง คุณควบคุมได้เต็มที่และไม่มีบุคคลที่สามเข้ามาเกี่ยวข้อง แต่ช้า: การฟังเสียงที่ชัดเจนหนึ่งชั่วโมงอย่างละเอียดอาจใช้เวลาหลายชั่วโมงเมื่อรวมการเล่นซ้ำ การพิมพ์ใหม่ และการพิสูจน์อักษร เหมาะกับคลิปสั้นๆ การบันทึกในภาษาที่เครื่องมืออัตโนมัติของคุณทำงานได้ไม่ดี หรือเนื้อหาที่คุณไม่สามารถปล่อยให้หลุดจากมือได้จริงๆ
การรู้จำเสียงพูดอัตโนมัติ ทำงานแบบเดียวกันแต่ใช้เวลาเป็นนาทีแทนที่จะเป็นชั่วโมง โมเดลจะฟังคลื่นเสียง คาดเดาคำที่น่าจะเป็นไปได้มากที่สุด แล้วส่งคืนร่างที่มีเครื่องหมายวรรคตอนและป้ายกำกับผู้พูดพร้อมแล้ว ร่างนี้ไม่สมบูรณ์แบบ แต่สำหรับการบันทึกทั่วไปส่วนใหญ่ก็ใกล้เคียงพอที่การอ่านตรวจทานเบาๆ จะจับส่วนที่เหลือได้
การถอดเสียงแบบผสม คือร่างอัตโนมัติบวกกับการตรวจทานของคุณเอง งานถอดเสียงที่ทำเป็นประจำส่วนใหญ่ลงเอยแบบนี้: โมเดลจัดการงานพิมพ์ส่วนใหญ่ ส่วนคุณจัดการชื่อ ศัพท์เฉพาะ และจุดที่ฟังผิด ค่าใช้จ่ายเป็นเพียงเศษเสี้ยวของงานด้วยตนเอง และได้ผลลัพธ์ที่สะอาดกว่าร่างอัตโนมัติที่ไม่ผ่านการตรวจทาน
วิธีไหนเหมาะสมขึ้นอยู่กับสิ่งที่จะเกิดขึ้นกับข้อความถอดเสียงในภายหลังมากกว่าความยาวของการบันทึก คำพูดอ้างอิงสำหรับบทความต้องตรวจสอบถ้อยคำที่แน่นอนกับเสียงไม่ว่าจะใช้วิธีใด ส่วนบันทึกการประชุมคร่าวๆ ไว้อ้างอิงเองแทบไม่จำเป็นต้องตรวจทานเลย
สิ่งที่กำหนดความแม่นยำจริงๆ
ปัจจัยที่ใหญ่ที่สุดเพียงอย่างเดียวที่กำหนดความแม่นยำของการถอดเสียงคือตัวการบันทึกเอง ไม่ใช่ซอฟต์แวร์ที่อ่านมัน เสียงที่ชัดเจน บันทึกใกล้ไมโครโฟน มีคนพูดทีละคน จะได้ร่างที่สะอาดจากระบบอัตโนมัติแทบทุกระบบ ส่วนการบันทึกข้ามห้อง ผ่านสายโทรศัพท์ที่แย่ หรือมีคนพูดทับกันสามคน จะเกิดข้อผิดพลาดไม่ว่าเครื่องมือใดจะอ่านมันก็ตาม คำแนะนำของ W3C เกี่ยวกับการสร้างข้อความถอดเสียงที่แม่นยำ ก็ชี้ประเด็นเดียวกันจากมุมของการเข้าถึงได้: ข้อความถอดเสียงทำหน้าที่แทนเสียง ดังนั้นความแม่นยำของมันจึงต้องยืนได้ด้วยตัวเอง โดยไม่ขึ้นกับว่าการบันทึกต้นฉบับฟังดูดีแค่ไหนสำหรับคนที่อยู่ในห้องนั้น
สิ่งที่คุณควบคุมได้ก่อนอัปโหลดสำคัญกว่าการตั้งค่าใดๆ ในภายหลัง:
- บันทึกใกล้ผู้พูด ไม่ใช่ข้ามห้อง
- หลีกเลี่ยงการใช้ไมโครโฟนสองตัวจับบทสนทนาเดียวกัน เพราะจะเพิ่มเสียงรบกวนในห้องเป็นสองเท่าโดยไม่ได้สัญญาณเพิ่มขึ้น
- หากไฟล์ให้คุณเลือกได้ ให้เลือกบิตเรตสูงกว่าไฟล์ขนาดเล็ก สิ่งแปลกปลอมจากการบีบอัดจะรบกวนโมเดลถอดเสียงเหมือนกับที่สัญญาณรบกวนรบกวนหูมนุษย์
งานวิจัยล่าสุดเกี่ยวกับการรู้จำเสียงพูดอัตโนมัติ รวมถึงงานสำรวจปี 2024 เกี่ยวกับแนวทางการเรียนรู้เชิงลึกสำหรับ ASR ติดตามว่าความแม่นยำในเสียงที่ชัดเจนพัฒนาไปไกลแค่ไหน และยังคงขึ้นอยู่กับข้อมูลฝึกฝนสำหรับสำเนียง สาขา หรือลักษณะเสียงรบกวนแบบใดแบบหนึ่งมากเพียงใด ไม่มีระบบใดอ่านการบันทึกทุกแบบได้ดีเท่ากันหมด ดังนั้นการทดสอบกับเสียงของคุณเองก่อนที่จะเชื่อผลลัพธ์ในเรื่องที่สำคัญยังคงเป็นนิสัยที่ปลอดภัยกว่า
ถอดเสียงการบันทึกทีละขั้นตอน
- อัปโหลดไฟล์ วางการบันทึกลงบนเสียงเป็นข้อความ รูปแบบเสียงและวิดีโอทั่วไปได้รับการยอมรับโดยตรง หากเป็นวิดีโอ เสียงจะถูกดึงออกในเบราว์เซอร์ของคุณก่อนที่จะมีการอัปโหลดสิ่งใด
- ตรวจสอบตัวอย่าง ไม่กี่นาทีแรกจะถูกถอดเสียงกลับมาให้ก่อนที่คุณจะลงชื่อเข้าใช้ พร้อมป้ายกำกับผู้พูด เพื่อให้คุณตัดสินได้ว่าเสียงชัดเจนพอหรือไม่ และการแยกผู้พูดสมเหตุสมผลหรือไม่
- ลงชื่อเข้าใช้แล้วปล่อยให้ทำงาน ไฟล์ทั้งหมดจะถูกอัปโหลดและงานจะเสร็จสิ้นด้วยตัวเอง คุณไม่จำเป็นต้องเปิดแท็บค้างไว้
- เปลี่ยนชื่อผู้พูด ป้ายกำกับทั่วไปอย่างผู้พูด A จะกลายเป็นชื่อจริงด้วยการแก้ไขเพียงครั้งเดียว และมีผลทั่วทั้งข้อความถอดเสียง
- อ่านเทียบกับเสียงในส่วนที่สำคัญ ตรวจดูชื่อ ตัวเลข และศัพท์เทคนิค ซึ่งเป็นจุดที่โมเดลมีแนวโน้มเดาผิดมากที่สุด
- ส่งออก เลือกรูปแบบที่ขั้นตอนถัดไปต้องการ ไม่ใช่แค่รูปแบบที่โหลดมาก่อน
ป้ายกำกับผู้พูด หากมีมากกว่าหนึ่งคนพูด
การบันทึกใดก็ตามที่มีมากกว่าหนึ่งเสียงต้องแยกผู้พูดก่อนที่ข้อความถอดเสียงจะอ่านได้จริง กำแพงข้อความทึบๆ ที่ไม่มีการแบ่งผู้พูดแทบไม่มีประโยชน์ไปกว่าตัวเสียงเอง การระบุผู้พูด จะแยกบทสนทนาตามเสียง และให้คุณเปลี่ยนชื่อป้ายกำกับทั่วไปได้เพียงครั้งเดียว โดยการเปลี่ยนแปลงจะมีผลทุกที่ที่ผู้พูดคนนั้นปรากฏ วิธีนี้ทำงานได้ดีกว่าเมื่อแต่ละคนมีเสียงต่างกันพอสมควรและไม่ขัดจังหวะกันตลอดเวลา สองเสียงที่คล้ายกันพูดทับกันยังคงเป็นกรณีที่ทำให้ทุกระบบสะดุด ไม่ใช่แค่ระบบอัตโนมัติเท่านั้น
เลือกรูปแบบส่งออกตามขั้นตอนถัดไป
รูปแบบส่งออกที่เหมาะสมขึ้นอยู่กับว่าข้อความจะถูกนำไปใช้ที่ไหน ไม่ใช่รูปแบบไหนดูครบถ้วนที่สุด:
- ข้อความธรรมดา สำหรับวางลงในเอกสารอื่นหรือป้อนให้เครื่องมือสรุปเนื้อหา
- SRT หรือ VTT หากคุณกำลังใส่คำบรรยายให้วิดีโอและต้องการการประทับเวลาที่เครื่องเล่นอ่านได้
- DOCX สำหรับแชร์กับคนที่ต้องการแสดงความคิดเห็นหรือแก้ไข
- JSON หากคุณจะนำข้อความถอดเสียงพร้อมข้อมูลผู้พูดและเวลาที่ครบถ้วนไปป้อนเข้าเครื่องมือของคุณเอง
การส่งออกมากกว่าหนึ่งรูปแบบจากงานเดียวกันไม่มีค่าใช้จ่ายเพิ่มเติม จึงไม่มีเหตุผลที่ต้องเดารูปแบบที่ถูกต้องเพียงรูปแบบเดียวล่วงหน้า ในเมื่อคุณสามารถเลือกสองหรือสามรูปแบบที่คุณจะใช้จริงได้
ความเป็นส่วนตัว หากไม่ควรเก็บการบันทึกไว้
ไม่ใช่ทุกการบันทึกที่ควรอยู่ในคลังถาวร การโทรลับ การสัมภาษณ์ที่ละเอียดอ่อน บันทึกเสียงครั้งเดียวที่คุณต้องการถอดเสียงแล้วให้หายไป: สิ่งเหล่านี้ต้องการการตั้งค่าที่ต่างจากงานประจำวันของคุณ การถอดเสียงแบบส่วนตัว จะข้ามการบันทึกสิ่งใดๆ ลงในบัญชีของคุณ ผลลัพธ์จะกลับมาเป็นไฟล์ดาวน์โหลดที่มีรหัสผ่านป้องกันและจะหมดอายุหากคุณไม่เคยเปิดมัน แทนที่จะค้างอยู่ในประวัติของคุณตลอดไป
สำหรับสิ่งที่คุณไม่แน่ใจ ค่าเริ่มต้นที่ปลอดภัยกว่าคือโหมดส่วนตัว คุณเลือกเก็บข้อความถอดเสียงครั้งถัดไปได้เสมอ แต่คุณย้อนกลับไปเลิกบันทึกอันนี้ไม่ได้
การบันทึกทั่วไปมีค่าใช้จ่ายเท่าไร
ค่าใช้จ่ายขึ้นอยู่กับจำนวนนาทีของเสียง ไม่ใช่ตัวไฟล์ รูปแบบ หรือจำนวนผู้พูด การโทรศัพท์ 45 นาทีและบันทึกเสียง 45 นาทีมีค่าใช้จ่ายในการถอดเสียงเท่ากัน เทียบกับแพ็ก 5 ชม. (300 นาที) ราคา $5.99 การบันทึก 45 นาทีจะใช้ไปประมาณ 45 นาทีจากยอดคงเหลือนั้น ซึ่งเป็นเพียงเศษเสี้ยวเล็กๆ ของแพ็ก ส่วนที่เหลือยังใช้ได้กับการบันทึกครั้งถัดไป ไม่มีการสมัครสมาชิกทำงานอยู่ไม่ว่าคุณจะใช้งานหรือไม่ก็ตาม ดูการถอดเสียงแบบจ่ายตามการใช้งาน ว่าแพ็กขยายขนาดต่อจากนั้นอย่างไร
การเปลี่ยนการบันทึกเดียวให้เป็นข้อความเป็นการตัดสินใจที่เล็กกว่าที่เห็น: เลือกวิธีด้วยตนเอง อัตโนมัติ หรือแบบผสมตามสิ่งที่ข้อความถอดเสียงต้องรองรับ ป้อนเสียงที่ชัดเจนให้โมเดลหากคุณควบคุมการบันทึกได้บ้าง และตรวจสอบผลลัพธ์เทียบกับส่วนที่สำคัญจริงๆ สำหรับกรณีความยาวหรือปริมาณที่คู่มือนี้ไม่ได้ครอบคลุม วิธีถอดเสียงการบันทึกที่มีความยาว และการถอดความโฟลเดอร์การบันทึก ครอบคลุมเรื่องเหล่านั้นโดยละเอียดมากกว่า
แหล่งข้อมูลและมาตรฐานอิสระ
Hushscript อ้างอิงแหล่งข้อมูลอิสระที่ไม่ใช่คู่แข่งเหล่านี้เพื่ออธิบายงานวิจัย มาตรฐาน หรือการทำงานของแพลตฟอร์ม โดยไม่ได้หมายความว่าแหล่งข้อมูลดังกล่าวรับรอง Hushscript
วันที่ตรวจสอบแหล่งข้อมูล: