วิธีแปลงวิดีโอ MP4 เป็นข้อความแบบส่วนตัว
ผู้เขียน: Hushscript เผยแพร่: ตรวจสอบล่าสุด:
เวิร์กโฟลว์วิดีโอที่อัปโหลดเป็นอันดับแรกอาจส่ง MP4 ทั้งหมด แม้ว่าการรู้จำเสียงต้องการเพียงแทร็กเสียงก็ตาม ขึ้นอยู่กับความละเอียด ตัวแปลงสัญญาณ และบิตเรต การบันทึกแบบยาวอาจมีขนาดได้หลายกิกะไบต์ Hushscript หลีกเลี่ยงการถ่ายโอนดังกล่าว: เบราว์เซอร์จะเตรียมเสียงก่อน และวิดีโอต้นฉบับจะยังคงอยู่ในอุปกรณ์ของคุณ
Hushscript ใช้เส้นทางอื่น เบราเซอร์ของคุณจะแยกเสียงออกจากวิดีโอก่อนที่การอัพโหลดจะเริ่มต้น ดังนั้น MP4 ต้นฉบับจะยังคงอยู่ในอุปกรณ์ของคุณ ถอดเสียงเฉพาะเสียงเท่านั้น และจะถูกลบทันทีที่ข้อความถอดเสียงของคุณพร้อม คู่มือนี้จะอธิบายกระบวนการทั้งหมด: ขั้นตอน ตัวอย่างข้างต้นในการสัมมนาผ่านเว็บที่บันทึกไว้ วิธีดึงคำบรรยาย SRT รูปแบบวิดีโออื่นๆ ที่ทำงานในลักษณะเดียวกัน และสิ่งที่ควรทำเมื่อมีสิ่งผิดปกติเกิดขึ้น
เหตุใดวิดีโอของคุณจึงไม่ควรอัปโหลด
แทร็กวิดีโอไม่เกี่ยวข้องกับการถอดเสียง โปรแกรมเสียงพูดต้องการเพียงเสียงเท่านั้น การอัพโหลดรูปภาพถือเป็นการสิ้นเปลืองเปล่าๆ: เวลาเครือข่าย พื้นที่เก็บข้อมูลเซิร์ฟเวอร์ และความเป็นส่วนตัวที่คุณไม่ต้องการ
วิธีการทำงานของการแยกข้อมูลในเบราว์เซอร์ แบบเข้าใจง่าย
MP4 คือคอนเทนเนอร์ ภายในมีสตรีมแยกกัน ได้แก่ วิดีโอ (ภาพ) เสียง (เสียง) และข้อมูลเมตาบางส่วน ซึ่งเป็นโครงสร้างที่อธิบายไว้ในคู่มือการประมวลผลวิดีโอของ MDN การถอดเสียงต้องการเพียงสตรีมเสียงเท่านั้น
Hushscript เรียกใช้ชุดเครื่องมือสื่อแบบเนทีฟของเบราว์เซอร์ขนาดเล็กบนหน้าเว็บ เมื่อคุณวาง MP4 ชุดเครื่องมือนั้นจะเปิดคอนเทนเนอร์ในเครื่อง คัดลอกสตรีมเสียงออก และส่งมอบเสียงนั้นไปยังการอัปโหลด โดยที่เพจไม่เคยส่งวิดีโอไปที่ใดเลย งานจะเกิดขึ้นในที่เดียวกับที่เล่นวิดีโอ: บนเครื่องของคุณเอง
ดังนั้นผลลัพธ์ในทางปฏิบัติคือ:
- ไฟล์ MP4 จะไม่ออกไปจากอุปกรณ์ของคุณ รูปภาพจะคงอยู่กับคุณ
- ขนาดที่อัปโหลดคือขนาดของเสียง ไม่ใช่ขนาดวิดีโอ ซึ่งโดยปกติจะเล็กกว่า 10–20 เท่า
- เซิร์ฟเวอร์และโปรแกรมเสียงพูดที่อยู่ด้านหลังจะไม่สามารถเข้าถึงเนื้อหาวิดีโอของคุณได้
สิ่งนี้มีความสำคัญสำหรับการประชุม การสัมภาษณ์ที่บันทึกไว้ การสืบพยานทางกฎหมาย และอะไรก็ตามที่วิดีโอมีความละเอียดอ่อน นอกจากนี้ ยังสำคัญเมื่อคุณใช้การเชื่อมต่อที่ช้าด้วยไฟล์หลายกิกะไบต์: การแยกเสียงก่อนจะเปลี่ยนการอัปโหลดครึ่งชั่วโมงเป็นสองสามนาที
สิ่งที่คุณต้องการ
สามสิ่งและไม่มีอะไรจะติดตั้ง:
- MP4 พร้อมเสียงพูด การประชุมที่บันทึกไว้ การสัมมนาผ่านเว็บ การสัมภาษณ์ การบรรยาย หรือหัวพูด วิดีโอ: อะไรก็ตามที่ผู้คนกำลังพูด คลิปเงียบหรือวิดีโอที่มีแต่เพลงไม่มีอะไรจะถอดเสียง
- เบราว์เซอร์ปัจจุบัน Chrome, Edge, Firefox หรือ Safari มีการอัปเดตพอสมควร การแยกเสียงทำงานในเบราว์เซอร์ ดังนั้นเบราว์เซอร์รุ่นเก่าหรือแบบลดทอนลงอาจไม่รองรับ
- บัญชี Hushscript คุณจะได้รับ 30 นาทีฟรีหลังจากตรวจสอบบัตร $1 (การกันเงินได้รับการอนุมัติ จากนั้นจึงปล่อยทันที ไม่มีการเรียกเก็บเงิน) หรือกับการซื้อครั้งแรกของคุณหากคุณใช้วิธีการชำระเงินอื่นที่ใช้ได้ในประเทศของคุณ ไม่จำเป็นต้องมีบัตร มันเป็นเพียงเส้นทางที่เร็วที่สุดในการนาทีฟรี หลังจากนั้นจะจ่ายตามการใช้งานจริงโดยไม่ต้องสมัครสมาชิก ค่าใช้จ่ายอยู่ที่หน้าราคา
คุณไม่จำเป็นต้องมีโปรแกรมแยกเสียง ตัวแปลง หรือซอฟต์แวร์วิดีโอใดๆ แยกต่างหาก การวาง MP4 ถือเป็นอินพุตทั้งหมด
แปลง MP4 ในสามขั้นตอน
- วาง MP4 ของคุณลงบนหน้าที่ /MP4-to-text เบราว์เซอร์ของคุณจะแยกแทร็กเสียงและอัปโหลดเฉพาะเสียง ดังนั้นวิดีโอจึงยังคงอยู่ในอุปกรณ์ของคุณ 30 วินาทีแรกกลับมาเป็นการแสดงตัวอย่างที่มีป้ายกำกับผู้บรรยาย ไม่จำเป็นต้องใช้บัญชี
- ลงทะเบียนเพื่อถอดเสียงส่วนที่เหลือ ป้อนอีเมลของคุณเพื่อสร้างบัญชี ใหม่ที่นี่? เราจะฟรี 30 นาทีแรกเมื่อคุณยืนยันวิธีการชำระเงิน ไม่ว่าจะเป็นการระงับบัตรมูลค่า 1 ดอลลาร์ (ได้รับอนุญาต จากนั้นจึงปล่อยทันที ไม่มีการเรียกเก็บเงิน) หรือแพ็คนาทีแรกของคุณหากคุณชำระเงินด้วยวิธีอื่น ไม่จำเป็นต้องมีบัตร การถอดเสียงจะเรียกเก็บเงินตามระยะเวลาของเสียง ไม่ใช่ขนาดไฟล์
- ส่งออกการถอดเสียง เมื่อพร้อมแล้ว ให้ดาวน์โหลดในรูปแบบใดก็ได้จาก 21 รูปแบบ (TXT, SRT และ VTT สำหรับคำบรรยาย, DOCX และ PDF สำหรับเอกสาร, JSON และ CSV สำหรับข้อมูล และอื่นๆ) พร้อมด้วย .husharchive ที่ป้องกันด้วยรหัสผ่าน รวมป้ายกำกับผู้พูดฟรี
การลบเสียงจะเกิดขึ้นโดยอัตโนมัติเมื่อมีการส่งการถอดเสียง ไม่มีขั้นตอนการล้างข้อมูลที่ต้องจำ
คำว่า “เรียกเก็บเงินตามระยะเวลาเสียง” หมายความว่าอย่างไร
MP4 หนึ่งชั่วโมงที่ 1080p อาจเป็น 6 GB เสียงที่แยกออกมา (โดยทั่วไปคือ AAC ที่ 128–256 kbps) จะอยู่ที่ประมาณ 60–120 MB นั่นคือสิ่งที่อัปโหลด และค่าใช้จ่ายนาทีจะขึ้นอยู่กับเสียงหนึ่งชั่วโมง ไม่ใช่ไฟล์ 6 GB
ผลลัพธ์สูงสุด: คุณสามารถถอดเสียงสารคดี 4K ความยาว 2 ชั่วโมงจากเครื่องบันทึกภาคสนามและเสียค่าใช้จ่ายในนาทีเดียวกับ MP3 ขนาดเล็ก เนื่องจากทั้งสองมีปริมาณเสียงเท่ากัน ความละเอียด บิตเรต และขนาดไฟล์ไม่เกี่ยวข้องโดยสิ้นเชิงกับสิ่งที่คุณถูกเรียกเก็บเงิน
ตัวอย่างข้างต้น: การสัมมนาผ่านเว็บที่บันทึกไว้
สมมติว่าคุณจัดการสัมมนาผ่านเว็บความยาว 52 นาทีโดยมีผู้นำเสนอสองคนและบันทึกเป็น MP4 เดียว:q3-product-webinar.mp4 ประมาณ 3.4 GB ที่ 1080p คุณต้องการสำเนาอีเมลที่สะอาดตาสำหรับอีเมลสรุป พร้อมแนบคำบรรยายไปกับการเล่นซ้ำ
นี่คือลักษณะที่ปรากฏจริง:
- คุณเปิด /MP4-to-text แล้ววาง
q3-product-webinar.mp4หน้านี้แยกเสียงในเครื่อง เพื่อให้วิดีโอขนาด 3.4 GB กลายเป็นเสียงประมาณ 70 MB เฉพาะการอัปโหลดขนาด 70 MB เท่านั้น - 30 วินาทีแรกกลับมาโดยมีป้ายกำกับ เพื่อให้คุณสามารถตรวจสอบคุณภาพเสียงก่อนที่จะถอดเสียงเต็ม 52 นาที
- เมื่อข้อความถอดเสียงฉบับเต็มพร้อมแล้ว จะแบ่งออกเป็นคำพูดที่ติดแท็ก
ผู้พูด Aหรือผู้พูด Bคุณคลิกผู้พูด Aพิมพ์ “Priya” คลิกผู้พูด Bพิมพ์ “Marcus” และติดป้ายกำกับใหม่ทุกที่พร้อมกัน - คุณส่งออก TXT สำหรับอีเมลสรุป และ SRT สำหรับแทร็กคำบรรยายของการเล่นซ้ำ MP4 ดั้งเดิมของการสัมมนาผ่านเว็บไม่เคยหายไปจากแล็ปท็อปของคุณ และเสียงก็ถูกลบออกจากเซิร์ฟเวอร์แล้ว
ส่วนที่สร้างความประหลาดใจให้กับผู้คนในครั้งแรกคือขั้นตอนที่ 1: การอัปโหลดหลายกิกะไบต์ซึ่งไม่เกิดขึ้นเลย รูปภาพจะอยู่กับคุณ เฉพาะคำที่เดินทางเท่านั้น
ป้ายกำกับผู้พูดสำหรับวิดีโอที่มีผู้เล่นหลายคน
ทุกข้อความถอดเสียงประกอบด้วยการแยกเสียงของผู้พูดอัตโนมัติโดยไม่มีค่าใช้จ่ายเพิ่มเติม สำหรับการสัมภาษณ์ การอภิปราย หรือการบันทึกการประชุม ผู้พูดแต่ละคนจะมีป้ายกำกับ ผู้พูด A,ผู้พูด B และอื่นๆ และคุณสามารถเปลี่ยนชื่อเป็นชื่อจริงในตัวแก้ไขได้โดยการคลิกที่ป้ายกำกับแล้วพิมพ์
การแยกส่วนจะทำงานได้ดีที่สุดโดยมีการแบ่งแยกที่ชัดเจน เสียงของกล้องในห้องที่เงียบสงบหรือการสนทนาทางวิดีโอที่บันทึกพร้อมแทร็กของผู้เข้าร่วมแต่ละคน ช่วยให้ระบบทำงานได้ดีที่สุด ห้องที่มีผู้คนหนาแน่นและมีคนพูดคุยกันเป็นเรื่องยากสำหรับเครื่องมือสร้างคำวิพากษ์วิจารณ์ ดูส่วนการแก้ปัญหาด้านล่างสำหรับสิ่งที่ช่วยได้
รับคำบรรยาย (SRT / VTT) จากวิดีโอ
หากเหตุผลที่คุณถอดความวิดีโอคือคำบรรยาย ให้ส่งออกการถอดเสียงเป็น SRT ทุกคำพูดมาพร้อมกับการประทับเวลาเริ่มต้นและสิ้นสุด ซึ่งจัดรูปแบบตามข้อกำหนดของ SRT:
1
00:00:04,210 --> 00:00:07,880
ผู้พูด A: ขอขอบคุณที่เข้าร่วมกับเราในวันนี้
2
00:00:08,100 --> 00:00:12,340
ผู้พูด B: ยินดีที่ได้อยู่ที่นี่
โหลด SRT ลงในเครื่องเล่นบนเดสก์ท็อป (VLC, QuickTime และโปรแกรมแก้ไขส่วนใหญ่ยอมรับ) หรืออัปโหลดเป็นแทร็กคำบรรยายบนแพลตฟอร์ม ที่รองรับสิ่งหนึ่ง การส่งออก Hushscript SRT จะเก็บป้ายกำกับผู้พูดไว้ ซึ่งมีประโยชน์สำหรับวิดีโอแบบหลายคน รูปแบบคำอธิบายภาพบางรูปแบบจะตัดชื่อออก SRT จะเก็บรักษาไว้
สำหรับผู้เล่นเว็บที่ใช้ WebVTT (.vtt) ความแตกต่างจาก SRT นั้นน้อยมาก นั่นคือ WEBVTT บรรทัดส่วนหัวและ . แทนที่จะเป็น , ในการประทับเวลา คุณสามารถแปลง SRT เป็น VTT ในเบราว์เซอร์ด้วยเครื่องมือฟรีที่ /tools/SRT-to-VTT; การแปลงจะทำงานภายในเพจ
คำแนะนำสองพี่น้องเจาะลึกเกินกว่าที่จะมีได้ที่นี่: วิธีสร้างคำบรรยาย SRT จากวิดีโอ ครอบคลุมการแก้ไขจังหวะคิวและความยาวบรรทัด และ วิธีเพิ่มคำบรรยายลงในวิดีโอ ครอบคลุมถึงการแนบ SRT หรือการเบิร์นคำบรรยาย การเบิร์นคำบรรยายลงในรูปภาพอย่างถาวร เป็นขั้นตอนการเข้ารหัสแยกต่างหาก เครื่องมือฟรีอย่าง HandBrake จะจัดการ mux เมื่อคุณมี SRT แล้ว
รูปแบบวิดีโออื่นๆ (MOV, WebM, MKV)
กระบวนการแยกเบราว์เซอร์เดียวกันนี้ใช้ได้ดีกว่า MP4:
- MOV: การส่งออกวิดีโอ iPhone และ Final Cut
- WebM: การบันทึกหน้าจอจาก Chrome และการจับภาพ OBS
- MKV: คอนเทนเนอร์ทั่วไปสำหรับเครื่องบันทึกหน้าจอและเนื้อหาที่ริปด้วยแทร็กเสียงมาตรฐาน
คอนเทนเนอร์เหล่านี้มีตัวแปลงสัญญาณเสียงตามปกติ (AAC, MP3, Opus, FLAC) และขั้นตอนการแยก แยกพวกมันออกในลักษณะเดียวกับที่ทำกับ MP4 ในทางปฏิบัติ ทุกสิ่งที่บันทึกไว้ในโทรศัพท์ กล้องถ่ายรูป หรือเครื่องบันทึกหน้าจอจะใช้งานได้ เพียงวางมันลงไป
คุณยังสามารถป้อนไฟล์เสียงอย่างเดียว เช่น MP3, WAV, M4A ได้โดยตรง เมื่อไม่มีสตรีมวิดีโอให้ตัด ขั้นตอนการแตกไฟล์จะถูกข้ามไป และไฟล์จะอัปโหลดตามที่เป็นอยู่ และหากคุณต้องการเพียงไฟล์เสียงแทนที่จะเป็นการถอดเสียง การแปลง MP4 เป็น MP3 เป็นงานแยกต่างหากที่ทำงานทั้งหมดในเบราว์เซอร์ของคุณด้วย หน้าวิดีโอเป็นข้อความครอบคลุมขั้นตอนการทำงานทั้งหมดสำหรับรูปแบบวิดีโอใดๆ รวมถึงรูปแบบที่มีตัวแปลงรหัสเสียงที่ผิดปกติ
การแก้ปัญหา
ไฟล์ MP4 ทั่วไปมักไม่จำเป็นต้องเตรียมการด้วยตนเอง หากล้มเหลวหรือแสดงข้อความที่ไม่ชัดเจน ให้ตรวจสอบสาเหตุเหล่านี้ก่อน
วิดีโอต้นฉบับมีขนาดใหญ่มาก แอปไม่มีการจำกัดขนาดไฟล์ – โดยจะเตรียมเสียงจากวิดีโอขนาดใหญ่มากในเบราว์เซอร์ของคุณโดยตรง ตราบใดที่การบันทึกอยู่ภายใน 10 ชั่วโมง (เบราว์เซอร์ของคุณยังต้องการความจุในเครื่องเพียงพอที่จะทำงาน) หากการแตกไฟล์ค้างในไฟล์ 4K ขนาดใหญ่ ให้ปิดแท็บอื่นแล้วลองอีกครั้ง หรือแตกไฟล์เสียงก่อน extract-audio tools ฟรีทำงานในเบราว์เซอร์และสร้างไฟล์ขนาดเล็กที่คุณสามารถอัปโหลดได้โดยตรง
ไม่มีแทร็กเสียงหรือไม่มีเสียงพูด การบันทึกหน้าจอแบบไม่มีเสียงหรือคลิปเพลงเท่านั้นไม่มีอะไรให้กลไกถอดความ ดังนั้นคุณจะได้รับผลลัพธ์ที่ว่างเปล่า ยืนยันว่าวิดีโอมีเสียงพูดจริง ๆ โดยการเล่นโดยเพิ่มระดับเสียง หากเป็นการบันทึกหน้าจอ ให้ตรวจสอบว่าเครื่องบันทึกได้รับการตั้งค่าให้จับภาพระบบหรือเสียงไมโครโฟน ค่าเริ่มต้นหลายรายการเป็นค่าเริ่มต้นสำหรับวิดีโอเท่านั้น
ตัวแปลงสัญญาณเสียงที่ไม่รองรับหรือคลุมเครือ ตัวแยกสัญญาณในเบราว์เซอร์จะจัดการกับตัวแปลงสัญญาณทั่วไป (AAC, MP3, Opus, FLAC) คอนเทนเนอร์ที่ใช้ตัวแปลงสัญญาณเสียงที่ผิดปกติหรือเป็นกรรมสิทธิ์อาจไม่ดีลักซ์อย่างหมดจด และเสียงจะไม่แยกออกมา การแก้ไขคือการรีมิวซ์หรือเข้ารหัสเสียงของวิดีโอใหม่เป็นตัวแปลงสัญญาณมาตรฐานก่อน ตัวแปลงส่วนใหญ่สามารถส่งออกไฟล์ MP4 มาตรฐานหรือไฟล์เสียงธรรมดาได้ หากคุณพบรูปแบบที่ไม่ผ่าน โปรดส่งอีเมลถึง support@hushscript.com แล้วเราจะพิจารณาเพิ่มให้
ผู้พูดหลายคน การแยกกันยุ่งเหยิง การถอดเสียงจำเป็นต้องมีเสียงที่แตกต่าง คำพูดที่ทับซ้อนกัน ไมโครโฟนระยะไกลเพียงตัวเดียวในห้องขนาดใหญ่ หรือเสียงรบกวนพื้นหลังที่หนักหน่วง ล้วนทำให้ขอบเขตระหว่างผู้พูดพร่ามัว คุณจะยังคงได้รับบทถอดเสียงที่ถูกต้อง ป้ายกำกับของผู้พูดมีความแม่นยำน้อยกว่า หากคุณควบคุมการบันทึก แทร็กต่อผู้เข้าร่วม (เนื่องจากเครื่องมือแฮงเอาท์วิดีโอส่วนใหญ่สามารถส่งออกได้) หรือไมโครโฟนที่อยู่ใกล้ผู้พูดแต่ละตัวมากขึ้นจะช่วยให้แยกเสียงได้ชัดเจนที่สุด ไม่ว่าจะด้วยวิธีใด คุณสามารถแก้ไขบรรทัดที่ติดป้ายกำกับผิดในโปรแกรมแก้ไขก่อนส่งออกได้
บทถอดเสียงมีการสะกดผิดสม่ำเสมอ คำนามเฉพาะหรือศัพท์แสงที่เกิดซ้ำซึ่งถอดความด้วยวิธีที่ผิดเหมือนกันเสมอคือการแก้ไขเพียงครั้งเดียว: การค้นหาและแทนที่เพียงครั้งเดียวในข้อความที่ส่งออกจะแก้ไขทุกกรณี ซึ่งเร็วกว่าการรันใหม่ทั้งหมด
ส่งออกรูปแบบได้อย่างรวดเร็ว
| รูปแบบ | สิ่งที่คุณได้รับ |
|---|---|
| TXT | ข้อความธรรมดา ป้ายกำกับผู้พูด ไม่มีการประทับเวลา |
| SRT | คำบรรยายแบบประทับเวลา พร้อมที่จะไซด์โหลดลงในโปรแกรมเล่นวิดีโอ |
| VTT | คำบรรยายเว็บสำหรับโปรแกรมเล่นวิดีโอ HTML5 |
| CSV | แถวที่เหมาะกับสเปรดชีตพร้อมผู้พูดและการกำหนดเวลา |
| Markdown | ข้อความที่มีป้ายกำกับผู้พูดสำหรับบันทึกย่อและการเผยแพร่ |
| JSON | ข้อมูลที่มีโครงสร้าง:{ speaker, start, end, text } ต่อคำพูด |
| DOCX | การถอดเสียงที่มีป้ายกำกับผู้พูดสำหรับ Word หรือ Google Docs |
| การถอดเสียงรูปแบบคงที่สำหรับการแชร์หรือการเก็บถาวร |
ทั้งหมด รูปแบบการส่งออกจะรวมอยู่ในทุกแผน รวมถึงการใช้งานฟรี 30 นาที และไม่มีลายน้ำใดๆ
สำหรับวิดีโอใดๆ ที่ความเป็นส่วนตัวมีความสำคัญ ไม่ว่าจะเป็นการประชุม การสัมภาษณ์ หรือการทับถม ประเด็นสำคัญคือ วิดีโอของคุณจะไม่มีการอัปโหลด คุณสามารถตรวจสอบได้ด้วยตัวเอง เปิดแท็บเครือข่ายของเบราว์เซอร์ก่อนที่คุณจะวางไฟล์และดูสิ่งที่ถูกส่งไป คุณจะเห็นเสียงขึ้น และภาพยังคงอยู่
แหล่งข้อมูลและมาตรฐานอิสระ
Hushscript อ้างอิงแหล่งข้อมูลอิสระที่ไม่ใช่คู่แข่งเหล่านี้เพื่ออธิบายงานวิจัย มาตรฐาน หรือการทำงานของแพลตฟอร์ม โดยไม่ได้หมายความว่าแหล่งข้อมูลดังกล่าวรับรอง Hushscript
วันที่ตรวจสอบแหล่งข้อมูล: