ข้ามไปยังเนื้อหาหลัก

วิธีถอดเสียงไฟล์เสียงทุกประเภทเป็นข้อความ

ผู้เขียน: เผยแพร่: ตรวจสอบล่าสุด:

MP3 จากโปรแกรมแก้ไขพอดแคสต์, M4A จาก iPhone ของคุณ, WAV จากเครื่องบันทึกภาคสนาม, CAF ที่คลุมเครือจากแอปบันทึกเสียง: หากต้องการถอดเสียงไฟล์เหล่านี้ คุณทำแบบเดียวกัน วางไฟล์ รับข้อความถอดเสียงโดยแยกผู้พูดออกแล้ว ส่งออกในรูปแบบที่คุณต้องการ คอนเทนเนอร์ที่เสียงเข้ามาไม่เปลี่ยนขั้นตอน

สิ่งที่รูปแบบส่งผลกระทบนั้นอยู่ด้านล่างอีกเล็กน้อย: ไฟล์มีขนาดใหญ่แค่ไหน การถอดเสียงอย่างหมดจด และสิ่งที่ต้องทำในกรณีที่ไฟล์ไม่โหลดซึ่งเกิดขึ้นได้ยาก คู่มือนี้ครอบคลุมถึงรูปแบบเสียงที่ใช้งานได้ วิธีการเดียวที่จัดการได้ทั้งหมด วิธีเลือกรูปแบบที่ดีที่สุดเมื่อคุณมีตัวเลือก และวิธีแก้ไขไฟล์ที่ดูหยาบ

สิ่งที่คุณต้องการ

การแสดงตัวอย่าง 30 วินาทีไม่จำเป็นต้องมีบัญชี คุณสามารถวางไฟล์และดูสไตล์ที่มีป้ายกำกับของผู้พูดได้ก่อนที่จะสมัคร ซึ่งเป็นวิธีที่ตรงไปตรงมาในการตรวจสอบผลลัพธ์ที่พอดีก่อนที่คุณจะกระทำสิ่งใด นอกเหนือจากนาทีฟรีแล้ว การถอดเสียงยังจ่ายตามการใช้งาน: คุณจะซื้อนาทีเมื่อคุณต้องการเท่านั้น โดยไม่ต้องสมัครสมาชิก ค่าใช้จ่ายอยู่ที่หน้าราคา

รูปแบบเสียงใดใช้งานได้

Hushscript ใช้รูปแบบเสียงมาตรฐานทั้งหมด ต่อไปนี้เป็นแหล่งที่มาของแต่ละรายการ เพื่อให้คุณสามารถทราบสิ่งที่คุณมี:

ชื่อไม่ได้เป็นเพียงรูปแบบชื่อไฟล์เท่านั้น รายการทะเบียน IANA Media Types ในปัจจุบันบันทึกประเภทมาตรฐาน เช่น audio/aac,audio/mp4,audio/mpeg,audio/ogg และ audio/opus ซึ่งเป็นเหตุผลว่าทำไมคอนเทนเนอร์และการเข้ารหัสเสียงภายในจึงเป็นคำถามที่แยกกัน

รูปแบบเสียงทั่วไปและที่มาของรูปแบบ
รูปแบบแหล่งที่มาทั่วไป
MP3Podcasts การบันทึกโทรศัพท์ การส่งออกจากแอปการบันทึกส่วนใหญ่
M4A / AACบันทึกเสียงของ iPhone, บันทึกเสียง WhatsApp, ส่งออกของ Apple
WAVเครื่องบันทึกดิจิทัล, ส่งออก DAW, เครื่องบันทึกเสียงของ Windows
FLACการบันทึกที่เก็บถาวร, DAW ส่งออก, ริปแบบไม่สูญเสีย
OGGบันทึกเสียงของ Android, เครื่องมือบันทึกแบบโอเพ่นซอร์ส
AIFF / CAFเสียงของ Mac และ iOS, GarageBand

ไฟล์วิดีโอทำงานในลักษณะเดียวกัน วาง MP4, MOV, WebM หรือ MKV แล้วแทร็กเสียงจะถูกแตกออกมาในเบราว์เซอร์ของคุณก่อนที่จะอัปโหลดสิ่งใดๆ ดังนั้นตัววิดีโอจึงไม่ออกจากอุปกรณ์ของคุณ เฉพาะเสียงที่ส่งถึงเซิร์ฟเวอร์

รายการด้านบนไม่ใช่รั้ว สัญญานี้ง่ายกว่าตารางรูปแบบที่รองรับ: เพียงวางไฟล์ของคุณ ไฟล์ก็จะถูกแปลงและถอดเสียง หากคุณมีบางอย่างที่ผิดปกติอย่างแท้จริง (ไฟล์ AMR จาก Nokia รุ่นเก่า,.3gp จาก Android ที่มีอายุหลายสิบปี, คลิป RealAudio) ให้ลองอัปโหลดมันต่อไป เบราว์เซอร์สามารถอ่านคอนเทนเนอร์มาตรฐานส่วนใหญ่ได้ และหากอ่านไม่ได้ คุณมีทางเลือกสองทาง: แปลงเป็น MP3 หรือ WAV ด้วยเครื่องมือฟรีในเบราว์เซอร์ที่ /tools แล้วอัปโหลดสิ่งนั้น หรือส่งอีเมลไปที่ support@hushscript.com แล้วเราจะเพิ่มรูปแบบดังกล่าว คุณไม่จำเป็นต้องทราบล่วงหน้าว่าไฟล์ของคุณมีคุณสมบัติเหมาะสมหรือไม่

ถอดเสียงไฟล์เสียงในสามขั้นตอน

โฟลว์จะเหมือนกันไม่ว่าคุณจะเริ่มต้นด้วยรูปแบบใดก็ตาม ขั้นตอนแรกเกิดขึ้นก่อนที่คุณจะมีบัญชีเลย

  1. วางไฟล์ของคุณเพื่อดูตัวอย่าง ไปที่ /audio-to-text แล้วลากไฟล์ไปที่ดรอปโซน หรือคลิกเพื่อเรียกดู ถอดเสียง 30 วินาทีแรกในเบราว์เซอร์ที่มีป้ายกำกับผู้พูด โดยไม่ต้องมีบัญชี นี่คือเช็คของคุณว่าผลลัพธ์จะอ่านตามที่คุณต้องการก่อนที่คุณจะสมัครใช้งานใดๆ
  2. ลงทะเบียนเพื่อถอดเสียงส่วนที่เหลือ ป้อนอีเมลของคุณเพื่อสร้างบัญชี ปลดล็อคนาทีฟรี 30 นาทีของคุณเมื่อคุณเพิ่มและตรวจสอบบัตร (การระงับ $1 ที่อธิบายไว้ข้างต้น) หรือเมื่อซื้อครั้งแรกหากคุณชำระเงินด้วยวิธีอื่น โหลดไฟล์เต็มได้จากที่นี่ การบันทึกสามารถทำงานได้นานถึง 10 ชั่วโมง โดยไม่จำกัดขนาดไฟล์ แม้แต่ไฟล์ขนาดใหญ่มากก็ถูกจัดเตรียมไว้ในเบราว์เซอร์ ความปลอดภัยของบริการและการป้องกันงานที่ใช้งานอยู่ก็มีผลเช่นกัน
  3. รับและส่งออกการถอดเสียง โปรแกรมเสียงพูดประมวลผลไฟล์และส่งกลับการถอดเสียงโดยแยกผู้พูดออกแล้ว เปลี่ยนชื่อผู้พูดหากต้องการ จากนั้นดาวน์โหลดในรูปแบบใดก็ได้จากทั้งหมด 21 รูปแบบ (TXT, SRT, DOCX และ PDF รวมถึงรูปแบบคำบรรยายและไทม์ไลน์ของบรรณาธิการ) หรือไฟล์ .husharchive ที่ป้องกันด้วยรหัสผ่าน รวมการส่งออกทุกครั้ง: ไม่มีเพย์วอลล์ ไม่มีลายน้ำ

การประมวลผลจะทำงานในพื้นหลังและปรับขนาดตามความยาวของเสียง (ประมาณสองสามนาทีต่อชั่วโมงในการบันทึก) ดังนั้นคุณจึงไม่ต้องเปิดแท็บทิ้งไว้ในขณะที่ไฟล์ยาว ๆ เสร็จสิ้น

ตัวอย่างข้างต้น: การบันทึกหนึ่งรายการ สองรูปแบบ

สมมติว่าคุณบันทึกการสนทนาความยาว 38 นาที และเครื่องบันทึกของคุณบันทึกไว้สองครั้ง:meeting.wav ด้วยคุณภาพสูงสุด และ meeting.m4a โทรศัพท์ของคุณสร้างขึ้นพร้อมกัน ทั้งสองทำตามขั้นตอนที่เหมือนกันสามขั้นตอน และข้อความถอดเสียงจะกลับมาแบ่งตามจำนวนผู้พูด โดยมีการประทับเวลาในแต่ละ:

[00:00:06] ผู้พูด A: ก่อนที่เราจะเริ่ม ทุกคนได้รับตัวเลขที่ฉันส่งไปแล้วหรือยัง
[00:00:10] ผู้พูด B: ได้รับแล้วเมื่อเช้านี้ หมายเลข Q3 เป็นหมายเลขที่ฉันต้องการ
           เจาะลึก
[00:00:17] ผู้พูด A: ใช่แล้ว นั่นคือบรรทัดที่เคลื่อนไหว ผมขอดึงมันขึ้นมาก่อน
[00:00:21] ผู้พูด C: ในขณะที่คุณทำ – เรากลับมาจ้างงานทีหลังได้ไหม

ทั้งสองไฟล์มีเนื้อหาที่เหมือนกันโดยพื้นฐานแล้ว WAV เป็นการอัปโหลดที่ใหญ่กว่ามากและ M4A เป็นการอัปโหลดขนาดเล็ก แต่คำและป้ายกำกับของผู้พูดจะเชื่อมโยงกันในลักษณะเดียวกัน เพราะทั้งสองมีคำพูดที่แฝงอยู่เหมือนกัน จากจุดนี้ การแก้ไขค่อนข้างง่าย: คุณคลิก ผู้พูด A หนึ่งครั้งเพื่อเปลี่ยนชื่อ และทุกบรรทัดของผู้พูดจะมีการอัปเดต คุณอ่านคำนามเฉพาะจำนวนหนึ่งที่กลไกเดาได้ (นามสกุล ชื่อผลิตภัณฑ์) และแก้ไขด้วยการค้นหาและแทนที่ ซึ่งจะแก้ไขทุกกรณีในการส่งครั้งเดียว

นั่นคือผลสรุปในทางปฏิบัติของวิธีเดียวสำหรับทุกรูปแบบ คุณไม่ได้เก็บเครื่องมืออื่นหรือรายการตรวจสอบทางจิตที่แตกต่างกันสำหรับ WAV กับ M4A กับ MP3 ไม่ว่าเครื่องบันทึก โทรศัพท์ของคุณ หรือการส่งออกของผู้อื่นจะมอบอะไรให้คุณก็ตาม รายการนั้นจะผ่านโซนรับส่งเดียวกันและออกมาเป็นข้อความถอดเสียงประเภทเดียวกัน

การเลือกรูปแบบที่ดีที่สุดเพื่อความถูกต้อง

โดยส่วนใหญ่แล้วคุณจะไม่สามารถเลือกได้ คุณถอดเสียงไฟล์ที่คุณได้รับ และมันก็ไม่เป็นไร แต่ถ้าคุณควบคุมวิธีการบันทึกหรือส่งออกเสียง มีตัวเลือกสองสามตัวที่จะกำหนดเพดานว่าผลลัพธ์จะสะอาดแค่ไหน

คุณภาพการบันทึกต้องมาก่อนด้วยขอบเขตที่กว้าง MP3 128 kbps จากไมโครโฟนปิดที่ดีจะเอาชนะไฟล์ WAV แบบไม่สูญเสียคุณภาพที่บันทึกไว้ทั่วทั้งห้องด้วยไมโครโฟนในตัวของแล็ปท็อปทุกครั้ง ก่อนที่คุณจะคิดถึงรูปแบบ ลองนึกถึงการวางไมค์ไว้ใกล้กับใครก็ตามที่กำลังพูด คอนเทนเนอร์นั้นอยู่ห่างออกไปเพียงไม่กี่วินาที

หลีกเลี่ยง MP3 ที่มีบิตเรตต่ำมาก MP3 สูญเสีย: การเข้ารหัสจะละทิ้งบางส่วนของเสียงเพื่อให้ไฟล์มีขนาดเล็ก และยิ่งบิตเรตต่ำลงเท่าใดไฟล์ก็จะยิ่งหายไปมากขึ้นเท่านั้น การรู้จำเสียงอาศัยรายละเอียดความถี่สูงในพยัญชนะ โดยที่ช่องว่างระหว่าง “สิบห้า” ถึง “สิบหก” หรือ “สามารถ” และ “ทำไม่ได้” การบีบอัดแบบก้าวร้าวจะกินรายละเอียดนั้นก่อน ต่ำกว่าประมาณ 64 kbps ข้อผิดพลาดของคำจะเพิ่มขึ้น ที่ความเร็ว 128 kbps ขึ้นไป คุณจะผ่านจุดที่ตัวเลขมีความสำคัญไปแล้ว บิตเรตที่สูงขึ้นจะไม่ทำให้การถอดเสียงดีขึ้น

Lossless จะลบรูปแบบที่เป็นตัวแปร WAV, FLAC และ AIFF จะส่งเสียงที่ไม่มีการบีบอัดให้กับระบบ สำหรับการบันทึกที่สะอาด ความแม่นยำที่ได้รับจาก MP3 ที่ดีนั้นมีเพียงเล็กน้อย แต่การบีบอัดข้อมูลออกจากตารางโดยสิ้นเชิง คู่มือเสียงดิจิทัลของ MDN อธิบายข้อดีข้อเสียที่สำคัญ นั่นคือ การไม่สูญเสียรายละเอียดจะรักษารายละเอียดในขนาดที่ใหญ่ขึ้น ในขณะที่การเข้ารหัสที่สูญเสียไปสามารถย่อขนาดเสียงได้อีกมากโดยการละทิ้งข้อมูล นั่นเป็นบริบทที่เป็นประโยชน์เมื่อการบันทึกมีค่าและคุณไม่อยากสงสัยในภายหลังว่ารูปแบบนั้นทำให้คุณเสียค่าใช้จ่ายหรือไม่

โมโนก็ใช้ได้ คุณไม่จำเป็นต้องใช้สเตอริโอ กลไกจะผสมเสียงสเตอริโอให้เป็นโมโนภายใน ดังนั้นไฟล์โมโนจึงถอดเสียงได้เช่นกันและอัปโหลดได้เร็วขึ้นด้วยการเชื่อมต่อที่ช้า ข้อแตกต่างประการหนึ่ง: หากการตั้งค่าของคุณบันทึกแต่ละคนในช่องสเตอริโอแยกกัน (“ดับเบิลเอนเดอร์”) การผสมลงในแทร็กโมโนแทร็กเดียวก่อนที่จะอัปโหลดมีแนวโน้มที่จะช่วยป้ายกำกับผู้พูดได้ เนื่องจากระบบจะได้ยินการสนทนาแบบผสมผสานครั้งเดียว แทนที่จะได้ยินสตรีมที่แยกจากกันสองสตรีม

อัตราตัวอย่างที่สูงกว่า 16 kHz ไม่สามารถซื้อเสียงพูดได้ ทุกอย่างตั้งแต่ 16 kHz ถึง 48 kHz ใช้งานได้ และ 48 kHz WAV จากโปรแกรมตัดต่อวิดีโอจะถอดเสียงเหมือนกับไฟล์โมโน 16 kHz จากแอปโทรศัพท์ โดยมีเสียงพูดที่เหมือนกัน โมเดลนี้ได้รับการฝึกฝนเกี่ยวกับเสียง ไม่ใช่ดนตรี ดังนั้นจึงไม่ได้รับความแม่นยำจากอัตราที่สูงกว่า

Lossless vs lossy และเมื่อการแปลงจะช่วยได้

คำถามทั่วไป: การแปลง MP3 ของคุณเป็น WAV จะปรับปรุงความแม่นยำก่อนหรือไม่ มันจะไม่ เมื่อบันทึกเสียงเป็น MP3 128 kbps แล้ว รายละเอียดที่ถูกละทิ้งก็จะหายไปตลอดกาล การรวมเสียงเดียวกันนั้นใน WAV จะทำให้ไฟล์มีขนาดใหญ่ขึ้นโดยไม่มีข้อมูลเพิ่มเติม การแปลงขึ้นด้านบนจะช่วยแก้ปัญหาเฉพาะหน้าสำหรับรูปแบบที่ไม่โหลด และไม่เคยเพิ่มความแม่นยำแต่อย่างใด

การแปลง ลง เป็นกรณีที่มีประโยชน์อย่างแท้จริง WAV หลายชั่วโมงอาจเป็นไฟล์ขนาดใหญ่มาก เข้ารหัสซ้ำเป็น MP3 ขนาด 128 kbps ก่อนอัปโหลดจะย่อขนาดลงอย่างมากโดยไม่มีค่าใช้จ่ายด้านความแม่นยำ ซึ่งจะช่วยเร่งความเร็วในการอัปโหลดด้วยลิงก์ที่ช้า ตัวแปลงในเบราว์เซอร์ ฟรีทำสิ่งนี้ได้โดยที่เสียงไม่ออกจากอุปกรณ์ของคุณ กฎที่ตรงไปตรงมา: หากไฟล์ของคุณโหลดแล้วและไม่มีบิตเรตเล็ก ๆ ให้ถอดเสียงตามที่เป็นอยู่ แปลงเพื่อแก้ไขปัญหาจริงเท่านั้น เช่น ไฟล์ที่ไม่สามารถเปิดได้หรือไฟล์ใหญ่เกินกว่าจะอัปโหลดได้อย่างสะดวกสบาย

ป้ายผู้พูดรวมอยู่ด้วยฟรี

การถอดเสียง Hushscript ทุกรายการมาพร้อมกับการแยกผู้พูดอัตโนมัติ (การแยกเสียง) โดยไม่มีค่าใช้จ่ายเพิ่มเติม กลไกจะเลือกเสียงที่แตกต่างกันและติดป้ายกำกับว่า ผู้พูด A,ผู้พูด B และอื่นๆ และคุณเปลี่ยนชื่อเป็นชื่อจริงในตัวแก้ไขด้วยการคลิกเพียงครั้งเดียวต่อผู้พูด โดยค่าเริ่มต้นจะเปิดไว้โดยไม่คำนึงถึงรูปแบบแหล่งที่มา โดยไม่มีระดับป้ายกำกับของผู้พูดแยกกัน

ความสะอาดของป้ายกำกับจะขึ้นอยู่กับการบันทึก ไม่ใช่ประเภทไฟล์:

สำหรับการสัมภาษณ์ พอดแคสต์ และการประชุมส่วนใหญ่ ป้ายกำกับจะสามารถใช้งานได้โดยต้องมีการมอบหมายงานใหม่เพียงไม่กี่ครั้ง หากต้องการทราบรายละเอียดเกี่ยวกับวิธีการทำงานของตัวแยกเสียง โปรดดูที่ ตัวแยกเสียงของผู้พูดคืออะไร หรือในหน้าระบุตัวของผู้พูด เพื่อดูภาพรวมของคุณสมบัติ

การแก้ไขไฟล์ที่ออกมาคร่าวๆ

ข้อความถอดเสียงแบบคร่าวๆ ส่วนใหญ่จะย้อนกลับไปที่การบันทึก ไม่ใช่รูปแบบหรือเครื่องมือ ผู้กระทำผิดตามปกติและสิ่งที่ต้องทำ:

ไฟล์ที่ไม่โหลด พบไม่บ่อยนัก แต่เกิดขึ้นกับคอนเทนเนอร์ที่ผิดปกติหรือเสียหาย ลองใช้ตัวแปลงในเบราว์เซอร์ฟรีเพื่อรวมเป็น MP3 หรือ WAV ก่อน ซึ่งจะช่วยแก้ไขไฟล์ที่ปากแข็งส่วนใหญ่ หากยังคงไม่สามารถใช้งานได้ โปรดส่งอีเมลไปที่ support@hushscript.com การเพิ่มการรองรับรูปแบบคือสิ่งที่เราทำ

ระดับเสียงต่ำ หากการบันทึกเงียบมาก ระบบจะมีสัญญาณให้ทำงานน้อยลงและความแม่นยำลดลง ทำให้เป็นมาตรฐานหรือขยายเสียงในตัวแก้ไขใด ๆ ก่อนที่จะอัปโหลด การเพิ่มระดับการบันทึกที่อ่อนแอคือหนึ่งในการแก้ไขที่ให้ผลตอบแทนสูงสุด

เสียงรบกวนพื้นหลัง เสียงรบกวนคงที่ (เครื่องปรับอากาศ เสียงฮัมจากถนน) ได้รับการจัดการอย่างดีพอสมควร เสียงกะทันหันที่ทับคำพูด (ประตู ไอ มีด) คือสิ่งที่ทำให้คำพูดหลุด การลดสัญญาณรบกวนเล็กน้อยก่อนอัปโหลดสามารถช่วยได้ แต่อย่าหักโหม: การลดสัญญาณรบกวนอย่างหนักจะเพิ่มสิ่งที่สร้างความเสียหายให้กับความแม่นยำมากกว่าเสียงรบกวน

สำเนียงหนักๆ หรือคำศัพท์เฉพาะทาง เอ็นจิ้นสมัยใหม่รองรับสำเนียงที่หลากหลายได้ดี การพลาดที่เชื่อถือได้คือชื่อโดเมนที่กลไกไม่มีเหตุผลที่จะคาดหวัง: ชื่อยา การอ้างอิงทางกฎหมาย ชื่อแบรนด์เฉพาะ วางแผนบนสกิมเดียวหลังการส่งออกและพึ่งพาการค้นหาและแทนที่ หากชื่อผิดพลาดในลักษณะเดียวกันทุกครั้ง การแก้ไขเพียงครั้งเดียวจะกวาดทั้งไฟล์

ไฟล์ขนาดใหญ่หรือยาวมาก ระยะเวลา 10 ชั่วโมงครอบคลุมเกือบทุกอย่าง และไม่มีการจำกัดขนาดไฟล์ที่ด้านบน ดังนั้นจึงไม่จำเป็นต้องตัดการบันทึกที่ยาวออกเป็นชิ้นๆ หากไฟล์ Lossless มีขนาดใหญ่จนน่าอึดอัดใจในการจัดเตรียมในเบราว์เซอร์ ให้เข้ารหัสไฟล์ MP3 อีกครั้งเป็น 128 kbps ก่อน (ไม่มีค่าใช้จ่ายด้านความแม่นยำที่แท้จริง) เพื่อเพิ่มความเร็ว สำหรับเซสชันระยะยาวโดยเฉพาะ คำแนะนำการบันทึกแบบยาวมีข้อมูลเชิงลึก

จะเกิดอะไรขึ้นกับไฟล์ของคุณ

เสียงจะถูกลบออกจากเซิร์ฟเวอร์ทันทีที่การถอดเสียงพร้อม ไม่มีพื้นที่เก็บข้อมูลบนคลาวด์ ไม่มีการใช้สำหรับการฝึกโมเดล และไม่มีระยะเวลาเก็บรักษา หากคุณทำไฟล์วิดีโอตก มีเพียงเสียงที่แยกออกมาเท่านั้นที่จะส่งถึงเซิร์ฟเวอร์ (วิดีโอจะยังคงอยู่ในอุปกรณ์ของคุณ) และคุณสามารถลบการถอดเสียงออกจากแดชบอร์ดได้ในคลิกเดียวทุกครั้งที่คุณต้องการ

การส่งออกการถอดเสียงของคุณ

หลังจากการถอดเสียง ให้เลือกรูปแบบที่เหมาะกับสิ่งที่คุณกำลังทำกับข้อความ หากคุณไม่แน่ใจว่ารูปแบบการถอดเสียงที่คุณต้องการจริงๆ ให้เริ่มด้วยตัวเลือกทั่วไปด้านล่าง:

รูปแบบการส่งออกการถอดเสียงและการใช้งานที่ดีที่สุด
รูปแบบสิ่งที่รวมอยู่ดีที่สุดสำหรับ
TXTป้ายกำกับผู้พูด, ข้อความธรรมดาบันทึก ค้นหา และป้อนลงในเครื่องมืออื่น
SRTการประทับเวลาต่อคำพูด ป้ายกำกับผู้พูดวิดีโอ คำบรรยาย การนำทางการบันทึกแบบยาวตามเวลา
VTTการประทับเวลาคำบรรยายเว็บ ป้ายกำกับผู้พูดเครื่องเล่นวิดีโอ HTML5 และการเผยแพร่เว็บ
CSVแถวกับผู้พูด เวลา และฟิลด์ข้อความการตรวจสอบสเปรดชีตและแฮนด์ออฟข้อมูลแบบไลท์เวท
Markdownการถอดเสียงที่มีป้ายกำกับผู้พูดใน Markdownบันทึกย่อ เอกสาร เวิร์กโฟลว์การเผยแพร่ และไซต์แบบคงที่
DOCXจัดรูปแบบสำหรับ Word หรือ Google เอกสารการแก้ไข การแชร์ คำอธิบายประกอบ
JSON{ speaker, start, end, text }ต่อรายการไปป์ไลน์และเครื่องมือที่กำหนดเอง
PDFการถอดเสียงเค้าโครงคงที่ที่อ่านได้การแชร์และการเก็บถาวรแบบอ่านอย่างเดียว

การส่งออกทุกครั้งจะมีป้ายกำกับผู้พูดโดยไม่มีลายน้ำอยู่ และรูปแบบการส่งออกทั้งหมดจะรวมอยู่ในทุกแผน โดยมีเวลาฟรี 30 นาทีในนั้น การประทับเวลาใน SRT อยู่ที่ระดับคำพูด (หนึ่งรายการต่อรอบผู้พูด) ซึ่งเป็นรายละเอียดที่เหมาะสมสำหรับคำบรรยายและการอ้างอิง หากคุณต้องการโครงสร้างระดับคำเพื่อประมวลผลในโค้ด JSON จะให้เวลาเริ่มต้นและสิ้นสุดเป็นมิลลิวินาทีสำหรับแต่ละเทิร์น

ภาษา

Hushscript ถอดเสียงประมาณ 99 ภาษา ซึ่งตรวจพบโดยอัตโนมัติ ไม่ได้ตั้งค่าด้วยมือ ความแม่นยำมีความแข็งแกร่งที่สุดใน 18 ภาษา รวมถึงภาษาอังกฤษ 4 รูปแบบ (ทั่วโลก อังกฤษ ออสเตรเลีย สหรัฐอเมริกา) สเปน ฝรั่งเศส เยอรมัน ญี่ปุ่น จีนกลาง ฮินดี และอารบิก รายการทั้งหมดอยู่ในหน้าภาษา

หากคุณกำลังตัดสินใจระหว่างการถอดเสียงภาษาเดียวกันและข้อความถอดเสียงที่แปล คำแนะนำในการ “แปลเสียงเป็นข้อความ” จะอธิบายความแตกต่าง


นั่นคืองานทั้งหมด (วาง ถอดเสียง ส่งออก) และ มันจะอ่านเหมือนกันไม่ว่าคุณจะเริ่มต้นด้วยรูปแบบใดก็ตาม สำหรับบันทึกเฉพาะรูปแบบ คู่มือพี่น้องจะครอบคลุมกรณีที่พบบ่อยที่สุด: MP3, WAV และ M4A / Apple Voice Memo หน้าเสียงเป็นข้อความ มีภาพรวมคุณลักษณะทั้งหมด และทุกรูปแบบก็ไปในทิศทางเดียวกัน เพียงวางไฟล์ของคุณ

แหล่งข้อมูลและมาตรฐานอิสระ

Hushscript อ้างอิงแหล่งข้อมูลอิสระที่ไม่ใช่คู่แข่งเหล่านี้เพื่ออธิบายงานวิจัย มาตรฐาน หรือการทำงานของแพลตฟอร์ม โดยไม่ได้หมายความว่าแหล่งข้อมูลดังกล่าวรับรอง Hushscript

วันที่ตรวจสอบแหล่งข้อมูล:

คำถามที่พบบ่อย

Hushscript ยอมรับรูปแบบเสียงใดบ้าง

MP3, M4A, WAV, FLAC, AAC, OGG, CAF, AIFF และรูปแบบเสียงทั่วไปอื่นๆ ไฟล์วิดีโอ (MP4, MOV, WebM, MKV) ก็ใช้งานได้เช่นกัน เสียงจะถูกแยกออกมาในเบราว์เซอร์ก่อนอัปโหลด ดังนั้นวิดีโอจะยังคงอยู่ในอุปกรณ์ของคุณ หากไฟล์ที่คุณไม่รองรับ โปรดส่งอีเมลไปที่ support@hushscript.com แล้วเราจะเพิ่มไฟล์นั้นให้

มีรูปแบบที่ให้ความแม่นยำสูงสุดหรือไม่

รูปแบบ Lossless (WAV, FLAC, AIFF) ส่งสัญญาณที่ชัดเจนที่สุดให้กับระบบ แต่ MP3 ขนาด 128 kbps หรือสูงกว่าของการบันทึกเดียวกันจะถอดเสียงในลักษณะเดียวกัน ตัวการบันทึก (ระยะไมค์ เสียง และความชัดเจนของคำพูดของผู้คน) มีความสำคัญมากกว่ารูปแบบของคอนเทนเนอร์

จะเป็นอย่างไรหากฉันมีรูปแบบที่ไม่อยู่ในรายการ

ลองอัปโหลดก่อน เบราว์เซอร์สามารถอ่านคอนเทนเนอร์มาตรฐานส่วนใหญ่ได้ แม้ว่าจะเก่าหรือผิดปกติก็ตาม หากไม่โหลด ให้แปลงเป็น MP3 หรือ WAV ด้วยตัวแปลงฟรีในเบราว์เซอร์ที่ /tools จากนั้นอัปโหลด เป็นทางเลือก โปรดส่งอีเมลไปที่ support@hushscript.com แล้วเราจะเพิ่มรูปแบบให้

ฉันจำเป็นต้องมีบัตรเครดิตเพื่อเริ่มต้นหรือไม่

ไม่ บัตรเป็นเพียงวิธีที่เร็วที่สุดในการใช้บริการฟรี 30 นาที การกันเงิน 1 ดอลลาร์จะเป็นการยืนยันบัตร จากนั้นจะออกทันทีและจะไม่มีการเรียกเก็บเงิน หากคุณต้องการใช้วิธีการชำระเงินแบบอื่นที่ใช้ได้ในประเทศของคุณ เวลา 30 นาทีจะมาถึงเมื่อคุณซื้อครั้งแรกแทน

มีป้ายกำกับผู้พูดในทุกรูปแบบหรือไม่

ใช่ การแยกผู้พูดทำงานในทุกทรานสคริปต์ ไม่ว่าจะเป็นรูปแบบหรือขนาดไฟล์ใด โดยไม่มีค่าใช้จ่ายเพิ่มเติม ป้ายกำกับจะกลับมาเป็นผู้พูด A ผู้พูด B และอื่นๆ และคุณสามารถเปลี่ยนชื่อได้

จะนับนาทีในรูปแบบต่างๆ อย่างไร

เทียบกับระยะเวลาของเสียง ไม่ใช่ขนาดไฟล์ FLAC 45 นาทีและ MP3 45 นาทีของการบันทึกเดียวกันจะใช้เวลาเท่ากัน แม้ว่า FLAC จะเป็นไฟล์ที่ใหญ่กว่ามากก็ตาม

สามารถถอดเสียงไฟล์ที่ไม่ใช่ภาษาอังกฤษได้หรือไม่

ใช่ ภาษาจะถูกตรวจพบโดยอัตโนมัติในประมาณ 99 ภาษา ดังนั้นคุณจึงไม่ต้องตั้งค่าด้วยตนเอง การบันทึกภาษาเดียวที่สะอาดจะถ่ายทอดได้ดีที่สุด การสลับระหว่างภาษาอย่างหนักระหว่างประโยคนั้นยากสำหรับกลไกใดๆ

จะเกิดอะไรขึ้นกับไฟล์ของฉันหลังจากการถอดเสียง

จะถูกลบออกจากเซิร์ฟเวอร์ทันทีที่การถอดเสียงพร้อม: ไม่มีพื้นที่เก็บข้อมูล ไม่มีการฝึกโมเดล หากไฟล์ของคุณเป็นวิดีโอ จะมีเพียงเสียงที่แยกออกมาเท่านั้นที่จะส่งถึงเซิร์ฟเวอร์ และคุณสามารถลบการถอดเสียงออกจากแดชบอร์ดของคุณได้ในคลิกเดียว

เริ่มต้นด้วย 30 นาทีฟรี

เริ่มต้น – 30 นาทีฟรี