Ana içeriğe geç

Her türlü ses dosyasını metne dönüştürme

Yazar: Yayınlandı: Son inceleme:

Bir podcast düzenleyicisinden bir MP3, iPhone’unuzdan bir M4A, bir alan kaydediciden bir WAV, bir ses kayıt cihazı uygulamasından belirsiz bir CAF: bunlardan herhangi birini metne dönüştürmek için aynı şeyi yaparsınız. Dosyayı bırakın, konuşmacıların zaten ayrılmış olduğu bir transkript alın, ihtiyacınız olan formatta dışa aktarın. Sesin geldiği kapsayıcı, adımları değiştirmez.

Biçimin etkilediği şey biraz daha aşağıdadır: dosyanın ne kadar büyük olduğu, ne kadar temiz bir şekilde yazıya döküldüğü ve bir dosyanın yüklenmediği nadir durumlarda ne yapılması gerektiği. Bu kılavuz, hangi ses formatlarının işe yaradığını, bunların tümünü idare eden tek yöntemi, seçeneğiniz olduğunda en iyi formatı nasıl seçeceğinizi ve zor çıkan dosyaları nasıl düzelteceğinizi kapsar.

İhtiyacınız olan şey

30 saniyelik önizleme için hesaba gerek yoktur. Kaydolmadan önce bir dosyayı bırakabilir ve konuşmacı etiketli stili görebilirsiniz; bu, herhangi bir işlem yapmadan önce çıktının uygunluğunu kontrol etmenin dürüst yoludur. Ücretsiz dakikaların ötesinde, transkripsiyon kullandıkça öde şeklindedir: dakikaları yalnızca ihtiyacınız olduğunda satın alırsınız, abonelik gerektirmez. Maliyetler fiyatlandırma sayfasında yer almaktadır.

Hangi ses formatları çalışır

Hushscript tüm standart ses formatlarını alır. Her birinin genellikle nereden geldiğini burada bulabilirsiniz, böylece nelere sahip olduğunuzu anlayabilirsiniz:

Adlar yalnızca dosya adı kuralları değildir. Mevcut IANA Medya Türleri kaydı,audio/aac,audio/mp4,audio/mpeg,audio/ogg ve audio/opus gibi standartlaştırılmış türleri kaydeder; bu nedenle kapsayıcı ve içindeki ses kodlaması ayrıdır. sorular.

Yaygın ses formatları ve genellikle nereden geldikleri
BiçimOrtak kaynak
MP3Podcast’ler, telefon kayıtları, çoğu kayıttan dışa aktarma uygulamalar
M4A / AACiPhone Sesli Notları, WhatsApp sesli notları, Apple dışa aktarmaları
WAVDijital kayıt cihazları, DAW dışa aktarmaları, Windows Ses Kaydedici
FLACArşiv kayıtları, DAW dışa aktarımları, kayıpsız rip’ler
OGGAndroid sesli notları, açık kaynaklı kayıt araçları
AIFF / CAFMac ve iOS ses, GarageBand

Video dosyaları aynı şekilde çalışır. Bir MP4, MOV, WebM veya MKV bırakın; herhangi bir şey yüklenmeden önce ses parçası tarayıcınıza çıkarılır, böylece videonun kendisi cihazınızdan asla ayrılmaz; sunucuya yalnızca ses ulaşır.

Yukarıdaki liste bir çit değildir. Vaat, desteklenen formatlar tablosundan daha basittir: dosyanızı bırakın, dönüştürülür ve kopyalanır. Gerçekten alışılmadık bir şeye sahipseniz (eski bir Nokia’dan bir AMR dosyası, on yıllık bir Android’den bir .3gp, bir RealAudio klibi), yine de onu yüklemeyi deneyin. Tarayıcı standart kapsayıcıların çoğunu okuyabilir ve okuyamıyorsa iki alternatifiniz vardır: /tools adresindeki ücretsiz tarayıcı içi araçları kullanarak MP3 veya WAV’a dönüştürün ve bunu yükleyin veya support@hushscript.com adresine e-posta gönderin; biz de biçimi ekleyelim. Dosyanızın uygun olup olmadığını önceden anlamanıza gerek yok.

Bir ses dosyasını üç adımda metne dönüştürün

Hangi formatla başlarsanız başlayın akış aynıdır. İlk adım, henüz bir hesabınız olmadan önce gerçekleştirilir.

  1. Önizlemek için dosyanızı bırakın./audio-to-text adresine gidin ve dosyayı bırakma bölgesine sürükleyin veya göz atmak için tıklayın. İlk 30 saniye, herhangi bir hesaba ihtiyaç duymadan, konuşmacı etiketli olarak doğrudan tarayıcıda yazıya aktarılır. Bu, herhangi bir şeye kaydolmadan önce çıktının istediğiniz gibi okunup okunmadığını kontrol etmenizdir.
  2. Geri kalanını metne dönüştürmek için kaydolun. Hesap oluşturmak için e-posta adresinizi girin. Bir kart ekleyip doğruladığınızda (yukarıda açıklanan 1 ABD doları bloke) veya başka bir şekilde ödeme yaparsanız ilk satın alma işleminizde 30 ücretsiz dakikanızın kilidini açarsınız. Dosyanın tamamı buradan yüklenir. Bir kayıt, dosya boyutu sınırı olmadan 10 saate kadar sürebilir; çok büyük bir dosya bile doğrudan tarayıcıda hazırlanır. Hizmet güvenliği ve aktif iş korumaları da geçerlidir.
  3. Transkript’i alın ve dışa aktarın. Konuşma motoru dosyayı işler ve konuşmacıların zaten ayrılmış olduğu bir transkript döndürür. İsterseniz konuşmacıları yeniden adlandırın ve ardından onu 21 formattan herhangi birinde (aralarında TXT, SRT, DOCX ve PDF’nin yanı sıra altyazı ve editör-zaman çizelgesi formatları) veya şifre korumalı bir .husharchive olarak indirin. Her dışa aktarma dahildir: ödeme duvarı yok, filigran yok.

İşleme arka planda çalışır ve sesin uzunluğuna göre ölçeklenir (kabaca kayıt saati başına birkaç dakika), böylece uzun bir dosya tamamlanırken sekmeyi açık tutmak zorunda kalmazsınız.

Çalışılmış bir örnek: bir kayıt, iki format

38 dakikalık bir görüşmeyi kaydettiğinizi ve kayıt cihazınızın bunu iki kez kaydettiğini varsayalım: tam kalitede bir meeting.wav ve telefonunuzun aynı anda oluşturduğu bir meeting.m4a. Her ikisi de aynı üç adımdan geçer ve konuşma metni, her birinde bir zaman damgasıyla birlikte, konuşmacının sırasına göre bölümlere ayrılmış olarak geri gelir:

[00:00:06] Konuşmacı A: Başlamadan önce, gönderdiğim rakamları herkes aldı mı?
[00:00:10] Konuşmacı B: Bu sabah aldım. 3. Çeyrek numarası
           araştırmak istediğim numara.
[00:00:17] Konuşmacı C: Evet, yani değişen satır bu. Konuyu açayım.
[00:00:21] Konuşmacı C: Siz hazırken – işe alıma sonra geri dönebilir miyiz?

İki dosya aslında aynı transkripti oluşturuyor. WAV çok daha büyük bir yüklemedir ve M4A ise küçüktür, ancak sözcükler ve konuşmacı etiketleri aynı şekilde yerleşir çünkü her ikisi de aynı temel konuşmayı taşır. Buradan düzenleme kolaydır:Konuşmacı A’yı yeniden adlandırmak için bir kez tıklarsınız ve konuşmacıyın her satırında güncellemeler olur; Motorun tahmin ettiği bir avuç özel isme (soyadı, ürün adı) göz atarsınız ve bunları, her örneği tek geçişte düzelten bul ve değiştir yöntemiyle düzeltirsiniz.

Bu, her format için tek bir yöntemin pratik sonucudur. WAV, M4A ve MP3 için farklı bir araç veya farklı bir zihinsel kontrol listesi tutmuyorsunuz. Kayıt cihazınız, telefonunuz veya bir başkasının dışa aktardığı dosya ne olursa olsun, aynı bırakma bölgesinden geçer ve aynı türde transkript olarak çıkar.

Doğruluk için en iyi formatı seçme

Çoğu zaman seçim yapamazsınız. Size verilen dosyayı yazıya dökersiniz ve bunda bir sorun yoktur. Ancak sesin nasıl kaydedildiğini veya dışa aktarıldığını kontrol ederseniz, birkaç seçenek sonucun ne kadar temiz olabileceğine ilişkin tavanı belirler.

Kayıt kalitesi büyük bir farkla önce gelir. İyi bir yakın mikrofondan gelen 128 kbps MP3, odanın diğer ucunda dizüstü bilgisayarın yerleşik mikrofonuyla kaydedilen kayıpsız bir WAV’ı her zaman yenecektir. Formatı düşünmeden önce mikrofonu konuşan kişiye yaklaştırmayı düşünün. Kapsayıcı çok uzak bir an.

Çok düşük bit hızına sahip MP3’ten kaçının. MP3 kayıplıdır: Kodlama, dosyayı küçük tutmak için sesin bazı kısımlarını atar ve bit hızı ne kadar düşükse, o kadar çok çöpe gider. Konuşma tanıma, “on beş” ile “on altı” veya “can” ile “can’t” arasındaki boşluğun bulunduğu ünsüz harflerdeki yüksek frekanslı ayrıntıya dayanır. Agresif sıkıştırma ilk önce tam olarak bu ayrıntıyı yer. Yaklaşık 64 kbps’nin altında kelime hataları artıyor. 128 kbps ve üzerinde sayının önemli olduğu noktayı çoktan geçmişsinizdir; Daha yüksek bir bit hızı, metni daha iyi hale getirmez.

Kayıpsız, formatı değişken olarak kaldırır. WAV, FLAC ve AIFF, motora sıkıştırılmamış ses verir. Temiz bir kayıt için, iyi bir MP3’e göre doğruluk kazancı marjinaldir, ancak sıkıştırmayı tamamen ortadan kaldırır. MDN’nin dijital ses kılavuzu temeldeki ödünleşimi açıklıyor: Kayıpsız, ayrıntıları daha büyük boyutta korurken, kayıplı kodlama, bilgileri atarak sesi daha da küçültebilir. Kaydın değerli olduğu ve daha sonra formatın size bir maliyeti olup olmadığını merak etmek istemediğiniz durumlarda bu yararlı bir bağlamdır.

Mono iyidir; stereoya ihtiyacınız yoktur. Motor, konuşma için dahili olarak stereoyu monoya karıştırır, böylece mono dosya da aynı şekilde metne dönüştürülür ve yavaş bir bağlantıda daha hızlı yüklenir. Tek nüans: Kurulumunuz her kişiyi ayrı bir stereo kanala (“çift sonlandırıcı”) kaydettiyse, yüklemeden önce bunu tek bir mono kanala karıştırmak konuşmacı etiketlerine yardımcı olabilir çünkü motor iki ayrı akış yerine karma bir konuşmayı duyar.

16 kHz’in üzerindeki örnekleme hızı konuşma için hiçbir şey satın almaz. 16 kHz’den 48 kHz’e kadar olan her şey çalışır ve Bir video düzenleyiciden gelen 48 kHz WAV, aynı temel konuşma göz önüne alındığında, bir telefon uygulamasından gelen 16 kHz mono dosyanın aynısını kopyalar. Model müziğe değil sese göre eğitilmiştir, bu nedenle daha yüksek bir orandan doğruluk kazanımı olmaz.

Kayıpsız ve kayıplı ve dönüştürme sırasında yardımcı olur

Yaygın bir soru: MP3’ünüzü WAV’a dönüştürmek öncelikle doğruluğu artırır mı? Olmayacak. Ses 128 kbps MP3 olarak kaydedildiğinde, atılan ayrıntılar tamamen kaybolur. Aynı sesi bir WAV’a sarmak, hiçbir ekstra bilgi içermeyen daha büyük bir dosya oluşturur. Yukarıya doğru dönüştürmek yalnızca yüklenmeyen bir format için geçici çözüm olarak yardımcı olur, hiçbir zaman doğruluğu artırmaz.

Aşağıya dönüştürmek gerçekten yararlı bir durumdur. Çok saatlik bir WAV çok büyük bir dosya olabilir; Yüklemeden önce onu 128 kbps MP3 olarak yeniden kodlamak, anlamlı bir doğruluk maliyeti olmadan onu önemli ölçüde küçültür, bu da yavaş bir bağlantıda yüklemeyi hızlandırır. Ücretsiz tarayıcı içi dönüştürücü bunu ses cihazınızdan hiç çıkmadan yapar. Dürüst kural: Dosyanız zaten yükleniyorsa ve küçük bit hızında değilse, onu olduğu gibi yazıya dökün. Yalnızca açılmayan veya rahatça yüklenemeyecek kadar büyük bir dosya gibi gerçek bir sorunu çözmek için dönüştürün.

Konuşmacı etiketleri, ücretsiz dahildir

Her Hushscript transkripti, hiçbir ekstra ücret ödemeden otomatik konuşmacı ayırma (ayrıştırma) özelliğiyle birlikte gelir. Motor, farklı sesleri seçip bunları Konuşmacı A,Konuşmacı B vb. olarak etiketler ve siz de bunları editörde, konuşmacı başına tek bir tıklamayla gerçek adlarla yeniden adlandırırsınız. Kaynak biçiminden bağımsız olarak, ayrı bir konuşmacı etiketi katmanı olmadan varsayılan olarak açıktır.

Etiketlerin ne kadar temiz çıkacağı dosya türüne değil kayda bağlıdır:

Röportajların, podcast’lerin ve toplantıların çoğu için etiketler en fazla birkaç yeniden atamayla kullanılabilir hale gelir. ayrıştırmanın genel olarak nasıl çalıştığına ilişkin ayrıntılı bilgi istiyorsanız konuşmacı ayrıştırmanın ne olduğuna veya özelliklere genel bakış için konuşmacı tanımlama sayfasına bakın.

Kötü görünen dosyaları düzeltme

Kaba metinlerin çoğu kayıttan kaynaklanır, kayıttan değil format veya araç. Olağan suçlular ve bunlar hakkında ne yapılması gerektiği:

Yüklenmeyen bir dosya. Nadirdir, ancak olağandışı veya bozuk bir kapsayıcıda meydana gelir. Çoğu inatçı dosyayı düzelten, önce MP3 veya WAV olarak yeniden sarmak için ücretsiz tarayıcı içi dönüştürücüyü deneyin. Hala devam etmiyorsa support@hushscript.com adresine e-posta gönderin. Format desteği eklemek yaptığımız bir şeydir.

Düşük ses seviyesi. Kayıt çok sessizse, motorun çalışacak sinyali azalır ve doğruluk düşer. Yüklemeden önce herhangi bir düzenleyicide sesi normalleştirin veya güçlendirin. Zayıf bir kaydın düzeyini artırmak, en yüksek getiri sağlayan çözümlerden biridir.

Arka plan gürültüsü. Sabit gürültü (klima, yol uğultusu) oldukça iyi bir şekilde giderilir. Konuşmayı engelleyen ani gürültü (bir kapı, bir öksürük, çatal bıçak takımı) kelimeleri düşüren şeydir. Yüklemeden önce hafif bir gürültü azaltma geçişi yardımcı olabilir, ancak aşırıya kaçmayın: Ağır gürültü giderme, doğruluğu gürültüden daha fazla olumsuz etkileyen kusurlar ekler.

Ağır aksanlar veya uzmanlık gerektiren sözcükler. Modern motorlar, çok çeşitli aksanları iyi bir şekilde işler. Güvenilir atlatmalar, motorun beklemesi için hiçbir neden olmayan alan terimleridir: ilaç adları, yasal alıntılar, niş marka adları. Dışa aktarma sonrasında tek bir gözden geçirme planlayın ve bul ve değiştir yöntemine güvenin; bir ad her seferinde aynı şekilde yanlışsa, bir düzeltme tüm dosyayı tarar.

Çok büyük veya çok uzun dosyalar. 10 saatlik tavan neredeyse her şeyi kapsar ve bunun üzerinde bir dosya boyutu sınırı yoktur, dolayısıyla uzun bir kaydı parçalara ayırmaya gerek yoktur. Kayıpsız bir dosya tarayıcıda hazırlanmak için çok büyükse, işleri hızlandırmak için önce onu 128 kbps MP3 olarak yeniden kodlayın (gerçek doğruluk maliyeti yok). Daha uzun oturumla ilgili ayrıntılar için uzun kayıt kılavuzu daha ayrıntılıdır.

Dosyanıza ne olur?

Transkript hazır olduğu anda ses sunucudan silinir. Bulut depolama alanı yok, model eğitiminin faydası yok ve saklama süresi yok. Bir video dosyasını düşürdüyseniz yalnızca çıkarılan ses sunucuya ulaştı (video cihazınızda kaldı) ve istediğiniz zaman tek tıklamayla transkriptin kendisini kontrol panelinizden silebilirsiniz.

Transkriptinizi dışa aktarma

Transkripsiyondan sonra, metinle yaptığınız işe uygun formatı seçin. Hangi transkript formatına ihtiyacınız olduğundan emin değilseniz, aşağıdaki genel seçimlerle başlayın:

Transkript dışa aktarma formatları ve en iyi kullanım alanları
BiçimNeler dahilEn iyi
TXTkonuşmacı etiketleri, düz metinNotlar, arama, başka bir araca besleme
SRTSöz başına zaman damgaları, konuşmacı etiketleriVideo altyazıları, uzun bir kayıtta zamana göre gezinme
VTTWeb altyazı zaman damgaları, konuşmacı etiketleriHTML5 video oynatıcılar ve web yayınlama
CSVkonuşmacı, zamanlama ve metin alanları içeren satırlarE-tablo incelemesi ve hafif veri aktarımı
MarkdownMarkdown’da konuşmacı etiketli transkriptNotlar, belgeler, yayınlama iş akışları ve statik siteler
DOCXWord veya Google Dokümanlar için biçimlendirilmişDüzenleme, paylaşma, açıklama ekleme
JSON{ speaker, start, end, text } öğe başınaArdışık düzen ve özel araçlar
PDFOkunabilir sabit yerleşimli transkriptSalt okunur paylaşım ve arşivleme

Her dışa aktarma, hiçbirinde filigran olmaksızın konuşmacı etiketleri taşır ve tüm dışa aktarma biçimleri, aralarında 30 ücretsiz dakikanın da bulunduğu her planla birlikte gelir. SRT’deki zaman damgaları, altyazı ve alıntı yapmak için doğru ayrıntı düzeyi olan, ifade düzeyinde (konuşmacı sırası başına bir giriş) bulunur; Kodda işlemek için kelime düzeyinde bir yapıya ihtiyacınız varsa, JSON size her dönüş için milisaniye cinsinden başlangıç ​​ve bitiş zamanını verir.

Diller

Hushscript yaklaşık 99 dili metne dönüştürür, otomatik olarak algılanır, elle ayarlanmaz. Doğruluk, dört İngilizce çeşidi (Global, İngiliz, Avustralya, ABD), İspanyolca, Fransızca, Almanca, Japonca, Mandarin, Hintçe ve Arapça dahil olmak üzere 18’de en güçlüsüdür. Listenin tamamı diller sayfasındadır.

Aynı dilde bir transkript ile çevrilmiş bir transkript arasında karar veriyorsanız, “sesi metne çevirme” kılavuzu farkı açıklar.


İşin tamamı bu kadar (bırak, kopyala, dışa aktar) ve başladığınız format ne olursa olsun aynı şekilde okunur. Biçime özel notlar için kardeş kılavuzlar en yaygın durumları kapsar: MP3, WAV ve M4A / Apple Voice Memo. sesten metne dönüştürme sayfası tüm özelliklere genel bir bakış sunar ve her format oraya aynı şekilde ulaşır: dosyanızı bırakmanız yeterlidir.

Bağımsız kaynaklar ve standartlar

Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.

Kaynakların incelenme tarihi:

Sıkça sorulan sorular

Hushscript hangi ses formatlarını kabul eder?

MP3, M4A, WAV, FLAC, AAC, OGG, CAF, AIFF ve diğer yaygın ses formatları. Video dosyaları (MP4, MOV, WebM, MKV) da çalışır. Ses, yüklemeden önce tarayıcıda çıkarılır, böylece video cihazınızda kalır. Sahip olduğunuz bir dosya desteklenmiyorsa support@hushscript.com adresine e-posta gönderin, biz de onu ekleyelim.

En iyi doğruluğu sağlayan bir format var mı?

Kayıpsız formatlar (WAV, FLAC, AIFF) motora en temiz sinyali verir, ancak aynı kaydın 128 kbps veya daha yüksek bir MP3'ü hemen hemen aynısını kopyalar. Kaydın kendisi (mikrofon mesafesi, gürültü, insanların ne kadar net konuştuğu) kapsayıcı formattan çok daha önemlidir.

Listede bulunmayan bir format varsa ne olur?

Önce onu yüklemeyi deneyin. Tarayıcı, eski veya alışılmadık olanlar da dahil olmak üzere çoğu standart kapsayıcıyı okuyabilir. Yüklenmezse, /tools adresindeki ücretsiz tarayıcı içi dönüştürücüyü kullanarak onu MP3 veya WAV'a dönüştürün ve ardından yükleyin. Yedek olarak support@hushscript.com adresine e-posta gönderin; biz de biçimi ekleyelim.

Başlamak için kredi kartına ihtiyacım var mı?

Hayır. Bir kart, 30 ücretsiz dakikaya ulaşmanın en hızlı yoludur: 1$'lık bloke işlemi onu doğrular, ardından hemen serbest bırakılır ve hiçbir zaman ücret alınmaz. Ülkenizde mevcut olan başka bir ödeme yöntemini kullanmayı tercih ederseniz, bunun yerine ilk satın alma işleminizde 30 dakika verilir.

konuşmacı etiketleri her format için dahil midir?

Evet. Konuşmacı ayırma, formatı veya dosya boyutu ne olursa olsun her transkriptte ekstra ücret ödemeden çalışır. Etiketler Konuşmacı A, Konuşmacı B vb. olarak geri gelir ve bunları yeniden adlandırabilirsiniz.

Dakikalar formatlara göre nasıl sayılır?

Dosya boyutuna değil, ses süresine göre. FLAC çok daha büyük bir dosya olmasına rağmen, aynı kaydın 45 dakikalık FLAC'ı ve 45 dakikalık MP3'ü aynı dakikaya mal olur.

İngilizce olmayan bir dosyayı metne dönüştürebilir mi?

Evet. Dil yaklaşık 99 dilde otomatik olarak algılanır, dolayısıyla manuel olarak ayarlamanız gerekmez. Temiz bir tek dilli kayıt en iyi şekilde kopyalanır; Cümlenin ortasında diller arasında yoğun geçiş yapmak her motor için daha zordur.

Dosyaya dönüştürüldükten sonra dosyama ne olur?

Transkript hazır olduğu anda dosya sunucudan silinir: depolama yok, model eğitimi yok. Dosyanız bir videoysa, yalnızca çıkarılan ses sunucuya ulaşır ve tek tıklamayla kontrol panelinizden transkriptin kendisini silebilirsiniz.

30 ücretsiz dakikayla başlayın

Başlayın – 30 ücretsiz dakika