Ana içeriğe geç

MP3’ü metne dönüştürme (ücretsiz, konuşmacı etiketli)

Yazar: Yayınlandı: Son inceleme:

Bir MP3’ü metne dönüştürmek, mevcut en yaygın transkripsiyon işlerinden biridir ve adımlar kaynağa göre değişmez: bir podcast bölümü, kayıtlı bir röportaj, bir ders veya telefonunuzdaki sesli notun tümü aynı akıştan geçer. Dosyayı yükleyin, transkripti bekleyin, ihtiyacınız olan formatta dışa aktarın.

Değişen şey, MP3’ün kendisinin sonucu nasıl etkilediğidir. Çoğu rehber bunu atlıyor. MP3 kayıplı, sıkıştırılmış bir dosyadır ve kaydedildiği bit hızı, konuşma motorunun ne kadar ayrıntıyla çalışması gerektiğine dair bir tavan belirler. Bu kılavuz üç adımı kapsar ve daha sonra daha da derinlere iner: Gerçek konuşmacı etiketli çıktı ile üzerinde çalışılmış bir örnek, doğruluk açısından bit hızının gerçekte ne anlama geldiği ve kaba çıkan kayıtların nasıl düzeltileceği.

İhtiyacınız olan şey

Yüklenecek hiçbir şey yoktur; masaüstü uygulaması yok, tarayıcı uzantısı yok. Her şey tarayıcıda ve hesapta çalışır.

Ücretsiz dakikaların ötesinde, transkripsiyon kullandıkça öde yöntemiyle yapılır: dakikaları yalnızca ihtiyacınız olduğunda satın alırsınız, abonelik gerektirmez. Maliyetler fiyatlandırma sayfasında yer almaktadır.

Bir MP3’ü üç adımda metne dönüştürün

  1. Dosyanızı yükleyin./audio-to-text’i açın, ardından MP3’ü bırakma bölgesine sürükleyin veya göz atmak için tıklayın. Dosya boyutu sınırı olmaksızın 10 saate kadar olan dosyalar kabul edilir. İlk 30 saniyelik önizleme, oturum açmadan önce doğrudan tarayıcıda görüntülenir; böylece, taahhütte bulunmadan önce konuşmacı etiketli stili görebilirsiniz.
  2. Metin haline gelmesine izin verin. Oturum açtıktan ve dosya yüklendikten sonra, konuşma motoru bunu işler ve konuşmacıların zaten ayrılmış olduğu bir transkript döndürür. İşleme süresi değişiklik gösterir ve iş arka planda çalıştığından sekmeyi açık tutmanıza gerek kalmaz.
  3. Dışa aktar. Sonucu 21 formattan herhangi birinde indirin. Bu, düz TXT, zaman damgalı SRT, Word DOCX, PDF ile altyazı ve düzenleyici zaman çizelgesi formatlarının yanı sıra parola korumalı .husharchive’ı kapsar. Dışa aktarmalarda ödeme duvarı ve hiçbirinde filigran olmaksızın her format dahildir.

Biten transkript kontrol panelinizde açılır. Konuşmacılar Konuşmacı A,Konuşmacı B vb. olarak görünür ve herhangi bir etiketi tıklayarak onu gerçek bir adla yeniden adlandırabilirsiniz; bu, konuşmacının sahip olduğu her satırı günceller.

Çalışılmış bir örnek: iki kişilik bir röportaj

Aldığınızı varsayalım.founder-interview.mp3: 42 dakikalık bir kayıt, 128 kbps, bir görüşmeci ve bir konuk, bir arama sırasında kaydedildi. Yükledikten sonra, konuşma metni konuşmacı sırasına göre bölümlere ayrılmış olarak ve her birinde bir zaman damgasıyla birlikte geri gelir:

[00:00:04] Konuşmacı A: Zaman ayırdığınız için teşekkürler. En baştan başlayalım –
           fikir nereden çıktı?
[00:00:11] Konuşmacı B: Açıkçası bizim de yaşadığımız bir sorundan ortaya çıktı.
           Kayıtlı aramalar arasında boğuluyorduk ve hiçbirinde arama yapılmıyordu.
[00:00:23] Konuşmacı A: Demek ihtiyacın olan şeyi yaptın.
[00:00:25] Konuşmacı B: Hemen hemen. İlk versiyon bantla bir arada tutuldu.

Bu noktadan sonra düzenleme kolaydır. Konuşmacı A etiketini görüşmeci, Konuşmacı B etiketini konuk olarak yeniden adlandırırsınız; böylece tüm satırlar güncellenir. Ardından motorun tahmin ettiği ürün adları veya kişi soyadları gibi birkaç özel adı gözden geçirir ve bul-değiştir özelliğiyle tüm örnekleri tek seferde düzeltirsiniz. Bunun gibi temiz, 128 kbps kalitesindeki bir röportajın alıntılanabilir hâle gelmesi için genellikle yalnızca bu gözden geçirme yeterlidir.

Bu, konuşmacıları ücretsiz olarak etiketleyen transkripsiyonun yerini aldığı yerdir. Bir röportajın bölünmemiş metninden oluşan bir duvar, geriye dönüp kimin ne söylediğini işaretleyene kadar neredeyse işe yaramaz; Zaten sırayla bölünmüş olarak gelen bir transkriptten hemen alıntı yapabilirsiniz.

Bit hızının doğruluk açısından anlamı

MP3 kayıplı bir formattır: kodlama, dosyayı küçük tutmak için sesin en az duyulabilir olduğuna karar verilen kısımlarını atar. Bit hızı kodlayıcının bunu yaparken saniyede kaç kilobit harcadığını gösterir. Ne kadar düşük olursa o kadar çok atılır. MDN’nin mevcut MP3 codec referansı, formatın desteklenen bit hızlarını ve örnekleme hızlarını belgeliyor ve sıkıştırmasını kayıplı olarak tanımlıyor.

Konuşma tanıma büyük ölçüde ünsüz harflerdeki yüksek frekans ayrıntılarına dayanır. “On beş” ile “on altı” ya da “yapabilir” ile “yapamaz” arasındaki fark burada ortaya çıkar. Agresif sıkıştırma tam olarak bu ayrıntının ilk olduğu yerdir. Yani bit hızı, bir transkripti eşit şekilde bozmaz; duyması en zor kelimeleri konuşmanın kenarında yer.

Uygulamada:

Gereksiz yeniden kodlamayı önleyen birkaç açıklama. Değişken bit hızı (VBR) iyidir; konuşma için ** sabit bit hızına (CBR)** göre herhangi bir doğruluk cezası yoktur, bu nedenle bir VBR dosyasını sırf “düzeltmek” için dönüştürmeyin. Ayrıca sesin iki kanala ihtiyacı olmadığından, transkripsiyon için ** mono da stereo kadar iyi çalışır**. Herhangi bir şey varsa, aşağıdaki stereo çift sonlandırıcılarla ilgili nota bakın.

MP3 ve kayıpsız: bunun yerine ne zaman yeniden kayıt yapılmalı

MP3’ünüzü öncelikle WAV gibi kayıpsız bir formata dönüştürmenin yardımcı olup olmayacağı doğal bir sorudur. Olmayacak. Ses 128 kbps MP3 olarak kaydedildiğinde eksik ayrıntılar ortadan kalkar; aynı sesi bir WAV kabına sarmak, hiçbir ekstra bilgi taşımayan daha büyük bir dosya oluşturur. Yeni kayıt yapıyorsanız ve seçeneğiniz varsa, kayıpsız veya yüksek bit hızlı bir kaynak daha iyi bir başlangıç ​​noktasıdır (bu durum için WAV-to-text kılavuzuna bakın), ancak mevcut bir MP3’ü yukarıya doğru dönüştürmek hiçbir şey satın almaz.

Dürüst karar kuralı: elinizdeki tek kopya makul bit hızına sahip bir MP3 ise onu olduğu gibi yazıya dökün. Kayıt gerçekten kötüyse (kırpılmış, gürültüye gömülmüş veya 32 kbps hızında kaydedilmişse) ve onu tekrar yakalayabiliyorsanız, yeniden kayıt herhangi bir dönüştürmeden çok daha fazla yardımcı olacaktır. Yeni kayıt yaptığınızda, iki alışkanlık bit hızından daha önemlidir: Mikrofonu konuşan kişiye yakın tutun ve mümkünse her kişiye kendi mikrofonunu verin, çünkü hem kelimelerin hem de konuşmacı etiketlerinin doğru çıkmasını sağlayan şey kaynakta temiz bir ayrımdır.

Genel sorunları düzeltme

Kaba metinlerin çoğu araca değil kayda dayanmaktadır. Her zamanki suçlularla ilgili yapmanız gerekenler aşağıda açıklanmıştır.

Düşük ses seviyesi. Dalga biçimi düz görünüyorsa (çok sessiz bir kayıt), motorun çalışacak sinyali azdır ve doğrulukta kayıplar olur. Önce herhangi bir ses düzenleyicide sesi normalleştirin veya yükseltin, ardından daha yüksek sesli sürümü yükleyin. Seviyeyi artırmak, zayıf bir kayıt için en yüksek getiri sağlayan düzeltmelerden biridir.

Arka plan gürültüsü. Sabit gürültü (klima, yol vızıltısı) oldukça iyi bir şekilde işlenir; Kapı, öksürük veya çatal bıçak takımı gibi konuşmanın üzerine binen ani gürültü, sözcüklerin düşmesine neden olur. Yüklemeden önce hafif bir gürültü azaltma geçişi gerçekleştirebiliyorsanız bunu yapın ancak aşırı işlem yapmayın: yoğun gürültü giderme, doğruluğu gürültüden daha fazla zedeleyen bozulmalara neden olur.

Ağır aksanlar veya uzman sözcükler. Modern motorlar çok çeşitli İngilizce aksanlarını iyi bir şekilde işleyebilir. Güvenilir atlatmalar, ilaç adları, yasal alıntılar veya niş marka adları gibi motorun beklemesi için hiçbir nedeni olmayan alan terimleridir. Bunları yakalamak için dışa aktarmadan sonra bir göz atmayı planlayın ve bul ve değiştir’e güvenin: Bir şirket adı her seferinde aynı şekilde yanlış çıkarsa, tek bir düzeltme tüm dosyayı tarar.

Çok uzun MP3’ler. 6 saatlik kayıt tek başına sorun değildir. 10 saatlik tavan neredeyse her şeyi kapsar ve bunun üzerinde bir dosya boyutu sınırı yoktur, dolayısıyla önce uzun bir dosyayı parçalara ayırmanıza gerek yoktur. Aslında uzun bir dosyayı bozan şey, kayıt kalitesinin onun boyunca kaymasıdır: mikrofondan uzaklaşan bir konuşmacı, ilk saatten sonra düşen bir seviye, dolan ve daha gürültülü bir mekan. Yapabildiğiniz yerde kaynağı sabit tutun; yapamayacağınız durumlarda, daha kaba kısımların temiz olanlardan daha fazla düzenlemeye ihtiyaç duymasını bekleyin. Zaman damgaları bunu yönetmeyi kolaylaştırır: Tamamını yeniden dinlemek yerine, doğrudan kötü okunan yamaya geçebilirsiniz.

Örüşen konuşmacılar. İki kişi aynı anda konuştuğunda, motor kelimeleri daha yüksek sese atar; bu, herhangi bir araç için değil, genel olarak konuşmacı ayrımında bir sınırlamadır. Yükleme tarafında bir düzeltme yoktur; canlı bir grup kaydının çapraz konuşma bölümleri için bütçe düzenleme süresi.

konuşmacıları temiz bir şekilde ayrı tutmak

Konuşmacı ayırma (ayrıştırma), her transkripsiyonda hiçbir ekstra maliyet olmadan çalışır ve MP3 düzeyindeki birkaç şey, bunun ne kadar temiz çıktığını etkiler. Temel olarak nasıl çalıştığına dair ayrıntılı bilgi istiyorsanız konuşmacı ayrıştırmanın ne olduğuna bakın; pratik noktalar burada:

Transkriptinizi dışa aktarma

Doğru biçim, metinle ne yaptığınıza bağlıdır. Aşağıdaki tablo, sunulan 21 formattan insanların en çok eriştiklerini listeliyor; tüm ödünleşimler için gerçekte hangi transkript biçimine ihtiyacınız olduğuna bakın:

Biçim Şunun için en iyisi
TXT Notlar, kopyala-yapıştır, metni besleme başka bir araca
SRT Bir videodaki altyazılar veya zaman damgasına göre gezinme; ayrıca kaynağınız MP4 gibi bir video dosyası
VTT Web altyazıları ve tarayıcıda yerel video oynatıcılar
CSV E-tablo incelemesi ve hafif veri aktarımı
Markdown Notları, README stilinde dosyaları ve düzenlenebilir taslakları yayınlama
JSON Programatik işleme ve özel araçlar
DOCX Word’de çalışan düzenleyiciler veya açıklayıcılarla paylaşma
PDF Salt okunur paylaşım ve arşivleme

Her dışa aktarma, hiçbirinde filigran olmaksızın konuşmacı etiketlerini ve zaman damgalarını içerir.

Zaman damgaları ve düzenleme

Düzenleyici, her ifadeyi başlangıç ​​zamanı, konuşmacı etiketi ve metniyle birlikte gösterir. Sesin o bölümünü metne göre oynatmak için herhangi bir satırı tıklayın. Bu, tüm dosyayı elle temizlemeden zor bir pasajı kontrol etmek için kullanışlıdır.

SRT dışa aktarımındaki zaman damgaları ifade düzeyinde bulunur: kelime başına değil, konuşmacı dönüşü başına bir giriş. Altyazı ekleme, gezinme ve zaman damgasıyla alıntı yapma için doğru ayrıntı düzeyi budur. Kodda işlemek için kelime düzeyinde bir yapıya ihtiyacınız varsa JSON’u dışa aktarın: her giriş size konuşmacı etiketini, milisaniye cinsinden başlangıç ​​ve bitiş zamanını ve o dönüşe ait metni verir.


Yükleme, metne dönüştürme, dışa aktarma: sonucun ne kadar temiz olacağına karar veren MP3’e özgü ayrıntılarla birlikte tüm iş budur. MP3’ten metne dönüştürme sayfası tüm özelliklere genel bakış sunar ve başka bir kapsayıcıdaki bir kayıtla çalışıyorsanız sesten metne dönüştürme sayfası her formatı aynı şekilde kapsar. Bütün bir gösteri mi yapıyorsun? podcast transkripsiyon kılavuzu, transkripti bölüm notlarına dönüştürme konusunda adım adım yol gösterir ve dosyanız MP3 yerine WAV ise, WAV’dan metne dönüştürme kılavuzu büyük, kayıpsız dosyaların işlenmesiyle ilgili notlar içerir.

Bağımsız kaynaklar ve standartlar

Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.

Kaynakların incelenme tarihi:

Sıkça sorulan sorular

Yükleyebileceğim maksimum MP3 dosyası boyutu nedir?

Dosya boyutu sınırı olmaksızın dosya başına 10 saate kadar. Her dosya ön ödemeli dakikalarınızdan alınır; hizmet güvenliği ve aktif iş korumaları da geçerlidir.

MP3 bit hızı, transkripsiyon doğruluğunu etkiler mi?

Yaklaşık 64 kbps'nin altında olabilir. Çok düşük bit hızlarındaki sıkıştırma, konuşma tanımanın dayandığı ünsüz harfleri bozar, böylece konuşmanın kenarlarındaki kelimeler kaybolur. 128 kbps veya üzerinde, bit hızının önemli olduğu noktayı zaten geçmişsinizdir ve daha yüksek bir sayı, metni daha iyi hale getirmez.

Yalnızca ses içeren bir MP3'ten SRT altyazı dosyası alabilir miyim?

Evet. Hushscript herhangi bir kaynaktan SRT, TXT, DOCX ve JSON'u dışa aktarır. Giriş, video eklenmemiş ses olsa bile SRT, ifade başına zaman damgaları taşır; böylece bunu daha sonra doğrudan bir videonun üzerine bırakabilirsiniz.

Başlamak için kredi kartına ihtiyacım var mı?

Hayır. Bir kart, 30 ücretsiz dakikaya giden en hızlı yoldur. 1$'lık blokaj bunu doğrular, ardından hemen serbest bırakılır ve hiçbir zaman ücret alınmaz. Ülkenizde mevcut olan başka bir ödeme yöntemini kullanmayı tercih ederseniz, 30 dakikanız bunun yerine ilk dakika paketinizle birlikte gelir.

MP3'üm metne dönüştürüldükten sonra ne olur?

Transkript hazır olduğunda sunucudan silinir. Depolama veya model eğitimi için hiçbir şey saklanmaz. Ayrıca tek tıklamayla transkriptin kendisini de kontrol panelinizden silebilirsiniz.

MP3'teki konuşmacı ayrımı ne kadar doğrudur?

Konuşmacı etiketleri, insanlar sırayla konuştuğunda ve kayıt makul derecede temiz olduğunda en güvenilirdir. İki kişilik bir görüşme genellikle net bir şekilde ayrılır; İnsanların birbirleriyle konuştuğu gürültülü bir grup görüşmesinin ardından daha fazla elle düzenleme yapılması gerekir.

Değişken bit hızına sahip (VBR) bir MP3 çalışır mı?

Evet. VBR'de sorun yok. Konuşma için sabit bit hızına (CBR) kıyasla doğruluk dezavantajı yoktur. Mono ve stereo da çalışır; yüklemeden önce hiçbir şeyi yeniden kodlamanıza gerek yoktur.

İngilizce olmayan bir MP3'ü metne dönüştürebilir mi?

Evet. Dil, yaklaşık 99 dilde otomatik olarak algılanır. Temiz bir tek dilli kayıt en iyi şekilde kopyalanır; Cümlenin ortasında yoğun kod değiştirme işlemi herhangi bir motor için daha zordur.

30 ücretsiz dakikayla başlayın

Başlayın – 30 ücretsiz dakika