Röportajı özel olarak metne dönüştürme
Yazar: Hushscript Yayınlandı: Son inceleme:
Bir röportajı iyi bir şekilde yazıya dökmek aynı anda iki şey anlamına gelir: doğru metin ve net atıf. Kimin ne söylediğini anlayamadığınız bir kelime duvarı, neredeyse ham kayıt kadar zahmetlidir. Görüşme hassas olduğunda, hukuki bir konu, gizli bir kaynak, İK durumu, sesin nasıl ele alındığı, transkripsiyonun kendisi kadar önemlidir. Bu kılavuz tüm konuyu kapsar: kaydetmeden önce temiz ses elde etmek, transkripsiyonu çalıştırmak, görüşmeyi yapan kişi ile konuyu ayrı tutmak, zaman damgalarıyla doğru alıntılar yapmak ve her şeyi gizli tutmak.
Başlamadan önce ihtiyacınız olan şeyler
Liste kısa. Röportajın ses veya video dosyası olarak kaydedilmesine ihtiyacınız var. Hushscript herhangi bir yaygın formatı kabul eder, dolayısıyla bir telefon sesli notu, bir Zoom kaydı, özel bir kaydedicinin WAV’ı veya bir MP4 ekran yakalamanın tümü dönüştürme olmadan çalışır. Aşağıda ele alınan ve isteğe bağlı olmayan, kaydedilen herkesin onayına ihtiyacınız vardır. Ayrıca, tarayıcınızdaki Hushscript uygulaması olan transkripti görüntülemenin ve düzenlemenin bir yoluna ihtiyacınız var. Yükleme yok, eklenti yok.
Dil seçmenize gerek yok. Hushscript bunu yaklaşık 99 dilde otomatik olarak algılar, böylece iki dilli bir röportaj veya cümlenin ortasında değişen bir konu, siz hiçbir şey ayarlamanıza gerek kalmadan gerçekleştirilir. Listenin tamamını görmek istiyorsanız diller sayfasında bulabilirsiniz.
Kaydetmeden önce
Kayıt sırasındaki ses kalitesi, transkripsiyonun doğruluğundaki en büyük faktördür. Otomatik veya insan hiçbir transkripsiyon motoru, mikrofonun asla net bir şekilde yakalayamadığı bir kelimeyi kurtaramaz. Birkaç ayrıntı, daha sonra yapacağınız her şeyden daha fazla işe yarar.
Mikrofon yerleşimi. Şahsen bir röportaj için, her iki konuşmacıdan eşit uzaklıkta masanın üzerine yerleştirilen küçük bir kayıt cihazı, cebinizde bırakılan bir telefondan daha iyidir. Her kişiye kendi mikrofonunu verebiliyorsanız bunu yapın: iki temiz girişi ayırmak, bir karma odayı ayırmaktan daha kolaydır. Bir video görüşmesinde uzaktan görüşmeler için, platformun izin verdiği ölçüde her tarafı kendi kanalı olarak kaydedin çünkü iki kanal, tek bir aşağı karıştırılmış akıştan daha temiz bir şekilde ayrılır.
Sessiz bir ortam. HVAC uğultusu, pencereden geçen trafik, bir kafenin arka plandaki sohbeti ve boş odadaki yankının tümü doğruluk açısından kaybolur. Halı kaplı küçük bir oda, hatta kıyafetlerin asıldığı bir dolap, açık bir ofisten daha iyi ses çıkarır. Sahada, hedefinize yönlendirilen bir yönsel mikrofon, sesini çevrenin üzerinde yükseltmeye yardımcı olur.
Her şeyden önce izin verin. Bir kişiyi bilgisi olmadan kaydetmek birçok yerde yasa dışıdır ve her yerde kabul edilemez. Başlamadan önce hedefinize kayıt yaptığınızı söyleyin. Bazı yargı bölgeleri tek tarafın onayına tabidir, ancak birkaç ABD eyaleti ve birçok ülke de dahil olmak üzere bazıları, mevcut herkesin bunu kabul etmesini gerektirir. Şüpheye düştüğünüzde, başladıktan hemen sonra kayıt hakkında açık bir evet cevabı alın; böylece sözleşme dosyanın bir parçası olur.
Kullanılabilir format ayarları. Stüdyo kalitesine ihtiyacınız yoktur. 128 kbps veya daha yüksek WAV veya MP3 yeterlidir ve 16 kHz veya daha yüksek örnekleme hızı rahattır. Kaçınılması gereken tek şey, ünsüz harflerin birbirine karıştığı ve doğruluğun gözle görülür şekilde düştüğü telefon kalitesinin 8 kHz civarına düşürülmesidir.
Röportajı adım adım yazıya dökün
Akış, taahhütte bulunmadan önce kaliteyi görebilmeniz için oluşturulmuştur. Gerçek sıra şu şekildedir.
- Kaydınızı /audio-to-text adresine bırakın. Eğer videoysa, ses önce tarayıcınızda çıkarılır, böylece video dosyasının kendisi cihazınızdan asla ayrılmaz. Buradan yalnızca ses dahil oluyor.
- 30 saniyelik önizlemeyi okuyun. Hushscript, ilk yarım dakikayı metne dönüştürür ve siz bir hesap oluşturmadan önce bunu konuşmacı etiketleri uygulanmış halde size geri gösterir. Bu, hesap dışı adımdır: Konuşmacı ayrımını ve ifadeleri demoda değil, gerçek dosyanızda değerlendirebilirsiniz.
- Geri kalanını metne dönüştürmek için kaydolun. Hesap oluşturmak, tam transkripsiyonun kilidini açar. Yeni hesaplara kısa bir röportaj veya uzun bir röportaj için yeterli olan 30 ücretsiz dakika verilir. Hushscript bundan sonra abonelik gerektirmeden kullandıkça öde yöntemine geçer, bu nedenle yalnızca ihtiyacınız olduğunda dakika satın alırsınız.
- Yeniden etiketleyin ve dışa aktarın. Tamamlanan transkript, her biri bir konuşmacı etiketi ve zaman damgasıyla etiketlenmiş olarak her ifade için bir satır olarak geri gelir. Etiketleri gerçek adlarla yeniden adlandırın ve dışa aktarın.
İnsanlar “ücretsiz” kısmın nasıl çalıştığını sorduğundan ücretsiz dakikalarla ilgili bir not. 30 dakika bir kez verilir. Bunları açmanın en hızlı yolu, hızlı bir kart kontrolüdür: Kartın onaylanması için 1 dolarlık bir bloke yetkisi verilir ve ardından hemen serbest bırakılır, hiçbir ücret alınmaz. Başka bir şekilde ödeme yapmayı tercih ederseniz, ülkenizde mevcut olan alternatif bir yöntem de işe yarar ve ilk satın alma işleminizde 30 dakika size ulaşır. Her iki durumda da kart gerekli değildir.
Görüşmeyi yapan kişi ile konuyu ayrı tutun
Bu, zaten yeniden dinlemeniz gereken bir transkript yerine röportaj transkriptinin kullanılabilir hale geldiği yerdir. konuşmacı tanımlama özelliği, herhangi bir kurulum veya ekstra maliyet gerektirmeden her farklı sese kendi etiketini atar. Bunun gibi diyalog anlamına gelen iki kişilik bir röportaj için:
Konuşmacı A [00:00:07]: Projenin zor durumda olduğunu ilk fark ettiğiniz zamana beni geri götürebilir misiniz?
Konuşmacı B [00:00:13]: 2019'un başlarıydı. Sunumu ben yürütüyordum ve rakamlar artık eklenmiyordu yukarı.
Konuşmacı A [00:00:28]: Peki bu konuda ne yaptın?
Konuşmacı B [00:00:31]: Dürüst olmak gerekirse ilk başta hiçbir şey olmadı. Pişman olduğum kısım burası.
Gerçek isimler koymak için:
- Transkriptteki
Konuşmacı A’nın herhangi bir örneğini tıklayın. - İstediğiniz adı yazın, örneğin “Görüşmeci” veya deneğinizin adı.
- Bu konuşmacının her satırı aynı anda güncellenir.
Bunu her konuşmacı için bir kez yaparsınız. 90 dakikalık, iki kişilik bir görüşme için tüm geçiş bir dakikadan az sürer ve her satırın adı geçen bir kişiye atfedildiği, alıntıya hazır bir belgeyle bitirirsiniz. Bu ayrımın aslında nasıl çalıştığına dair ayrıntılı bilgi istiyorsanız, konuşmacı ayrıştırmanın nasıl çalıştığını sade bir dille olarak anlatabilirsiniz.
Çalışılmış bir örnek: bir saatlik araştırma görüşmesi
Telefonunuza .m4a dosyası olarak 58 dakikalık bir araştırma görüşmesi kaydettiğinizi varsayalım. Oda sessizdi, ikiniz de telefona yakındınız ve konunuz canlandırıldığında her zamanki gibi bir örtüşme oluyor.
Dosyayı /audio-to-text adresine bırakıyorsunuz. 30 saniyelik ön izleme, açılış sorunuzun Konuşmacı A olduğunu ve deneğinizin ilk cevabının Konuşmacı B olduğunu gösterir; bu, size ayrımın net olduğunu söyler. Kaydolun ve tüm dosyanın metne dönüştürülmesine izin verin. 58 dakikalık bir görüşme, bakiyenizin 58 dakikasını kullanır, yani 30 ücretsiz dakika yarıdan biraz fazlasını kapsar ve gerisini siz tamamlarsınız.
Transkript net bir şekilde ileri geri okunuyor. İlk Konuşmacı A’ya tıklıyorsunuz, kendi adınızı yazıyorsunuz, ilk Konuşmacı B’ye tıklayıp konu adınızı yazıyorsunuz ve tüm belge güncelleniyor. Göz gezdirirken, motorun konunuzu telefondan uzağa doğru eğildiği için ikinci bir etikete böldüğü üç kısa bölümü fark ediyorsunuz, böylece bunları birleştiriyorsunuz. Notlarınız için DOCX’e ve JSON’a aktarırsınız, böylece analiz komut dosyanız her ifadeyi başlangıç zamanı, bitiş zamanı ve konuşmacısıyla birlikte alabilir. Yüklemeden sonraki toplam uygulama süresi: birkaç dakika.
Zaman damgalarıyla doğru bir şekilde alıntı yapın
Transkriptteki her ifade bir zaman damgası taşır; bu, çıktının alıntı yapılmasını güvenli kılan şeydir. Bir makale, rapor veya makale için alıntı yaptığınızda yanındaki zaman damgasını not edin. Bu size doğruluk kontrolü sırasında dinleyeceğiniz kesin bir nokta verir, editöre alıntıyı doğrulamak için bir yol sunar ve bir kaynağın daha sonra söylediklerine itiraz etmesi durumunda size işaret edebileceğiniz bir şey verir. Bir alıntıyı aldıktan sonra ne kadar düzenli hale getireceğiniz, ister her yanlış başlangıcı koruyun, ister ifadeleri düzgün bir düzyazıya dönüştürün, bilerek yapılmaya değer bir stil seçimidir ve tam anlamıyla temiz ve birebir deşifre her iki kuralı da ortaya koyar.
DOCX dışa aktarma, zaman damgalarını satır içi tutar. Ham yapıya ihtiyacınız varsa, JSON dışa aktarımı size programlı olarak işleyebileceğiniz her girişin başlangıç zamanı, bitiş zamanı, konuşmacı ve metni içeren konuşma düzeyindeki verilerini verir. TXT dışa aktarma temiz okuma kopyasıdır ve röportaj bir videonun altında yer alacaksa SRT size zamanlanmış altyazı satırları verir.
Bilmeye değer bir sınır: zaman damgaları tek tek kelime değil, ifade düzeyindedir. Çoğu röportaj çalışması için tam olarak istediğiniz şey budur, çünkü bir heceden değil bir cümleden alıntı yapıyorsunuz. Altyazıları çekime yazmak için özellikle kelime düzeyinde zamanlamaya ihtiyacınız varsa, SRT satır zamanlaması neredeyse her amaç için yeterince yakındır.
Genel sorunlar ve bunların nasıl düzeltileceği
Röportaj kayıtlarının çoğu temiz bir şekilde yazıya aktarılır. Bir şeyler ters gittiğinde, bu durum neredeyse her zaman bir avuç sorundan biridir ve her birinin basit bir çözümü vardır.
Bir konuşmacı iki etikete bölünmüştür. Bu, en sık karşılaşılan beklenmedik durumdur. Bu genellikle kişinin sesinin yarı yolda değiştiği anlamına gelir: mikrofona yaklaşıyor veya uzaklaşıyor, kulaklıktan hoparlöre geçiyor veya çağrı sırasında hat kalitesi değişiyor. Motor, sesleri duyuluşlarına göre kümeler, böylece büyük bir değişim yeni bir ses olarak okunabilir. Düzenleyicide iki etiketi birleştirdiğinizde, yukarıdaki uygulamalı örnekte olduğu gibi tek geçişte düzeltilir.
İki kişi tek bir etikette birleştirildi. Tam tersi. Bu, iki ses gerçekten benzer olduğunda veya kayıt sessiz olduğunda ve farklılıkların duyulması zor olduğunda meydana gelir. Olayı net bir şekilde düzeltmek daha zordur, bu nedenle kayıt sırasında kişi başına bir tane olacak şekilde iki ayrı giriş, buna karşı en iyi sigortadır.
Karışık konuşma ve insanların birbirleriyle konuşması. Her ikisi de aynı anda konuştuğunda, otomatik veya insan olsun, herhangi bir transkripsiyon yapan kişi zorlanır çünkü kelimeler seste fiziksel olarak örtüşür. Hararetli bir röportajın en yoğun anlarının manuel olarak dinlenmeye ihtiyaç duymasını bekleyin. Zaman damgaları bu anları bulmayı kolaylaştırır.
Güçlü aksanlar veya uzmanlık terimleri. Doğruluk, aksanlarda oldukça iyi sonuç verir, ancak tanıdık olmayan özel isimler, teknik jargon ve adlar, otomatik transkripsiyonun kayma olasılığının en yüksek olduğu yerlerdir. Röportajınıza özel bir avuç isim ve terim için bir arama ve değiştirme geçişi yapın ve alıntı yapmayı düşündüğünüz her şeyi onaylayın. Mülakat, uzman sözcük dağarcığıyla dolu bir klinik veya araştırma görüşmesi olduğunda, dikte ve röportajlar için tıbbi transkripsiyon bu terimlerin nasıl ele alınacağını kapsar.
Sessiz veya uzak bir kayıt. Kişi mikrofondan uzaktaysa veya kısık sesle konuşursa doğruluk genel olarak düşer ve bu olaydan sonra herhangi bir yazılım düzeltmesi yapılmaz. Bu durumu önlemek için “kaydetmeden önce” bölümü bulunmaktadır. Zayıf bir kayıtla karşılaşırsanız yine de onu taslak olarak metne dönüştürün ve ardından sese göre düzeltin.
Çok uzun veya büyük bir dosya. Bir kayıt, dosya boyutu sınırı olmaksızın 10 saate kadar sürebilir; çok büyük bir kayıt bile doğrudan tarayıcıda hazırlanır. Doğal bir duraklama kullanarak yalnızca 10 saatlik sınırı aşan kayıtları bölün ve ardından her bölümü metne dönüştürün.
Ses kaynağı veya video kaynağı: hangisi yüklenecek
Aynı röportajın hem ses dosyası hem de videosu varsa, ikisini de yükleyin. Hushscript her iki durumda da sesten çalıştığı için transkript aynıdır. Pratik fark gizliliktir. Ona bir video verdiğinizde, ses tarayıcınızda çıkarılır ve yalnızca o ses gönderilir, böylece genellikle daha tanımlayıcı ve daha hassas bir yapı olan video, makinenizden asla ayrılmaz. Hassas bir röportaj için bu daha iyi bir varsayılandır. Zaten temiz bir salt ses dosyanız varsa, bunu yüklemek en kolay yoldur.
Hassas röportajları gizli tutmak
Yasal konulara, gizli kaynaklara, İK vakalarına veya kişisel açıklamalara dokunan röportajlar için sesin nasıl işlendiği, transkript kalitesinin ötesinde önemlidir. Hushscript tam olarak bunun için tasarlandı.
Transkript hazır olduğu anda ses sunucudan silinir. Saklama penceresi yoktur ve kaydın daha sonra bir yerde duran yedek kopyası yoktur. Bir video yüklediyseniz yalnızca çıkarılan ses gönderildi ve o da gitti. Konuşma motoru kayıtlarınız üzerinde eğitim almadığından gönderdiğiniz hiçbir şey bir modeli beslemez.
Transkriptlerin kendisi kullanımda değilken şifrelenir. Açıkça söylemek gerekirse, eğer depolama alanı ihlal edilmişse, saldırganın bulacağı şey okunamayan şifreli metindir, öznenizin sözleri değil. Bu, transkriptlerinizi okuyamayacağımız iddiası değil, sızıntıya karşı korumadır: ürünün size kendi çalışmanızı gösterebilmesi için anahtar bizim tarafımızda tutulur. Bu, herhangi bir bulut aracı için gerçekçi bir tehdit olan veri sızıntısının, okunabilir röportaj içeriğini aktarmayacağı anlamına gelir.
Gazetecilikte kaynak koruması, ayrıcalıklı yasal materyal gibi en güçlü durumlar için standart önlemi alın: sesin ve bitmiş transkripsiyonun kendi çevrimdışı kopyasını kontrol ettiğiniz bir cihazda saklayın ve bu dahil olmak üzere hiçbir bulut hizmetini tek kopya olarak kabul etmeyin. Veri işlemenin tam resmini istiyorsanız, özel transkripsiyon sayfası bunu gösterir.
Kaydınız bire bir röportaj yerine çok sunuculu bir podcast ise iş akışı aynıdır ve bir podcast’in nasıl yazıya geçirileceği çoklu ses ayrıntılarını kapsar.
Bağımsız kaynaklar ve standartlar
Hushscript bu bağımsız ve rakip olmayan kaynaklara başvurmuştur. Bu kaynaklar araştırmaları, standartları veya platformların çalışma biçimini açıklar; Hushscript’i destekledikleri anlamına gelmez.
Kaynakların incelenme tarihi: