Zum Hauptinhalt springen

So transkribieren Sie eine lange Aufnahme (2+ Stunden)

Autor: Veröffentlicht: Zuletzt geprüft:

Eine lange Aufzeichnung macht jedes Limit sichtbar: maximale Dauer, Browservorbereitung, Upload-Zuverlässigkeit, Minutensaldo und Warteschlangenschutz. Wenn Sie ein dreistündiges Vorstellungsgespräch, einen halbtägigen Workshop oder eine Vorstandssitzung in Text umwandeln möchten, überprüfen Sie diese Grenzen vor dem Hochladen und nicht nach einem fehlgeschlagenen Auftrag.

Hushscript benötigt für Uploads jeweils bis zu 10 Stunden, ohne Beschränkung der Dateigröße– große Dateien werden direkt in Ihrem Browser vorbereitet. Es gibt kein planmäßiges Tagegeld; Eine hohe 40-Stunden-Sicherheitshöchstgrenze und 24-Stunden-Sicherheitsvorkehrungen schützen den Dienst. Eine lange Datei ist hier kein Sonderfall; Es ist der gleiche Arbeitsablauf wie bei einem zweiminütigen Clip, der nur von alleine fertig wird.

Was Sie brauchen, bevor Sie beginnen

Sie brauchen drei Dinge, und wahrscheinlich haben Sie alle drei schon.

Kurze Anmerkung zu den Freiminuten, da diese bei langen Aufnahmen schnell durchbrennen: Sie erhalten einmalig 30 Freiminuten. Der schnellste Weg, sie freizuschalten, besteht darin, eine Karte hinzuzufügen (eine Vormerkung von 1 $ validiert sie und wird sofort freigegeben, ohne dass eine Gebühr erhoben wird), und die Minuten landen sofort. Wenn Sie lieber eine andere in Ihrem Land verfügbare Zahlungsmethode verwenden möchten, gelten die 30 Minuten stattdessen bei Ihrem ersten Einkauf. Eine Karte ist nicht erforderlich; Es ist einfach der schnellste Weg. Dreißig Minuten reichen aus, um einen kurzen Abschnitt zu transkribieren und die Genauigkeit zu beurteilen, bevor Sie ein komplettes Paket in eine dreistündige Datei übertragen.

Was vor einem langen Upload überprüft werden muss

Vier Überprüfungen verhindern die meisten Überraschungen:

Bestätigen Sie diese Grenzen vor dem Hochladen. Hushscript gibt sie hier an, damit ein langer Job anhand der Quelldauer geplant werden kann und nicht durch Ausprobieren entdeckt werden muss.

Eine lange Aufnahme Schritt für Schritt transkribieren

Es gibt keinen langen Aufnahmemodus zum Einschalten. Der Vorgang ist identisch mit einem kurzen Clip; es läuft nur länger im Hintergrund.

  1. Öffnen Sie den Konverter und legen Sie Ihre Datei ab. Gehen Sie zu Audio in Text und ziehen Sie die Aufnahme in den Upload-Bereich oder klicken Sie zum Durchsuchen. Es wird jedes gängige Audio- oder Videoformat akzeptiert. Wenn es sich um ein Video handelt, wird der Ton zu diesem Zeitpunkt in Ihrem Browser extrahiert, sodass die umfangreiche Videodatei nie Ihren Computer verlässt.
  2. Überprüfen Sie die 30-Sekunden-Vorschau. Bevor Sie sich anmelden, bereitet Hushscript einen kurzen Clip in Ihrem Browser vor, sendet diesen Clip zur Transkription und zeigt Ihnen die mit dem Sprecher gekennzeichnete Ausgabe. Die vollständige Aufzeichnung bleibt zu diesem Zeitpunkt lokal. Lesen Sie die Vorschau, vergewissern Sie sich, dass die Sprecher sinnvoll aufgeteilt sind und die Worte stimmen, und Sie werden wissen, ob der Ton für den gesamten Vortrag sauber genug ist.
  3. Melden Sie sich an, um den Rest zu transkribieren. Wenn die Vorschau richtig aussieht, melden Sie sich an und laden Sie die vollständige Datei hoch. Hier kommt es auf Ihr Minutenguthaben an: Eine 150-minütige Datei dauert 150 Minuten. Stellen Sie sicher, dass das Paket, über das Sie verfügen, die Dauer abdeckt.
  4. Lassen Sie den Auftrag von selbst abschließen. Die Verarbeitungszeit variiert je nach Dateilänge und Dienstauslastung, der Auftrag wird jedoch unbeaufsichtigt ausgeführt. Sie müssen die Registerkarte nicht im Fokus behalten; Kommen Sie zurück, wenn es fertig ist.
  5. Beschriften Sie die Sprecher neu. Das Transkript kommt mit generischen Bezeichnungen wie „Sprecher A“ und „Sprecher B“ an. Benennen Sie „Sprecher A“ im Editor einmal in einen richtigen Namen um und es wird überall im Dokument aktualisiert, sodass ein dreistündiges Interview durchgehend mit den richtigen Namen gelesen wird.
  6. Im gewünschten Format exportieren. Laden Sie es in einem von 21 Formaten (darunter TXT, SRT, DOCX, PDF und Untertitel- und Editor-Timeline-Format) sowie einem passwortgeschützten Format herunter .husharchive, ohne Wasserzeichen auf einem von ihnen. Bei langen Dateien ist SRT die richtige Wahl, da Sie mit seinen Zeitstempeln direkt zu jedem Zeitpunkt springen können, anstatt zu scrollen.

Das Ergebnis befindet sich in Ihrem Dashboard mit Sprecherlabels, Zeitstempeln und dem vollständigen Exportmenü und bleibt dort, damit Sie darauf zurückgreifen können.

Ein funktionierendes Beispiel: ein 2,5-stündiges aufgezeichnetes Interview

So sieht das mit einer echten Dateiform aus. Angenommen, Sie haben ein 2-Stunden-30-Minuten-Interview als einzelne MP3-Datei aufgezeichnet: zwei Personen, eine leise, eine laute, aufgenommen über einen Videoanruf.

Sie legen die MP3-Datei im Upload-Bereich ab. Die 30-sekündige Vorschau zeigt zwei bereits im Eröffnungsbeispiel getrennte Sprecher. Sie melden sich an; Die 150-minütige Datei wird hochgeladen und der Job beginnt. Wenn es abgeschlossen ist, ist das Ergebnis ein fortlaufendes Dokument mit Zeitstempeln, die ununterbrochen von 00:00:00 bis 02:30:00 laufen.

Die Rohausgabe sieht so aus:

[00:00:04] Sprecher A: Vielen Dank, dass Sie sich die Zeit genommen haben. Können wir damit beginnen, wie das Projekt begann?
[00:00:11] Sprecher B: Natürlich. So richtig fing es also Anfang 2023 an, als...

Sie benennen „Sprecher A“ einmal in „Interviewer“ und „Sprecher B“ in „Betreff“ um und jede Zeile wird aktualisiert. Dann exportieren Sie zweimal: eine TXT-Datei zum Einfügen in eine Zusammenfassung für einen First-Pass-Digest und eine SRT-Datei, sodass Sie beim Verfassen eines direkten Zitats auf den Zeitstempel klicken und genau hören können, wie es gesagt wurde. Gesamtkosten: 150 Minuten weniger als Ihr Guthaben, ein Upload, kein Aufteilen, kein Abschneiden, kein zweiter Versuch.

Sprecher während einer langen Sitzung beschriftet halten

Diarisierung bei einer 3-stündigen Aufnahme ist wirklich schwieriger als bei einem 10-minütigen Clip: Stimmen driften, Pausen werden länger und Hintergrundgeräusche kommen und gehen. Hushscript führt die Beschriftung auf einmal über das gesamte Transkript aus, sodass die Beschriftungen durchgehend konsistent bleiben, aber die Aufnahme selbst kann dabei helfen oder schaden.

Zur Aufnahmezeit:

Audioqualität:

Sobald das Transkript zurück ist, ist das Umbenennen von „Sprecher A“ mit einem echten Namen eine einmalige Bearbeitung, die sich im gesamten Dokument ausbreitet. Weitere Informationen zur Funktionsweise der Kennzeichnung selbst finden Sie unter Sprecheridentifizierung.

Datei teilen oder als Ganzes hochladen?

Die kurze Antwort für fast alle: als Ganzes hochladen Eine lange Aufnahme in Teile aufzuteilen ist das, was man vermeiden sollte, nicht die Sache, die man machen sollte, und es gibt nur zwei Situationen, in denen das der Fall ist Es ist notwendig.

Laden Sie es als eine Datei hoch, wenn die Aufzeichnung 10 Stunden oder weniger dauert, was die überwiegende Mehrheit der Interviews, Vorträge, Meetings und Panels abdeckt – es gibt keine Dateigrößenbeschränkung, die umgangen werden muss. Eine Datei bedeutet einen kontinuierlichen Satz Zeitstempel und einen konsistenten Satz Sprecherlabels. Durch die Aufteilung werden beide unterbrochen: Jeder Teil startet seine Uhr bei Null neu, und dieselbe Person kann in Teil zwei ein anderes Etikett erhalten als in Teil eins, sodass Sie von Hand sticken und neu zuordnen müssen.

Sprachsysteme teilen möglicherweise immer noch lange Audiodaten intern auf. In einer aktuellen IWSLT 2026-Studie zur Langform-Sprachverarbeitung wurden mehrere Segmentierungsstrategien verglichen und festgestellt, dass sich die Wahl auf die Robustheit auswirkt. Das ist ein Problem auf Engine-Ebene und kein Grund, Ihre Quelle manuell zu kürzen: Bei der Beibehaltung eines einzigen Uploads bleibt ein fortlaufendes, für den Benutzer sichtbares Transkript erhalten, während die Verarbeitungspipeline ihre eigenen internen Grenzen verwaltet.

Nur teilen, wenn die Aufzeichnung tatsächlich mehr als 10 Stunden dauert, wie etwa bei einer mehrtägigen Konferenzaufzeichnung. Schneiden Sie in diesem Fall eine natürliche Pause (eine Sitzungspause) statt mitten im Satz ein und notieren Sie sich den Versatz, damit Sie die Zeitstempel später neu nummerieren können. Wenn Sie eine MP3-Datei vor dem Hochladen schneiden, bevorzugen Sie eine konstante Bitrate (CBR) gegenüber einer variablen Bitrate (VBR), da VBR in einigen Editoren zu Synchronisierungsabweichungen führen kann.

Eine Videodatei mit mehreren Gigabyte ist kein Problem. Da Hushscript das Audio in Ihrem Browser vor dem Hochladen extrahiert, entspricht die Größe des Quellvideos nicht der Upload-Größe, und es gibt keine Obergrenze für die Größe dieser Quelldatei – nur der viel kleinere Audiostream wird übertragen, solange Ihr Browser und Ihr Gerät mit der Vorbereitung zurechtkommen.

Beste Einstellungen für Genauigkeit bei langen Audiodaten

Der größte Faktor für die Genauigkeit ist die Sprachklarheit, nicht das Sample Rate oder Dateiformat. Speziell für lange Sitzungen:

Fehlerbehebung bei häufigen Problemen mit langen Dateien

Die Genauigkeit nimmt in der hinteren Hälfte der Aufnahme ab. Dabei handelt es sich fast immer um sinkende Audiopegel oder steigende Raumgeräusche spät in einer langen Sitzung, nicht um eine Längenbeschränkung. Überprüfen Sie die Originalaufzeichnung rund um die Zeitstempel, in denen sich Fehler häufen. Wenn der Pegel gesunken ist, normalisieren Sie ihn, führen Sie ihn erneut aus und verwenden Sie zur Bestätigung die 30-Sekunden-Vorschau in einem späteren Segment, bevor Sie die Minuten erneut ausgeben.

Zwei Personen verschmelzen immer wieder zu einem Sprecher. Überlappende Sprache und Übersprechen sind die übliche Ursache. Eine perfekte Lösung gibt es im Nachhinein nicht, aber eine Aufnahme mit mehr Trennung zwischen den Stimmen (eine Spur pro Kanal oder weiter entfernte Mikrofone) wird beim nächsten Mal weitaus sauberer aufgezeichnet. In dem Transkript, das Sie jetzt haben, können Sie gelegentliche Fehlbezeichnungen manuell im Editor korrigieren.

Das Hochladen einer großen Datei dauert langsam. Die Upload-Geschwindigkeit hängt von Ihrer Verbindung ab, nicht vom Tool. Denken Sie bei einem Multi-Gigabyte-Video daran, dass der Ton zuerst lokal extrahiert wird, sodass der tatsächliche Upload viel kleiner ist als die Datei auf der Festplatte. Wenn Sie eine schwache Verbindung haben, gelangen Sie dorthin, indem Sie eine Kabelverbindung verwenden oder sie einfach laufen lassen.

Hintergrundgeräusche während der gesamten Aufnahme. Ständige Geräusche (Klimaanlage, Verkehr, Zimmerbrummen) verringern die Genauigkeit in der gesamten Datei. Eine leichte Normalisierung der Lautstärke hilft normalerweise mehr als die Rauschunterdrückung, die tendenziell die Sprache beeinträchtigt. Wenn ein Segment stark betroffen ist, können Sie es mithilfe der Zeitstempel trotzdem finden und abhören.

Das Transkript scheint vorzeitig beendet zu sein. Auf Hushscript deckt ein Transkript die gesamte Datei ab; es gibt keine stille Kürzung. Wenn der Text kurz erscheint, vergleichen Sie den endgültigen Zeitstempel mit der tatsächlichen Länge der Aufzeichnung. Lange Abschnitte der Stille oder Musik erzeugen einfach nur wenige Wörter, die als „fehlend“ gelesen werden können, dies aber nicht ist.

Exportieren eines langen Transkripts: Welches Format

Bei einer mehrstündigen Sitzung ändert das von Ihnen ausgewählte Format die Verwendbarkeit des Transkripts.

Jeder Export ist in jedem Plan enthalten, ohne Wasserzeichen und ohne separate Gebühr zum Freischalten von Untertiteln.


Für lange Aufnahmen, die nach Minute abgerechnet werden, vermeidet die Pay-as-you-go-Transkription einen wiederkehrenden monatlichen Plan. Sie zahlen für die Stunden, die Sie transkribieren, mit einer hohen gleitenden Sicherheitsobergrenze und aktiven Jobkontrollen für ungewöhnlich große Stapel. Für die beiden gängigsten Langzeitaufzeichnungsaufgaben gibt es eigene exemplarische Vorgehensweisen: wie man einen Podcast transkribiert deckt Episoden mit mehreren Gästen und Shownotizen ab, und wie man eine Vorlesung transkribiert behandelt Audio-Macken im Klassenzimmer wie Nachhall und Fragen des Publikums von der anderen Seite des Raums. Und wenn es sich bei Ihrem Material um einen Stapel separater Dateien und nicht um eine lange Aufnahme handelt, umfasst das Transkribieren eines Ordners mit Aufnahmen das Durchlaufen dieser als Stapel.

Unabhängige Quellen und Standards

Hushscript hat diese unabhängigen, nicht konkurrierenden Quellen herangezogen. Sie erläutern Forschung, Standards oder Plattformfunktionen und stellen keine Empfehlung durch Hushscript dar.

Quellen geprüft am:

Häufig gestellte Fragen

Gibt es eine Dateigrößenbeschränkung für lange Aufnahmen?

Nein. Aufzeichnungen können bis zu 10 Stunden dauern, ohne Beschränkung der Dateigröße – große Dateien werden direkt in Ihrem Browser vorbereitet. Es gibt keine planbasierte Tages- oder Monatspauschale, es gelten jedoch eine hohe 40-Stunden-Sicherheitsobergrenze rund um die Uhr und Schutzmaßnahmen für den aktiven Arbeitsplatz.

Muss ich eine lange Aufnahme in Teile aufteilen?

Nein. Eine 3- oder 8-Stunden-Datei wird als ein einziger Upload hochgeladen und kommt als ein Transkript mit fortlaufenden Zeitstempeln zurück. Sie müssen nur dann aufteilen, wenn die Aufnahme selbst länger als 10 Stunden dauert.

Werden die Sprecherlabels über eine 3-stündige Aufnahme hinweg konsistent bleiben?

Ja. Die Aufzeichnung des Sprecherdiarisierung erfolgt auf einmal über das gesamte Transkript und nicht Stück für Stück, sodass jede Person von der ersten bis zur letzten Minute die gleiche Bezeichnung behält.

Kann ich anstelle einer Audiodatei eine lange Videodatei hochladen?

Ja. Der Ton wird in Ihrem Browser aus dem Video extrahiert, bevor etwas gesendet wird, sodass nur der Ton den Server erreicht. Das Originalvideo wird nie hochgeladen, wodurch eine Vorlesungsaufzeichnung mit mehreren Gigabyte normalerweise zu einem viel kleineren Audio-Upload wird.

Wie lange dauert die Transkription einer langen Datei?

Die Verarbeitungszeit variiert je nach Aufzeichnungslänge und Dienstauslastung. Lange Jobs werden unbeaufsichtigt ausgeführt, sodass Sie die Seite verlassen und zurückkehren können, wenn das Transkript fertig ist.

Welche Exportformate eignen sich am besten für ein langes Transkript?

TXT zum Einspeisen in andere Tools, SRT zum Springen zu einem Zeitstempel, DOCX zum Teilen und Kommentieren und JSON für die Rohdaten zu Sprecher und Timing. Alle Exportformate sind ohne Wasserzeichen enthalten.

Verfallen meine Minuten, wenn ich nur gelegentlich transkribiere?

Minuten verfallen nach 180 Tagen ohne abgeschlossene Transkription oder Minutenkauf. Bei beiden Aktivitäten wird das Zeitfenster zurückgesetzt und wir senden Ihnen vor Ablauf eine E-Mail.

Mit 30 kostenlosen Minuten starten

Starten – 30 kostenlose Minuten