Saltar al contenido principal

Cómo transcribir un podcast y crear notas del episodio

Autor: Publicado: Última revisión:

La transcripción de un podcast se gana el doble. Hace que el episodio se pueda buscar y sea accesible para los oyentes que leen en lugar de escuchar, y le brinda materia prima para notas del episodio, citas y subtítulos sin tener que reproducir toda la grabación. El soporte de la plataforma es concreto, no teórico: Apple Podcasts documenta transcripciones y navegación de capítulos para creadores. Esta guía explica cómo transcribir un episodio, etiquetar a cada presentador e invitado y convertir el resultado en un documento utilizable de notas del episodio.

La parte que ahorra más tiempo es la separación de los hablantes. Una transcripción que se lee como un bloque de texto indiviso requiere casi tanto trabajo como el audio en sí. Hushscript etiqueta cada voz automáticamente y la incluye de forma gratuita en cada transcripción, para que la conversación vuelva a ser una conversación.

Lo que necesitas antes de comenzar

Una grabación del episodio, en cualquier formato de audio o video común. Si exportó un archivo de audio simple desde su editor (MP3, WAV, M4A), eso funciona directamente. Si su única copia es la grabación de video de Zoom, Riverside o Ecamm, eso también funciona y el audio se extrae en su navegador para que el video nunca se cargue.

El audio de fuente limpia ayuda más que cualquier otra cosa. Las etiquetas de los hablantes funcionan mejor cuando cada voz es distinta y las personas no hablan constantemente entre sí. Si grabó a cada participante en una pista separada, ya tendrá la entrada más limpia posible. Una sola pista mixta todavía funciona; simplemente se apoya más en la diarización para distinguir las voces. Si puede, grabe las voces en seco y luego agregue la base musical en su editor, ya que un jingle que se ejecuta bajo un discurso continuo es lo único que reduce de manera confiable la precisión.

Necesitará una cuenta para transcribir un episodio completo. La vista previa de 30 segundos es el paso sin cuenta, por lo que puedes verificar las etiquetas de los hablantes y la calidad del texto en tu archivo real antes de registrarte para cualquier cosa.

Transcribe el episodio

El flujo sigue el orden real del embudo: vista previa primero, luego regístrate y luego transcribe el resto.

  1. Suelta el archivo en /podcast-transcription. Hushscript recorta los primeros 30 segundos en su navegador y devuelve una vista previa etiquetada por el hablante. No se necesita ninguna cuenta para este paso. Podrás ver exactamente cómo se dividen el anfitrión y el invitado y qué tan limpio se lee el texto en tu propio audio.
  2. Regístrate para transcribir el resto. Una vez que ingresas tu correo electrónico e inicias sesión, subes el episodio completo. Las cuentas nuevas obtienen 30 minutos gratis para probar, concedidos una vez. La forma más rápida de reclamarlos es con un cheque con tarjeta de $1 que se autoriza y luego se libera de inmediato, sin ningún cargo. Si prefieres un método de pago alternativo disponible en tu país, los 30 minutos llegan con tu primera compra; no se requiere una tarjeta.
  3. Deje que se ejecute la transcripción y luego exporte. La transcripción regresa con una etiqueta y una marca de tiempo en cada expresión. Exporte DOCX para un documento que editará en notas del episodio, TXT para un bloque limpio para pegar en su CMS, SRT para subtítulos en una versión de video o JSON si su anfitrión de podcast acepta cargas de transcripciones a nivel de expresión.

Los 30 minutos gratuitos pueden cubrir un episodio corto o una sección representativa de uno más largo. Un episodio de 60 minutos utiliza 60 minutos de su saldo, por lo que necesita una recarga después de la asignación de prueba.

Etiquete a cada anfitrión e invitado

La agenda del hablante se ejecuta automáticamente, por lo que no activa nada. Para un episodio de dos personas (un presentador, un invitado), la transcripción aparece claramente dividida, con cada línea atribuida a una de dos etiquetas. Para un panel, Hushscript separa tantas voces distintas como escucha, sin límite de hablante.

Para reemplazar las etiquetas genéricas con nombres reales:

  1. Haga clic en cualquier instancia de Hablante A en el editor.
  2. Escriba el nombre, como “Alex” o “Host”.
  3. Cada instancia de esa etiqueta se actualiza a lo largo de la transcripción a la vez.

Se vuelve a etiquetar cada voz una vez, no línea por línea. Un episodio de dos personas dura aproximadamente un minuto; un panel de cuatro personas requiere algunas. Después de volver a etiquetar, una parte de la transcripción dice así:

Alex [00:03:12]: Entonces usted dirigía la empresa en ese momento. ¿Cuáles fueron las primeras señales?
Jamie [00:03:19]: Sinceramente, fueron los números. Tuvimos una caída del 40 % en un trimestre.
Alex [00:03:27]: ¿Y no pudiste explicarlo en ese momento?
Jamie [00:03:35]: No durante semanas. Esa fue la parte que me mantuvo despierto.

Esa es la estructura que necesitas para extraer citas y escribir capítulos con marca de tiempo. Debido a que las etiquetas abarcan todo el archivo, un episodio largo se etiqueta exactamente una vez. Para conocer los mecanismos detrás de la separación de voces, consulte cómo funciona la diarización del hablante.

Cuando las etiquetas necesitan una solución

La diarización es precisa en grabaciones limpias, pero no es infalible, y vale la pena conocer un par de patrones para poder corregirlos rápidamente.

Si dos invitados tienen palabras muy similares voces, una línea ocasional puede llegar al hablante equivocado. Escanee la transcripción con el audio abierto y reasigne a mano las pocas líneas mal atribuidas. Esto es mucho más rápido que escribir los nombres de los hablantes desde cero, porque solo está solucionando excepciones.

Si un coanfitrión silencioso que apenas habla se fusiona en otra etiqueta, dé a los hablantes principales sus nombres reales primero y luego busque las pocas líneas que deberían pertenecer a la voz tranquila. En una grabación bien separada rara vez se llega a cualquiera de los dos casos, por lo que vale la pena configurar una pista separada por persona en un tiempo récord.

Problemas comunes y sus causas reales

La mayoría de los problemas de transcripción se remontan a la grabación, no a la herramienta. Vale la pena planificar algunos antes de publicar un programa.

Difonía y personas hablando entre sí. Esto es lo más difícil para cualquier sistema de separación de hablantes, porque dos voces en el mismo instante no se pueden dividir claramente. El texto generalmente sigue siendo legible, pero un momento de gran superposición puede aterrizar en un hablante o desdibujarse en la unión. Una buena higiene del podcast ya ayuda en este caso: un presentador que deja que los invitados terminen produce una transcripción más limpia como efecto secundario. Cuando esto suceda, corrija esas pocas líneas a mano con el audio.

Invitados remotos grabados en una pista. Una llamada grabada como un único archivo mixto es más difícil de separar que la misma llamada capturada como una pista por participante. Si su herramienta admite la grabación local por participante, úsela; Si solo tiene el archivo mixto, la transcripción aún llega, solo depende más de la diarización. De cualquier manera, el audio es la misma carga, por lo que no hay nada diferente que hacer en el momento de la transcripción.

Acentos fuertes y cambio de código. Hushscript detecta el idioma automáticamente y transcribe alrededor de 99 idiomas, con precisión de primer nivel en dieciocho de ellos, por lo que un invitado con un acento pronunciado en un idioma admitido se maneja bien. Un invitado que cambia entre dos idiomas a mitad de una frase es el caso realmente difícil; Espere limpiar las frases cambiadas a mano. Para obtener la lista completa de idiomas admitidos, consulte la página de idiomas.

Música de introducción y aguijones. Generalmente se omite una base musical entre segmentos en lugar de transcribirla como una tontería. Los problemas comienzan sólo cuando la música suena bajo un discurso continuo durante un período prolongado. La solución limpia es editorial: grabe las voces secas y coloque la música después, de modo que la transcripción solo vea el habla.

Nombres, jerga y ortografía de la marca. Un invitado especializado utilizará términos y nombres de productos que el modelo puede representar fonéticamente. Estos se solucionan rápidamente porque se repiten, y una función de búsqueda y reemplazo en el documento exportado soluciona los errores ortográficos recurrentes de una sola vez.

Algunos consejos de precisión

El factor más importante es la calidad de la grabación, por lo que el esfuerzo invertido en los micrófonos y en una habitación silenciosa se amortiza a la hora de la transcripción. Más allá de eso, una pista por hablante proporciona el texto más limpio y las etiquetas de hablante más limpias, ya que el sistema nunca tiene que desenredar dos voces de una forma de onda. Mantenga el micrófono de un invitado cerca y consistente en lugar de desviarse, y dedicará su tiempo de edición a la sustancia en lugar de a las reparaciones.

Cuando revise, lea con el audio abierto y corrija en pasadas: primero las etiquetas de los hablantes, luego los nombres y la jerga mal escuchados, luego la superposición ocasional. Trabajar por categoría es más rápido que leer de arriba a abajo y le deja un documento lo suficientemente limpio como para publicarlo.

De la transcripción a las notas de presentación

Las notas de presentación no son un resumen de todo lo dicho. Son una ayuda de navegación para los oyentes y una superficie de búsqueda para las personas que aún no han presionado reproducir. Una estructura que funciona para la mayoría de entrevistas y conversaciones muestra:

Resumen del episodio, de dos a cuatro oraciones. Extraiga el tema central de la transcripción. ¿Cuál es el argumento, la historia o la conclusión central? Escríbalo para que alguien decida si quiere escucharlo.

Capítulos con marca de tiempo. Escanee la transcripción para ver cambios de tema. Cada vez que la conversación gire hacia un tema nuevo, anote la marca de tiempo y escriba una descripción de una línea. Las marcas de tiempo provienen directamente de la transcripción, por lo que nunca volverás a escucharlas para encontrarlas.

[00:02:15] Lanzamiento de la empresa sin presupuesto de marketing
[00:14:30] La caída del 40% en los ingresos y qué la causó
[00:28:44] Reconstrucción: qué cambió internamente
[00:51:00] Consejos para fundadores en la misma posición

Citas clave. Escriba dos o tres líneas que capturen las principales afirmaciones del episodio o sus momentos más citables. Cite palabra por palabra la transcripción y atribuya cada una al hablante por su nombre. Ya sea para ejecutar una cita exactamente como se dice o recortar el relleno y los comienzos en falso para obtener notas más limpias es una decisión que vale la pena tomar a propósito, y transcripción depurada y transcripción literal explica ambos. Como el texto se puede buscar, encontrar el texto exacto de una línea que recuerdas a medias lleva unos segundos.

Enlaces y recursos de invitados. Añade todo lo que el invitado haya mencionado. Para encontrar URL habladas rápidamente, busque en la transcripción fragmentos como “punto com” o “barra”; la gente dice direcciones web en voz alta con más frecuencia de lo que cabría esperar, y una transcripción textual las captura.

Transcripción completa, opcional pero valiosa. Pegue el texto completo debajo de las notas o enlace a una página de transcripción separada. Aquí es donde reside el valor de la búsqueda, porque el contenido hablado se vuelve indexable. Si su plataforma de alojamiento acepta cargas de transcripciones, la exportación JSON transporta datos a nivel de expresión; de lo contrario, el texto sin formato es suficiente.

Un ejemplo práctico

Supongamos que grabó una entrevista de 58 minutos con el fundador en dos pistas y las mezcló en un MP3. Dejas el MP3 en /podcast-transcription, miras la vista previa de 30 segundos dividir al anfitrión y al invitado correctamente, te registras y subes el archivo completo. La transcripción regresa con Hablante A y Hablante B; les cambia el nombre a “Alex” y “Jamie” con dos clics. A partir de ahí, el resumen proviene de los dos primeros minutos, los cuatro capítulos anteriores provienen de la búsqueda de cambios de tema y las dos citas provienen de la búsqueda en el texto de los momentos que recuerda. Las notas del episodio desde el principio hasta el final duran aproximadamente quince minutos, la mayor parte de las cuales las editas tú mismo en lugar de esperar o transcribir.

Agregar leyendas o subtítulos

Si publica una versión en video del episodio en una plataforma como un servidor de video, un video de Spotify o LinkedIn, la exportación SRT es un archivo de subtítulos cronometrado listo para cargar. No hay ningún paso adicional, porque la transcripción que ya generó contiene los datos de tiempo. Para conocer el flujo de trabajo más amplio para obtener subtítulos en un clip, incluidos archivos grabados versus archivos sidecar, consulte cómo agregar subtítulos a un video.

Si su punto de partida es una grabación de video en lugar de una exportación de audio, el proceso es idéntico; el audio se extrae primero en su navegador. La página video a texto cubre esa ruta en su totalidad.

Episodios largos y de varias partes

Para un episodio de larga duración o una grabación en vivo, Hushscript admite cargas de hasta 10 horas de duración, sin límite de tamaño de archivo. Un panel de cuatro horas o un episodio en formato documental se presenta como un solo archivo en lugar de dividirse en partes, lo cual es importante por dos razones. Las etiquetas de los hablantes se mantienen consistentes en todo el archivo, por lo que puede volver a etiquetarlas una vez. Y las marcas de tiempo son continuas, por lo que un capítulo en la marca de tres horas dice [03:12:40] en lugar de reiniciar desde cero en la segunda parte.

Si graba una serie de varias partes en una sesión, transcriba toda la sesión como un solo archivo y luego divida las notas del episodio por partes. Cortar el audio primero solo multiplica el trabajo de reetiquetado.

Por qué esto se vuelve rápido

Para una cadencia de publicación regular, semanal o dos veces por semana, la rutina de transcripción a notas de programa se comprime a minutos por episodio una vez que lo haya hecho varias veces: suelte el archivo, vuelva a etiquetar a los hablantes, busque capítulos, extraiga citas, exporte. Las etiquetas de los hablantes que hacen la atribución de forma gratuita es lo que elimina la parte tediosa. Dedicas tu tiempo al juicio editorial que las notas realmente necesitan, no a descubrir quién dijo qué.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Cómo etiqueto al presentador y a cada invitado en la transcripción?

Hushscript separa a los hablantes automáticamente con etiquetas como 'Hablante A' y 'Hablante B'. Después de la transcripción, haga clic en cualquier etiqueta en el editor, escriba el nombre real y se actualizará en todos los lugares donde aparezca el hablante. Un episodio de dos personas tarda aproximadamente un minuto en volver a etiquetarse; un panel con cuatro voces toma unos minutos.

¿Las etiquetas de los hablantes tienen un costo adicional?

No. Las etiquetas de los hablantes se incluyen de forma gratuita en cada transcripción que produce Hushscript, sin tarifa por hablante y sin límite en la cantidad de voces. Muchas herramientas bloquean esto detrás de un nivel superior; aquí es parte de la salida estándar.

¿Puedo transcribir una grabación de vídeo del podcast?

Sí. Si tiene un archivo de video como MP4, MOV o MKV, el audio se extrae en su navegador antes de que se cargue algo, por lo que el video permanece en su dispositivo. Solo el audio extraído llega al servidor, lo que también evita que un archivo de vídeo grande obstruya tu conexión.

¿Cuánto tiempo puedo transcribir un episodio de una sola vez?

Hasta 10 horas por carga, sin límite de tamaño de archivo. Un episodio de 60 minutos, una inmersión profunda de dos horas o una grabación en vivo de cuatro horas se reproducen como un solo archivo, por lo que puede volver a etiquetar los hablantes una vez en lugar de unir partes.

¿Qué formatos de exportación produce Hushscript?

TXT, SRT, VTT, CSV, TSV, Markdown, HTML, RTF, XML, JSON, DOCX, PDF y .husharchive protegido con contraseña, sin marca de agua. Para las notas del episodio, DOCX le brinda un documento formateado para editar directamente. SRT le ofrece subtítulos cronometrados si publica una versión en video. JSON le brinda datos a nivel de expresión si alimenta un host de podcast que acepta cargas de transcripciones.

¿Necesito transcribir todo el episodio para escribir notas del episodio?

Para marcas de tiempo precisas y citas textuales, sí. Puede tomar notas aproximadas de memoria, pero los marcadores de capítulo, las citas exactas y una transcripción completa con capacidad de búsqueda provienen del texto completo. La vista previa de 30 segundos le muestra la calidad antes de comprometerse con el episodio completo.

¿La música de fondo o un jingle de introducción confundirán la transcripción?

La música entre segmentos generalmente se omite o no se transcribe, y un jingle breve debajo de una voz rara vez causa problemas. Si una plataforma musical funciona con un habla continua, la precisión en ese tramo puede disminuir. Grabar voces limpias y agregar música en el editor después proporciona la mejor transcripción.

¿Qué tan precisa es la transcripción de un podcast claramente grabado?

En una grabación limpia de dos micrófonos con poca diafonía, el texto es lo suficientemente preciso como para publicarlo después de una revisión rápida. La precisión depende principalmente de la calidad de la grabación, los acentos y la frecuencia con la que los invitados hablan entre sí, no del formato de archivo que subes.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis