Cómo transcribir un podcast y crear notas del episodio
Autor: Hushscript Publicado: Última revisión:
La transcripción de un podcast se gana el doble. Hace que el episodio se pueda buscar y sea accesible para los oyentes que leen en lugar de escuchar, y le brinda materia prima para notas del episodio, citas y subtítulos sin tener que reproducir toda la grabación. El soporte de la plataforma es concreto, no teórico: Apple Podcasts documenta transcripciones y navegación de capítulos para creadores. Esta guía explica cómo transcribir un episodio, etiquetar a cada presentador e invitado y convertir el resultado en un documento utilizable de notas del episodio.
La parte que ahorra más tiempo es la separación de los hablantes. Una transcripción que se lee como un bloque de texto indiviso requiere casi tanto trabajo como el audio en sí. Hushscript etiqueta cada voz automáticamente y la incluye de forma gratuita en cada transcripción, para que la conversación vuelva a ser una conversación.
Lo que necesitas antes de comenzar
Una grabación del episodio, en cualquier formato de audio o video común. Si exportó un archivo de audio simple desde su editor (MP3, WAV, M4A), eso funciona directamente. Si su única copia es la grabación de video de Zoom, Riverside o Ecamm, eso también funciona y el audio se extrae en su navegador para que el video nunca se cargue.
El audio de fuente limpia ayuda más que cualquier otra cosa. Las etiquetas de los hablantes funcionan mejor cuando cada voz es distinta y las personas no hablan constantemente entre sí. Si grabó a cada participante en una pista separada, ya tendrá la entrada más limpia posible. Una sola pista mixta todavía funciona; simplemente se apoya más en la diarización para distinguir las voces. Si puede, grabe las voces en seco y luego agregue la base musical en su editor, ya que un jingle que se ejecuta bajo un discurso continuo es lo único que reduce de manera confiable la precisión.
Necesitará una cuenta para transcribir un episodio completo. La vista previa de 30 segundos es el paso sin cuenta, por lo que puedes verificar las etiquetas de los hablantes y la calidad del texto en tu archivo real antes de registrarte para cualquier cosa.
Transcribe el episodio
El flujo sigue el orden real del embudo: vista previa primero, luego regístrate y luego transcribe el resto.
- Suelta el archivo en /podcast-transcription. Hushscript recorta los primeros 30 segundos en su navegador y devuelve una vista previa etiquetada por el hablante. No se necesita ninguna cuenta para este paso. Podrás ver exactamente cómo se dividen el anfitrión y el invitado y qué tan limpio se lee el texto en tu propio audio.
- Regístrate para transcribir el resto. Una vez que ingresas tu correo electrónico e inicias sesión, subes el episodio completo. Las cuentas nuevas obtienen 30 minutos gratis para probar, concedidos una vez. La forma más rápida de reclamarlos es con un cheque con tarjeta de $1 que se autoriza y luego se libera de inmediato, sin ningún cargo. Si prefieres un método de pago alternativo disponible en tu país, los 30 minutos llegan con tu primera compra; no se requiere una tarjeta.
- Deje que se ejecute la transcripción y luego exporte. La transcripción regresa con una etiqueta y una marca de tiempo en cada expresión. Exporte DOCX para un documento que editará en notas del episodio, TXT para un bloque limpio para pegar en su CMS, SRT para subtítulos en una versión de video o JSON si su anfitrión de podcast acepta cargas de transcripciones a nivel de expresión.
Los 30 minutos gratuitos pueden cubrir un episodio corto o una sección representativa de uno más largo. Un episodio de 60 minutos utiliza 60 minutos de su saldo, por lo que necesita una recarga después de la asignación de prueba.
Etiquete a cada anfitrión e invitado
La agenda del hablante se ejecuta automáticamente, por lo que no activa nada. Para un episodio de dos personas (un presentador, un invitado), la transcripción aparece claramente dividida, con cada línea atribuida a una de dos etiquetas. Para un panel, Hushscript separa tantas voces distintas como escucha, sin límite de hablante.
Para reemplazar las etiquetas genéricas con nombres reales:
- Haga clic en cualquier instancia de
Hablante Aen el editor. - Escriba el nombre, como “Alex” o “Host”.
- Cada instancia de esa etiqueta se actualiza a lo largo de la transcripción a la vez.
Se vuelve a etiquetar cada voz una vez, no línea por línea. Un episodio de dos personas dura aproximadamente un minuto; un panel de cuatro personas requiere algunas. Después de volver a etiquetar, una parte de la transcripción dice así:
Alex [00:03:12]: Entonces usted dirigía la empresa en ese momento. ¿Cuáles fueron las primeras señales?
Jamie [00:03:19]: Sinceramente, fueron los números. Tuvimos una caída del 40 % en un trimestre.
Alex [00:03:27]: ¿Y no pudiste explicarlo en ese momento?
Jamie [00:03:35]: No durante semanas. Esa fue la parte que me mantuvo despierto.
Esa es la estructura que necesitas para extraer citas y escribir capítulos con marca de tiempo. Debido a que las etiquetas abarcan todo el archivo, un episodio largo se etiqueta exactamente una vez. Para conocer los mecanismos detrás de la separación de voces, consulte cómo funciona la diarización del hablante.
Cuando las etiquetas necesitan una solución
La diarización es precisa en grabaciones limpias, pero no es infalible, y vale la pena conocer un par de patrones para poder corregirlos rápidamente.
Si dos invitados tienen palabras muy similares voces, una línea ocasional puede llegar al hablante equivocado. Escanee la transcripción con el audio abierto y reasigne a mano las pocas líneas mal atribuidas. Esto es mucho más rápido que escribir los nombres de los hablantes desde cero, porque solo está solucionando excepciones.
Si un coanfitrión silencioso que apenas habla se fusiona en otra etiqueta, dé a los hablantes principales sus nombres reales primero y luego busque las pocas líneas que deberían pertenecer a la voz tranquila. En una grabación bien separada rara vez se llega a cualquiera de los dos casos, por lo que vale la pena configurar una pista separada por persona en un tiempo récord.
Problemas comunes y sus causas reales
La mayoría de los problemas de transcripción se remontan a la grabación, no a la herramienta. Vale la pena planificar algunos antes de publicar un programa.
Difonía y personas hablando entre sí. Esto es lo más difícil para cualquier sistema de separación de hablantes, porque dos voces en el mismo instante no se pueden dividir claramente. El texto generalmente sigue siendo legible, pero un momento de gran superposición puede aterrizar en un hablante o desdibujarse en la unión. Una buena higiene del podcast ya ayuda en este caso: un presentador que deja que los invitados terminen produce una transcripción más limpia como efecto secundario. Cuando esto suceda, corrija esas pocas líneas a mano con el audio.
Invitados remotos grabados en una pista. Una llamada grabada como un único archivo mixto es más difícil de separar que la misma llamada capturada como una pista por participante. Si su herramienta admite la grabación local por participante, úsela; Si solo tiene el archivo mixto, la transcripción aún llega, solo depende más de la diarización. De cualquier manera, el audio es la misma carga, por lo que no hay nada diferente que hacer en el momento de la transcripción.
Acentos fuertes y cambio de código. Hushscript detecta el idioma automáticamente y transcribe alrededor de 99 idiomas, con precisión de primer nivel en dieciocho de ellos, por lo que un invitado con un acento pronunciado en un idioma admitido se maneja bien. Un invitado que cambia entre dos idiomas a mitad de una frase es el caso realmente difícil; Espere limpiar las frases cambiadas a mano. Para obtener la lista completa de idiomas admitidos, consulte la página de idiomas.
Música de introducción y aguijones. Generalmente se omite una base musical entre segmentos en lugar de transcribirla como una tontería. Los problemas comienzan sólo cuando la música suena bajo un discurso continuo durante un período prolongado. La solución limpia es editorial: grabe las voces secas y coloque la música después, de modo que la transcripción solo vea el habla.
Nombres, jerga y ortografía de la marca. Un invitado especializado utilizará términos y nombres de productos que el modelo puede representar fonéticamente. Estos se solucionan rápidamente porque se repiten, y una función de búsqueda y reemplazo en el documento exportado soluciona los errores ortográficos recurrentes de una sola vez.
Algunos consejos de precisión
El factor más importante es la calidad de la grabación, por lo que el esfuerzo invertido en los micrófonos y en una habitación silenciosa se amortiza a la hora de la transcripción. Más allá de eso, una pista por hablante proporciona el texto más limpio y las etiquetas de hablante más limpias, ya que el sistema nunca tiene que desenredar dos voces de una forma de onda. Mantenga el micrófono de un invitado cerca y consistente en lugar de desviarse, y dedicará su tiempo de edición a la sustancia en lugar de a las reparaciones.
Cuando revise, lea con el audio abierto y corrija en pasadas: primero las etiquetas de los hablantes, luego los nombres y la jerga mal escuchados, luego la superposición ocasional. Trabajar por categoría es más rápido que leer de arriba a abajo y le deja un documento lo suficientemente limpio como para publicarlo.
De la transcripción a las notas de presentación
Las notas de presentación no son un resumen de todo lo dicho. Son una ayuda de navegación para los oyentes y una superficie de búsqueda para las personas que aún no han presionado reproducir. Una estructura que funciona para la mayoría de entrevistas y conversaciones muestra:
Resumen del episodio, de dos a cuatro oraciones. Extraiga el tema central de la transcripción. ¿Cuál es el argumento, la historia o la conclusión central? Escríbalo para que alguien decida si quiere escucharlo.
Capítulos con marca de tiempo. Escanee la transcripción para ver cambios de tema. Cada vez que la conversación gire hacia un tema nuevo, anote la marca de tiempo y escriba una descripción de una línea. Las marcas de tiempo provienen directamente de la transcripción, por lo que nunca volverás a escucharlas para encontrarlas.
[00:02:15] Lanzamiento de la empresa sin presupuesto de marketing
[00:14:30] La caída del 40% en los ingresos y qué la causó
[00:28:44] Reconstrucción: qué cambió internamente
[00:51:00] Consejos para fundadores en la misma posición
Citas clave. Escriba dos o tres líneas que capturen las principales afirmaciones del episodio o sus momentos más citables. Cite palabra por palabra la transcripción y atribuya cada una al hablante por su nombre. Ya sea para ejecutar una cita exactamente como se dice o recortar el relleno y los comienzos en falso para obtener notas más limpias es una decisión que vale la pena tomar a propósito, y transcripción depurada y transcripción literal explica ambos. Como el texto se puede buscar, encontrar el texto exacto de una línea que recuerdas a medias lleva unos segundos.
Enlaces y recursos de invitados. Añade todo lo que el invitado haya mencionado. Para encontrar URL habladas rápidamente, busque en la transcripción fragmentos como “punto com” o “barra”; la gente dice direcciones web en voz alta con más frecuencia de lo que cabría esperar, y una transcripción textual las captura.
Transcripción completa, opcional pero valiosa. Pegue el texto completo debajo de las notas o enlace a una página de transcripción separada. Aquí es donde reside el valor de la búsqueda, porque el contenido hablado se vuelve indexable. Si su plataforma de alojamiento acepta cargas de transcripciones, la exportación JSON transporta datos a nivel de expresión; de lo contrario, el texto sin formato es suficiente.
Un ejemplo práctico
Supongamos que grabó una entrevista de 58 minutos con el fundador en dos pistas y las mezcló en un MP3. Dejas el MP3 en /podcast-transcription, miras la vista previa de 30 segundos dividir al anfitrión y al invitado correctamente, te registras y subes el archivo completo. La transcripción regresa con Hablante A y Hablante B; les cambia el nombre a “Alex” y “Jamie” con dos clics. A partir de ahí, el resumen proviene de los dos primeros minutos, los cuatro capítulos anteriores provienen de la búsqueda de cambios de tema y las dos citas provienen de la búsqueda en el texto de los momentos que recuerda. Las notas del episodio desde el principio hasta el final duran aproximadamente quince minutos, la mayor parte de las cuales las editas tú mismo en lugar de esperar o transcribir.
Agregar leyendas o subtítulos
Si publica una versión en video del episodio en una plataforma como un servidor de video, un video de Spotify o LinkedIn, la exportación SRT es un archivo de subtítulos cronometrado listo para cargar. No hay ningún paso adicional, porque la transcripción que ya generó contiene los datos de tiempo. Para conocer el flujo de trabajo más amplio para obtener subtítulos en un clip, incluidos archivos grabados versus archivos sidecar, consulte cómo agregar subtítulos a un video.
Si su punto de partida es una grabación de video en lugar de una exportación de audio, el proceso es idéntico; el audio se extrae primero en su navegador. La página video a texto cubre esa ruta en su totalidad.
Episodios largos y de varias partes
Para un episodio de larga duración o una grabación en vivo, Hushscript admite cargas de hasta 10 horas de duración, sin límite de tamaño de archivo. Un panel de cuatro horas o un episodio en formato documental se presenta como un solo archivo en lugar de dividirse en partes, lo cual es importante por dos razones. Las etiquetas de los hablantes se mantienen consistentes en todo el archivo, por lo que puede volver a etiquetarlas una vez. Y las marcas de tiempo son continuas, por lo que un capítulo en la marca de tres horas dice [03:12:40] en lugar de reiniciar desde cero en la segunda parte.
Si graba una serie de varias partes en una sesión, transcriba toda la sesión como un solo archivo y luego divida las notas del episodio por partes. Cortar el audio primero solo multiplica el trabajo de reetiquetado.
Por qué esto se vuelve rápido
Para una cadencia de publicación regular, semanal o dos veces por semana, la rutina de transcripción a notas de programa se comprime a minutos por episodio una vez que lo haya hecho varias veces: suelte el archivo, vuelva a etiquetar a los hablantes, busque capítulos, extraiga citas, exporte. Las etiquetas de los hablantes que hacen la atribución de forma gratuita es lo que elimina la parte tediosa. Dedicas tu tiempo al juicio editorial que las notas realmente necesitan, no a descubrir quién dijo qué.
Fuentes y normas independientes
Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.
Fuentes revisadas: