Saltar al contenido principal

Vocabulario personalizado para transcripciones precisas

Autor: Publicado: Última revisión:

Un motor de voz de propósito general tiene menos contexto para el nombre en clave de un producto, un apellido regional o un acrónimo interno que su equipo usa diez veces en una reunión. La investigación llama a la técnica para dirigir el reconocimiento hacia los términos esperados sesgo contextual, y una 2025 W3C Web Speech session la describió como una capacidad incluida en Chrome. Hushscript convierte esa idea en cuatro controles de vocabulario, que van desde una adición única para un archivo hasta una configuración permanente que puede reutilizar.

Donde el vocabulario personalizado ayuda más

Tres categorías causan la mayor parte de los errores de reconocimiento que comete un modelo de propósito general. Los nombres de las personas son los primeros, especialmente las grafías que no son la variante más común. Un modelo no tiene forma de adivinar si el audio decía “Nguyen” o un casi homófono a menos que algo le diga que el nombre está en juego. Los nombres de productos y marcas son el segundo: un nombre como “FlowBridge” se escucha como las dos palabras comunes que parecen, no como el nombre propio elegido por una empresa específica. La jerga interna y las siglas son el tercero: términos que sólo significan algo dentro de un equipo o industria, que ningún vocabulario general iba a contener. Los nombres de medicamentos y procedimientos de una práctica clínica son el mismo problema a mayor escala, que la transcripción médica maneja con un modo dedicado junto con estas herramientas de vocabulario. Un acrónimo repetido diez veces en una reunión se transcribe mal diez veces o bien diez veces; no hay crédito parcial, por lo que corregirlo una vez en una lista de términos clave o diccionario corrige automáticamente cada aparición en ese archivo.

Para un solo archivo: términos clave y un mensaje personalizado

Si está transcribiendo una grabación inusual y no necesita una configuración permanente, agregue términos clave directamente a ese trabajo. Hasta 1000 términos clave (nombres, marcas, acrónimos) sesgan el reconocimiento hacia las palabras que usted realmente dijo, solo para ese archivo. Junto a ellos, un mensaje personalizado de hasta 2000 caracteres le brinda al motor un contexto que el audio por sí solo no puede: quién habla, qué cubre la grabación, términos específicos de la situación. Ambos desaparecen tras el trabajo; nada se transfiere al siguiente archivo a menos que lo agregue nuevamente.

Para trabajos recurrentes: diccionarios guardados y ajustes preestablecidos de mensajes

Si aparecen los mismos nombres y jerga archivo tras archivo, ya no vale la pena volver a escribir una lista única. Un diccionario guardado resuelve eso: importar términos en masa desde un archivo CSV o TSV, organizarlos en categorías y adjuntar variantes ortográficas a cada término canónico para que se reconozca “McAllister” si el audio de origen suena como “MacAlister” o “McAllaster”. Los ajustes preestablecidos de mensajes funcionan de la misma manera para el contexto, guardando el fondo que de otro modo volverías a escribir cada vez. Marque un diccionario o un ajuste preestablecido como predeterminado y se preseleccionará automáticamente la próxima vez que transcriba, por lo que no es necesario volver a seleccionar una configuración permanente en cada archivo.

Se combinan, no se reemplazan entre sí

Un diccionario permanente y una adición única no son una elección entre dos opciones; se postulan juntos para el mismo trabajo. Mantenga un diccionario predeterminado de los nombres de productos de su equipo y un mensaje predeterminado que describa cuáles son normalmente sus grabaciones, luego agregue un término clave único para el nombre de un invitado que solo sea relevante para el archivo de esta semana. La configuración de pie cubre el vocabulario recurrente; la adición única cubre lo que es específico de esta grabación. Ninguno de los dos tiene que tener en cuenta lo que el otro ya maneja.

Lo que no toca

El vocabulario personalizado en cualquiera de sus cuatro formas da forma a lo que el motor escucha mientras transcribe y no configura el trabajo posterior de Insights. Los Insights se comparan con la transcripción resultante. Por lo tanto, obtener el vocabulario correcto antes puede mejorar el texto fuente que lee Insights, sin cambiar lo que genera Insights.

Un ejemplo práctico

Un podcast semanal entrevista a un invitado diferente en cada episodio, pero siempre cubre las mismas tres líneas de productos por nombre. El anfitrión crea un diccionario guardado una vez, importado de una hoja de cálculo de nombres de productos y los nombres propios del equipo, escrito como el programa realmente los dice y lo marca como predeterminado. El episodio de cada semana se beneficia automáticamente. Para el invitado de esa semana, un nombre que el diccionario permanente no tiene por qué conocer, el anfitrión agrega un término clave antes de cargarlo, específico para ese archivo. El diccionario permanente y el término clave único se aplican a la misma transcripción y ninguno requiere tocar al otro.

Dónde configurarlo

Las opciones de vocabulario se encuentran junto con otras configuraciones por archivo en audio a texto, ya sea que esté agregando un término clave único a una carga única o administrando un diccionario guardado para un trabajo recurrente. Funcionan de la misma manera independientemente de cuál de los aproximadamente 99 idiomas Hushscript detecta automáticamente en la grabación, y la página de idiomas tiene la lista completa, junto con cuáles obtienen una precisión de primer nivel. Para obtener más información sobre cómo obtener la transcripción antes de preocuparse por el vocabulario, consulte cómo transcribir un podcast para conocer el flujo de trabajo de invitados recurrentes que sigue este ejemplo.

Fuentes y normas independientes

Hushscript consultó estas referencias independientes y no competidoras. Explican investigaciones, normas o el funcionamiento de plataformas y no implican el respaldo de Hushscript.

Fuentes revisadas:

Preguntas frecuentes

¿Cuál es la diferencia entre términos clave y un diccionario guardado?

Los términos clave son únicos: los agrega a un solo archivo y se aplican a ese trabajo únicamente. Un diccionario guardado es reutilizable: constrúyalo una vez, márquelo como predeterminado si desea que se preseleccione automáticamente y se aplica a cada archivo que transcriba posteriormente sin tener que volver a ingresar nada.

¿Cuántos términos clave puedo agregar a un archivo?

Hasta 1000 por archivo. Esto cubre nombres, marcas y acrónimos que desea que el motor escuche correctamente para esa grabación.

¿Cuánto tiempo puede durar un mensaje personalizado?

Hasta 2000 caracteres. Es contexto para ese único archivo: el audio por sí solo no puede proporcionarle al motor un fondo, como quién está hablando o de qué trata la grabación.

¿Puedo importar un diccionario de forma masiva en lugar de escribir términos uno por uno?

Sí. Importe un archivo CSV o TSV, organice las entradas en categorías y adjunte variantes ortográficas a cada término canónico, para que el diccionario reconozca las diferentes formas en que puede aparecer un nombre o término.

¿El vocabulario personalizado afecta a Insights?

No directamente. Los diccionarios, los ajustes preestablecidos de mensajes, los términos clave y los mensajes personalizados dan forma al reconocimiento de voz. Las Insights se ejecutan más tarde en la transcripción resultante, por lo que un mejor vocabulario puede mejorar el texto de origen, pero no configura el trabajo de Insights.

Comienza con 30 minutos gratis

Comenzar – 30 minutos gratis