Edición de transcripciones
Edición de transcripciones
Esta guía te muestra cómo aplicar instrucciones de edición en lenguaje natural a transcripciones confirmadas con la API de Voz a Texto en Tiempo Real.
Guía práctica · Da por hecho que has completado la guía de streaming del lado del cliente o streaming del lado del servidor.
Descripción general
La edición de transcripciones es una función experimental y añade un recargo del 30 % al coste base de la transcripción, facturado por un mínimo de 10 segundos de audio por cada transcripción confirmada. Consulta la página de precios de la API para obtener información detallada sobre los precios.
La transcripción en tiempo real puede aplicar una instrucción de edición en lenguaje natural a cada transcripción confirmada; por ejemplo, para escribir fechas pronunciadas con un formato fijo o para desarrollar abreviaturas y acrónimos. La instrucción se envía una vez al abrir la conexión, y cada transcripción confirmada va seguida de un evento edited_transcript independiente con el texto editado.
Las transcripciones parciales nunca se editan. El evento committed_transcript tampoco cambia, por lo que las integraciones existentes siguen funcionando cuando activas esta función.
La edición de transcripciones no se puede combinar con entity_detection. Las conexiones que configuran ambas opciones
se rechazan con un error invalid_request.
Activar la edición de transcripciones
Envía la instrucción con la opción transcriptEdit al conectarte (el parámetro de consulta transcript_edit de la API de WebSocket). La instrucción puede tener hasta 2000 caracteres. Consulta la guía de edición de transcripciones por lotes para obtener orientación sobre cómo escribir instrucciones.
En todos los SDK, las transcripciones editadas llegan mediante el evento RealtimeEvents.EDITED_TRANSCRIPT.
Lado del cliente
Usa @elevenlabs/client en el navegador con un token de un solo uso emitido por tu servidor, como se describe en la guía de streaming del lado del cliente.
Lado del servidor
Usa el SDK oficial en tu servidor, como se describe en la guía de streaming del lado del servidor. Solo difieren de esa guía la opción y el controlador de eventos; el envío de audio y el cierre de la conexión funcionan igual.
Recibir transcripciones editadas
Cuando está activada, cada transcripción confirmada va seguida de un evento edited_transcript que contiene el texto confirmado y su versión editada:
Comportamiento que debes tener en cuenta:
- Las ediciones se aplican por segmento confirmado. El evento
edited_transcriptse emite poco después del eventocommitted_transcriptcorrespondiente, ya que la edición se ejecuta de forma asíncrona. Puede llegar después de la siguiente transcripción parcial, y las ediciones de segmentos consecutivos pueden llegar fuera de orden. Usa el campotextpara asociar una edición a su transcripción confirmada. - Si no se han realizado ediciones en un segmento,
edited_textes idéntico atext. - Si no se puede generar una edición para un segmento, no se envía ningún evento
edited_transcriptpara él. El eventocommitted_transcriptno se ve afectado. - Las marcas de tiempo por palabra en
committed_transcript_with_timestampsdescriben el texto confirmado original, no el texto editado.