Edición de transcripciones

Esta guía te muestra cómo editar transcripciones con instrucciones en lenguaje natural mediante la API de Voz a Texto.

Guía práctica · Da por hecho que has completado la guía de inicio rápido de Voz a Texto .

Resumen

La edición de transcripciones es una función experimental y tiene un coste adicional del 30 % sobre el coste base de la transcripción, facturado por un mínimo de 10 segundos de audio por solicitud. Consulta la página de precios de la API para obtener información detallada sobre los precios.

La edición de transcripciones te permite añadir una instrucción en lenguaje natural a una solicitud de transcripción. Una vez transcrito el audio, la instrucción se aplica a la transcripción y el texto editado se devuelve junto al original.

Esto sustituye un paso independiente de posprocesamiento en tu propio workflow. Los usos habituales incluyen normalizar cómo se escriben las fechas, horas o unidades, desarrollar abreviaturas, eliminar contenido que no necesitas, aplicar otro estilo o tono, o reformatear la transcripción.

Por ejemplo, al transcribir un mensaje de voz con la instrucción Write all dates in ISO 8601 format (YYYY-MM-DD), se devuelven ambas versiones del texto:

{
"language_code": "eng",
"language_probability": 0.9912,
"text": "Hi, this is Jill. Your appointment is confirmed for the twelfth of July twenty twenty-six, and the follow-up is on the third of August.",
"words": [
{ "text": "Hi,", "start": 0.12, "end": 0.38, "type": "word", "logprob": 0.0 },
{ "text": " ", "start": 0.38, "end": 0.41, "type": "spacing", "logprob": 0.0 },
{ "text": "this", "start": 0.41, "end": 0.55, "type": "word", "logprob": 0.0 },
...
],
"transcription_id": "Y2ZX8AxHUzTPCIualYiE",
"edited_transcript": {
"kind": "transcript",
"text": "Hi, this is Jill. Your appointment is confirmed for 2026-07-12, and the follow-up is on 2026-08-03."
}
}

Los campos text y words siempre describen la transcripción original. La versión editada se devuelve por separado en edited_transcript.

Integrar la edición de transcripciones

La edición de transcripciones se integra en la API de Voz a Texto pasando el parámetro transcript_edit al método convert. La instrucción puede tener hasta 2000 caracteres.

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
with open("voicemail.mp3", "rb") as audio_file:
transcription = elevenlabs.speech_to_text.convert(
file=audio_file,
model_id="scribe_v2",
# Natural-language instruction applied to the finished transcript.
transcript_edit="Write all dates in ISO 8601 format (YYYY-MM-DD)",
)
print("Original:", transcription.text)
print("Edited:", transcription.edited_transcript)

La edición de transcripciones funciona tanto con solicitudes síncronas como con solicitudes de webhook. En las solicitudes de webhook, edited_transcript se incluye en el objeto transcription de la carga útil del webhook.

Scribe v2 Realtime admite las mismas instrucciones en cada transcripción confirmada. Consulta la guía de edición de transcripciones en tiempo real.

Redactar instrucciones

La instrucción se aplica a toda la transcripción donde sea relevante, y se edita cada aparición coincidente, no solo la primera. Una instrucción puede cambiar palabras o frases específicas y dejar todo lo demás intacto, o puede reescribir o anotar el texto completo. Una sola instrucción puede combinar varias ediciones.

Los siguientes ejemplos muestran el rango de instrucciones compatibles:

InstrucciónEfecto
Write all dates in ISO 8601 format (YYYY-MM-DD)the twelfth of July twenty twenty-six pasa a ser 2026-07-12
Write times in 24-hour formathalf past two in the afternoon pasa a ser 14:30
Expand abbreviations such as "ETA" and "ASAP" on first useETA pasa a ser estimated time of arrival (ETA)
Add the sentiment of every sentence in brackets at the end. Choose from [positive, negative, neutral]Thanks, that was really helpful. pasa a ser Thanks, that was really helpful. [positive]
Redact every curse word with its first letter followed by stars, e.g. s***That was a damn good call. pasa a ser That was a d*** good call.
Format the transcript as a bulleted list, one sentence per bulletReformatea toda la transcripción

Algunos ajustes tienen parámetros específicos que son más económicos y predecibles que una instrucción de edición. Usa el prompting de términos clave para orientar el reconocimiento hacia nombres y términos concretos, no_verbatim para eliminar muletillas y disfluencias, y numbers_format (cuando sea compatible) para elegir entre dígitos y palabras. Reserva la edición de transcripciones para cambios que estas opciones no cubran.

Ten en cuenta lo siguiente al redactar instrucciones:

  • Sé explícito sobre el resultado deseado. Write all dates in ISO 8601 format (YYYY-MM-DD) es más fiable que fix the dates.
  • La instrucción puede escribirse en cualquier idioma, aunque las instrucciones en inglés funcionan mejor. La transcripción editada se mantiene en el idioma del original.
  • Solo se ejecuta la instrucción. El contenido hablado en el audio se trata como datos y no puede cambiar cómo se aplica la instrucción.
  • Si la instrucción no afecta a nada de la transcripción, la transcripción editada es idéntica a la original.

Formato de respuesta

Cuando se establece transcript_edit, la respuesta contiene un objeto edited_transcript. Su campo kind indica si la edición se ha realizado correctamente:

kindCamposDescripción
transcripttextLa transcripción editada. Es idéntica al text original cuando no se han realizado ediciones.
errorerror_type (edit_failed), messageNo se ha podido generar la edición. La transcripción se ha realizado correctamente y se sigue devolviendo el text original.

El campo no está presente cuando no se ha solicitado ningún transcript_edit.

Edición fallida
{
"text": "Hi, this is Jill. Your appointment is confirmed for ...",
"edited_transcript": {
"kind": "error",
"error_type": "edit_failed",
"message": "The transcript could not be edited. Please try again."
}
}

Comportamientos que debes tener en cuenta:

  • La transcripción editada es texto sin formato. Las marcas de tiempo por palabra, las etiquetas de hablante y additional_formats siguen describiendo la transcripción original.
  • La edición se ejecuta una vez finalizada la transcripción, por lo que añade latencia que aumenta con la duración de la transcripción.
  • El recargo se aplica a la duración de audio de la solicitud, con un mínimo facturado de 10 segundos por solicitud.

La edición de transcripciones no puede combinarse con entity_detection, entity_redaction ni use_multi_channel. Las solicitudes que los combinan se rechazan con un error de parámetros no válidos.

Próximos pasos