Redigering av transkript
Den här guiden visar hur du redigerar transkript med instruktioner på naturligt språk med Speech to Text API.
Guide · Förutsätter att du har slutfört Speech to Text- snabbstarten.
Översikt
Transkriptredigering är en experimentell funktion och medför en extra kostnad på 30 % utöver grundkostnaden för transkribering. Minst 10 sekunders ljud debiteras per begäran. Se sidan med API- priser för detaljerad prisinformation.
Med transkriptredigering kan du bifoga en instruktion på naturligt språk till en transkriberingsbegäran. När ljudet har transkriberats tillämpas din instruktion på transkriptet och den redigerade texten returneras tillsammans med originalet.
Det ersätter ett separat efterbehandlingssteg i din egen pipeline. Vanliga användningsområden är att standardisera hur datum, tider eller enheter skrivs, skriva ut förkortningar, ta bort innehåll du inte behöver, tillämpa en annan stil eller ton eller formatera om transkriptet.
Om du till exempel transkriberar ett röstmeddelande med instruktionen Write all dates in ISO 8601 format (YYYY-MM-DD) returneras båda versionerna av texten:
Fälten text och words beskriver alltid originaltranskriptet. Den redigerade versionen returneras separat i edited_transcript.
Integrera transkriptredigering
Transkriptredigering integreras i Speech to Text API genom att skicka parametern transcript_edit till metoden convert. Instruktionen får vara upp till 2 000 tecken lång.
Transkriptredigering fungerar med både synkrona begäranden och webhook-begäranden. För webhookbegäranden ingår edited_transcript i objektet transcription i webhookens payload.
Scribe v2 Realtime stöder samma instruktioner för varje bekräftat transkript. Se guiden för redigering av realtidstranskript.
Skriva instruktioner
Instruktionen tillämpas på hela transkriptet där den är relevant, och varje matchande förekomst redigeras, inte bara den första. En instruktion kan ändra specifika ord eller fraser och lämna allt annat orört, eller skriva om eller kommentera hela texten. En enskild instruktion kan kombinera flera redigeringar.
Följande exempel visar utbudet av instruktioner som stöds:
Vissa justeringar har särskilda parametrar som är billigare och mer förutsägbara än en
redigeringsinstruktion. Använd keyterm-
prompting för att styra
igenkänningen mot specifika namn och termer, no_verbatim för att ta bort utfyllnadsord och
felsägningar samt numbers_format (där det stöds) för att välja mellan siffror och ord. Använd
transkriptredigering för ändringar som de alternativen inte täcker.
Tänk på följande när du skriver instruktioner:
- Var tydlig med önskat resultat.
Write all dates in ISO 8601 format (YYYY-MM-DD)är mer tillförlitligt änfix the dates. - Instruktionen kan skrivas på vilket språk som helst, men instruktioner på engelska fungerar bäst. Det redigerade transkriptet förblir på originalets språk.
- Endast instruktionen utförs. Innehåll som sägs i ljudet behandlas som data och kan inte ändra hur instruktionen tillämpas.
- Om inget i transkriptet påverkas av instruktionen är det redigerade transkriptet identiskt med originalet.
Svarsformat
När transcript_edit anges innehåller svaret ett objekt av typen edited_transcript. Fältet kind anger om redigeringen lyckades:
Fältet saknas när ingen transcript_edit har begärts.
Att känna till:
- Det redigerade transkriptet är oformaterad text. Tidsstämplar på ordnivå, talaretiketter och
additional_formatsfortsätter att beskriva originaltranskriptet. - Redigeringen körs efter att transkriberingen har slutförts, så den ökar latensen i takt med transkriptets längd.
- Tillägget beräknas utifrån begärans ljudlängd, med minst 10 sekunder debiterade per begäran.
Transkriptredigering kan inte kombineras med entity_detection, entity_redaction eller
use_multi_channel. Begäranden som kombinerar dem avvisas med ett fel om ogiltiga parametrar.