Crea trascrizione
Trascrive un file audio o video. Se webhook è impostato su true, la richiesta verrà elaborata in modo asincrono e i risultati verranno inviati ai webhook configurati. Quando use_multi_channel è true e l’audio fornito ha più canali, viene restituito un oggetto ‘transcripts’ con trascrizioni separate per ciascun canale; imposta multichannel_output_style=‘combined’ per ricevere invece un’unica trascrizione con tutti i canali uniti e ordinati per tempo. Altrimenti, restituisce un’unica trascrizione. Il parametro facoltativo webhook_metadata ti consente di allegare dati personalizzati che saranno inclusi nelle risposte webhook per la correlazione e il tracciamento delle richieste.
Header
Parametri di query
Un token di autenticazione monouso creato tramite POST /v1/single-use-token/batch_scribe. Questo token può essere usato una sola volta e scade dopo 15 minuti. È un'alternativa all'autenticazione con chiave API o bearer token per i client frontend.
Quando enable_logging è impostato su false, per la richiesta verrà usata la modalità senza conservazione dei dati. Di conseguenza, le funzionalità di archiviazione di log e trascrizioni non saranno disponibili per questa richiesta. La modalità senza conservazione dei dati può essere usata solo dai clienti enterprise.
Richiesta
Il file da trascrivere (durata audio minima di 100 ms). Sono supportati tutti i principali formati audio e video. Deve essere fornito esattamente uno dei parametri file o cloud_storage_url. La dimensione del file deve essere inferiore a 5,0 GB.
Un language_code ISO-639-1 o ISO-639-3 corrispondente alla lingua del file audio. Se noto in anticipo, può talvolta migliorare le prestazioni della trascrizione. Il valore predefinito è null; in questo caso la lingua viene prevista automaticamente.
Istruzione in linguaggio naturale applicata alla trascrizione finale, massimo 2000 caratteri. Il testo modificato viene restituito in 'edited_transcript' insieme alla trascrizione originale. Non può essere combinata con entity_detection, entity_redaction o use_multi_channel. L'uso di questo parametro comporta un supplemento del 30% sul costo base della trascrizione, fatturato per almeno 10 secondi di audio.
Indica se contrassegnare nella trascrizione eventi audio come (risate), (passi) ecc.
Il numero massimo di parlanti nel file caricato. Può aiutare a prevedere chi parla e quando. Il numero massimo di parlanti prevedibili è 32. Il valore predefinito è null; in questo caso, il numero di parlanti viene impostato sul valore massimo supportato dal modello.
La granularità dei timestamp nella trascrizione. 'word' fornisce timestamp a livello di parola e 'character' fornisce timestamp a livello di carattere per ogni parola.
Soglia di diarizzazione da applicare durante la diarizzazione dei parlanti. Un valore più alto riduce la probabilità che un parlante venga diarizzato come due parlanti diversi, ma aumenta la probabilità che due parlanti diversi vengano diarizzati come un unico parlante (meno parlanti totali previsti). Un valore basso aumenta la probabilità che un parlante venga diarizzato come due parlanti diversi, ma riduce la probabilità che due parlanti diversi vengano diarizzati come un unico parlante (più parlanti totali previsti). Può essere impostata solo quando diarize=True e num_speakers=None. Il valore predefinito è None; in questo caso scegliamo una soglia in base a model_id (in genere 0.22).
The format of input audio. Options are 'pcm_s16le_16' or 'other' For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.
[Obsoleto] Questo parametro è deprecato e verrà rimosso in futuro. Usa invece 'source_url'. L'URL HTTPS del file da trascrivere. Devi fornire esattamente uno dei parametri file o cloud_storage_url. Il file deve essere accessibile tramite HTTPS e avere dimensioni inferiori a 2 GB. È accettato qualsiasi URL HTTPS valido, inclusi gli URL di provider di cloud storage (AWS S3, Google Cloud Storage, Cloudflare R2 ecc.), CDN o altre fonti HTTPS. Gli URL possono essere pre-firmati o includere token di autenticazione nei parametri query.
Indica se inviare il risultato della trascrizione ai webhook Speech to Text configurati. Se impostato, la richiesta restituirà anticipatamente senza la trascrizione, che verrà inviata successivamente tramite webhook.
ID webhook specifico facoltativo a cui inviare il risultato della trascrizione. È valido solo quando webhook è impostato su true. Se non viene fornito, la trascrizione verrà inviata a tutti i webhook speech-to-text configurati.
Controlla la casualità dell'output della trascrizione. Accetta valori compresi tra 0.0 e 2.0, dove valori più alti producono risultati più diversificati e meno deterministici. Se omesso, useremo una temperature basata sul modello selezionato, che di solito è 0.
Se specificato, il nostro sistema farà del suo meglio per eseguire il campionamento in modo deterministico, così che richieste ripetute con lo stesso seed e gli stessi parametri restituiscano lo stesso risultato. Il determinismo non è garantito. Deve essere un numero intero compreso tra 0 e 2147483647.
Se il file audio contiene più canali, ciascuno con un singolo parlante. Se abilitata, ogni canale viene trascritto in modo indipendente. Per impostazione predefinita viene restituita una trascrizione separata per canale; imposta multichannel_output_style='combined' per ricevere invece un'unica trascrizione con tutti i canali uniti e ordinati per tempo. Ogni parola nella risposta include un campo 'channel_index' che indica in quale canale è stata pronunciata. Sono supportati al massimo 5 canali. Ogni canale viene fatturato in modo indipendente sulla durata audio completa, quindi il costo aumenta linearmente con il numero di canali.
Controlla la struttura della risposta quando use_multi_channel è abilitato. 'separate' (predefinito) restituisce una trascrizione per canale in 'transcripts'. 'combined' unisce tutti i canali in un'unica trascrizione, le cui parole sono ordinate in base all'ora di inizio e ciascuna contiene un 'channel_index', corrispondendo alla struttura della risposta a canale singolo. 'combined' richiede timestamp (timestamps_granularity non deve essere 'none') e non supporta il rilevamento o l'oscuramento delle entità.
Metadati facoltativi da includere nella risposta webhook. Deve essere una stringa JSON che rappresenta un oggetto con profondità massima di 2 livelli e dimensione massima di 16 KB. Utile per monitorare ID interni, riferimenti a job o altre informazioni contestuali.
Rileva le entità nella trascrizione. Può essere 'all' per rilevare tutte le entità, una singola stringa di tipo o categoria di entità, oppure un elenco di tipi/categorie di entità. Le categorie includono 'pii', 'phi', 'pci', 'other', 'offensive_language'. Se abilitato, le entità rilevate vengono restituite nel campo 'entities' con il relativo testo, tipo e posizioni dei caratteri.
Se true, la trascrizione non conterrà intercalari, false partenze né suoni non vocali. Supportato solo dal modello scribe_v2.
Indica se usare la libreria degli speaker per identificare speaker noti durante la diarizzazione. Quando è abilitata e diarize è true, gli speaker rilevati verranno confrontati con quelli registrati nella libreria degli speaker del workspace.
Indica se rilevare i ruoli degli interlocutori (agente o cliente). Richiede diarize=true. Non può essere utilizzato con use_multi_channel=true. Se abilitato, i valori speaker_id saranno 'agent' e 'customer' anziché 'speaker_0', 'speaker_1' ecc. L'utilizzo comporta un supplemento del 10% sul costo base della trascrizione.
Oscura le entità dal testo della trascrizione. Accetta lo stesso formato di entity_detection: 'all', una categoria ('pii', 'phi') o tipi di entità specifici. Deve essere un sottoinsieme di entity_detection. Quando l'oscuramento è abilitato, il campo entities non viene restituito.
Come formattare le entità oscurate. 'redacted' sostituisce con {REDACTED}, 'entity_type' sostituisce con {ENTITY_TYPE}, 'enumerated_entity_type' sostituisce con {ENTITY_TYPE_N}, dove N enumera ogni occorrenza. Viene usato solo quando entity_redaction è impostato.
Un elenco di termini chiave per orientare la trascrizione. I termini chiave sono parole o frasi che vuoi che il modello riconosca con maggiore precisione. Il numero di termini chiave non può superare 1000. La lunghezza di ciascun termine chiave deve essere inferiore a 50 caratteri. I termini chiave possono contenere al massimo 5 parole, dopo la normalizzazione. Ad esempio ["hello", "world", "technical term"]. I seguenti caratteri non sono supportati: <, >, {, }, [, ], \. L'uso di questo parametro comporta un supplemento del 20% sul costo base della trascrizione. Se vengono forniti più di 100 termini chiave, per ogni richiesta si applica una durata minima fatturabile di 20 secondi.