> This is a page from the ElevenLabs documentation. For a complete page index, fetch https://elevenlabs.io/docs/llms.txt. For the full documentation in a single file, fetch https://elevenlabs.io/docs/llms-full.txt.

# Trasmetti in streaming il parlato

POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}/stream
Content-Type: application/json

Converte il testo in parlato usando una voce a tua scelta e restituisce l'audio come stream audio.

Reference: https://elevenlabs.io/docs/api-reference/text-to-speech/stream

## Servers

- `https://api.elevenlabs.io` (Production, default)
- `https://api.us.elevenlabs.io` (Production US)
- `https://api.eu.residency.elevenlabs.io` (Production EU)
- `https://api.in.residency.elevenlabs.io` (Production India)
- `https://api.sg.residency.elevenlabs.io` (Production Singapore)

## Request

### Path parameters

- `voice_id` (string, required) — ID della voce da usare. Usa l'endpoint [Get voices](/docs/api-reference/voices/search) per elencare tutte le voci disponibili.

### Query parameters

- `enable_logging` (boolean, optional, default: true) — Quando enable_logging è impostato su false, per la richiesta verrà usata la modalità senza conservazione dei dati. Di conseguenza, le funzionalità della cronologia non saranno disponibili per questa richiesta, incluso il collegamento delle richieste. La modalità senza conservazione dei dati può essere usata solo dai clienti enterprise.
- `optimize_streaming_latency` (integer, optional, nullable, deprecated) — Puoi attivare le ottimizzazioni della latenza a scapito della qualità. La migliore latenza finale possibile varia in base al modello. Valori possibili: 0 - modalità predefinita (nessuna ottimizzazione della latenza) 1 - ottimizzazioni normali della latenza (circa il 50% del miglioramento di latenza possibile con l'opzione 3) 2 - ottimizzazioni avanzate della latenza (circa il 75% del miglioramento di latenza possibile con l'opzione 3) 3 - ottimizzazioni massime della latenza 4 - ottimizzazioni massime della latenza, con il normalizzatore del testo disattivato per ridurre ulteriormente la latenza (latenza ottimale, ma potrebbe pronunciare in modo errato, ad esempio, numeri e date). Il valore predefinito è None.
- `output_format` (enum, optional, default: mp3_44100_128) — Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
  - Allowed values: `mp3_22050_32`, `mp3_24000_48`, `mp3_44100_32`, `mp3_44100_64`, `mp3_44100_96`, `mp3_44100_128`, `mp3_44100_192`, `pcm_8000`, `pcm_16000`, `pcm_22050`, `pcm_24000`, `pcm_32000`, `pcm_44100`, `pcm_48000`, `ulaw_8000`, `alaw_8000`, `opus_48000_32`, `opus_48000_64`, `opus_48000_96`, `opus_48000_128`, `opus_48000_192`

### Body (application/json)

This endpoint expects a Body_text_to_speech_stream.

- `text` (string, required) — Il testo che verrà convertito in parlato.
- `model_id` (string, optional, default: eleven_multilingual_v2) — Identificatore del modello che verrà usato; puoi interrogarli tramite GET /v1/models. Il modello deve supportare la sintesi vocale; puoi verificarlo tramite la proprietà can_do_text_to_speech.
- `language_code` (string, optional, nullable) — Codice lingua (ISO 639-1) usato per applicare una lingua al modello e alla normalizzazione del testo. Se il modello non supporta il codice lingua fornito, verrà ignorato. Questo parametro non è supportato per i modelli multilingual_v2.
- `voice_settings` (VoiceSettingsResponseModel, optional, nullable) — Impostazioni vocali che sovrascrivono quelle salvate per la voce specificata. Vengono applicate solo alla richiesta indicata.
- `pronunciation_dictionary_locators` (list of PronunciationDictionaryVersionLocatorRequestModel, optional, nullable) — Un elenco di locator dei dizionari di pronuncia (id, version_id) da applicare al testo. Verranno applicati nell'ordine indicato. Puoi includere fino a 3 locator per richiesta.
- `seed` (integer, optional, nullable) — Se specificato, il nostro sistema farà del suo meglio per eseguire il campionamento in modo deterministico, così che richieste ripetute con lo stesso seed e gli stessi parametri restituiscano lo stesso risultato. Il determinismo non è garantito. Deve essere un numero intero compreso tra 0 e 4294967295.
- `previous_text` (string, optional, nullable) — Il testo che precede quello della richiesta corrente. Può essere usato per migliorare la continuità del parlato concatenando più generazioni o per influenzarla nella generazione corrente.
- `next_text` (string, optional, nullable) — Il testo che segue quello della richiesta corrente. Può essere usato per migliorare la continuità del parlato concatenando più generazioni o per influenzarla nella generazione corrente.
- `previous_request_ids` (list of string, optional, nullable) — Un elenco di request_id dei campioni generati prima di questa generazione. Può essere usato per migliorare la continuità del parlato quando una grande attività viene suddivisa in più richieste. I risultati sono migliori quando viene usato lo stesso modello per tutte le generazioni. Se vengono inviati sia previous_text sia previous_request_ids, previous_text verrà ignorato. Puoi inviare al massimo 3 request_ids.
- `next_request_ids` (list of string, optional, nullable) — Un elenco di request_id dei campioni successivi a questa generazione. next_request_ids è particolarmente utile per mantenere la continuità del parlato quando rigeneri un campione con problemi di qualità audio. Ad esempio, se hai generato 3 clip vocali e vuoi migliorare la clip 2, passare l'ID della richiesta della clip 3 come next_request_id, e quello della clip 1 come previous_request_id, aiuta a mantenere un flusso naturale nel parlato combinato. I risultati sono migliori quando viene usato lo stesso modello per tutte le generazioni. Se vengono inviati sia next_text sia next_request_ids, next_text verrà ignorato. Puoi inviare al massimo 3 request_ids.
- `use_pvc_as_ivc` (boolean, optional, default: false) — Indica se usare la versione IVC di una voce professionale. Può migliorare l'espressività e ridurre la latenza.
- `apply_text_normalization` (enum, optional, default: auto) — Questo parametro controlla la normalizzazione del testo con tre modalità: 'auto', 'on' e 'off'. Se impostato su 'auto', il sistema decide automaticamente se applicare la normalizzazione del testo, ad esempio scrivendo i numeri in lettere. Con 'on', la normalizzazione del testo viene sempre applicata, mentre con 'off' viene ignorata.
  - Allowed values: `auto`, `on`, `off`
- `apply_language_text_normalization` (boolean, optional, default: false) — Questo parametro controlla la normalizzazione del testo nella lingua. Aiuta a pronunciare correttamente il testo in alcune lingue supportate. ATTENZIONE: questo parametro può aumentare notevolmente la latenza della richiesta. Attualmente è supportato solo per il giapponese.

## Response

### 200

Dati audio in streaming

- Streaming response of `string`.

## Errors

### 422 Unprocessable Entity Error

Errore di convalida

- `detail` (list of ValidationError, optional)

## Types

### VoiceSettingsResponseModel

- `stability` (double, optional, nullable, default: 0.5) — Determina la stabilità della voce e il grado di casualità tra le generazioni. Valori più bassi introducono una gamma emotiva più ampia. Valori più alti possono produrre una voce monotona con emozioni limitate.
- `use_speaker_boost` (boolean, optional, nullable, default: true) — Questa impostazione aumenta la somiglianza con il parlante originale. Il suo utilizzo richiede un carico computazionale leggermente maggiore, aumentando di conseguenza la latenza.
- `similarity_boost` (double, optional, nullable, default: 0.75) — Determina quanto fedelmente l'IA deve attenersi alla voce originale nel tentativo di replicarla.
- `style` (double, optional, nullable, default: 0) — Determina l'esagerazione dello stile della voce. Questa impostazione cerca di amplificare lo stile dell'oratore originale. Consuma risorse di calcolo aggiuntive e potrebbe aumentare la latenza se impostata su un valore diverso da 0.
- `speed` (double, optional, nullable, default: 1) — Regola la velocità della voce. Il valore 1.0 corrisponde alla velocità predefinita; valori inferiori a 1.0 rallentano il parlato, mentre valori superiori a 1.0 lo accelerano.

### PronunciationDictionaryVersionLocatorRequestModel

- `pronunciation_dictionary_id` (string, required) — L'ID del dizionario di pronuncia.
- `version_id` (string, optional, nullable) — L'ID della versione del dizionario di pronuncia. Se non viene fornito, verrà usata la versione più recente.

### ValidationError

- `loc` (list of ValidationErrorLocItems, required)
- `msg` (string, required)
- `type` (string, required)

### ValidationErrorLocItems

## Examples

**Request**

```json
{
  "text": "The first move is what sets everything in motion.",
  "model_id": "eleven_multilingual_v2"
}
```

**SDK Code**

```python
import requests

url = "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream"

querystring = {"output_format":"mp3_44100_128"}

payload = {
    "text": "The first move is what sets everything in motion.",
    "model_id": "eleven_multilingual_v2"
}
headers = {
    "xi-api-key": "xi-api-key",
    "Content-Type": "application/json"
}

response = requests.post(url, json=payload, headers=headers, params=querystring)

print(response.json())
```

```javascript
const url = 'https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128';
const options = {
  method: 'POST',
  headers: {'xi-api-key': 'xi-api-key', 'Content-Type': 'application/json'},
  body: '{"text":"The first move is what sets everything in motion.","model_id":"eleven_multilingual_v2"}'
};

try {
  const response = await fetch(url, options);
  const data = await response.json();
  console.log(data);
} catch (error) {
  console.error(error);
}
```

```go
package main

import (
	"fmt"
	"strings"
	"net/http"
	"io"
)

func main() {

	url := "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128"

	payload := strings.NewReader("{\n  \"text\": \"The first move is what sets everything in motion.\",\n  \"model_id\": \"eleven_multilingual_v2\"\n}")

	req, _ := http.NewRequest("POST", url, payload)

	req.Header.Add("xi-api-key", "xi-api-key")
	req.Header.Add("Content-Type", "application/json")

	res, _ := http.DefaultClient.Do(req)

	defer res.Body.Close()
	body, _ := io.ReadAll(res.Body)

	fmt.Println(res)
	fmt.Println(string(body))

}
```

```ruby
require 'uri'
require 'net/http'

url = URI("https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128")

http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true

request = Net::HTTP::Post.new(url)
request["xi-api-key"] = 'xi-api-key'
request["Content-Type"] = 'application/json'
request.body = "{\n  \"text\": \"The first move is what sets everything in motion.\",\n  \"model_id\": \"eleven_multilingual_v2\"\n}"

response = http.request(request)
puts response.read_body
```

```java
import com.mashape.unirest.http.HttpResponse;
import com.mashape.unirest.http.Unirest;

HttpResponse<String> response = Unirest.post("https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128")
  .header("xi-api-key", "xi-api-key")
  .header("Content-Type", "application/json")
  .body("{\n  \"text\": \"The first move is what sets everything in motion.\",\n  \"model_id\": \"eleven_multilingual_v2\"\n}")
  .asString();
```

```php
<?php
require_once('vendor/autoload.php');

$client = new \GuzzleHttp\Client();

$response = $client->request('POST', 'https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128', [
  'body' => '{
  "text": "The first move is what sets everything in motion.",
  "model_id": "eleven_multilingual_v2"
}',
  'headers' => [
    'Content-Type' => 'application/json',
    'xi-api-key' => 'xi-api-key',
  ],
]);

echo $response->getBody();
```

```csharp
using RestSharp;

var client = new RestClient("https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128");
var request = new RestRequest(Method.POST);
request.AddHeader("xi-api-key", "xi-api-key");
request.AddHeader("Content-Type", "application/json");
request.AddParameter("application/json", "{\n  \"text\": \"The first move is what sets everything in motion.\",\n  \"model_id\": \"eleven_multilingual_v2\"\n}", ParameterType.RequestBody);
IRestResponse response = client.Execute(request);
```

```swift
import Foundation

let headers = [
  "xi-api-key": "xi-api-key",
  "Content-Type": "application/json"
]
let parameters = [
  "text": "The first move is what sets everything in motion.",
  "model_id": "eleven_multilingual_v2"
] as [String : Any]

let postData = JSONSerialization.data(withJSONObject: parameters, options: [])

let request = NSMutableURLRequest(url: NSURL(string: "https://api.elevenlabs.io/v1/text-to-speech/JBFqnCBsd6RMkjVDRZzb/stream?output_format=mp3_44100_128")! as URL,
                                        cachePolicy: .useProtocolCachePolicy,
                                    timeoutInterval: 10.0)
request.httpMethod = "POST"
request.allHTTPHeaderFields = headers
request.httpBody = postData as Data

let session = URLSession.shared
let dataTask = session.dataTask(with: request as URLRequest, completionHandler: { (data, response, error) -> Void in
  if (error != nil) {
    print(error as Any)
  } else {
    let httpResponse = response as? HTTPURLResponse
    print(httpResponse)
  }
})

dataTask.resume()
```