Obsługa wielu głosów

Pozwól agentowi AI przełączać się między różnymi głosami w rozmowach z wieloma postaciami i bardziej angażujących opowieściach.

Omówienie

Obsługa wielu głosów pozwala twojemu agentowi ElevenLabs dynamicznie przełączać się między różnymi głosami ElevenLabs w trakcie jednej rozmowy. Ta funkcja umożliwia:

  • Historie z wieloma postaciami: Różne głosy dla różnych postaci w narracji
  • Naukę języków: Głosy rodzimych użytkowników różnych języków
  • Agentów emocjonalnych: Zmiany głosu zależnie od kontekstu emocjonalnego
  • Scenariusze role-play: Osobne głosy dla różnych person
Interfejs konfiguracji wielu głosów

Jak to działa

Gdy obsługa wielu głosów jest włączona, twój agent może używać znaczników w stylu XML, aby przełączać się między skonfigurowanymi głosami podczas generowania tekstu. Gdy nie określono konkretnego głosu, agent automatycznie wraca do głosu domyślnego.

The teacher said, <spanish>¡Hola estudiantes!</spanish>
Then the student replied, <student>Hello! How are you today?</student>

Konfiguracja

Dodawanie obsługiwanych głosów

Każdy obsługiwany głos ma następujące właściwości:

  • Etykieta głosu: Unikalny identyfikator (np. „Joe”, „Spanish”, „Happy”)
  • Głos: Wybierz spośród dostępnych głosów ElevenLabs
  • Rodzina modeli: Wybierz Turbo, Flash lub Multilingual (opcjonalnie)
  • Język: Zastąp język domyślny dla tego głosu (opcjonalnie)
  • Opis: Kiedy agent powinien używać tego głosu

Otwórz agenta w panelu, przejdź do karty Voice i znajdź sekcję Multi-voice support. Kliknij Add voice, aby skonfigurować nowy obsługiwany głos.

Interfejs konfiguracji wielu głosów

Właściwości głosu

Unikalny identyfikator, którego LLM używa do wskazania tego głosu. Wybieraj opisowe etykiety, takie jak: - Nazwy postaci: „Alice”, „Bob”, „Narrator” - Języki: „Spanish”, „French”, „German” - Emocje: „Happy”, „Sad”, „Excited” - Role: „Teacher”, „Student”, „Guide”

Zastąp domyślną rodzinę modeli agenta dla tego konkretnego głosu: - Flash: Najszybsze generowanie, zoptymalizowane do użycia w czasie rzeczywistym - Turbo: Zrównoważona szybkość i jakość - Multilingual: Najwyższa jakość, najlepsza dla języków innych niż angielski - Same as agent: Użyj domyślnego ustawienia agenta

Określ inny język dla tego głosu. Przydatne w przypadku: - Rozmów wielojęzycznych - Nauki języków

  • Wymowy specyficznej dla regionu

Podaj kontekst, kiedy agent powinien używać tego głosu. Przykłady:

  • „Dla dowolnych hiszpańskich słów lub fraz”
  • „Gdy treść wiadomości jest radosna lub podekscytowana”
  • „Gdy mówi postać Joe”

Implementacja

Składnia znaczników XML

Twój agent używa tagów w stylu XML do przełączania głosów:

<VOICE_LABEL>text to be spoken</VOICE_LABEL>

Najważniejsze informacje:

  • Zastąp VOICE_LABEL dokładną skonfigurowaną etykietą
  • Tekst poza tagami używa głosu domyślnego
  • W tagach wielkość liter ma znaczenie
  • Zagnieżdżone tagi nie są obsługiwane

Integracja z promptem systemowym

Gdy skonfigurujesz obsługiwane głosy, system automatycznie doda instrukcje do promptu agenta:

When a message should be spoken by a particular person, use markup: "<CHARACTER>message</CHARACTER>" where CHARACTER is the character label.
Available voices are as follows:
- default: any text outside of the CHARACTER tags
- Joe: Whenever Joe is speaking
- Spanish: For any Spanish words or phrases
- Narrator: For narrative descriptions

Przykład użycia

Teacher: Let's practice greetings. In Spanish, we say <Spanish>¡Hola! ¿Cómo estás?</Spanish>
Student: How do I respond?
Teacher: You can say <Spanish>¡Hola! Estoy bien, gracias.</Spanish> which means Hello! I'm fine, thank you.

Dobre praktyki

  • Wybieraj głosy, które wyraźnie odróżniają postacie lub konteksty
  • Testuj kombinacje głosów, aby upewnić się, że dobrze ze sobą współgrają
  • Uwzględnij ton emocjonalny i osobowość każdego głosu
  • Przy zmianie języka zadbaj, by głosy pasowały do języka i akcentu
  • Używaj opisowych, intuicyjnych etykiet, które LLM zrozumie
  • Etykiety powinny być krótkie i łatwe do zapamiętania
  • Unikaj znaków specjalnych i spacji w etykietach
  • Ogranicz liczbę obsługiwanych głosów do tych, których naprawdę potrzebujesz
  • Gdy to możliwe, używaj tej samej rodziny modeli, aby ograniczyć narzut przełączania
  • Testuj z przewidywanymi schematami rozmów
  • Monitoruj czas odpowiedzi przy wielu zmianach głosu
  • Podaj jasne opisy, kiedy należy używać każdego głosu
  • Testuj przypadki brzegowe, w których zmiana głosu może być niejasna
  • Uwzględnij zachowanie awaryjne, gdy etykiety głosów są niejednoznaczne
  • Upewnij się, że zmiany głosu wzbogacają rozmowę, a nie rozpraszają

Ograniczenia

  • Maksymalnie 10 obsługiwanych głosów na agenta (w tym domyślny)
  • Przełączanie głosów dodaje minimalne opóźnienie podczas generowania
  • Tagi XML muszą mieć poprawny format i być zamknięte
  • W znacznikach etykiety głosów rozróżniają wielkość liter
  • Zagnieżdżone tagi głosów nie są obsługiwane

FAQ

Jeśli agent użyje etykiety głosu, która nie została skonfigurowana, tekst zostanie wypowiedziany głosem domyślnym. Tagi XML zostaną zignorowane.

Tak, możesz przełączać głosy w jednej odpowiedzi. Każda oznaczona sekcja użyje określonego głosu, a tekst bez tagów użyje głosu domyślnego.

Przełączanie głosów dodaje minimalny narzut. Pierwsze użycie każdego głosu w rozmowie może mieć nieco większe opóźnienie podczas inicjalizacji głosu.

Tak, możesz skonfigurować wiele etykiet używających tego samego głosu ElevenLabs, ale z różnymi rodzinami modeli, językami lub kontekstami.

Podaj jasne przykłady w prompcie systemowym i dokładnie przetestuj działanie. Możesz uwzględnić konkretne scenariusze, w których powinna nastąpić zmiana głosu, oraz przykłady formatu znaczników XML.