Text to Speech streamen
Dieser Leitfaden behandelt drei Ansätze: Sprache als Datei erzeugen, die Audioantwort direkt streamen und generiertes Audio optional in einen AWS-S3-Bucket hochladen, um es über eine signierte URL zu teilen.
Dieser Leitfaden setzt voraus, dass Sie Ihren API-Schlüssel und Ihr SDK eingerichtet haben. Schließen Sie zuerst die Schnellstartanleitung ab, falls Sie dies noch nicht getan haben. Für den optionalen S3-Upload benötigen Sie außerdem ein AWS-Konto mit Zugriff auf S3.
Möchten Sie wissen, warum Streaming so funktioniert? Audio-Streaming verstehen erläutert das Protokoll, die Pufferung und die Latenz-Kompromisse ausführlich.
Text in Sprache umwandeln (Datei)
Um Text in Sprache umzuwandeln und als Datei zu speichern, verwenden wir die Methode convert des ElevenLabs SDK und speichern sie anschließend lokal als .mp3-Datei.
Sie können diese Funktion anschließend wie folgt ausführen:
Text in Sprache umwandeln (Streaming)
Wenn Sie das Audio direkt streamen möchten, ohne es als Datei zu speichern, können Sie unsere Streaming-Funktion verwenden.
Sie können diese Funktion anschließend wie folgt ausführen:
Bonus – In AWS S3 hochladen und einen sicheren Freigabelink erhalten
Sobald Ihre Audiodaten als Datei oder Stream erstellt wurden, möchten Sie sie möglicherweise mit Ihren Nutzern teilen. Eine Möglichkeit ist, sie in einen AWS-S3-Bucket hochzuladen und einen sicheren Freigabelink zu generieren.
Ihre AWS-Anmeldedaten erstellen
Um die Daten in S3 hochzuladen, müssen Sie Ihre AWS-Zugriffsschlüssel-ID, den geheimen Zugriffsschlüssel und den AWS-Regionsnamen zu Ihrer .env-Datei hinzufügen. So finden Sie die Anmeldedaten:
- Melden Sie sich bei Ihrer AWS Management Console an: Navigieren Sie zur AWS-Startseite und melden Sie sich mit Ihrem Konto an.

- Öffnen Sie das IAM-Dashboard (Identity and Access Management): Sie finden IAM im Servicemenü unter „Security, Identity, & Compliance“. Das IAM-Dashboard verwaltet den Zugriff auf Ihre AWS-Services sicher.

- Erstellen Sie einen neuen Benutzer (falls erforderlich): Wählen Sie im IAM-Dashboard „Users“ und dann „Add user“. Geben Sie einen Benutzernamen ein.

- Legen Sie die Berechtigungen fest: Hängen Sie Richtlinien entsprechend der gewünschten Zugriffsebene direkt an den Benutzer an. Für S3-Uploads können Sie die Richtlinie AmazonS3FullAccess verwenden. Es ist jedoch Best Practice, das Prinzip der geringsten Berechtigung anzuwenden, also nur die für eine Aufgabe notwendigen Berechtigungen zu erteilen. Sie sollten eine benutzerdefinierte Richtlinie erstellen, die nur die erforderlichen Aktionen für Ihren S3-Bucket erlaubt.

- Überprüfen und erstellen Sie den Benutzer: Prüfen Sie Ihre Einstellungen und erstellen Sie den Benutzer. Nach der Erstellung erhalten Sie eine Zugriffsschlüssel-ID und einen geheimen Zugriffsschlüssel. Laden Sie diese Anmeldedaten herunter und speichern Sie sie sicher. Der geheime Zugriffsschlüssel kann nach diesem Schritt nicht erneut abgerufen werden.

- AWS-Regionsnamen abrufen: z. B. us-east-1

Falls Sie keinen AWS-S3-Bucket haben, müssen Sie einen neuen erstellen:
- Öffnen Sie das S3-Dashboard: Sie finden S3 im Servicemenü unter „Storage“.

- Erstellen Sie einen neuen Bucket: Klicken Sie im S3-Dashboard auf „Create bucket“.

- Geben Sie einen Bucket-Namen ein und klicken Sie auf „Create bucket“. Sie können die übrigen Bucket-Optionen auf den Standardwerten belassen. Der neue Bucket erscheint in der Liste.


AWS SDK installieren und Anmeldedaten hinzufügen
Installieren Sie boto3 für die Interaktion mit AWS-Services über pip und npm.
Fügen Sie dann die Umgebungsvariablen wie folgt zur .env-Datei hinzu:
In AWS S3 hochladen und die signierte URL generieren
Fügen Sie die folgenden Funktionen hinzu, um den Audiostream in S3 hochzuladen und eine signierte URL zu generieren.
Sie können die Upload-Funktion anschließend mit dem Audiostream aus dem Text aufrufen.
Generieren Sie nach dem Hochladen der Audiodatei in S3 eine signierte URL, um Zugriff auf die Datei zu gewähren. Diese URL ist zeitlich begrenzt und läuft nach einem bestimmten Zeitraum ab. Dadurch eignet sie sich für die temporäre Freigabe.
Sie können jetzt mit Folgendem eine URL aus einer Datei generieren:
Wenn Sie die Datei mehrfach verwenden möchten, sollten Sie den S3-Dateipfad in Ihrer Datenbank speichern und die signierte URL bei Bedarf jeweils neu generieren, statt die signierte URL direkt zu speichern, da sie abläuft.
Alles zusammenführen
Um alles zusammenzuführen, können Sie das folgende Skript verwenden:
Fazit
Sie wissen jetzt, wie Sie Text in Sprache umwandeln und eine signierte URL generieren, um die Audiodatei zu teilen. Diese Funktion eröffnet zahlreiche Möglichkeiten, Inhalte dynamisch zu erstellen und zu teilen.
Hier sind einige Beispiele dafür, was Sie damit entwickeln können.
-
Bildungspodcasts: Erstellen Sie personalisierte Bildungsinhalte, auf die Schüler bei Bedarf zugreifen können. Lehrkräfte können ihren Unterricht in ein Audioformat umwandeln, in S3 hochladen und die Links mit Schülern teilen, um das Lernen außerhalb des klassischen Klassenzimmers interessanter zu gestalten.
-
Barrierefreiheitsfunktionen für Websites: Verbessern Sie die Barrierefreiheit Ihrer Website, indem Sie Textinhalte als Audio anbieten. So werden Informationen auf Websites für Personen mit Sehbeeinträchtigungen oder für Menschen, die auditives Lernen bevorzugen, zugänglicher.
-
Automatisierte Kundensupport-Nachrichten: Erstellen Sie automatisierte und personalisierte Audionachrichten für den Kundensupport, etwa FAQs oder Bestellupdates. Das kann im Vergleich zu klassischen Text-E-Mails ein ansprechenderes Kundenerlebnis bieten.
-
Hörbücher und Vertonung: Wandeln Sie ganze Bücher oder Kurzgeschichten in ein Audioformat um und bieten Sie Ihrem Publikum einen neuen Zugang zu Literatur. Autoren und Verlage können ihr Inhaltsangebot diversifizieren und Menschen erreichen, die lieber hören als lesen.
-
Sprachlern-Tools: Entwickeln Sie Sprachlernhilfen, die Lernenden Audiolektionen und Übungen bieten. So lassen sich Aussprache und Hörverständnis gezielt trainieren.