Vad är Speech to Text?
Speech to Text omvandlar talat ljud till skriven text. På ElevenLabs heter vår Speech to Text-modell Scribe. Med den kan du transkribera tal korrekt på över 90 språk, så att du enkelt kan omvandla ljud till läsbar och sökbar text.
Viktiga funktioner i Scribe
- Branschledande precision, med 98 % precision för stora språk som engelska, franska, italienska, portugisiska, spanska och tyska.
- Exakta tidsstämplar på ordnivå, så att du kan se precis när varje ord sägs.
- Smart talaridentifiering som automatiskt identifierar och skiljer mellan olika talare.
- Dynamisk ljudtaggning för att upptäcka ljud som inte är tal.
- Stöd för upp till 32 talare med fortsatt hög precision.
Nyheter i Scribe v2
Scribe v2 bygger vidare på kärnmodellen med ytterligare funktioner för mer krävande användningsområden.
- Nyckeltermsinstruktioner. Du kan ange upp till 100 ord eller fraser för att hjälpa modellen att transkribera viktiga termer korrekt. Användning av nyckeltermsinstruktioner ökar kostnaden med 20 %.
- Entitetsidentifiering. Du kan välja specifika informationskategorier som ska upptäckas i transkriptionen, till exempel kreditkortsnummer, namn eller medicinska tillstånd. Entitetsidentifiering är endast tillgänglig via API och ökar kostnaden med 30 %.
- Smart stöd för flera språk. Du kan skicka in ljud som innehåller flera språk, och Scribe v2 identifierar och transkriberar automatiskt varje språk korrekt.
- Förbättrad stabilitet. Scribe v2 hanterar pauser, tonförändringar och långa tystnader
utan att avbrytas eller tappa precision.
Vilken version bör du använda?
Vi rekommenderar Scribe v2 när transkribering med hög precision krävs. Den finns tillgänglig via vår webbplats och API. När du använder Speech to Text via vår webbplats är Scribe v2 standardmodellen.
För medicinskt och kliniskt ljud använder du Scribe v2 Medical (scribe_v2_medical) via samma API. Den debiteras till samma pris som Scribe v2.
För användning i realtid rekommenderar vi Scribe v2 Realtime, som är tillgänglig via ElevenAgents och API.
Mer information finns i vår dokumentation för Speech to Text.