Qu’est-ce que Speech to Text ?

Speech to Text convertit l’audio parlé en texte écrit. Chez ElevenLabs, notre modèle Speech to Text est Scribe. Il vous permet de transcrire avec précision la parole dans plus de 90 langues, afin de transformer facilement l’audio en texte lisible et consultable.

Fonctionnalités clés de Scribe

  • Une précision de premier plan, atteignant 98 % dans les principales langues telles que l’anglais, le français, l’italien, le portugais, l’espagnol et l’allemand.
  • Des horodatages précis au niveau du mot, pour savoir exactement quand chaque mot est prononcé.
  • Une diarisation intelligente des locuteurs, qui identifie et sépare automatiquement les différents intervenants.
  • Le balisage audio dynamique pour détecter les sons non vocaux.
  • La prise en charge de մինչև 32 locuteurs tout en conservant une grande précision.

Nouveautés de Scribe v2

Scribe v2 s’appuie sur le modèle de base avec des capacités supplémentaires conçues pour les cas d’utilisation plus exigeants.

  • Guidage par termes clés. Vous pouvez fournir jusqu’à 100 mots ou expressions pour aider le modèle à retranscrire correctement les termes importants. Le recours au guidage par termes clés augmente le coût de 20 %.
  • Détection d’entités. Vous pouvez sélectionner des catégories précises d’informations à détecter dans la transcription, comme des numéros de carte bancaire, des noms ou des pathologies. La détection d’entités est disponible uniquement via l’API et augmente le coût de 30 %.
  • Prise en charge intelligente de plusieurs langues. Vous pouvez envoyer un audio contenant plusieurs langues, et Scribe v2 détectera et transcrira automatiquement chacune d’elles correctement.
  • Stabilité améliorée. Scribe v2 gère les pauses, les changements de ton et les longs silences sans interruption ni perte de précision.

Quelle version utiliser ?

Nous recommandons Scribe v2 lorsque vous avez besoin d’une transcription très précise. Il est disponible sur notre site web et via l’API. Lorsque vous utilisez Speech to Text sur notre site web, Scribe v2 est le modèle par défaut.

Pour l’audio médical et clinique, utilisez Scribe v2 Medical (scribe_v2_medical) via la même API. Sa tarification est identique à celle de Scribe v2.

Pour les cas d’utilisation en temps réel, nous recommandons Scribe v2 Realtime, disponible via ElevenAgents et l’API.

Pour plus de détails, consultez notre documentation Speech to Text.