Speech to Text

Guide de transcription audio avec ElevenLabs
Fonctionnalité du produit Text to Speech

Présentation

Avec Speech to Text, vous pouvez transcrire l’audio parlé en texte avec une précision de pointe. Grâce à la détection automatique de la langue, vous pouvez transcrire de l’audio dans de nombreuses langues.

Créer une transcription

1

Importez un fichier audio

Dans le Dashboard ElevenLabs, accédez à la page Speech to Text et cliquez sur le bouton « Transcrire des fichiers ». Dans la fenêtre modale, vous pouvez importer un fichier audio ou vidéo à transcrire.

Importation Speech to Text

2

Sélectionnez les options

  • Sélectionnez la langue principale de l’audio si vous la connaissez. Vous pouvez laisser l’option sur « Détecter », et toutes les langues présentes dans l’audio seront automatiquement détectées.

  • Choisissez si vous souhaitez étiqueter les événements audio tels que les rires ou les applaudissements à l’aide du bouton bascule « Étiqueter les événements audio ».

  • Les prompts de termes clés vous permettent d’ajouter jusqu’à 1 000 mots ou expressions afin d’orienter le modèle vers leur transcription. Cette fonctionnalité est utile pour transcrire des mots ou phrases spécifiques peu fréquents dans l’audio, tels que des noms de produits, des noms propres ou d’autres termes précis.

Lorsque vous êtes prêt, cliquez sur le bouton « Importer des fichiers » pour envoyer le fichier.

3

Affichez les résultats

Cliquez sur le nom du fichier audio importé dans le panneau central pour afficher les résultats. Vous pouvez cliquer sur un mot pour lancer la lecture de l’audio à cet endroit.

Cliquez sur le bouton « Exporter » en haut à droite pour télécharger les résultats dans différents formats.

Éditeur de transcription

Une fois votre transcription créée, vous pouvez la modifier dans notre Éditeur de transcription. En savoir plus dans ce guide.

FAQ

Oui, l’outil prend en charge l’importation de fichiers audio et vidéo. La taille maximale des fichiers est de 3 Go.

Renommer les intervenants

Oui, vous pouvez renommer les intervenants en cliquant sur le bouton « Modifier » à côté du libellé « Intervenants ».

Speech to Text convertit l’audio parlé en texte écrit. Chez ElevenLabs, notre modèle Speech to Text est Scribe. Il vous permet de transcrire avec précision la parole dans plus de 90 langues, afin de transformer facilement l’audio en texte lisible et consultable.

Fonctionnalités clés de Scribe

  • Une précision de premier plan, atteignant 98 % dans les principales langues telles que l’anglais, le français, l’italien, le portugais, l’espagnol et l’allemand.
  • Des horodatages précis au niveau du mot, pour savoir exactement quand chaque mot est prononcé.
  • Une diarisation intelligente des locuteurs, qui identifie et sépare automatiquement les différents intervenants.
  • Le balisage audio dynamique pour détecter les sons non vocaux.
  • La prise en charge de մինչև 32 locuteurs tout en conservant une grande précision.

Nouveautés de Scribe v2

Scribe v2 s’appuie sur le modèle de base avec des capacités supplémentaires conçues pour les cas d’utilisation plus exigeants.

  • Guidage par termes clés. Vous pouvez fournir jusqu’à 100 mots ou expressions pour aider le modèle à retranscrire correctement les termes importants. Le recours au guidage par termes clés augmente le coût de 20 %.
  • Détection d’entités. Vous pouvez sélectionner des catégories précises d’informations à détecter dans la transcription, comme des numéros de carte bancaire, des noms ou des pathologies. La détection d’entités est disponible uniquement via l’API et augmente le coût de 30 %.
  • Prise en charge intelligente de plusieurs langues. Vous pouvez envoyer un audio contenant plusieurs langues, et Scribe v2 détectera et transcrira automatiquement chacune d’elles correctement.
  • Stabilité améliorée. Scribe v2 gère les pauses, les changements de ton et les longs silences sans interruption ni perte de précision.

Quelle version utiliser ?

Nous recommandons Scribe v2 lorsque vous avez besoin d’une transcription très précise. Il est disponible sur notre site web et via l’API. Lorsque vous utilisez Speech to Text sur notre site web, Scribe v2 est le modèle par défaut.

Pour l’audio médical et clinique, utilisez Scribe v2 Medical (scribe_v2_medical) via la même API. Sa tarification est identique à celle de Scribe v2.

Pour les cas d’utilisation en temps réel, nous recommandons Scribe v2 Realtime, disponible via ElevenAgents et l’API.

Pour plus de détails, consultez notre documentation Speech to Text.

Speech to Text prend en charge plus de 90 langues. 

Pour consulter la liste complète des langues prises en charge, consultez la section sur la prise en charge des langues de notre documentation Speech to Text.

La limite de requêtes simultanées, c’est-à-dire les requêtes exécutées en parallèle, dépend de votre abonnement et de votre utilisation de Speech to Text ou de Realtime Speech to Text.

Voici les limites actuelles de requêtes simultanées pour Speech to Text.

ForfaitLimite de requêtes simultanées Speech to TextLimite de requêtes simultanées Realtime Speech to Text
Gratuit86
Starter129
Creator2015
Pro4030
Scale6045
Business6045
EnterpriseAugmentéeAugmentée

Si vous avez besoin d’un plus grand nombre de requêtes simultanées, contactez directement notre service Enterprise via cette page web. Nous serons ravis d’échanger avec vous sur un forfait sur mesure adapté à vos besoins spécifiques.

No results