Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Comment utiliser une API de transcription de réunions : temps réel et traitement par lots avec Scribe v2

Rédigé par
Jack Limebear
Publié

ÉcouterÉcouter cet article

Prendre des notes de réunion manuellement est fastidieux et source d'erreurs, surtout lorsqu'une réunion dure plus d'une heure. Cela fait perdre du temps et détourne les participants de la discussion. Même avec un enregistrement audio, associer des conversations précises à chaque intervenant reste difficile. 


Une API de transcription de réunions vous permet de convertir des réunions en direct ou enregistrées en texte horodaté, avec identification des intervenants, directement dans votre produit. Vous envoyez l'audio et recevez une transcription structurée, sans avoir à créer vous-même un modèle de parole.

Cet article explique le fonctionnement d'une API de transcription de réunions, compare la transcription en temps réel et par lots, et montre comment développer avec Eleven Scribe v2 et Eleven Scribe v2 Realtime.

En résumé

  • Une API de transcription de réunions convertit l'audio des réunions en transcriptions horodatées avec identification des intervenants.
  • La transcription en temps réel offre un sous-titrage à faible latence pendant la réunion, tandis que la transcription par lots traite les enregistrements audio une fois la réunion terminée.
  • La précision de la transcription de réunions dépend de la qualité audio, des caractéristiques vocales des intervenants et du modèle vocal sous-jacent. 
  • ElevenLabs propose les modèles Scribe v2 et Scribe v2 Realtime, qui permettent aux équipes d'ingénierie de créer des produits de transcription de réunions très précis. 

Rôle d'une API de transcription de réunions et profils concernés

Une API de transcription de réunions reçoit l'audio d'une réunion en entrée et renvoie du texte. Elle gère la reconnaissance vocale, la diarisation des intervenants et l'horodatage, pour vous fournir un ensemble complet. Par rapport à la prise de notes manuelle, la conversion de la parole en texte pour les réunions donne aux participants un compte rendu consultable qu'ils peuvent retrouver ultérieurement.

À mesure que les équipes adoptent des agents IA, les comptes rendus écrits des réunions deviennent un contexte consultable. Un agent interne recherche des détails dans les transcriptions et fait ressortir des informations qui réduisent les silos de données et améliorent l'accès aux informations entre les équipes.

De nombreux outils commerciaux proposent la transcription, mais ils ne répondent pas toujours entièrement aux exigences d'une organisation.


Pour les équipes d'ingénierie produit, créer une application de réunions STT ou ajouter cette capacité à un outil existant est parfois plus pertinent. Avec votre propre logiciel de transcription de réunions, vous contrôlez les éléments suivants :

  • Confidentialité : ElevenLabs propose le Mode zéro rétention pour les utilisateurs Enterprise, afin de répondre davantage aux exigences de confidentialité dans certaines régions. 
  • Vocabulaire personnalisé : vous fournissez un contexte supplémentaire au modèle afin qu'il comprenne et transcrive les termes propres à votre entreprise, votre produit et votre secteur. 
  • Workflow sur mesure : au lieu d'être limité aux workflows propres à un fournisseur, vous créez un outil de transcription de réunions connecté à votre base de données interne, à votre CRM et à vos logiciels d'entreprise. 


ElevenLabs fournit des modèles vocaux et audio de référence qui vous aident à créer une application de transcription de réunions. Notre API de transcription de réunions vous permet de retranscrire avec précision les échanges d'une réunion sous forme de notes écrites. Nos modèles prennent en charge plus de 90 langues, pour transcrire l'anglais, le français, le mandarin et des dizaines d'autres langues. 

Why teams build custom meeting transcription API: privacy, vocabulary, workflow, and searchable AI context.

Conversion de la parole en texte pour les réunions : temps réel ou traitement par lots, comment choisir 

La transcription en temps réel capte les flux audio au moment où les personnes parlent et les transforme en sous-titres en direct. Vous l'utilisez pour fournir une assistance textuelle durant la réunion ou déclencher des actions en cours de session avec un bot en direct. La transcription par lots, elle, traite l'intégralité de l'enregistrement après une réunion afin de fournir une transcription plus concise et structurée. Elle facilite la création de notes après réunion, l'archivage et la conservation de registres auditables. 

Il est important de comprendre les implications techniques et financières avant de choisir entre une transcription parole-texte en temps réel ou par lots. 

Voici une comparaison rapide des deux approches.

Caractéristiques

Transcription en temps réel

Transcription par lots

Fonctionnement technique

Capte les flux audio en direct. Nécessite une connexion active au modèle vocal. 

Traite l'intégralité de l'enregistrement audio après une réunion. Peut fonctionner de manière asynchrone.  

Précision 

Standard. Traite l'audio à la volée sans disposer de tout le contexte.

Supérieure. Dispose de suffisamment de temps pour analyser l'intégralité du contexte conversationnel.

Cas d'usage

Sous-titrage en direct pendant la réunion, bot de réunion. 

Notes après réunion, archivage.

Coût

Plus élevé, car une connexion persistante est nécessaire.

Plus faible grâce à l'efficacité du traitement en masse. 

En définitive, votre choix dépend de vos priorités. Si vous créez un assistant de réunion en direct, vous devez transcrire en temps réel. Dans le cas contraire, utilisez la transcription par lots, qui offre des avantages en termes de coût et de précision. 

Configurer une API de transcription de réunions avec Scribe v2

ElevenLabs Speech to Text vous permet de transcrire des réunions avec Scribe v2 Realtime et Scribe v2. Ces deux modèles vocaux sont entraînés pour identifier précisément les intervenants, quels que soient les accents, dialectes et niveaux de qualité audio. Scribe v2 Realtime vous permet de transcrire instantanément la parole en direct, tandis que Scribe v2 transforme les enregistrements audio en transcriptions très précises. 

Vous pouvez accéder aux deux modèles via l'API que nous fournissons. Nous examinons ci-dessous chaque modèle en détail, en présentant leurs principales fonctionnalités, leur architecture API et les moyens de les intégrer à votre solution de transcription. 

Option 1 : transcription en temps réel (en direct) 

La transcription en temps réel vous permet de traiter les conversations pendant une réunion et de les convertir en texte à mesure que les intervenants parlent. L'écart entre la parole entendue et la parole transcrite est imperceptible, voire inexistant. 

Pour transcrire en temps réel, utilisez le modèle Scribe v2 Realtime, qui atteint une faible latence de 150 ms entre l'entrée audio et la sortie texte, pour des transcriptions partielles quasi instantanées. Vous obtenez ainsi un sous-titrage sans interruption lorsque vous intégrez le modèle à votre application de transcription. 

Conçu pour les conversations en direct, Scribe v2 Realtime convient aux cas d'usage nécessitant du sous-titrage en direct, la génération de notes de réunion en temps réel ou l'alimentation d'un assistant IA avec du texte en direct pour déclencher des actions secondaires. Le modèle prend également en charge jusqu'à 50 termes clés pour le prompting. 

Transcrire avec Scribe v2 Realtime


Pour effectuer une transcription en direct, connectez votre produit à Scribe v2 Realtime via ElevenAPI. 

  1. Commencez par ouvrir un WebSocket afin que votre produit puisse recevoir les transcriptions du modèle Scribe v2 Realtime. 
  2. Envoyez ensuite au modèle les flux des conversations de réunion en direct. 
  3. Enfin, recevez les transcriptions partielles et finales en moins de 150 ms. 


Dans votre code, vous créez des gestionnaires pour les événements API qui surviennent tout au long du processus de transcription. Par exemple, votre code gère les événements liés à l'envoi de données audio et à la réception d'une transcription validée. 

Live meeting transcription workflow: open WebSocket, stream audio, receive partial and final text.

Méthodes de streaming en direct pour Scribe v2 Realtime

L'exemple ci-dessous crée un jeton à usage unique sur votre backend. Votre client peut diffuser l'audio de réunion vers l'API de transcription de réunions sans exposer votre clé API.

// Node.js server
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
  apiKey: process.env.ELEVENLABS_API_KEY,
});

app.get("/scribe-token", yourAuthMiddleware, async (req, res) => {
  const token = await elevenlabs.tokens.singleUse.create("realtime_scribe");

  res.json(token);
});

Selon l'architecture de votre application, vous pouvez diffuser les conversations en direct avec Scribe v2 Realtime depuis l'application cliente ou le serveur backend.

  • Streaming côté client : avec cette méthode, vous transmettez l'entrée audio au modèle audio directement depuis le microphone ou par découpage manuel. Pour vous connecter à l'API, vous vous authentifiez avec un jeton à usage unique, ce qui évite d'exposer votre clé API. 
  • Streaming côté serveur : cette méthode vous permet de diffuser l'audio directement depuis une URL, des fichiers importés ou un flux audio. Vous utilisez votre clé API ElevenLabs au lieu d'un jeton à usage unique. 

Choisir une stratégie de validation pour Scribe v2 Realtime

L'exemple ci-dessous configure la détection d'activité vocale. L'API valide un segment de transcription chaque fois qu'un intervenant fait une pause.

import { Scribe, AudioFormat, CommitStrategy } from "@elevenlabs/client";

const connection = Scribe.connect({
  token: "sutkn_1234567890",
  modelId: "scribe_v2_realtime",
  audioFormat: AudioFormat.PCM_16000,
  commitStrategy: CommitStrategy.VAD,
  vadSilenceThresholdSecs: 1.5,
  vadThreshold: 0.4,
  minSpeechDurationMs: 100,
  minSilenceDurationMs: 100,
});

La transcription finale fournit des éléments probants qui retranscrivent fidèlement les échanges de la réunion. Il existe deux façons de valider les transcriptions finales : manuellement ou avec la détection d'activité vocale (VAD). 

  • Validation manuelle : par défaut, vous devez valider manuellement le segment de transcription dans votre code. Nous recommandons une validation toutes les 20 à 30 secondes pour une latence optimale. Si vous craignez de perdre le contexte, vous pouvez envoyer le texte précédent avec le segment audio à traiter.
  • Détection d'activité vocale : vous pouvez aussi utiliser la VAD, qui détecte les silences dans le flux audio pour lancer la transcription. 

Option 2 : transcription par lots après réunion 

La transcription par lots permet efficacement de convertir des heures d'enregistrements de réunions en texte. Elle fournit à grande échelle des transcriptions concises, pertinentes dans leur contexte et avec diarisation.

Scribe v2 est un modèle de conversion de la parole en texte d'ElevenLabs qui prend en charge le balisage audio dynamique. Vous pouvez extraire précisément les données de conversation, ainsi que les événements non vocaux, tels que les rires et les bruits de pas. 

Contrairement à la transcription en temps réel, Scribe v2 est conçu pour les notes de réunion après enregistrement. Par exemple, vous enregistrez des réunions sur des plateformes telles que Zoom, Teams et Google Meet, puis vous chargez les fichiers audio dans Scribe v2 après la session pour une transcription par lots. 

Batch transcription workflow: upload recording, receive webhook, and verify its HMAC signature.

Effectuer une transcription par lots avec Scribe v2 

La transcription avec Scribe v2 s'effectue de manière asynchrone via une API REST. Vous n'avez pas besoin de maintenir une connexion active avec le modèle vocal. Vous utilisez plutôt un webhook pour être averti lorsque la transcription est prête.

Voici le flux logique qui convertit des enregistrements audio en transcription.

Create webhook dialog configuring callback URL, HMAC authentication, and event subscriptions.

 

  1. Commencez par créer un WebHook dans le Dashboard ElevenLabs pour recevoir les résultats de transcription.
  2. Créez ensuite des gestionnaires d'événements dans votre code pour traiter la transcription renvoyée. 
  3. Chargez ensuite les fichiers audio vers le point de terminaison REST de Scribe v2. 


Une fois la transcription terminée, le gestionnaire d'événements que vous avez configuré est appelé. 

Prompting par mots-clés pour Scribe v2

Scribe v2, en traitement par lots, prend en charge jusqu'à 1 000 termes pour le prompting par mots-clés. Lorsque vous envoyez un fichier audio à transcrire, vous pouvez inclure les termes dans l'appel API. Contrairement à une liste de vocabulaire, Scribe v2 compare les mots-clés au contexte de la conversation afin de déterminer la transcription appropriée.


Le modèle porte ainsi une attention particulière aux termes spécifiques lorsqu'ils sont prononcés et les transcrit avec précision. 

L'exemple ci-dessous transmet des termes d'entreprise et de produit avec la requête. L'API les transcrira donc correctement dans leur contexte. 

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
    model_id="scribe_v2_realtime",
    keyterms=["ElevenLabs"],
))

Par exemple, il transcrit « ElevenLabs » lorsque vous prononcez ce mot dans le contexte d'une marque ou d'une entreprise. 

Transcription multicanale pour Scribe v2

La transcription multicanale permet au modèle Scribe v2 de transcrire les canaux individuels d'un fichier audio contenant la parole de différents intervenants. Cette fonctionnalité est utile pour créer un outil de transcription destiné aux conférences, aux enregistrements judiciaires ou aux podcasts. 

Chaque canal reçoit un identifiant unique représentant un intervenant.

Défis courants de la transcription de réunions et réponses de l'API 

Lors de la transcription de réunions, les équipes d'ingénierie rencontrent souvent plusieurs difficultés.

Slide outlines four meeting transcription challenges, API solutions, and keyterm limits.

Conversations qui se chevauchent 

Lorsque plusieurs intervenants parlent en même temps, il devient difficile de comprendre ce qui est dit. Pour les distinguer, utilisez la diarisation ou la transcription multicanale proposées par Scribe v2. Vous recevez ainsi des transcriptions distinctes associées à chaque intervenant.

Erreurs d'interprétation

Les outils de transcription rencontrent aussi des difficultés pour détecter et interpréter avec précision des produits, marques ou termes sectoriels spécifiques. Par exemple, « DevOps », un terme familier aux développeurs logiciels, peut être transcrit à tort comme « dev ops ». Avec l'API de transcription de réunions d'ElevenLabs, vous pouvez guider le modèle pour une interprétation correcte grâce au prompting par termes clés.

Intervenants multilingues

Certaines réunions se déroulent dans différentes langues, les intervenants alternant entre deux langues ou plus qu'ils maîtrisent. Les modèles vocaux standard ont du mal à interpréter le contexte et le contenu de la parole, ce qui réduit la qualité de transcription. Scribe v2 permet la transcription multilingue dans plus de 90 langues et capture précisément les conversations au fil de leur déroulement. 

Sous-titrage en direct et transcription après enregistrement

Certaines équipes doivent projeter des sous-titres en direct et générer une transcription après réunion. Tous les outils de transcription prêts à l'emploi ne proposent malheureusement pas ces deux fonctionnalités. L'API ElevenLabs vous permet de les obtenir avec Scribe v2 et Scribe v2 Realtime. 

Démarrer avec l'API de transcription de réunions

ElevenAPI vous donne accès à des modèles Speech to Text de référence pour créer des outils de transcription de réunions. La configuration d'un environnement de développement est simple. Obtenez une clé API et installez le SDK pour Python ou Node.js. Intégrez ensuite Scribe v2 ou Scribe v2 Realtime à votre produit grâce à l'API fournie. 

Accédez à ElevenLabs et envoyez votre première requête API dès maintenant. 

Développez à grande échelle avec ElevenAPI

Vous cherchez autre chose ? Consultez notre centre d'aide

FAQ 

Rédigé par

Jack Limebear fait partie de l’équipe Growth, où il rédige et conçoit des contenus pour le blog et les pages d’analyses. Avant de rejoindre ElevenLabs, il a passé plus de dix ans à piloter la stratégie de contenu pour des organisations allant de start-ups SaaS en forte croissance à des entreprises du Fortune 500. Il est titulaire d’un master en littérature anglaise de l’Université de Cambridge.

Articles similaires

Créez avec l'audio IA de la plus haute qualité