Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Dust incorpora voz multilingüe a flujos de trabajo empresariales impulsados por IA con ElevenLabs

Publicado

EscucharEscucha este artículo

Dust, el sistema operativo para empresas nativas de IA, ahora incorpora entrada y salida de voz multilingüe, impulsadas por ElevenLabs. Diseñado para integrar modelos en el trabajo diario, Dust necesitaba capacidades de voz que funcionaran en distintos idiomas, dispositivos y contextos, con baja latencia y gran realismo.

No era una exploración. La voz se convirtió en una prioridad de producto tras las reiteradas peticiones de clientes. El resultado: un sistema que permite interactuar con agentes sin manos durante los trayectos, colaborar en varios idiomas entre equipos globales y generar audio profesional para flujos de trabajo asíncronos.

Por qué la voz es importante en la empresa

Dust identificó cuatro requisitos críticos para la voz en un contexto de trabajo:

  • Calidad natural que resiste el escrutinio: La salida de voz debe sonar profesional y humana, apta para compartirla en correos a clientes, pódcast o demostraciones de producto.
  • Multilingüe de serie: Los equipos trabajan en oficinas e idiomas de todo el mundo. Cambiar entre francés, inglés y alemán en una misma sesión no debería ser un caso excepcional.
  • Baja latencia: Tanto para la entrada como para la salida, la velocidad de respuesta debe seguir el ritmo del pensamiento y la conversación.
  • Gestión de datos de nivel empresarial: La ausencia de retención de datos, el enrutamiento por región y el cumplimiento de SOC 2 y el RGPD no eran negociables.

Por qué Dust eligió ElevenLabs

Tras evaluar proveedores como OpenAI, Google, Deepgram y AssemblyAI, Dust eligió ElevenLabs por su calidad superior y su preparación para el despliegue:

  • Texto a Voz ofreció voces con un realismo alto y constante, y una amplia gama emocional, algo fundamental para las herramientas Speech Generator y Sound Studio de Dust.
  • Voz a Texto admitía transcripción en 99 idiomas, con gran fidelidad entre idiomas.
  • Retención de datos cero y el enrutamiento multirregional garantizaban el cumplimiento normativo empresarial desde el principio.
  • SDK y API preparados para producción permitieron una integración rápida y un rendimiento uniforme en todas las plataformas.

Cómo integró Dust la voz

Dust incorporó compatibilidad con voz en dos flujos de trabajo principales:

1. Entrada de voz: hablar con agentes

Con el modelo scribe_v1 de ElevenLabs, usuarios ya pueden hablar con agentes mediante el micrófono. El sistema detecta automáticamente el idioma hablado, lo transcribe y enruta la solicitud según corresponda; incluso infiere los nombres de los agentes a partir del habla natural.

La entrada de voz está disponible en móvil, para los momentos en que escribir resulta menos cómodo.

2. Salida de voz: audio generado por agentes

A través de Speech Generator, los agentes de Dust pueden crear contenido de audio con los modelos eleven_multilingual_v2 y eleven_v3 de ElevenLabs. La salida incluye pódcast, informes y piezas de audio narrativas, tanto para uso interno como para compartir externamente.

Sound Studio, impulsado por Efectos de Sonido, añade capas de audio no verbal para casos de uso de formación y creación de contenido.

Lo que aprendió Dust

  • El enrutamiento regional importa: Permitir seleccionar la región de la UE o EE. UU. redujo la latencia y facilitó las conversaciones sobre cumplimiento normativo.
  • La selección supera a la abundancia: Una selección cuidada de 12 voces reduce la fatiga de decisión y cubre todas las necesidades principales.
  • Calidad > velocidad: Aunque había modelos más rápidos disponibles, usuarios elegían sistemáticamente voces de mayor fidelidad para contenido de producción.

Lo que permite

  • Productividad móvil primero: Captura ideas y colabora mientras te desplazas.
  • Colaboración multilingüe: Habla con naturalidad en tu propio idioma; los agentes se encargan del resto.
    Flujos de trabajo accesibles y asíncronos: Convierte investigaciones en audio, reduce las barreras de entrada y facilita distintos estilos de trabajo.

Qué viene հետո

Dust está explorando agentes de voz conversacionales en tiempo real, una comprensión del audio más profunda que la transcripción y compatibilidad con entradas largas, como reuniones y presentaciones. Al integrar ElevenLabs, Dust convierte la voz en una parte fluida de la IA empresarial.

Artículos relacionados

Crea con el audio IA de la más alta calidad