Mistral lanza un nuevo modelo de código abierto para la generación de voz


La empresa francesa de inteligencia artificial Mistral lanzó el jueves un nuevo modelo de texto a voz de código abierto que puede ser utilizado por asistentes de voz de inteligencia artificial o en casos de uso empresarial como atención al cliente. El modelo, que permite a las empresas crear agentes de voz para ventas y participación del cliente, coloca a Mistral en competencia directa con empresas como ElevenLabs, Deepgram y OpenAI.

El nuevo modelo, llamado Voxtral TTS, admite nueve idiomas, incluidos inglés, francés, alemán, español, holandés, portugués, italiano, hindi y árabe.

«Nuestros clientes han estado pidiendo un modelo de voz. Así que construimos un modelo de voz de tamaño pequeño que puede caber en un reloj inteligente, un teléfono inteligente, una computadora portátil u otros dispositivos de vanguardia. Su costo es una fracción de cualquier otra cosa en el mercado, pero ofrece un rendimiento de última generación», dijo a TechCrunch Pierre Stock, vicepresidente de operaciones científicas de Mistral AI, durante una entrevista telefónica.

Créditos de imagen: Mistral

Mistral dijo que el nuevo modelo puede adaptar una voz personalizada con una muestra de menos de cinco segundos y también capturar características como acentos sutiles, inflexiones, entonaciones e irregularidades en el flujo del habla. El modelo, basado en Ministral 3B, puede cambiar entre idiomas fácilmente sin perder las características de la voz, lo que resulta útil para casos de uso como doblaje o traducción en tiempo real. Stock dijo que la compañía quería que el modelo sonara humano y no robótico.

Según la empresa, el modelo ha sido creado para funcionar en tiempo real. Tiene un tiempo hasta el primer audio (TTFA), una medida de cuándo el modelo comienza a «hablar» después de recibir información, de 90 ms para una muestra de 500 caracteres de 10 segundos. El modelo también tiene un factor de tiempo real (RTF) de 6x, lo que significa que puede renderizar un clip de 10 segundos en aproximadamente 1,6 segundos.

Créditos de imagen: Mistral AI

A principios de este año, Mistral lanzó un par de modelos de transcripción, uno para procesamiento por lotes grandes y el otro para casos de uso en tiempo real con baja latencia. Con el nuevo modelo de voz, es probable que la empresa apunte a proporcionar un conjunto completo de productos de voz a las empresas.

«Planeamos tener una plataforma de extremo a extremo que pueda manejar flujos de entrada multimodales, incluidos audio, texto e imágenes y también salida. El principal beneficio de esto es que se obtiene mucha más información con un sistema agente de extremo a extremo que admite audio como entrada o salida», dijo Stock.

Evento tecnológico

San Francisco, California
|
13-15 de octubre de 2026

El posicionamiento de Mistral es que su código abierto y su parte de personalización ayudarán a las empresas a adoptar sus modelos de voz sobre sus competidores, ya que pueden sintonizarlos como quieran.



Fuente: TechCrunch

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad