La transcripción ahora cuesta 10 centavos la hora. El diferenciador ya no es el modelo, sino en qué conversaciones puedes entrenar.



Grok Voice Transcribe 2.0 se lanzó el 18 de septiembrecon un precio de 0,10 dólares por hora de audio para trabajo por lotes y 0,20 dólares por hora para streaming. Ambas cifras no cambian con respecto a la versión anterior.

El anuncio se publica bajo SpaceXAI, el nombre que xAI lleva desde julio después de que SpaceX lo adquiriera en febrero. La cobertura todavía llama a la empresa xAI y su propio pie de página no.

Lea la afirmación de exactitud con precisión

La compañía dice que el modelo es dos veces más preciso que Grok Voice Transcribe 1.0. Se trata de una comparación con su propio predecesor, no con el modelo de nadie más.

Contra el campo, hace una afirmación más limitada: ocupa el primer lugar en precisión entre 32 modelos de transmisión en la clasificación pública de Análisis Artificial, y se describe a sí mismo como uno de los más precisos en lugar del más preciso. La cobertura es propiedad de la empresa y vale la pena conservarla.

Sus gráficos internos se comparan con ElevenLabs Scribe v2 y Deepgram Nova-3. Se trata de evaluaciones realizadas por proveedores frente a comparadores elegidos por ellos, lo cual es normal y no es lo mismo que una prueba independiente.

El precio es la noticia real.

Mantener el precio mientras se afirma que se duplica la precisión es una afirmación sobre el mercado más que sobre el modelo. El etiquetado de locutores, las marcas de tiempo a nivel de palabra y el sesgo de términos clave se incluyen sin costo adicional.

Esas eran funciones facturables no hace mucho. El precio de la transcripción se considera un insumo básico y las empresas que la venden compiten por lo que pueden agrupar.

La presión es generalizada. OpenAI ha lanzado nuevos modelos de API de vozy El modelo de transcripción interno de Microsoft se comparó con Whisper, Gemini y ElevenLabs en 25 idiomas..

¿De dónde viene realmente la ventaja?

SpaceXAI es explícito al respecto. El modelo se entrena en lo que llama un conjunto de datos único de audio en vivo, ruidoso y multilingüe grabado en un conjunto diverso de entornos.

También describe la canalización que produce ese audio. Grok Voice realiza decenas de miles de llamadas de atención al cliente al día, transcribe millones de horas de narraciones en vídeo y ejecuta el asistente en vehículos Tesla.

Se resuelve la precisión del habla limpia. Lo que queda es telefonía, acentos, diafonía y comandos en el automóvil, y la ventaja pertenece a quien tenga las conversaciones más reales fluyendo a través de sus sistemas.

Los sets de evaluación son el detalle a destacar

La compañía dice que mide la tasa de error de palabras en cuatro conjuntos internos extraídos del tráfico de producción. Se trata de telefonía de atención al cliente, conversaciones con Grok, comandos de voz breves en varios idiomas y credenciales habladas.

Ese último conjunto se describe como códigos de cuenta, números de teléfono, direcciones de correo electrónico y direcciones leídas en voz alta. Es un corpus de evaluación permanente de personas que leen en voz alta sus propios detalles de identificación.

Nada en el anuncio dice cómo se obtiene, retiene o se consiente ese material. Es muy posible que esté cubierto por términos empresariales, y el anuncio no lo dice.

La cuestión europea que sigue

Una llamada de atención al cliente tiene dos partes y solo una de ellas tiene un contrato con el proveedor de IA. La persona que llama leyendo un número de cuenta no ha aceptado nada.

Las grabaciones de voz son datos personales en Europa, y un conjunto creado específicamente en torno a credenciales habladas es tan sensible como lo son los datos de transcripción. La limitación y retención del propósito son las preguntas obvias y tienen respuesta.

La práctica no es nueva, lo cual es parte del punto. La gente ha estado escuchando transcripciones supuestamente automatizadas durante más de una década.y las divulgaciones han ido constantemente a la zaga de la práctica.

¿Dónde está la verdadera ganancia?

La mejora del título es multilingüe, y concretamente frases cortas. En el conjunto de expresiones del asistente de voz en 19 idiomas de la empresa, la tasa de error de palabras cae del 20,6% al 6,8%.

Los comandos cortos no le dan al modelo casi ningún contexto para identificar el idioma, que es exactamente el problema en el automóvil. La mayor ganancia reportada corresponde al caso de uso que SpaceXAI posee directamente a través de Tesla.

El multilingüe es también donde se han concentrado los proveedores europeos. DeepL ejecuta traducción de voz en tiempo real en más de 40 idiomasy ElevenLabs ha incluido la transcripción entre cinco servicios en el marco de nube del gobierno del Reino Unido..

El punto de prueba del cliente

Atlassian dice que encontró el modelo más preciso que su proveedor actual y ahora transcribe todos los videos de Loom con él. Se trata de un cambio real por parte de un comprador identificado, que vale más que un gráfico de referencia.

La versión 1.0 quedará obsoleta en unas semanas y la fijación estará disponible durante la transición. Los clientes del modelo antiguo están siendo trasladados, lo hayan pedido o no.

que mirar

Observe si alguien pregunta sobre el corpus de credenciales. Es la única revelación genuinamente novedosa del anuncio y nadie la ha captado.

Observe el precio mínimo. Por 10 centavos la hora, el modelo es casi gratuito y el negocio es el audio que fluye a través de él.



Fuente: TNW

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad