PrismML espera que su pequeño LLM cambie la forma en que todos usamos la IA


Si el laboratorio de inteligencia artificial PrismML aún no está en su radar, debería estarlo, no porque haya recaudado grandes cantidades de dinero (aún no lo ha hecho, solo una ronda inicial de $ 22,25 millones), sino debido a las mentes técnicas involucradas y la tecnología que está desarrollando y que potencialmente cambiará la industria.

PrismML apuesta a que los modelos de lenguaje grandes capaces, de alto rendimiento y de razonamiento no tienen por qué ser grandes.

Está fabricando modelos de razonamiento tan pequeños que caben en PC y teléfonos inteligentes. (Incluso se rumorea que está en conversaciones con Apple, aunque el CEO Babak Hassibi se negó a comentar eso con TechCrunch).

El jueves, PrismML lanzó Bonsai 2 27B, el último de una familia de modelos, que comprime Qwen3.8 27B, un modelo de código abierto ampliamente utilizado de Alibaba, hasta 5,9 GB. Es lo suficientemente pequeño como para caber en una PC y, posiblemente, en un teléfono inteligente de alta gama. Es una reducción de memoria de 9 a 10 veces en comparación con el original.

PrismML fue fundado por un grupo de investigadores de Caltech y está dirigido por Hassibi, profesor de Caltech y experto en tecnologías de compresión. La startup también cuenta con Ion Stoica como asesor. Stoica es cofundador de Databricks (y otras empresas) y director del famoso Sky Computing Lab de Berkeley, que ha dado origen a muchas tecnologías y nuevas empresas, desde Letta hasta SGLang.

PrismML también cuenta con el respaldo de los inversores Khosla Ventures, Cerberus Capital y Caltech.

Ciertamente, esta startup no es la única empresa que trabaja en tecnología de compresión LLM. Multiverse Computing, fundada por un conocido profesor del Centro Internacional de Física de Donostia (España), es otro. (Y Multiverse Computing ha recaudado montones de dinero en efectivo).

Pero Hassibi dice que la tecnología de compresión de PrismML es única porque sus LLM prácticamente no han perdido rendimiento en comparación con los originales. Bonsai 2 coincide con el 98 % de las puntuaciones de referencia agregadas de Qwen. Eso es más que el primer Bonsái, lanzado hace un par de meses en marzo, que igualaba el 95%. Ese modelo original ya se ha descargado más de 11 millones de veces, y los modelos aún más pequeños de PrismML se han descargado otros 2,6 millones de veces, afirma la compañía.

Esto muestra que los resultados de compresión de PrismML han mejorado de una versión a la siguiente. Queda por ver si algún día se podrá alcanzar el 100% de paridad de rendimiento de referencia. Es probable que la compresión siempre tenga alguno impacto, dice Hassibi.

Aún así, la paridad de referencia perfecta es bastante académica de todos modos. Los LLM no son tan precisos en su forma sin comprimir, y los puntos de referencia no reflejan tan perfectamente las tareas reales, que una degradación del 2% probablemente afectaría significativamente el rendimiento de un modelo en el uso real. (Además, el software circundante, el arnés en el que se ejecuta un modelo, también es muy importante en lo que respecta a la precisión).

PrismML dice que logra esto reduciendo los «pesos» que componen un modelo; los pesos son, esencialmente, la información que un modelo aprende y almacena durante el entrenamiento. Normalmente, cada peso requiere 16 bits. El enfoque de PrismML, llamado pesos «ternarios», lo simplifica a tres: +1, −1 o 0. Con valores mucho más pequeños para almacenar para cada peso, el modelo ocupa mucho menos espacio. (Para profundizar más en la técnica de compresión, aquí está la página Hugging Face del proyecto).

El próximo objetivo de la startup es aplicar esta técnica de compresión a modelos aún más grandes. «Los próximos modelos que lanzaremos, con suerte en los próximos meses, estarán en el rango de varios cientos de miles de millones de parámetros, y espero que sea más fácil retener la inteligencia allí», dijo Hassibi a TechCrunch.

A medida que crece el tamaño del modelo, añadió, «hay más espacio para poder comprimirlos sin perder la inteligencia. Así que yo diría simplemente, como tendencia general, que para los modelos más grandes, es más fácil llegar al 100%».

Stoica nos dice que está entusiasmado con esta tecnología porque hace posible que modelos avanzados se ejecuten en los dispositivos de los usuarios. «Tendrás inteligencia al alcance de tu mano y será gratuita porque se ejecutará en el dispositivo que ya compraste. También será privada, porque no la enviarás a la nube».

Cuando compra a través de enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.



Fuente: TechCrunch

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad