Google publicó el martes una publicación de blog de investigación sobre un nuevo algoritmo de compresión para modelos de IA. En cuestión de horas, las existencias de memoria estaban cayendo. Micron cayó un 3 por ciento, Western Digital perdió un 4,7 por ciento y SanDisk cayó un 5,7 por ciento, mientras los inversores recalculaban cuánta memoria física podría realmente necesitar la industria de la IA.
El algoritmo se llama TurboQuant y aborda uno de los cuellos de botella más costosos en la ejecución de modelos de lenguaje grandes: la caché de valores-clave, un almacén de datos de alta velocidad que contiene información de contexto para que el modelo no tenga que volver a calcularla con cada nuevo token que genera. A medida que los modelos procesan entradas más largas, la caché crece rápidamente, consumiendo memoria de GPU que de otro modo podría usarse para atender a más usuarios o ejecutar modelos más grandes. TurboQuant comprime el caché a sólo 3 bits por valor, por debajo de los 16 estándar, reduciendo su uso de memoria al menos seis veces sin, según los puntos de referencia de Google, ninguna pérdida mensurable en precisión.
El artículo, que se presentará en ICLR 2026, fue escrito por Amir Zandieh, científico investigador de Google, y Vahab Mirrokni, vicepresidente y miembro de Google, junto con colaboradores de Google DeepMind, KAIST y la Universidad de Nueva York. Se basa en dos artículos anteriores del mismo grupo: QJL, publicado en AAAI 2025, y PolarQuant, que aparecerá en AISTATS 2026.
como funciona
La principal innovación de TurboQuant es eliminar la sobrecarga que hace que la mayoría de las técnicas de compresión sean menos efectivas de lo que sugieren los números principales. Los métodos de cuantificación tradicionales reducen el tamaño de los vectores de datos, pero deben almacenar constantes adicionales, valores de normalización que el sistema necesita para descomprimir los datos con precisión. Estas constantes suelen agregar uno o dos bits adicionales por número, deshaciendo parcialmente la compresión.
TurboQuant evita esto mediante un proceso de dos etapas. La primera etapa, llamada PolarQuant, convierte vectores de datos de coordenadas cartesianas estándar en coordenadas polares, separando cada vector en una magnitud y un conjunto de ángulos. Debido a que las distribuciones angulares siguen patrones concentrados y predecibles, el sistema puede omitir por completo el costoso paso de normalización por bloque. La segunda etapa aplica QJL, una técnica basada en la transformada de Johnson-Lindenstrauss, que reduce el pequeño error residual de la primera etapa a un bit de signo único por dimensión. El resultado combinado es una representación que utiliza la mayor parte de su presupuesto de compresión para capturar el significado de los datos originales y un presupuesto residual mínimo para la corrección de errores, sin desperdiciar gastos generales en constantes de normalización.
Google probó TurboQuant en cinco puntos de referencia estándar para modelos de lenguaje de contexto largo, incluidos LongBench, Needle in a Haystack y ZeroSCROLLS, utilizando modelos de código abierto de las familias Gemma, Mistral y Llama. En 3 bits, TurboQuant igualó o superó a KIVI, la base estándar actual para la cuantificación de caché de valores clave, que se publicó en ICML 2024. En tareas de recuperación de una aguja en un pajar, que prueban si un modelo puede localizar una sola pieza de información enterrada en un pasaje largo, TurboQuant logró puntuaciones perfectas mientras comprime el caché en un factor de seis. Con una precisión de 4 bits, el algoritmo aceleró hasta ocho veces la atención informática en las GPU Nvidia H100 en comparación con la línea base de 32 bits sin comprimir.
Lo que escuchó el mercado
La reacción de las acciones fue rápida y, en opinión de varios analistas, desproporcionada. El analista de Wells Fargo, Andrew Rocha, señaló que TurboQuant ataca directamente la curva de costos de la memoria en los sistemas de inteligencia artificial. Si se adopta ampliamente, dijo, rápidamente surge la pregunta de cuánta capacidad de memoria necesita realmente la industria. Pero Rocha y otros también advirtieron que el panorama de la demanda de memoria de IA sigue siendo fuerte y que los algoritmos de compresión han existido durante años sin alterar fundamentalmente los volúmenes de adquisición.
Sin embargo, la preocupación no es infundada. El gasto en infraestructura de IA está creciendo a un ritmo extraordinario, y solo Meta se compromete hasta 27 mil millones de dólares en un acuerdo reciente con Nebius para capacidad informática dedicada, y Google, Microsoft y Amazon planean colectivamente cientos de miles de millones en gastos de capital en centros de datos hasta 2026. Una tecnología que reduce los requisitos de memoria seis veces no reduce el gasto seis veces, porque la memoria es solo un componente del costo de un centro de datos. Pero cambia la proporción, y en una industria que gasta a esta escala, incluso las ganancias marginales de eficiencia se acumulan rápidamente.
La cuestión de la eficiencia
TurboQuant llega en un momento en el que la industria de la IA se ve obligada a afrontar la economía de la inferencia. Entrenar un modelo es un costo único, por enorme que sea. Ejecutarlo y atender millones de consultas por día con una latencia y precisión aceptables es el gasto recurrente que determina si Los productos de IA son financieramente viables a escala. La caché de valores-clave es fundamental para este cálculo: es el cuello de botella que limita cuántos usuarios simultáneos puede atender una sola GPU y cuánto tiempo puede soportar prácticamente un modelo una ventana de contexto.
Las técnicas de compresión como TurboQuant son parte de un impulso más amplio para abaratar la inferencia, junto con mejoras de hardware como Arquitectura Vera Rubin de Nvidia y los TPU Ironwood de Google. La pregunta es si estos ganancias de eficiencia reducirán la cantidad total de hardware que compra la industria, o si simplemente permitirán implementaciones más ambiciosas a aproximadamente el mismo costo. La historia de la informática sugiere lo último: cuando el almacenamiento se vuelve más barato, la gente almacena más; cuando el ancho de banda aumenta, las aplicaciones lo consumen.
Para Google, TurboQuant también tiene una aplicación comercial directa más allá de los modelos lingüísticos. La publicación del blog señala que el algoritmo mejora la búsqueda vectorial, la tecnología que impulsa las búsquedas de similitudes semánticas en miles de millones de elementos. Google lo probó con métodos existentes en el conjunto de datos de referencia de GloVe y descubrió que lograba índices de recuperación superiores sin requerir los grandes libros de códigos o ajustes específicos del conjunto de datos que exigen los enfoques de la competencia. Esto es importante porque la búsqueda vectorial sustenta todo, desde la Búsqueda de Google hasta las recomendaciones de YouTube y la orientación publicitaria, es decir, sustenta los ingresos de Google.
La contribución del artículo es real: un método de compresión sin formación que logra resultados considerablemente mejores que el estado de la técnica existente, con sólidas bases teóricas y una implementación práctica en hardware de producción. Si reforma la economía de la infraestructura de IA o simplemente se convierte en una optimización más absorbida por el insaciable apetito de la industria por la informática es una pregunta que el mercado responderá en meses, no en horas.

