Una IA de 2.000 millones de parámetros que funciona dentro de unas gafas inteligentes

PrismML ha ejecutado su modelo de visión y lenguaje Bonsai, comprimido a 1 bit, directamente en el chip Snapdragon AR1 Gen 1 de Qualcomm, sin depender de la nube.

Meter un asistente capaz de ver y entender lo que tienes delante en unas gafas ligeras sigue siendo uno de los grandes retos de los wearables. La startup PrismML ha dado un paso en esa dirección: en el Snapdragon Summit de Qualcomm mostró su modelo Bonsai funcionando de forma local sobre la plataforma Snapdragon AR1 Gen 1, el chip que usan muchas gafas inteligentes actuales.

El modelo, llamado 1-bit Bonsai 2B, combina un modelo de lenguaje de 1.700 millones de parámetros con un codificador de visión de unos 300 millones, hasta sumar unos 2.000 millones. Su truco es la representación de los pesos en 1 bit, una compresión extrema que permite encajar mucha más inteligencia en muy poca memoria.

Según las pruebas de la propia PrismML, la versión de 1 bit ocupa 0,43 GB frente a los 1,66 GB de una variante equivalente de 4 bits, un 74% menos, y genera texto a 15,36 tokens por segundo, más del doble que esa versión de 4 bits (7,44). La empresa asegura que, con la misma memoria, se puede ejecutar un modelo con cuatro veces más parámetros.

Procesar en el propio dispositivo reduce la latencia, evita enviar imágenes a servidores externos y ahorra datos. Eso sí, por ahora se trata de una demostración: todavía no se han anunciado gafas comerciales que integren el modelo de PrismML, una startup fundada por investigadores de Caltech que apuesta por modelos abiertos capaces de funcionar en el propio dispositivo.