Inicio Noticias Inteligencia Artificial Gadgets Guías y Tutoriales Tutoriales IA Reviews ✍️ El autor 📬 Contacto

Bonsai 27B: el primer modelo de IA con 27.000 millones de parámetros que funciona en tu móvil

PrismML, una startup fundada por investigadores de Caltech, ha publicado un modelo de 27.800 millones de parámetros que cabe en 3,9 GB de memoria. Apple ya está probando la tecnología. Esto cambia lo que entendemos por "IA local".

En resumen

Bonsai 27B corriendo en un smartphone

Hasta ahora, si querías usar un modelo de IA realmente potente —de esos capaces de razonar, escribir código o planificar tareas complejas— tenías dos opciones: conectarte a la nube o tener un PC con varios miles de euros en GPUs. PrismML acaba de romper ese esquema con Bonsai 27B, el primer modelo de 27.000 millones de parámetros que funciona directamente en un móvil.

Lo lanzaron el 14 de julio de 2026 y en cuestión de horas se convirtió en la conversación principal de Hacker News con más de 600 puntos. No es para menos: la startup respaldada por Khosla Ventures —fundada por Babak Hassibi, profesor de Caltech— ha conseguido comprimir un modelo que originalmente ocupaba 54 GB en precisión completa (FP16) a unos increíbles 3,9 GB en su versión de 1 bit. Y lo mejor: retiene más del 90% del rendimiento del modelo original.

¿Cómo han metido 27.000 millones de parámetros en 4 GB?

La técnica se llama cuantización extrema. En lugar de almacenar cada peso del modelo con 16 bits (FP16), PrismML reduce cada peso a un solo bit en su variante binaria (el valor solo puede ser +1 o -1) o a 1,58 bits en la variante ternaria (valores {-1, 0, +1}). Esto se aplica de extremo a extremo: embeddings, capas de atención, MLPs y la cabeza de lenguaje usan el mismo formato comprimido.

La clave que evita que la calidad se despeñe es una técnica llamada FP16 group-wise scaling: cada grupo de pesos conserva su propio factor de escala en precisión completa, anclando la salida del modelo aunque los valores individuales se hayan colapsado a niveles binarios. Según los benchmarks que publicaron, la variante ternaria retiene el 95% del rendimiento del modelo FP16 original y la binaria el 90%, medidas en 15 evaluaciones combinadas.

El tradeoff principal, como reconoció el propio Hassibi a CNBC, está en la memoria factual: los datos concretos se degradan antes que las habilidades de orden superior como el razonamiento, las matemáticas y la programación. Las tareas de agente autónomo —uso de herramientas, planificación multi-paso— aguantan sorprendentemente bien.

¿Y qué tal funciona en un móvil real?

He visto muchas promesas de IA local que luego resultan ser demos de laboratorio. Bonsai 27B es diferente porque ya hay datos de rendimiento concretos:

Developers Digest hizo los cálculos: la "intelligence density" —una métrica propia de PrismML que mide rendimiento en benchmarks por GB— del Bonsai 27B de 1 bit es de 0,53 por GB, aproximadamente 10 veces la línea base de precisión completa y 2,7 veces las alternativas low-bit convencionales con el mismo número de parámetros.

🎬 Can a 27B AI Model Run on Your Phone? Bonsai 27B + Locally AI — TechWealth Hub

Apple ya está evaluando la tecnología

La noticia que disparó el interés no fue solo el lanzamiento del modelo. Resulta que Apple está probando activamente la tecnología de PrismML para su próxima generación de Siri on-device. El propio Hassibi lo confirmó a CNBC: "Están evaluando nuestra tecnología ahora mismo. Las conversaciones son muy tempranas, pero las cosas progresan bien."

El contexto es importante. Apple abrió la beta pública de iOS 27 el 13 de julio —un día antes del lanzamiento de Bonsai 27B— con una Siri renovada que depende de una combinación de procesamiento local y en la nube. El modelo actual de Apple, el AFM 3 Core Advanced de 20.000 millones de parámetros, usa una arquitectura diferente: carga solo entre 1.000 y 4.000 millones de parámetros activos desde la memoria flash para cada petición. El enfoque de PrismML es más radical: todo el modelo de 27B parámetros cabe en DRAM, sin necesidad de swapping.

Según Tech Times, si las pruebas de Apple confirman las cifras de PrismML, esto podría cambiar cómo la compañía gestiona la IA en el dispositivo: desde fotografía computacional y generación de vídeo hasta herramientas de salud y fitness que manejan datos personales sensibles sin enviarlos a la nube.

No es solo para móviles: Bonsai 27B piensa, codifica y ve

Bonsai 27B no es un modelo de chat ligero. Está basado en Qwen3.6 27B de Alibaba, que ya soporta entradas multimodales (imágenes y texto), llamadas a herramientas y una ventana de contexto de 262.000 tokens. PrismML mantiene todas esas capacidades. Esto significa que el modelo puede:

La empresa ha publicado los modelos con licencia Apache 2.0 en Hugging Face y hay demos disponibles para iOS a través de la app Locally AI. Si tienes un iPhone 15 o superior, puedes probarlo hoy mismo.

¿Qué significa esto para el futuro de la IA?

Llevamos años escuchando que la IA necesita la nube. Bonsai 27B demuestra que la frontera entre cloud y edge se está desdibujando. Un modelo de 27B parámetros que cabe en 3,9 GB cambia las reglas para la privacidad (todo queda en el dispositivo), el coste (cero llamadas API) y la latencia (sin esperar a que un servidor responda).

Personalmente, creo que el impacto más grande no será en los móviles de gama alta, sino en cómo esto democratiza el acceso a modelos potentes. Si un iPhone 15 del 2023 puede ejecutar Bonsai 27B, un portátil de gama media también podrá. Y eso significa que desarrolladores, estudiantes y pequeños estudios van a poder trabajar con modelos de nivel frontier sin pagar suscripciones mensuales ni alquilar GPUs en la nube.

El paper técnico de Bonsai 27B explica que el modelo se presentó en ICML 2026. La empresa ya trabaja en la siguiente generación con compresión aún más agresiva y kernels específicos para hardware móvil. Como dijo Hassibi: "El problema no es la capacidad de los modelos, es el despliegue." Después de Bonsai 27B, el despliegue ya no es una excusa.

Bonsai 27B es un punto de inflexión. No porque sea el modelo más potente del mundo —no lo es—, sino porque rompe el supuesto de que la IA potente necesita infraestructura cloud. Cuando Apple, que es posiblemente la empresa más conservadora del mundo adoptando tecnología externa, se sienta a evaluar a PrismML, algo está cambiando de verdad. Los próximos meses nos dirán si esta compresión extrema escala a modelos aún más grandes, pero por ahora, tener 27.000 millones de parámetros en el bolsillo es un hito que merece la pena celebrar.

✍️ Luigy García — Editor de La Frontera IA. Llevo años siguiendo la evolución de los modelos locales y nunca había visto algo así a este nivel de parámetros. Escríbeme si tú también lo has probado o tienes dudas.