GLM-5.2 arrasa en benchmarks y se corona como el mejor modelo open weights del mundo
Z.ai acaba de volar la mesa. Su nuevo GLM-5.2 iguala a GPT-5.5 en pruebas de agentes, destroza a DeepSeek V4 Pro y lo regala con licencia MIT. La comunidad de Hacker News está que arde.
En resumen
- Z.ai lanza GLM-5.2, el nuevo líder open weights que iguala a GPT-5.5 en pruebas de agentes y destroza a DeepSeek V4 Pro y MiniMax-M3. 744B parámetros, licencia MIT, a precio de risa.
Lo he estado viendo desde ayer en Hacker News y los números no engañan. GLM-5.2, el nuevo modelo de la china Z.ai, ha conseguido una puntuación de 51 en el Intelligence Index v4.1 de Artificial Analysis. Son 11 puntos más que su predecesor GLM-5.1 y deja muy atrás a MiniMax-M3 (44), DeepSeek V4 Pro en modo max (44) y Kimi K2.6 (43).
El dato que más ruido está haciendo: en GDPval-AA v2, la prueba estrella de rendimiento agéntico en el mundo real, GLM-5.2 saca 1524 puntos. MiniMax-M3 se queda en 1418 y DeepSeek V4 Pro max en 1328. Está al mismo nivel que GPT-5.5 con razonamiento alto (1514 puntos). No es una exageración de benchmark inflado: el test GDPval-AA v2 usa paneles rotatorios de jueces modelo, sube el límite de 100 a 250 turnos y calibra el Elo tomando como referencia el rendimiento humano en 1000.
Aquí es donde me parece que la cosa se pone interesante de verdad. No es solo que el modelo rinda — es que lo hace con un precio ridículo: $1.4 por millón de tokens de entrada, $4.4 por millón de salida y $0.26 por millón de tokens en caché. El coste por tarea en el Intelligence Index ronda los $0.46, y aunque es más caro que DeepSeek V4 Pro ($0.05), está en la frontera de Pareto de inteligencia vs coste. Dicho claro: no hay modelo más barato con esa inteligencia, ni modelo más inteligente a ese precio.
Qué ha mejorado realmente
La arquitectura no ha cambiado de tamaño: 744.000 millones de parámetros totales con 40.000 millones activos, lo mismo que GLM-5.1. Pero el salto en benchmarks es brutal:
- Razonamiento científico (CritPt): del 5% al 21% (+16 puntos)
- HLE (Humanity's Last Exam): del 28% al 40% (+12)
- AA-LCR: del 62% al 71% (+9)
- TerminalBench v2.1: del 62% al 78% (+16)
- SciCode: del 43% al 50% (+7)
- GPQA Diamond: del 86% al 89% (+3)
También amplía la ventana de contexto de 200K a 1 millón de tokens, algo que faltaba en la versión anterior y que ahora lo pone a la par de Gemini. Y tiene licencia MIT, lo que significa que cualquiera puede descargarlo, modificarlo y usarlo comercialmente sin ataduras. Está en Hugging Face desde el 16 de junio y ya acumula más de 1.000 likes.
Lo que dice la comunidad
El hilo en Hacker News acumula 835 puntos y más de 400 comentarios en menos de 48 horas. El sentimiento es casi unánime: esto es real. Un usuario que lo probó dice que «es bastante bueno, más hablador que 5.1, me recuerda a DeepSeek 4». Otro directamente lo compara con Opus 4.7 y señala que hay proveedores ofreciéndolo a $50 al mes con tokens ilimitados y APIs con precios 3 veces más bajos que los oficiales de Z.ai.
No todo son flores. El modelo es más verboso que sus rivales: usa 43.000 tokens de salida por tarea (37.000 de ellos en razonamiento), frente a los 26.000 de GLM-5.1 o los 24.000 de MiniMax-M3. En los comentarios de HN varios desarrolladores mencionan que «los servidores de Z.ai están fundidos» — timeouts constantes y velocidad muy baja en horas punta. Un problema de capacidad que no es nuevo para la compañía, pero que con este hype puede volverse crónico.
Hay quien ya lo está usando para programar en el día a día. Un desarrollador cuenta que alterna entre Codex 5.5 Medium, Opus 4.8 Max y GLM-5.2 Max, y que este último es «mediocre sin hand holding» — o sea, funciona bien si le das instrucciones claras, pero no esperes que adivine lo que quieres hacer si lo sueltas a ciegas. Otro dato que me parece clave: GLM-5.2 necesita correr con máximo esfuerzo de razonamiento para competir con los modelos de OpenAI y Anthropic, y eso ralentiza bastante las respuestas.
Dónde probarlo ya mismo
Z.ai tiene su propia plataforma en z.ai, pero además el modelo está disponible en un montón de proveedores externos: DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten y Fireworks. También está en OpenRouter si prefieres una API unificada.
Para los que quieran ejecutarlo en local, la descarga está en Hugging Face con soporte para Transformers y vLLM. Eso sí, con 744B parámetros no es precisamente ligero: necesitas hardware de nivel profesional. Un usuario de HN comenta que «es muy difícil de ejecutar excepto en hardware prosumer, pero una pequeña empresa podría hacerlo sin demasiado problema».
Personalmente creo que este es el lanzamiento open source más importante desde DeepSeek V3. No solo por los números — que son brutales — sino porque viene con licencia MIT, sin restricciones y con un ecosistema de proveedores ya montado desde el día 1. Si Z.ai consigue arreglar sus problemas de capacidad, esto puede cambiar las reglas del juego para cualquiera que no quiera depender de OpenAI o Anthropic.
El gran asterisco: como señalan en HN, ni DeepSeek ni GLM tienen modalidad de entrada de imagen todavía. Si tu flujo de trabajo depende de analizar capturas de pantalla, UIs o fotos, estos modelos se quedan cortos frente a GPT-5.5 o Claude. Pero para todo lo demás — código, razonamiento, agentes — la brecha se ha cerrado más rápido de lo que nadie esperaba.