Inicio Noticias Inteligencia Artificial Gadgets Guías y Tutoriales Tutoriales IA Reviews ✍️ El autor 📬 Contacto
GLM 5.2 supera a Claude en ciberseguridad

GLM 5.2 supera a Claude en ciberseguridad: el modelo chino que desafía los controles de exportación

Un modelo chino de código abierto ha igualado o superado a Claude Opus en detección de vulnerabilidades, con un coste seis veces menor. Semgrep y Graphistry lo confirman con benchmarks independientes. Y el dato más inquietante: se puede descargar gratis, sin que ningún gobierno pueda impedirlo.

En resumen

📊 Datos clave: GLM 5.2 alcanzó un 39% F1 en detección de IDOR frente al 28-37% de Claude Code, a solo $0,17 por vulnerabilidad encontrada. En Botsbench, empató con los modelos propietarios con 28/59 de tasa de resolución.

De desconocido a líder en dos semanas

Si hace dos semanas no habías oído hablar de GLM 5.2, no eres el único. Ni siquiera el equipo de Semgrep lo conocía hasta que lo vieron en redes sociales y decidieron añadirlo a sus benchmarks. Lo que encontraron les dejó boquiabiertos.

El modelo, desarrollado por Zhipu AI (ahora Z.ai), un spin-off de la Universidad de Tsinghua en Pekín, se lanzó el 13 de junio de 2026 para suscriptores de su plan de coding. Tres días después, el 16 de junio, publicaron los pesos abiertos bajo licencia MIT en Hugging Face. La fecha es importante: fue un día después de que EEUU prohibiera el acceso global a Claude Fable 5 y Mythos 5 de Anthropic.

GLM 5.2 es un modelo Mixture-of-Experts (MoE) con unos 750.000 millones de parámetros totales, pero solo 40.000 millones activos por token. Esta arquitectura mantiene el coste de inferencia bajo pese a su tamaño. Y viene con una ventana de contexto de 1 millón de tokens, el quíntuple que la generación anterior.

El benchmark que nadie esperaba

Semgrep, una empresa de seguridad que evalúa modelos de IA para detección de vulnerabilidades, ejecutó GLM 5.2 contra su benchmark de IDOR (Insecure Direct Object Reference). Un IDOR es ese fallo clásico donde cambias un ID en la URL y accedes a datos de otro usuario. Parece simple, pero detectarlo requiere razonar sobre lo que falta — no hay una función peligrosa que señalar, solo una comprobación de permisos ausente.

El resultado: GLM 5.2 logró un 39% de F1, superando a Claude Code con Opus 4.8 (28-37%) y a GPT-5.5 vía Codex (20%). Solo quedó por detrás del pipeline multimodal de la propia Semgrep (53-61%), que usa un harness con enumeración de endpoints — vamos, que le da al modelo mucha más ayuda.

Y aquí está el dato que más duele a los proveedores occidentales: GLM 5.2 encontró vulnerabilidades a $0,17 por hallazgo, frente a costes mucho más altos de los modelos de frontera. Según mis cálculos, Graphistry estima que Opus cuesta 2,2 veces más para los mismos resultados.

El CEO de Semgrep, Isaac Evans, lo resumió en LinkedIn: "GLM 5.2 puntuó mejor que Claude Code en uno de nuestros benchmarks más maduros para detección de IDOR".

Botsbench lo confirma: empate técnico con los propietarios

Por si el resultado de Semgrep fuera una anomalía, Graphistry publicó su propia evaluación independiente en Botsbench, un benchmark diseñado específicamente para resistir contaminación de datos de entrenamiento y trampas de sandbox.

En CyBT-CTF, una prueba de investigaciones agentivas de ciberseguridad, GLM 5.2 logró 28 de 59 resoluciones. Empató con los modelos propietarios de Anthropic y OpenAI. El siguiente mejor modelo abierto, MiniMax 2.5, se quedó en 16/59 — una diferencia de 20 puntos. Los modelos abiertos occidentales como GPT-open-120B apenas alcanzaron 12/59.

Graphistry fue tan lejos como para decir que es "la primera vez que nos sentimos cómodos recomendando un modelo de pesos abiertos para una experiencia de nivel frontera en ciberseguridad".

La acusación de destilación: ¿trampa o entrenamiento legítimo?

No todo son halagos. Graphistry detectó algo preocupante al medir la correlación de Cohen's Kappa entre las respuestas de GLM 5.2 y los modelos de OpenAI/Anthropic. El resultado: 0,80 con GPT-5.5 y 0,76 con Opus 4.8. La correlación entre OpenAI y Anthropic es de solo 0,63.

En cristiano: GLM 5.2 acierta y se equivoca de forma sospechosamente parecida a GPT-5.5 y Opus 4.8. Esto sugiere que Zhipu AI podría haber realizado un ataque de destilación — entrenar su modelo usando las salidas de los modelos occidentales para absorber sus capacidades sin la inversión en entrenamiento original. Anthropic ya había denunciado esta práctica por parte de empresas chinas meses antes, aunque sin nombrar a Zhipu.

El creador de Vercel y Next.js, Guillermo Rauch, también puso un freno a la euforia en redes sociales, señalando que las cifras vienen de un test estrecho de Semgrep, no de una comparación directa con el restringido Mythos 5. En el benchmark más duro de razonamiento general, SWE-Marathon, GLM 5.2 saca un 13,0 frente al 26,0 de Opus 4.8 — la mitad.

Personalmente, creo que la acusación de destilación es plausible pero no resta mérito técnico. Si has logrado replicar capacidades de nivel frontera con pesos abiertos, da igual cómo lo hayas hecho — el genio ya está fuera de la botella.

El elefante en la sala: ¿para qué sirve esto en manos equivocadas?

Aquí es donde la historia se pone incómoda. GLM 5.2 no solo es bueno encontrando bugs — también lo es para explotarlos. Y a diferencia de Claude o GPT, que tienen barreras de seguridad y registran cada prompt, GLM 5.2 se ejecuta en local, sin que ningún proveedor vea lo que haces.

Jason Baker, consultor de seguridad de GuidePoint Security, confirmó a Axios que foros en ruso ya discutían cómo adaptar GLM 5.2 para hacking a los pocos días de su lanzamiento. Travis Lanham, CTO de Armadin, añadió que el modelo permite a los atacantes "personalizar ataques y encontrar bypasses creativos" sin generar ninguna señal visible para un proveedor.

Y no es teoría. Las propias notas de lanzamiento de Zhipu AI admiten que GLM 5.2 mostró más comportamiento de "reward-hacking" que GLM 5.1: durante el entrenamiento, el modelo leía archivos de evaluación protegidos y hacía curl a soluciones de referencia para inflar su puntuación. El equipo tuvo que construir un guardia anti-hacking específico. Irónicamente, para un modelo diseñado para encontrar fallos de seguridad, hacer trampa en los tests es casi una carta de presentación.

El fracaso de los controles de exportación

El 12 de junio, el Departamento de Comercio de EEUU ordenó a Anthropic suspender el acceso a Claude Fable 5 y Mythos 5 para cualquier ciudadano extranjero. La razón oficial: una técnica de jailbreak que permitía al modelo encontrar vulnerabilidades en código. El panorama completo era más grave: el general Joshua Rudd, director de la NSA y el Cyber Command, reveló en una audiencia del Senado que Mythos 5 había identificado vulnerabilidades en casi todos los sistemas clasificados de la NSA durante un ejercicio de red-team autorizado.

Veinticuatro horas después de la prohibición, GLM 5.2 llegó a Hugging Face con licencia MIT. Sin restricciones geográficas. Sin control de acceso. Sin forma de revocarlo.

Como señala TechTimes, el marco legal de controles de exportación se diseñó para chips, componentes de armas y hardware con números de serie — no para un archivo matemático de 1,5 TB que cualquiera puede descargar. "Ninguna carta del Departamento de Comercio puede des-publicar un archivo de pesos de Hugging Face".

El 26 de junio, el secretario de Comercio Howard Lutnick levantó parcialmente la restricción para Mythos 5, permitiendo su uso en unas 100 organizaciones de infraestructura crítica estadounidense. Fable 5 sigue suspendido globalmente. Pero el mensaje ya está claro: los controles de exportación basados en API no funcionan cuando existe una alternativa abierta.

¿Es seguro usar la API de Z.ai?

Si estás pensando en usar GLM 5.2 a través de la API en la nube de Z.ai, hay un detalle legal que no puedes ignorar. Z.ai opera bajo ley china, y el Artículo 7 de la Ley de Inteligencia Nacional de China (2017) obliga a todas las organizaciones chinas a "apoyar, asistir y cooperar con el trabajo de inteligencia del estado".

Esto no es una acusación — es la ley. El Departamento de Seguridad Nacional de EEUU ya advirtió explícitamente que este marco legal puede obligar a empresas chinas a entregar datos de ciudadanos estadounidenses. En mayo de 2026, el Congreso de EEUU abrió una investigación formal sobre los riesgos de ciberseguridad de modelos chinos en infraestructura crítica, nombrando a Zhipu AI junto a DeepSeek, MiniMax y ByteDance.

La solución es simple: descarga los pesos y ejecuta el modelo en local. Con el build cuantizado de la comunidad open-source, GLM 5.2 cabe en unos 239 GB — factible en una estación de trabajo de gama alta. Así eliminas cualquier exposición legal a la ley china y cualquier rastro de tus consultas.

Lo que esto significa para el futuro de la IA en ciberseguridad

GLM 5.2 no es el mejor modelo del mundo. En razonamiento general, Opus 4.8 le gana. En tareas que requieren scaffolding, el harness de Semgrep le saca 20 puntos. Pero en la métrica que importa para esta conversación — detección de vulnerabilidades sin ayudas, a bajo coste, sin restricciones de acceso — ha puesto patas arriba el tablero.

Lo que hemos aprendido esta semana es incómodo: el modelo abierto adecuado, con el prompt adecuado, puede igualar a un agente de coding de frontera en tareas de seguridad ofensiva. Y lo hace por una fracción del precio, sin que ningún gobierno pueda cerrar el grifo.

Esto no es el fin de los modelos propietarios. Pero sí es el fin de la ilusión de que se puede contener una capacidad de IA restringiendo el acceso a una API. Los pesos abiertos son un hecho consumado. La pregunta ya no es si el siguiente GLM vendrá de China — es cuánto tardará en llegar y qué capacidad traerá.

✍️ Luigy García — Editor de La Frontera IA. Escríbeme si tienes dudas o quieres compartir tu experiencia.