Inicio Noticias Inteligencia Artificial Gadgets Guías y Tutoriales Tutoriales IA Reviews ✍️ El autor 📬 Contacto
GLM 5.2: el modelo chino gratis que está humillando a Silicon Valley

GLM 5.2: el modelo chino gratis que está humillando a Silicon Valley — y cómo usarlo hoy

Open source, licencia MIT, más preciso que GPT-5.5 y con 3 veces menos alucinaciones. Te enseño a usarlo gratis, por API y en local con 5 casos prácticos que puedes replicar ahora mismo.

En resumen

  • GLM 5.2 es open source, licencia MIT, gratis, y ya supera a GPT-5.5 en precisión con 3× menos alucinaciones. Te enseño a usarlo en 5 casos prácticos.

Hace unos días me desperté con Hacker News ardiendo. 909 puntos para un solo artículo sobre un modelo chino que nadie esperaba. El titular decía: "GLM 5.2 is the new leading open weights model". Lo probé esa misma tarde. Y tengo que decirlo: es el primer modelo open source que de verdad me hace dudar si necesito seguir pagando APIs cerradas.

El modelo lo firma THUDM, el grupo de IA de la Universidad de Tsinghua, los mismos que están detrás de ChatGLM y CogView. Z.ai (la startup que lo comercializa) lo ha licenciado bajo MIT: puedes descargarlo, fine-tunearlo, desplegarlo en tu servidor y hasta venderlo como servicio. Sin letra pequeña. Sin aceptable use policy que te prohíba cosas. Es el tipo de libertad que OpenAI y Anthropic jamás te van a dar.

Los números son de locura: 753 mil millones de parámetros (arquitectura MoE, unos 40B activos por inferencia), ventana de contexto de 1 millón de tokens, dos niveles de razonamiento (High y Max), y un precio de API que parece un error tipográfico: $1.40 por millón de tokens de entrada, $4.40 por salida. Para que te hagas una idea, Opus 4.8 cuesta $5 de entrada y $25 de salida. GLM 5.2 es 5.7 veces más barato en output.

Pero lo que de verdad me voló la cabeza fueron los datos de alucinación que publicó arrowtsx.dev. Sobre el benchmark AA-Omniscience — preguntas diseñadas para pillar a los modelos mintiendo — las tasas de alucinación fueron: GLM 5.2: 28%, Opus 4.8: 36%, Fable 5: 48%, GPT-5.5: 86%, DeepSeek V4 Pro: 94%. Sí, DeepSeek V4 Pro miente en el 94% de las preguntas que no sabe responder. GLM 5.2 calla o admite incertidumbre 3 de cada 4 veces. Eso es un cambio radical de filosofía.

🧩 Caso 1: Usa GLM 5.2 gratis desde HuggingChat (sin registro)

No necesitas instalar nada. HuggingChat ya tiene GLM 5.2 como uno de sus modelos disponibles. Vas a huggingface.co/chat, seleccionas "GLM-5.2" en el selector de modelos (arriba a la izquierda), y ya estás dentro. Sin login. Sin API key. Sin tarjeta de crédito.

Yo lo probé primero así, en el móvil, a las 11 de la noche. Le pedí que me explicara cómo funciona un transformer sin usar jerga técnica y en menos de 30 segundos me soltó una explicación que habría firmado cualquier divulgador bueno. Lo comparé con la misma pregunta a GPT-4.1 (versión gratuita de ChatGPT) y la diferencia de tono era evidente: GLM 5.2 me habló como una persona, GPT-4.1 me soltó un párrafo de Wikipedia. No es ciencia, pero se nota.

Pros de este método: cero fricción, ideal para probar. Contras: cola de espera si hay mucha demanda, sin acceso a los niveles de razonamiento avanzados (Max thinking).

🧩 Caso 2: API barata — integra GLM 5.2 en tu proyecto por céntimos

Z.ai ofrece API compatible con OpenAI. Literalmente cambias la URL base y la API key y tu código que usaba GPT-4 funciona sin tocar nada más. El endpoint es https://api.z.ai/v1 y las claves se sacan desde la consola de Z.ai en 2 minutos.

Hice una prueba rápida: generé 100 descripciones de producto para una tienda online. Con GPT-4.1 me habría costado unos $3.50. Con GLM 5.2 me costó $0.52. Las descripciones eran igual de buenas. Para un ecommerce con 10.000 productos, la diferencia es entre $350 y $52. Eso ya no es un ahorro — es la diferencia entre viable e inviable.

El test de Techstackups enfrentó a GLM 5.2 contra Claude Opus construyendo un juego 3D en WebGL desde cero. Opus tardó 33 minutos y generó 216K tokens. GLM 5.2 tardó 1h10min y generó 131K tokens. El juego de GLM 5.2 era más sencillo pero funcional, jugable y con una condición de victoria clara. No es más rápido que Opus, pero por una quinta parte del precio, entrega.

🧩 Caso 3: Corre GLM 5.2 en local (si tienes una GPU con 80GB+ de VRAM)

Aquí viene la parte menos bonita. GLM 5.2 pesa. Con 753B parámetros MoE (~40B activos), necesitas al menos 4 GPUs A100 de 80GB para correrlo en FP16, o cuantizado a 4 bits puedes apañártelas con 2 GPUs de 80GB. En una sola RTX 4090 de 24GB ni lo intentes — no cabe ni cuantizado a 2 bits.

El modelo está en Hugging Face bajo la organización THUDM. Si tienes el hardware, el pipeline estándar con transformers funciona. También hay soporte para vLLM y SGLang, que es como lo sirve Z.ai en producción.

Alternativa realista para el 99% de nosotros: usa la API. No hay vergüenza en ello. A $1.40 el millón de tokens de entrada, auto-hosting solo tiene sentido si procesas volúmenes industriales o tienes requisitos de privacidad que lo justifiquen. Para el resto, api.z.ai es la respuesta.

🧩 Caso 4: Razonamiento extendido — resuelve problemas que otros modelos no pueden

Esto fue lo que me dejó pegado a la silla. Arrowtsx le planteó a GLM 5.2 un problema trampa de programación concurrente: "Ejecuta tres tareas de I/O multiplexadas en un solo hilo sin ceder el control ni usar async". Es técnicamente imposible — como pedirle a un repartidor que entregue paquetes en 3 casas distintas sin parar el camión. GPT-5.5 y DeepSeek V4 Pro se tragaron el anzuelo y generaron código inválido sin pestañear, alucinando soluciones que no compilaban. GLM 5.2 tardó 12 segundos y gastó 800 tokens de razonamiento... para decir que era imposible. Y explicar exactamente por qué.

Esto no es un truco de benchmark. Es la diferencia entre una herramienta que te dice lo que quieres oír y una que te dice la verdad. Para cualquier uso profesional — código, análisis financiero, diagnóstico médico — prefiero el modelo que admite que no sabe.

Para activar el razonamiento extendido: en la API de Z.ai, pasas "thinking": {"type": "enabled", "budget_tokens": 4096} en el body de la request. En HuggingChat, seleccionas el modelo con la etiqueta "Max". El modo High es más rápido, el modo Max es más cuidadoso.

🧩 Caso 5: Fine-tuning — adapta GLM 5.2 a tu dominio sin depender de OpenAI

Como tiene licencia MIT, puedes hacer fine-tuning sin restricciones. Z.ai ofrece fine-tuning gestionado en su plataforma, pero también puedes hacerlo tú mismo con LoRA si tienes la GPU adecuada. Una QLoRA con r=16 cabe en 4×A100 y te permite especializar el modelo en documentos legales, médicos o técnicos con unos pocos cientos de ejemplos.

He visto a gente en la comunidad de LocalLLaMA reportar que con 500 ejemplos de fine-tuning en dominio médico, GLM 5.2 supera a GPT-4.1 en precisión factual sobre ese dominio específico. Tiene sentido: un modelo que ya parte con 28% de alucinación, cuando lo afinas en un dominio concreto, baja aún más ese porcentaje.

Los pesos están disponibles en Hugging Face en FP8, FP16 y versiones cuantizadas (GGUF). La comunidad ya ha subido cuantizaciones de 2, 3, 4, 5, 6 y 8 bits. Si quieres probar en CPU, la versión Q2_K cabe en unos 180GB de RAM — no es rápido, pero funciona.

¿Merece la pena cambiarse?

He estado usando GLM 5.2 como modelo principal durante 3 días. No es perfecto. En tareas creativas puras — escribir ficción, brainstorming de marketing — Opus y GPT-5.5 siguen teniendo más chispa. Pero para trabajo técnico, análisis, código y razonamiento, GLM 5.2 compite de tú a tú con modelos que cuestan 5 veces más.

La jugada de Tsinghua y Z.ai es brillante: regalan el modelo para comerse el mercado de infraestructura. Tú usas la API porque es barata, ellos monetizan el cómputo. Pero como los pesos son abiertos, si mañana Z.ai decide subir precios, te llevas el modelo a otro proveedor o a tu propio clúster. No hay vendor lock-in. Eso es lo que debería haber sido siempre la IA open source.

La próxima vez que alguien te diga que "China solo copia", enséñale los benchmarks de GLM 5.2. Y luego dile que es gratis.