¿Se puede sustituir Claude o GPT con un modelo local para programar? La comunidad de desarrolladores lo tiene claro
Una pregunta en Hacker News acumula más de 1.000 votos y 448 respuestas en 24 horas. Esto es lo que dicen quienes ya han dado el salto.
En resumen
- Una pregunta en Hacker News con 1.004 votos y 448 comentarios revela qué modelos locales (Qwen 3.6, Gemma 4) pueden sustituir a Claude o GPT para programar a diario.
Esta semana, un usuario de Hacker News lanzó una pregunta que tocó una fibra muy sensible: "¿Alguien ha reemplazado Claude o GPT por un modelo local para programar a diario?". En 24 horas, el hilo acumuló 1.004 puntos y 448 comentarios, convirtiéndose en uno de los Ask HN más activos del año. Las respuestas dibujan un panorama mucho más maduro del que la mayoría cree.
La pregunta llega en un momento especialmente caliente. El 15 de junio, Anthropic recibió su primera demanda colectiva por los planes Claude Max. Según recoge WWWhat's New, un usuario alega que una sesión de trabajo de cinco horas consumió el 15% de su cuota semanal en un plan de $200 al mes. La frustración con los límites de las suscripciones está empujando a cada vez más desarrolladores a buscar alternativas locales.
Qwen 3.6, el modelo que sale en 8 de cada 10 respuestas
Si hay un nombre que se repite una y otra vez en el hilo, es Qwen 3.6 de Alibaba. Aparece en aproximadamente el 80% de las respuestas de quienes han dado el salto. Las dos variantes más mencionadas:
- Qwen 3.6 27B (denso): Más preciso para código, sacrifica velocidad. Entre 25 y 40 tokens por segundo en una Mac Studio con 512GB de RAM.
- Qwen 3.6 35B-A3B (MoE): Solo 3B de parámetros activos de los 35B totales. Mucho más rápido (50-80 tok/s en un Strix Halo) pero algo menos fino en tareas complejas.
El usuario Kostic lo resume con claridad: "Conecté VSCode con llama.cpp corriendo Qwen 3.6 27B o Gemma 4 31B y es lo bastante bueno para cancelar mi suscripción a la nube". xmstan va más lejos: compara Qwen 3.6 27B con "Sonnet de hace 4-6 meses en calidad de output. Totalmente usable para programar a diario".
La alternativa que más crece es Gemma 4 de Google, especialmente la versión 31B y la 26B-A4B. sosodev apunta: "He encontrado que Gemma 4 31B y Qwen 3.6 27B son los mejores en el rango de ~30B ahora mismo".
El hardware que necesitas (sin endeudarte)
No voy a endulzarlo: montar un setup local decente requiere inversión. Pero los números que comparte la comunidad son más accesibles de lo que parecen:
- RTX 3090 usada (24GB): ~700-900€. Qwen 3.6 35B en Q4 a 50-150 tok/s. El setup más repetido.
- Strix Halo 128GB (Bosgame M5): ~2.000€. Un portátil que corre modelos de 35B a 50-80 tok/s consumiendo 120W.
- Mac Studio M2 128GB: ~4.500€. Qwen 3.6 27B a 25-40 tok/s.
- 2x RTX 3090: ~1.500-1.800€. Gemma 4 31B en Q8 a 100-150 tok/s.
El setup estrella es una RTX 3090 de segunda mano con 24GB. La encuentras por unos 800€ y con eso mueves Qwen 3.6 35B en Q4_K_M sin problemas. pierotofy, que documentó su configuración en GitHub, dice que "llama.cpp + Qwen 3.6 35B (MTP) + OpenCode es bastante capaz en una sola RTX 3090 y más rápido que la mayoría de modelos en la nube".
La gran sorpresa de 2026 es Strix Halo, el chip de AMD que mete 128GB de memoria unificada en portátil. stymaar lo describe así: "demasiada VRAM para este modelo, pero mi factura de luz es ridícula. Consume casi nada en idle y unos 120W durante el procesamiento". Un portátil que corre modelos de 35B a 50-80 tok/s consumiendo lo mismo que una bombilla.
pi y OpenCode: las navajas suizas del código con IA local
El modelo es la mitad de la ecuación. La otra mitad es el harness: el software que conecta el modelo con tu editor. Dos nombres dominan la conversación:
pi (pi.dev) es el más mencionado. Una especie de Claude Code open source que funciona con modelos locales. horsawlarway reemplazó "una suscripción de $100/mes a Claude por pi apuntando a modelos Qwen y Gemma en Unsloth Studio". Su máquina con 2x RTX 3090 de hace 5 años saca ~150 tok/s.
OpenCode, la alternativa open source a Cursor, aparece constantemente en setups con Qwen. cheekygeeky cuenta que el desarrollador más brillante de su equipo usa "OpenCode y Tmux con modelos open source, con DeepSeek como su modelo preferido".
Eso sí, el consenso sobre las herramientas es agridulce. blurbleblurble lo clava: "No son los modelos los que limitan ahora, son los harnesses alternativos con funciones que faltan y mala ergonomía". Las herramientas están a un 80% de madurez. Suficiente para el día a día, pero con roces que los productos de pago ya han pulido.
Lo que todavía no funciona (y hay que decirlo)
Sería deshonesto pintarlo todo de color de rosa. La comunidad es brutalmente honesta sobre las limitaciones:
Ventanas de contexto cortas. mitchell_h lo intentó y se rindió: "Las ventanas de contexto simplemente no eran lo bastante grandes". Para codebases con cientos de archivos, los 128K-200K tokens del contexto local se quedan cortos frente a los 500K+ de los modelos cloud.
Arquitectura compleja = sigue necesitando frontier. cloudengineer94 probó con una RTX 5090 y sentencia: "Nada reemplaza a Claude Code o Kiro para desarrollo guiado por especificaciones". La estrategia híbrida es la norma: garethsprice usa "Opus para generar planes que el agente local ejecuta, y luego Opus para validar". Pagas tokens de frontier para pensar, usas tokens gratis para picar.
Sin acceso a Internet. CuriousRose señala que "los modelos alojados hacen búsqueda web increíblemente bien y eso es una parte enorme de la calidad del output". Sin RAG ni búsqueda, el modelo local se queda ciego a documentación reciente y cambios de API.
Configurarlo lleva horas. Departed7405 se rindió: "OpenCode no tiene buena integración con modelos locales. Es un dolor de cabeza". henrixd, en cambio, compila su propio fork de llama.cpp con parches MTP personalizados y le va de maravilla. La diferencia entre éxito y fracaso está en la tolerancia al bricolaje técnico.
DeepSeek V4: la tercera vía que nadie esperaba
Hay un punto intermedio que aparece en decenas de comentarios: DeepSeek V4 Flash vía API. No es técnicamente "local", pero es open source y los precios son ridículos. zftnb666 lo resume: "Reemplacé Claude con DeepSeek V4 Flash vía API. No es local, pero es el 95% de la calidad al 5% del precio".
goranmoomin usa modelos open source en proveedores de inferencia independientes: "Puedo elegir el proveedor yo mismo, disfrutar de 300 tok/s y gastar mucho menos que con los grandes". Es el equivalente a comprar el procesador a Intel en lugar de pagar la suscripción del portátil entero.
Y para los que tienen hardware de verdad, arjie corre DeepSeek V4 Flash en 2x RTX Pro 6000 Blackwell (96GB cada una) a 160 tok/s. Una bestialidad.
Mi experiencia (sin filtros)
He probado esto yo mismo en una Raspberry Pi 5 y no, no voy a fingir que corría Qwen 3.6 a velocidades utilizables. Corría modelos de 3B que servían para autocompletar imports y poco más. Pero la experiencia me dejó claro algo: el salto de 2025 a 2026 ha sido bestial. Las GPUs de consumo ya pueden con modelos de 30B+, las herramientas open source han madurado una barbaridad, y los precios de las suscripciones están empujando a la gente a buscar alternativas.
Si tuviera que dar una recomendación hoy: una RTX 3090 de segunda mano + Qwen 3.6 35B + pi es el punto dulce para quien quiera independizarse de las suscripciones sin arruinarse. No vas a tener la calidad de Claude Opus. Pero para el 80% del trabajo diario de programación, sobra.
La comunidad de Hacker News ha hablado. Y la respuesta a si se puede sustituir Claude o GPT con un modelo local para programar es un sí con asteriscos. No es para todos. No es para todos los proyectos. Pero para quienes tienen el hardware y la paciencia de configurarlo, junio de 2026 marca el momento en que los modelos locales se volvieron lo bastante buenos.