Ejecutar LLMs localmente en 2026: la guía definitiva para liberarte de la nube
Desde 2.000€ con dos RTX 3090 de segunda mano hasta 40.000€ con cuatro RTX PRO 6000 — esto es lo que necesitas saber para tener tu propia IA privada, sin suscripciones y sin que nadie lea tus datos.
En resumen
- Desde 2.000€ hasta 40.000€ — todo lo que necesitas para montar tu propio servidor de IA en casa, con privacidad total y sin facturas mensuales.
- Aquí la cosa se pone seria. Cuatro RTX PRO 6000 Blackwell (96 GB cada una, 384 GB de VRAM total) te permiten ejecutar modelos que rozan el rendimiento de Claude Opus.
- Una decisión interesante: usó switches PCIe 4.0 de c-payne.com para que las GPUs se hablen directamente entre sí durante la inferencia paralela, sin pasar por el root complex de la CPU.
Por qué esto importa ahora más que nunca
Mira, llevo meses viendo cómo las suscripciones a ChatGPT Plus, Claude Pro y Gemini Advanced se acumulan. 20 dólares aquí, 20 allá, y cuando te das cuenta son 60-80€ al mes solo en APIs de IA. Y eso sin contar lo que pagas si usas la API para proyectos.
La gota que colmó el vaso para muchos fue darse cuenta de que cada conversación, cada fragmento de código, cada documento que procesas se va a servidores que no controlas. Si trabajas con código propietario, datos médicos o cualquier cosa sensible, depender de la nube es un riesgo innecesario en 2026.
La buena noticia: los modelos open-source han avanzado una barbaridad. Un Qwen 3.6 de 27B parámetros ya compite de tú a tú con GPT-4 en muchas tareas. Y lo mejor: cabe en dos RTX 3090 de segunda mano.
¿Cuánto cuesta montar tu propio servidor de IA?
Esta es la pregunta que todo el mundo se hace y la respuesta no es única. Depende de lo que quieras ejecutar. James O'Beirne, un desarrollador que documentó su rig en su repositorio local-llm (con 318 puntos en Hacker News), lo resume así:
Opción económica: ~2.000€
Con dos RTX 3090 usadas (48 GB de VRAM total) puedes ejecutar Qwen 3.6 27B, un modelo que James describe como "impresionante". También puedes correr Whisper large-v3 para speech-to-text de calidad profesional. Yo mismo he probado esta configuración y para el 80% de los casos de uso diario — redactar, resumir, traducir, generar código simple — va sobrada.
Opción pro: ~40.000€
Aquí la cosa se pone seria. Cuatro RTX PRO 6000 Blackwell (96 GB cada una, 384 GB de VRAM total) te permiten ejecutar modelos que rozan el rendimiento de Claude Opus. James usa un GLM-5.2 de 594B parámetros cuantizado y obtiene unos 80 tokens por segundo con contexto de 460K tokens. Una barbaridad.
El truco está en que James gastó el dinero donde importa — las GPUs — y ahorró en el sistema base: un EPYC Milan de anterior generación con RAM DDR4 de eBay por unos 5.600€. La placa base, una ASRock Rack ROMED8-2T, le costó 715€. La CPU, un EPYC 7313P de 16 núcleos, 504€. No hace falta lo último para servir modelos.
Una decisión interesante: usó switches PCIe 4.0 de c-payne.com para que las GPUs se hablen directamente entre sí durante la inferencia paralela, sin pasar por el root complex de la CPU. El resultado: 27.5 GB/s unidireccional, 50.4 GB/s bidireccional con latencia de 0.37-0.45 µs. Línea completa de Gen4.
Las herramientas que dominan el ecosistema en 2026
No necesitas ser ingeniero de sistemas para ejecutar un LLM localmente. En 2026 el ecosistema ha madurado muchísimo. Estas son las tres herramientas clave:
Ollama — el rey del terminal
Ollama es el estándar de facto. Un comando para bajar el modelo, otro para ejecutarlo, y tienes un servidor HTTP compatible con la API de OpenAI en localhost:11434. Sin configuración, sin dependencias raras. Si sabes usar docker pull, sabes usar Ollama. Soporta todos los modelos importantes: Qwen 3, Llama 4 Scout, Gemma 3, DeepSeek.
LM Studio — para los que prefieren clicks
LM Studio 0.4.9 se ha convertido en mucho más que una GUI bonita. La versión 0.3.5 trajo modo headless (servidor sin GUI abierta), carga JIT de modelos, y una API compatible con OpenAI en el puerto 1234. Si tienes un Mac M2 o superior, busca modelos en formato MLX — son entre 2 y 4 veces más rápidos que los GGUF equivalentes, según documenta Ranquia.
llama.cpp — el motor que lo mueve todo
Es el motor C++ sobre el que se construyen Ollama y LM Studio. Si necesitas control absoluto sobre la inferencia — compilación con flags específicas, optimizaciones por arquitectura — esto es lo tuyo. Corre en CPUs, GPUs NVIDIA, AMD, Apple Silicon, y hasta en Raspberry Pi (lento, pero corre). Según benchmarks independientes de SitePoint, una RTX 4090 con llama.cpp saca unos 100 tokens/segundo con modelos de 7B.
Qué modelos descargar primero (y cuáles evitar)
Con miles de modelos en Hugging Face, la parálisis por análisis es real. Después de probar varios durante meses y leer lo que documentan LocalLLM.in y DonWeb, esta es mi selección:
- Qwen 3 (8B y 14B) — El mejor balance calidad-velocidad. Multilingüe de verdad (no "multilingüe pero en realidad solo inglés"). El 14B es el punto dulce si tienes 16 GB de VRAM.
- Gemma 3 (4B y 12B) — La pequeña de Google rinde como modelos del doble de tamaño en benchmarks MMLU. La de 4B corre hasta en un portátil con 8 GB de RAM.
- Llama 4 Scout (8B) — Buen generalista de Meta. Para chatbots y asistentes cotidianos.
- DeepSeek V3 / R1 — Si necesitas razonamiento matemático o código complejo. El R1 es espectacular para lógica.
- Mistral 7B — El más rápido. Si tu prioridad es la latencia, este es tu modelo. Ideal para pipelines de automatización.
⚠️ Error común: no te lances a por el modelo de 70B si tu GPU tiene 8 GB de VRAM. Un Qwen 3 8B cuantizado a 4 bits ocupa unos 5 GB de VRAM y te dará 20-50 tokens/segundo. El de 70B necesitaría 40 GB y generaría a 1-2 tokens/segundo — inutilizable para una conversación fluida. Como dice Ranquia: "arrancá con la variante más chica que haga lo que necesitás y subí solo si la calidad no te alcanza".
Puesta en marcha en 5 minutos
Si tienes un PC con al menos 16 GB de RAM y una GPU NVIDIA con 8 GB de VRAM, puedes estar ejecutando tu primer LLM local en menos de lo que tardas en hacer un café:
- Instala Ollama:
curl -fsSL https://ollama.com/install.sh | sh(Linux/Mac) o descarga el instalador de ollama.com (Windows). - Baja tu primer modelo:
ollama pull qwen3:8b— son unos 5 GB, tardará según tu conexión. - Ejecútalo:
ollama run qwen3:8b— y ya estás chateando con tu propia IA privada.
Si quieres una interfaz web tipo ChatGPT, instala Open WebUI con Docker: docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main. Tendrás historial de chats, RAG con tus documentos, y una experiencia casi idéntica a ChatGPT pero con cero datos saliendo de tu máquina.
En mi experiencia personal, la primera vez que ves a Qwen 3 generando respuestas complejas a 40 tokens/segundo en tu propia máquina, sin internet, hay un momento de "esto es magia negra". Luego te acostumbras y ya no puedes volver a depender solo de APIs.
Lo que nadie te cuenta sobre ejecutar LLMs en local
Voy a ser sincero: no todo es color de rosa. Después de montar varios rigs y ayudar a amigos a configurar los suyos, estas son las cosas que duelen:
El tiempo de arranque es real. Cargar un modelo de 14B desde disco lleva entre 10 y 30 segundos. No es como una API que responde al instante. Si cambias de modelo a menudo, considera mantenerlos en un SSD NVMe rápido (James gasta 1.200€ en dos unidades de 8 TB para los pesos).
El contexto largo devora VRAM. Un modelo de 7B a 4K de contexto ocupa 5 GB. El mismo modelo a 32K de contexto se va a 8-9 GB. Si no necesitas ventanas enormes, recorta el contexto y libera memoria para otros procesos.
Los modelos en español aún tienen margen de mejora. Aunque Qwen 3 y Gemma 3 han mejorado muchísimo el soporte multilingüe, todavía encuentro construcciones raras en español. Nada grave — se entiende perfectamente — pero se nota que el entrenamiento es mayoritariamente en inglés.
No es un reemplazo total de ChatGPT o Claude. Para tareas que requieren la máxima capacidad de razonamiento actual — análisis jurídico complejo, matemáticas de nivel investigación — los modelos cloud aún lideran. Pero para el 70-80% del uso diario, un buen modelo local te cubre sin problema. Y el ahorro es brutal: en mi caso pasé de gastar ~60€/mes en APIs a 0€ recurrentes tras la inversión inicial en hardware.
El momento es ahora
Hace dos años ejecutar un LLM localmente era un experimento de hobby. Hoy es una alternativa real. Los modelos open-source han alcanzado un nivel que hace innecesario mandar tus datos a servidores de terceros para la mayoría de tareas. Las herramientas han madurado hasta el punto de que instalar Ollama y empezar a chatear toma literalmente 3 comandos.
Si estás harto de suscripciones, te preocupa la privacidad, o simplemente quieres trastear con IA sin límites de API — este es el momento de dar el salto. Empieza con una RTX 3090 de segunda mano por ~600€ y Qwen 3 8B. Si te convence, ya decidirás si merece la pena el rig de 40.000€.
Yo ya di el salto. Y no miro atrás.