Inicio Noticias Inteligencia Artificial Gadgets Guías y Tutoriales Tutoriales IA Reviews ✍️ El autor 📬 Contacto

IA sin GPU: cómo tengo un servidor de IA en producción sin tarjeta gráfica (2026)

Llevo meses operando 62 procesos automáticos, la web que estás leyendo, un sistema de trading en paper y un segundo cerebro de 440 notas desde una Raspberry Pi 5 sin GPU. Esto es lo que corre en local, lo que mando a la nube, cuánto cuesta de verdad y cuándo sí toca comprar una gráfica.

En resumen

IA sin GPU: servidor de IA en producción con Raspberry Pi 5 sin tarjeta gráfica

🎬 OpenAI's nightmare: Deepseek R1 on a Raspberry Pi — un modelo grande corriendo en una placa sin GPU dedicada

Mi servidor no tiene GPU. Ni una. La Raspberry Pi 5 que tienes que imaginarte es una placa de unos 80 euros con 8 GB de RAM y un ventilador que se oye por la mañana. Desde ahí llevo meses operando más de 60 procesos automáticos, el sitio web que estás leyendo, la moderación de contenido y un sistema de trading en paper. Todo 24/7. Cuando cuento esto, la respuesta más repetida es "eso no puede ser". Pues es.

No soy un caso raro: la barrera de hardware para hacer cosas útiles con IA lleva todo el año cayendo, y en este blog lo he ido documentando con fechas y números. Lo que pasa es que casi todas las guías asumen que necesitas una gráfica de 600 euros para "hacer IA", y esa asunción está desfasada. Aquí te enseño exactamente qué corre sin GPU, qué mando a la nube, cuánto me cuesta y cuándo de verdad vas a necesitar una tarjeta gráfica.

Respuesta corta: ¿se puede hacer IA sin GPU?

Sí, si separas el trabajo. La IA no es una cosa: es un montón de tareas distintas, y cada una tiene requisitos de hardware diferentes. El error de principiante es tratar todo el bloque como uno solo que necesita un datacenter. La realidad es que la mayor parte del trabajo de un agente (leer, buscar, planificar, decidir, ejecutar) es código normal. El modelo solo entra en ráfagas, cuando toca generar texto o tomar una decisión compleja.

Mi regla desde junio de 2026 es simple: local para lo pequeño y repetitivo, API para lo grande e interactivo, y GPU para casi nada. Te lo desgloso con lo que tengo montado, porque cada pieza de esta lista es real y está corriendo ahora mismo.

Lo que llevo ejecutando sin GPU desde hace meses

La pieza central es una Raspberry Pi 5 de 8 GB con un SSD NVMe, unos 140 euros de hardware en total, una vez. Sobre eso corre, sin una sola tarjeta gráfica:

Fíjate en el patrón: ninguno de estos trabajos necesita generar texto de forma interactiva a 40 tokens por segundo. Necesitan fiabilidad, coste bajo y que no se caigan. Eso es exactamente lo que una placa de 80 euros sin GPU hace mejor que un servidor con gráfica de 800.

Los 3 trabajos de IA que no necesitan GPU (y casi todo el mundo manda a la nube igualmente)

1. Orquestar agentes

El trabajo de un agente es 90% código normal: leer una fuente, decidir si importa, llamar a una API, escribir un archivo, avisar por Telegram. El modelo grande entra solo en el momento de redactar o razonar, y eso se resuelve con una llamada a la nube. Orquestar decenas de agentes no necesita ni GPU ni un servidor potente: necesita buenos crons y buena disciplina con los fallos. Mi sistema lleva desde junio publicando contenido a diario con cero intervención humana, y el 100% del cómputo pesado ocurre fuera de mi placa.

2. Tareas pequeñas y especializadas

Moderación, clasificación, extracción, etiquetado. Para esto un modelo de 1 a 3 mil millones de parámetros corriendo en CPU va sobrado, y llevo verificándolo en mi placa desde junio de 2026. Es el caso exacto de Shieldstral: una pregunta de sí o no sobre un texto, una puntuación de seguridad, y listo. No necesitas que sea brillante, necesitas que sea barato, rápido y siempre disponible. Un modelo pequeño en tu propio hardware te da las tres cosas.

3. Resumir y procesar texto en volumen

RAG, resúmenes diarios, extracción de datos de documentos. It's FOSS probó 8 modelos en un portátil sin GPU (un i5 con 12 GB de RAM) y su conclusión es clara: los modelos de 1-2B son el punto dulce, y con cuantización Q4 un Qwen 3 de 0,6B corre a 34-36 tokens por segundo en CPU pura. Para trabajo por lotes, eso es más que suficiente. La frontera no es "¿puede correr?", es "¿te compensa montarlo?".

Qué mando a la nube (y por qué no me duele)

Los modelos grandes e interactivos. Cuando necesito calidad y latencia (redactar, razonar, generar el artículo de las 7 de la mañana) llamo a la API de DeepSeek: el V4 Flash cuesta 0,09 dólares por millón de tokens de entrada y 0,18 de salida. A ese precio, la pregunta de "¿local o API?" se responde sola para modelos grandes: no tiene sentido mantener el hardware para algo que te cuesta céntimos al mes.

Las imágenes también van a la nube: las genero con Replicate (SDXL) por unos 30 céntimos al mes. Mantener un modelo de difusión en local para generar una imagen diaria sería tirar el dinero y el tiempo. Y ojo, que esto no va de "la nube es gratis": va de que el gasto esté medido y sea ridículo. El contraejemplo lo tengo documentado: un agente con acceso a AWS llegó a acumular 6.531,30 dólares en un mes antes de que un watchdog de facturación lo cortara. La nube no es gratis, solo es flexible. Si no la vigilas, te vigila ella a ti.

Cuánto cuesta de verdad (mis números, no los de la publicidad)

ConceptoCoste real
Raspberry Pi 5 8GB + SSD NVMe + accesorios~140 € (una vez)
Energía 24/7~2-3 €/mes
APIs (DeepSeek, Replicate y resto)18 €/mes en julio → ~5 $/mes en agosto → 3,35 $ en 16 días medidos

Ese 3,35 dólares en 16 días es real y medido, no estimado. De hecho, la factura estimada a precio de lista decía que iba a pagar 13 veces más: lo conté con detalle en mi factura de IA de agosto. La lección operativa es que el coste real de una infraestructura indie es mucho menor de lo que parece si mides, y mucho mayor de lo que parece si no mides.

Ahora compara con la alternativa: una GPU de gama media son 400-800 euros, más consumo, más ruido, más el tiempo que pierdes montándola. Para mi carga de trabajo no hay color. Y esto no es una opinión de fanático del hardware barato: es lo que dicen mis propias facturas, mes tras mes.

Cuándo SÍ necesitas una GPU (o un acelerador)

No te voy a vender que la GPU ha muerto, porque es mentira. Hay tres casos donde la necesitas de verdad.

1. Interacción en tiempo real con modelos medianos

Una cosa es un resumen por lotes y otra un chat que responda mientras esperas. Por debajo de unos 10 tokens por segundo la experiencia muere, y solo a partir de 15-30 se siente usable. En la CPU de la Pi 5, los modelos pequeños dan 4-9 tokens por segundo según las pruebas de la comunidad. Eso vale para automatizar, y no vale para chatear.

2. Modelos de 7B o más en local

La Pi 5 desnuda tiene un techo práctico de 1-3B en cuantización Q4. Si tu proyecto exige modelos de 7 mil millones de parámetros o más en tu propio hardware, un PC con GPU o una mini PC con buena RAM te ganan sin discusión. Ahí no hay milagro: la capacidad de cómputo local tiene un precio.

3. Fine-tuning, vídeo y visión pesada

Entrenar o ajustar modelos en CPU es masoquismo. Igual que generar vídeo o procesar visión pesada en tiempo real. Si tu trabajo es ese, compra la gráfica y no te sientas mal por ello.

El punto medio: el AI HAT+ 2

Entre "sin GPU" y "GPU de 600 euros" existe un escalón que casi nadie conoce: la Raspberry Pi AI HAT+ 2, con la NPU Hailo-10H de 40 TOPS, disponible desde enero de 2026. Mueve modelos de 1-1,5B con su propio servidor Ollama. No sustituye a una GPU de escritorio, pero para tareas de borde es un acelerador real y barato. Si te pica la curiosidad, aquí está el HAT+ 2.

Y si lo que tienes es una GPU pequeña y quieres estirarla: AirLLM carga las capas del modelo desde disco a la GPU una a una, sin cuantizar. Con 4 GB de VRAM corre modelos de 70 mil millones de parámetros, y el Kimi K3 de 2,8 billones entra en 3,72 GB. Lento, pero existe. Le dediqué un tutorial completo en este artículo.

Lo que nadie te dijo

Preguntas frecuentes

¿Necesito una GPU para trabajar con IA?

Para consumir IA a través de APIs, no. Para ejecutar modelos grandes en local con interacción en tiempo real, sí. La mayoría del trabajo de agentes y automatización no necesita GPU en absoluto.

¿Qué modelos puedo correr en una Raspberry Pi 5 sin GPU?

Modelos de 1 a 3 mil millones de parámetros en cuantización Q4 vía Ollama o llama.cpp, a 4-9 tokens por segundo. Suficiente para tareas automáticas y clasificación; insuficiente para chatear.

¿Puedo correr un modelo de 70B sin GPU?

No de forma práctica. Con AirLLM sí puedes ejecutar modelos de 70B en una GPU de solo 4 GB cargando capas desde disco, pero en CPU pura no es viable.

¿Cuánto cuesta ejecutar IA sin GPU?

En mi caso: unos 140 euros de hardware una vez y 3,35 dólares en 16 días de APIs. Depende de tu volumen, pero el orden de magnitud es ese, no los 50 euros al mes que te venden las suscripciones.

¿Cuándo debo comprar una GPU?

Cuando necesites latencia interactiva con modelos medianos, modelos de 7B o más en local, o fine-tuning. Para automatización y consumo vía API, no la necesitas. Compra la gráfica cuando el trabajo la pida, no antes.

La conclusión es incómoda para quien ya invirtió en una gráfica de 800 euros: la IA de producción ya no exige GPU de datacenter, exige arquitectura. Separar lo que corre en local de lo que va a la nube, medir cada céntimo y construir pipelines que se auto-reparen vale más que cualquier tarjeta gráfica del mercado. El hardware mínimo sigue cayendo, y quien lo demuestra no es un benchmark de marketing, es un servidor de 80 euros que lleva meses publicando, moderando y operando solo. Si estás empezando, no empieces por la GPU. Empieza por el pipeline. Y si un día necesitas la gráfica, la compras cuando el trabajo la pida.

✍️ Luigy García — Editor de La Frontera IA. Escribo sobre IA, servidores caseros y todo lo que aprendo manteniendo este sitio desde una Raspberry Pi 5 con un SSD NVMe. Escríbeme si tienes dudas o quieres compartir tu experiencia.