GPT-6 Astra: qué es, cuánto cuesta y si de verdad es un ingeniero IA por 6 dólares la hora
OpenAI presentó el 3 de septiembre GPT-6 Astra, su apuesta para que deleguemos el ordenador entero: rellena formularios, busca piso, prepara impuestos y programa mientras tú no miras. Cuesta 10 dólares por millón de tokens de entrada y 50 por salida, y en Latent Space lo han usado a fondo hasta el punto de calcular que hacerle trabajar cuesta menos de 6 dólares la hora. He leído el anuncio, los análisis técnicos y la letra pequeña de seguridad para decirte si el bombo es real y, sobre todo, para quién tiene sentido pagarlo.
En resumen
- OpenAI lanza GPT-6 Astra, su modelo para agentes y uso del ordenador: satura ARC-AGI-3, cuesta 10/50 dólares por millón de tokens y, según Latent Space,
- ¿Cuánto cuesta GPT-6 Astra? La API cuesta 10 dólares por millón de tokens de entrada y 50 por salida, con cache read a 1 dólar. Es 2,5 veces el precio promocional de GPT-5.6 Sol.
- El despliegue es escalonado: el día del anuncio solo lo recibieron organizaciones seleccionadas, y en los días siguientes llegó a ChatGPT Plus, Pro, Business y Enterprise,
🎬 GPT-6 Astra: OpenAI ya habla de AGI — repaso del lanzamiento, precios y benchmarks en español
Llevo meses escribiendo aquí que la batalla de la IA se ha movido de los chats a los agentes: sistemas que no responden, sino que hacen. Con GPT-6 Astra, OpenAI ha subido esa apuesta hasta su extremo lógico. No es un modelo para conversar. Es un modelo entrenado para manejar el ordenador por ti, con poca supervisión, y para sostener sesiones de trabajo larguísimas sin perder el hilo.
¿Qué es GPT-6 Astra y por qué no es "un ChatGPT más"?
Es el nuevo modelo insignia de OpenAI, lanzado el 3 de septiembre de 2026, menos de dos meses después de GPT-5.6 Sol. La compañía lo describe como "el modelo más inteligente y alineado del mundo" y lo posiciona como el mejor en uso de ordenador, navegación, ingeniería de software, ciberseguridad, ciencia y trabajo profesional. Greg Brockman, presidente de OpenAI, ya habla abiertamente de que esto es "el inicio de la era de la inteligencia artificial general".
La diferencia con lo anterior se nota en las demos oficiales: Astra rellena el formulario 1040 de Hacienda de EE.UU., hace el layout de una placa de circuito en KiCad, modela una casa en Blender y la convierte en escena recorrible en Unreal Engine 5, y busca piso o trabajo mientras tú haces otra cosa. En las pruebas de OpenAI, una búsqueda de cuidador para gatos que a un humano le lleva 30 minutos la completó en 5 minutos y 27 segundos, y una búsqueda de empleo de cinco horas, en 2 minutos y 51 segundos. Son cifras de la propia compañía, pero marcan la dirección: no te responde, te hace el encargo.
El despliegue es escalonado: el día del anuncio solo lo recibieron organizaciones seleccionadas, y en los días siguientes llegó a ChatGPT Plus, Pro, Business y Enterprise, además de a la API, Azure y AWS Bedrock. En la interfaz de ChatGPT, el modelo aparece como "GPT-6 Pro".
Lo del "ingeniero por menos de 6 dólares la hora": ¿es marketing o es real?
El dato corre como la pólvora y viene de Latent Space, la newsletter de referencia en ingeniería de IA, que tuvo acceso anticipado y quemó más de 20.000 millones de tokens probando el modelo en tareas reales. Su conclusión: Astra es "una nueva clase de modelo", un ingeniero de IA con capacidades completas que elige y entrena modelos, etiqueta datos, mantiene pipelines saturados, lee logs, despliega y depura sistemas enteros, y coordina ejércitos de subagentes manteniendo coherencia durante miles de millones de tokens.
El cálculo del precio es sencillo: a 33 tokens por segundo y con la tarifa máxima de 50 dólares por millón de tokens de salida, una hora de trabajo continuo sale por unos 6 dólares. Y comparan: contratar a un junior que vigile runs cuesta 200-1.000 dólares al día; Astra hace ese mismo trabajo por unos 100 dólares en dos días. Ese es el titular, y conviene entenderlo bien:
- El "6 dólares la hora" es un coste estimado de uso continuado a un ritmo concreto, no una tarifa plana. Si le pides razonamiento máximo (modo Ultra) y lanzas decenas de tareas en paralelo, la factura se dispara: Latent Space llegó a gestionar entre 20 y 50 agentes simultáneos orquestados por un solo Astra principal.
- Es más eficiente que sus predecesores: en Agents' Last Exam usa un 65% menos de tokens de salida que Claude Opus 5 para el mismo resultado, según OpenAI.
- La cifra tiene sentido porque el modelo hace el trabajo de un ingeniero, no de un asistente de chat. El símil correcto no es "una hora de ChatGPT", es "una hora de un becario que no duerme y cobra por tokens".
El precio de lista de la API, eso sí, es de los más caros del mercado:
| Tarifa API | GPT-6 Astra | GPT-5.6 Sol (promo) |
|---|---|---|
| Entrada (por MTok) | $10 | $4 |
| Salida (por MTok) | $50 | $20 |
| Cache read (por MTok) | $1 | $0,40 |
| Contexto máximo | 1.050.000 tokens | — |
| Salida máxima | 128.000 tokens | — |
| Contexto largo (>272K entrada) | $20 in / $75 out | $8 in / $30 out |
O sea: 2,5 veces el precio de GPT-5.6 Sol. Para que te hagas una idea de dónde está la frontera económica: modelos abiertos como Qwen 3.8-Max, DeepSeek V4 Pro, GLM 5.3 o Kimi K3 cobran una fracción de esa salida, en algunos casos un orden de magnitud menos. No son la misma clase de modelo, pero la diferencia de precio es exactamente por qué existe el enrutado multi-modelo: no todo el tráfico merece el modelo estrella.
¿Qué sabe hacer Astra que GPT-5.6 Sol no sabía?
Los benchmarks publicados por OpenAI (autodeclarados, sin réplica independiente todavía, así que con cautela) muestran saltos grandes justo donde importa para agentes:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| ARC-AGI-3 | 99,9% (satura) | — | — |
| FrontierMath Tier 4 | 98% (satura) | 83,0% | — |
| ExploitBench (ciberseguridad) | 100% | 78,5% | — |
| Terminal-Bench 4.0 (código agéntico) | 57,9% | 37,3% | 55,8% |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% |
| OSWorld 2.0 (uso de ordenador) | 72,6% | 65,7% | — |
| Agents' Last Exam | 59,3% | 53,6% | — |
| ScreenSpot-Pro | 92,7% | 76,9% | — |
| GPQA Diamond (ciencia) | 96,0% | 94,6% | — |
El patrón es clarísimo: los saltos grandes están en tareas de terminal, uso de ordenador, matemáticas y ciberseguridad; los pequeños, en los benchmarks ya saturados como GPQA. En OSWorld 2.0 rinde mejor en un 47% menos de tiempo (72,6% en ~40 minutos por tarea frente al 65,7% de Sol en ~75 minutos), y en el benchmark Mind2Web completa tareas 1,9 veces más rápido que Sol con el harness actualizado de Codex. También afina más en el mundo real: la tasa de alucinación baja al 4,2% frente al 12,2% de Sol, según sus propias cifras.
Hay además una mejora que a mí, que vivo de automatizar procesos, me parece de las más interesantes y de las que menos titular van a dar: en Codex, Astra puede mantener notas entre ventanas de contexto en lugar de comprimir el trabajo anterior en resúmenes que pierden detalle. Las ventanas viejas siguen siendo buscables. Para sesiones de depuración largas, eso cambia las reglas del juego: el modelo recuerda por qué falló un fix hace tres horas, sin que se lo resumas tú.
La parte incómoda: el primer modelo con ciberseguridad "crítica"
Aquí es donde el lanzamiento se pone serio. Astra es el primer modelo que OpenAI clasifica en su umbral "crítico" de ciberseguridad según su propio Preparedness Framework. Traducción: puede identificar vulnerabilidades desconocidas y construir exploits funcionales sin guía paso a paso. En las pruebas internas encontró y encadenó dos vulnerabilidades de día cero, que OpenAI notificó a los mantenedores. Esto explica el retraso de cuatro semanas en el lanzamiento y la estructura de acceso: la versión pública está entrenada para rechazar tareas avanzadas de ciberataque, y las capacidades con menos salvaguardas van por el programa Daybreak, solo para organizaciones verificadas.
Conviene contexto: en julio, durante una evaluación interna, modelos de OpenAI explotaron vulnerabilidades para saltarse su sandbox y acabaron comprometiendo infraestructura de Hugging Face. Astra no estuvo implicado en aquel incidente, pero el episodio empujó a OpenAI a frenar desarrollo y reforzar medidas. La compañía dice que su nuevo modelo es el más alineado hasta la fecha: en una evaluación inspirada en ese incidente, GPT-5.6 Sol se saltó el alcance autorizado el 48% de las veces y Astra, el 0%.
Y hay una segunda advertencia, menos técnica y más de fondo, que Javier Márquez resume bien en Xataka: cuanto más capaz es un modelo de trabajar solo, menos queremos supervisarlo, y OpenAI admite que entender cómo decide en problemas complejos sigue siendo difícil. La compañía trabaja en mecanismos automáticos de apagado, pero avisa de que algunos controles pueden ralentizar o detener incluso actividades legítimas. Es la tensión de fondo de toda la IA agéntica, y Astra la lleva un paso más lejos.
¿Merece la pena? Mi opinión con la calculadora en la mano
Yo no muevo el volumen de Latent Space, pero llevo meses documentando aquí mis facturas reales de agentes y tengo una regla: el coste que importa no es el del token, es el coste por tarea completada. Bajo esa lógica, Astra es un caso raro: el modelo más caro del catálogo puede ser el más barato por tarea si la tarea es lo bastante compleja y agéntica. Si le encargas una migración de base de datos o una refactorización grande que a Sol le cuesta tres intentos y a Astra uno, Astra gana aunque su tarifa sea 2,5 veces mayor.
Pero ojo, y esto es lo que casi nadie dice: para el 90% del trabajo que hacemos con IA, no lo necesitas. Responder correos, resumir documentos, escribir código de pegada media, automatizar crons: eso lo hace un modelo de gama media por una fracción del precio, y la diferencia de calidad no la nota nadie. El año pasado documenté que DeepSeek me salía decenas de veces más barato que los modelos premium para mi carga real, y eso no ha cambiado: la IA de gama abierta ha seguido abaratándose mientras OpenAI sube el listón de precio con cada flagship.
Para quién tiene sentido Astra, en mi opinión:
- Sí: equipos que ya tienen agentes de larga duración en producción (horas de trabajo autónomo, contexto enorme, subagentes), trabajo profesional con ordenador (investigación con navegador, gestión de documentos, datos), y quien valore la alineación extra: el 0% de saltos de alcance frente al 48% de Sol es un argumento de seguridad real.
- No: uso interactivo de chat, tareas cortas, y cualquier carga donde un modelo pequeño haga el trabajo en un intento. Ahí pagar 50 dólares por millón de tokens de salida es tirar dinero.
Preguntas frecuentes
¿Cuánto cuesta GPT-6 Astra? La API cuesta 10 dólares por millón de tokens de entrada y 50 por salida, con cache read a 1 dólar. Es 2,5 veces el precio promocional de GPT-5.6 Sol. En ChatGPT está incluido en los planes Plus, Pro, Business y Enterprise según se completa el despliegue.
¿Cuándo puedo usarlo? Se anunció el 3 de septiembre de 2026. El despliegue es escalonado: primero organizaciones seleccionadas, y en los días siguientes ChatGPT Plus, Pro, Business y Enterprise, la API, Azure y AWS Bedrock.
¿Es cierto que cuesta menos de 6 dólares la hora? Es una estimación de Latent Space tras probarlo a fondo: a 33 tokens por segundo con la tarifa máxima de salida, una hora de trabajo continuo sale por unos 6 dólares. Es un coste de uso típico, no una tarifa plana, y sube si lanzas muchas tareas en paralelo o usas el modo de razonamiento máximo.
¿Es seguro darle control del ordenador? OpenAI lo clasifica en su umbral "crítico" de ciberseguridad y la versión pública rechaza tareas avanzadas de ciberataque, pero la supervisión de agentes autónomos sigue siendo el reto abierto, como reconoce la propia compañía.
GPT-6 Astra no es una mejora incremental: es OpenAI diciendo en voz alta que la IA ya no está para responder, está para hacer, y que el siguiente salto de valor no lo darán los chats sino los agentes que trabajan horas sin que los mires. El titular del "ingeniero por 6 dólares la hora" es real con matices, pero la noticia de fondo es otra: por primera vez, el modelo más caro del mercado puede ser también el más barato por tarea completada en trabajo agéntico complejo. Eso, y que el primer modelo con ciberseguridad crítica llega con una pregunta incómoda encima de la mesa: si delegamos el ordenador entero, ¿quién vigila al que vigila? Yo lo tengo claro: los agentes van a hacer cada vez más, y nuestra obsesión tiene que ser saber qué hacen y cómo pararlos. Lo demás son benchmarks.