Inicio Noticias Inteligencia Artificial Gadgets Guías y Tutoriales Tutoriales IA Reviews ✍️ El autor 📬 Contacto
Cognition SWE-1.7 modelo de código frontera

SWE-1.7: Cognition lanza un modelo de código que roza a GPT-5.5 por 1,97 dólares la tarea

El nuevo motor de Devin alcanza el 42,3% en FrontierCode, se queda a 0,7 puntos de GPT-5.5 y cuesta una fracción del precio. Corre a 1.000 tokens por segundo sobre hardware de Cerebras.

En resumen

  • Cognition presenta SWE-1.7, su nuevo modelo de código que alcanza un 42,3% en FrontierCode, a solo 0,7 puntos de GPT-5.5. Cuesta 1,97$ por tarea y corre a 1000 tokens por segundo.
  • 4. Auto-compactación para tareas de 6 horas. Como los rollouts pueden durar más que la ventana de contexto del modelo, SWE-1.7 aprende a resumir su propio estado y retomar desde el resumen.
  • Vamos al grano. Esto es lo que saca SWE-1.7 frente a los pesos pesados:

Cognition acaba de soltar SWE-1.7, el modelo más potente que han entrenado hasta ahora. Y los números son de los que hacen levantar una ceja: 42,3% en FrontierCode 1.1 Main, el benchmark que mide si un maintainer real aceptaría tu PR. Para que te hagas una idea: GPT-5.5 saca un 43,0% y Claude Opus 4.8 un 46,5%. La diferencia es mínima. Y el coste por tarea son 1,97 dólares.

He estado siguiendo a Cognition desde que lanzaron Devin en marzo de 2024. Aquel primer vídeo acumuló 30 millones de visualizaciones en X. Pero lo de hoy es otra cosa: han dado un salto de 4,5× respecto a SWE-1.6, que solo arañaba un 9,4% en el mismo benchmark. En seis meses han multiplicado por cuatro su rendimiento. No está mal.

Los números que importan

Vamos al grano. Esto es lo que saca SWE-1.7 frente a los pesos pesados:

ModeloFrontierCode 1.1Terminal-Bench 2.1SWE-Bench Multilingual
Claude Opus 4.846,5%86,9%84,4%
GPT-5.543,0%84,2%76,8%
SWE-1.742,3%81,5%77,8%
Opus 4.738,5%83,0%80,5%
Kimi K2.7 (base)30,1%72,7%73,5%
SWE-1.69,4%39,7%58,3%

El modelo base del que parte es Kimi K2.7 Code de Moonshot AI, un monstruo de 1 billón de parámetros (32B activos) con 256K de contexto. Lo interesante es que Kimi K2.7 ya había pasado por un RL post-entrenamiento bastante extenso. Que Cognition haya conseguido sacarle 12 puntos adicionales en FrontierCode con más RL pone en duda la idea del «techo de post-entrenamiento». Vamos, que el RL aún tiene mucho margen.

Qué hace bien y qué no tanto

SWE-1.7 está optimizado para tareas asíncronas de larga duración. El tipo de trabajo en el que lanzas una tarea, te vas a comer y vuelves con el PR hecho. Cognition lo entrenó directamente dentro del harness de Devin pensando en este caso de uso.

Donde más brilla es en investigación de bugs. Según el análisis de OfficeChai, SWE-1.7 es mucho más propenso que Kimi K2.7 a rastrear la causa raíz de un bug y considerar casos extremos, inputs adversarios y requisitos que van más allá de lo pedido.

La contrapartida: toca más archivos de la cuenta. Al razonar más, el blast radius crece. Escribe tests adicionales, modifica más ficheros de los estrictamente necesarios. Cognition lo reconoce como un tradeoff deliberado, no un bug. Y dice que el mismo patrón se repite en otros modelos frontera del sector.

El entrenamiento: tres continentes, entropía y auto-compactación

El blog técnico de Cognition es una mina. Cuatro cosas que me han llamado la atención:

1. Colapso de entropía. En entrenamientos largos con RL, el modelo deja de explorar y se estanca. La solución de Cognition fue top-p sampling: filtrar tokens de baja probabilidad que vienen de trayectorias que ya se fueron al garete. Simple, pero efectivo.

2. Sampling distribution replay. Para evitar el desajuste entre la política que entrena y la que genera rollouts (el clásico problema de RL asíncrono), graban qué tokens estaban disponibles en el momento del rollout y usan esas mismas restricciones en el entrenador.

3. Infraestructura en tres continentes. Entrenaron con clústeres repartidos por el mundo, enviando actualizaciones de pesos a través de object storage. Con tolerancia a fallos para que un hardware roto no parase la ejecución. No es sexy, pero es lo que permite escalar.

4. Auto-compactación para tareas de 6 horas. Como los rollouts pueden durar más que la ventana de contexto del modelo, SWE-1.7 aprende a resumir su propio estado y retomar desde el resumen. Esto permitió rollouts de hasta seis horas. Ya lo habían probado antes con un modelo llamado Kevin en tareas de kernel.

Corre en Cerebras a 1.000 TPS

SWE-1.7 ya está disponible en Devin Web, Desktop y CLI sobre hardware de Cerebras a 1.000 tokens por segundo. Para que te hagas una idea de lo que significa: la mayoría de APIs de modelos frontera andan entre 50-150 TPS. Mil tokens por segundo es velocidad de lectura humana multiplicada por diez.

Y lo mejor: $1,97 por tarea. Compáralo con los $8-10 que cuesta una tarea equivalente en Opus 4.8 o los $6-8 de GPT-5.5. Cognition está avanzando la curva de Pareto coste-rendimiento de forma bastante agresiva.

Mi opinión

Lo que me gusta de este lanzamiento no es solo el benchmark. Es que Cognition está demostrando que no necesitas ser OpenAI o Anthropic para competir en la frontera. Parten de un modelo open-source (Kimi K2.7), le meten RL con ingeniería sólida —no magia— y sacan algo que se codea con los grandes.

El hecho de que Kimi K2.7 ya tuviera RL y aun así Cognition le haya sacado 12 puntos más me dice que el RL está lejos de tocar techo. Si una startup puede hacer esto, imagina lo que están consiguiendo los laboratorios que no publican.

Eso sí, el tema del blast radius me preocupa un poco. Si el modelo toca más archivos de los necesarios, en un codebase grande puedes acabar con un PR de 40 ficheros cuando necesitabas tocar 3. En mi experiencia con Devin, esto ya pasaba con versiones anteriores. Habrá que ver si SWE-1.7 lo controla mejor o si el problema persiste.