Claude Sonnet 5: guía práctica del modelo más agente de Anthropic
Anthropic soltó Sonnet 5 el 30 de junio sin keynote ni fanfarria. Cuatro horas después del primer leak ya era el modelo por defecto en Free y Pro. Te enseño cómo usarlo en Claude Code, con Aider y desde la API, y cuándo compensa no usarlo.
En resumen
- Anthropic lanzó Sonnet 5 el 30 de junio. Te enseño a usarlo en Claude Code, con Aider y desde la API. Benchmarks, precios y 4 casos prácticos.
- Traducción práctica: si tu tarea es compleja y necesitas que salga bien a la primera, Opus 4.8 puede salirte más barato que repetir 3 veces con Sonnet 5.
- La clave está en que Aider aprovecha el mejor tool-use de Sonnet 5: lee archivos, los edita con parches precisos y ejecuta los tests sin despistarse.
🧩 Qué trae Sonnet 5 bajo el capó
Anthropic lo llama "el Sonnet más agente hasta la fecha". Y los números lo respaldan: 63,2% en SWE-Bench Pro, frente al 58,1% de Sonnet 4.6. En Terminal-Bench 2.1 saca un 80,4% — Sonnet 4.6 se quedaba en 67,0%. Opus 4.8 sigue arriba en coding agente puro (69,2%), pero la brecha pasó de 11 puntos a solo 6.
Lo más interesante: en pruebas de conocimiento general (Humanity's Last Exam sin herramientas), Sonnet 5 supera ligeramente a Opus 4.8, según la propia gráfica de Anthropic. Eso no lo esperaba nadie.
La ventana de contexto sigue en 1 millón de tokens. Lo que cambia es el tokenizer: Anthropic renovó el que venía usando desde Claude 3. El mismo prompt ahora gasta entre 1,0 y 1,35 veces más tokens que en Sonnet 4.6. No es un aumento trivial — si procesas documentos largos, la factura sube aunque el precio por token sea más bajo.
En seguridad: Anthropic activó por defecto los cyber safeguards porque Sonnet 5 es mejor en tareas de ciberseguridad. También reportan menos alucinaciones, menos adulación y mejor resistencia a prompt injection que Sonnet 4.6, según el análisis de seguridad publicado.
🧩 Caso 1: Claude Code con Sonnet 5 — coding agente desde el terminal
Lo primero que hice tras el lanzamiento fue cambiar el modelo en Claude Code. Se hace con un comando:
claude model set claude-sonnet-5
O directamente en una sesión:
claude --model claude-sonnet-5
El cambio más notable es que el pensamiento adaptativo viene activado por defecto, según documenta Apidog. Ya no tienes que pedirle explícitamente que razone. En tareas de varias herramientas — buscar en la codebase, leer archivos, editar y ejecutar tests — Sonnet 5 completa flujos que Sonnet 4.6 dejaba a medias.
Anthropic incluyó un caso con Zapier en el anuncio: un workflow de dos pasos (actualizar cuentas de Salesforce y enviar un email a clientes enterprise) que modelos Sonnet anteriores no terminaban. Sonnet 5 lo resolvió en una sola ejecución. Es un caso seleccionado por el vendor, no un benchmark controlado, pero el patrón coincide con lo que estoy viendo en mis pruebas.
Mi consejo: si trabajas con Claude Code a diario, migra ya. La mejora en seguimiento de instrucciones multi-paso compensa el leve aumento de tokens. Pero para tareas muy intensivas (>30 pasos de herramientas), Opus 4.8 sigue siendo más fiable.
🧩 Caso 2: Aider + Sonnet 5 — el combo para programar sin tocar el código
Aider ya soporta Sonnet 5 desde el día del lanzamiento. La configuración es directa si usas la API de Anthropic:
aider --model claude-sonnet-5 --api-key anthropic=TU_CLAVE
Si prefieres pasar por OpenRouter (más caro pero con fallback entre proveedores):
aider --model openrouter/anthropic/claude-sonnet-5
En pruebas con el benchmark SWE-Bench Lite, la combinación Aider + Sonnet 5 resolvió un 72,7% de los issues sin intervención humana, según los datos de CosmicJS. Sonnet 4.6 con Aider rondaba el 62,3%. Una mejora de 10 puntos porcentuales sin cambiar de herramienta, solo de modelo.
La clave está en que Aider aprovecha el mejor tool-use de Sonnet 5: lee archivos, los edita con parches precisos y ejecuta los tests sin despistarse. He notado que se equivoca menos en refactors grandes que impliquen 5 o 6 archivos a la vez.
🧩 Caso 3: API directa — cuándo usar Sonnet 5 y cuándo saltar a Opus 4.8
Los precios son el factor decisivo aquí. Precios de lanzamiento (hasta el 31 de agosto de 2026):
| Modelo | Input (por M tokens) | Output (por M tokens) |
|---|---|---|
| Sonnet 5 (intro) | $2 | $10 |
| Sonnet 5 (estándar, post-agosto) | $3 | $15 |
| Opus 4.8 | $15 | $75 |
| Sonnet 4.6 (anterior) | $3 | $15 |
Sonnet 5 cuesta un 40% de lo que vale Opus 4.8. Pero ojo: Anthropic publicó una gráfica de coste por tarea resuelta que muestra que, a partir de esfuerzo medio, Opus 4.8 entrega más precisión por dólar gastado, como señala el análisis de Kie.ai. La comunidad en Hacker News y Reddit lo llama la "inversión coste-tarea".
Traducción práctica: si tu tarea es compleja y necesitas que salga bien a la primera, Opus 4.8 puede salirte más barato que repetir 3 veces con Sonnet 5. Si es una tarea moderada, Sonnet 5 es imbatible en relación calidad/precio.
Endpoint de la API (igual que siempre, solo cambia el slug):
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":1024,"messages":[{"role":"user","content":"Explica qué es un transformer en 3 frases"}]}'
🧩 Caso 4: Prompt engineering con el nuevo tokenizer — lo que rompe y lo que mejora
El tokenizer nuevo es el cambio menos comentado y el que más te va a afectar en producción. Anthropic renovó el tokenizer que arrastraba desde Claude 3, según el análisis de MarkTechPost.
Lo que cambia en la práctica:
- El mismo prompt gasta entre 1,0x y 1,35x más tokens que en Sonnet 4.6
- Si procesas documentos de 50K-100K tokens, el incremento se nota en la factura
- El nuevo tokenizer es más eficiente con código y texto técnico, pero menos eficiente con lenguaje natural genérico
- Los mensajes de sistema largos ahora tokenizan de forma distinta — revisa tus system prompts
Mi recomendación: mide tus costes durante la primera semana. No asumas que pagarás lo mismo que con Sonnet 4.6. Si usas prompts de sistema muy elaborados (500+ tokens), haz una comparativa A/B con el contador de tokens de Anthropic.
🧩 ¿Merece la pena migrar ya?
Depende de lo que hagas:
- Claude Code a diario → Migra. El pensamiento adaptativo por defecto y el mejor tool-use se notan desde el minuto uno.
- Aider o Cline para coding → Migra. 10 puntos más en SWE-Bench Lite no es marginal.
- API con tareas moderadas → Migra ya, aprovecha el precio introductorio hasta agosto.
- API con tareas muy complejas → Quédate en Opus 4.8. La inversión coste-tarea es real.
- Procesamiento de documentos largos (>100K tokens) → Espera una semana, mide el impacto del tokenizer nuevo y decide.
Anthropic ha conseguido algo poco habitual: un modelo de gama media que compite con el tope de gama en varios frentes. No es Opus 4.8, pero cuesta un 40% y en conocimiento general incluso lo supera. Si tu carga de trabajo no requiere el 100% de precisión en coding agente avanzado, Sonnet 5 es ahora mismo el mejor modelo calidad/precio del mercado.
Sonnet 5 no es una revolución, es una iteración sólida que cierra la brecha con Opus. Anthropic ha puesto el foco donde más duele: coding agente, tool-use multi-paso y coste por tarea. Si usas modelos de IA a diario para programar, este es el salto que estabas esperando desde Sonnet 3.7.