Claude Sonnet 5: Anthropic da el golpe con su modelo más autónomo y barato
Sonnet 5 se acerca a Opus 4.8 en rendimiento pero cuesta la mitad. Desde el 1 de julio es el modelo por defecto para todos los usuarios de Claude.
En resumen
- Sonnet 5 se acerca a Opus 4.8 en rendimiento pero cuesta la mitad. Ya es el modelo por defecto para todos los usuarios de Claude.
- Lo más llamativo es que rinde casi como Opus 4.8 pero cuesta bastante menos. Anthropic lo ha colocado como modelo por defecto para los planes Free y Pro desde el 1 de julio.
- A mí personalmente me ha pillado trabajando con Claude Code y la diferencia en tareas encadenadas es palpable: donde antes se atascaba a mitad de un flujo, ahora termina.
Anthropic acaba de mover ficha. El 30 de junio lanzó Claude Sonnet 5, un modelo que redefine lo que se puede esperar de la gama media de la compañía. No es una evolución menor: es el Sonnet más agentivo hasta la fecha, capaz de hacer planes, manejar navegadores y terminales, y ejecutar tareas complejas de forma autónoma.
Lo más llamativo es que rinde casi como Opus 4.8 pero cuesta bastante menos. Anthropic lo ha colocado como modelo por defecto para los planes Free y Pro desde el 1 de julio. Millones de usuarios se encontraron con el cambio de la noche a la mañana, sin avisar. Y la verdad es que el salto se nota.
A mí personalmente me ha pillado trabajando con Claude Code y la diferencia en tareas encadenadas es palpable: donde antes se atascaba a mitad de un flujo, ahora termina. No es magia, pero se acerca.
Qué puede hacer Sonnet 5 que no hacía Sonnet 4.6
La palabra clave es agencia. Sonnet 5 no solo responde preguntas: actúa. Usa el navegador para buscar información actualizada, ejecuta comandos en terminal, comprueba sus propios resultados sin que se lo pidas. Según TechCrunch, los testers destacan que «termina tareas complejas donde versiones anteriores se paraban a medias» y que «revisa su propio output sin que se lo pidan explícitamente».
Un ejemplo concreto viene de Zapier. Daniel Shepard, ingeniero senior, contó que le pidieron a Sonnet 5 dos tareas encadenadas — actualizar tiers de Salesforce y mandar un anuncio a contactos enterprise — y «lo terminó de principio a fin. Eso antes se atascaba a la mitad. Para automatización del día a día, no hay discusión».
Esto no es un benchmark abstracto. Es el tipo de cosas que un desarrollador nota en su trabajo diario. Y es justo lo que Anthropic necesitaba demostrar tras varios meses en los que las mejoras agentivas más visibles venían solo de los modelos Opus.
Benchmarks: los números que importan
Los datos de Marktechpost y del System Card oficial son claros:
- SWE-bench Pro (programación agentiva): 63,2% — Opus 4.8 saca 69,2%, Sonnet 4.6 se quedaba en 58,1%.
- OSWorld-Verified (uso de ordenador): 81,2% — una mejora enorme respecto a Sonnet 4.6.
- HLE (razonamiento complejo): 57,4%.
- Trabajo de conocimiento: aquí Sonnet 5 supera ligeramente a Opus 4.8. Sí, has leído bien. Un modelo de gama media ganándole al flagship en conocimiento general.
La gráfica de coste-rendimiento que publicó Anthropic es reveladora: Sonnet 5 (línea naranja) domina en eficiencia a esfuerzo bajo y medio. A esfuerzo alto puede igualar a Opus 4.8 en algunas tareas, aunque a veces acaba costando más.
Precios: la guerra del token se calienta
Aquí viene lo bueno. Sonnet 5 tiene precio de lanzamiento hasta el 31 de agosto de 2026:
- $2 por millón de tokens de entrada, $10 por millón de tokens de salida
- Después sube a $3 / $15
Para ponerlo en contexto:
- Opus 4.8: $5 / $25
- GPT-5.5 (OpenAI): $3,75 / $15
- Gemini 3.1 Pro (Google): $2,50 / $10
- Haiku 4.5: $0,80 / $4
Sonnet 5 es más barato que Opus 4.8, GPT-5.5 y Gemini 3.1 Pro. Solo Gemini 3.5 Flash lo supera en precio, pero con bastante menos capacidad agentiva. La relación calidad-precio es, ahora mismo, la mejor del mercado en modelos con capacidad agentiva real.
Está disponible en todos los planes de Claude, en Claude Code y en la API con el ID claude-sonnet-5.
Seguridad: más seguro que 4.6, pero con matices
Anthropic ha sido transparente con las evaluaciones de seguridad. Sonnet 5 alucina menos que Sonnet 4.6, es menos adulador (syphophancy) y rechaza mejor las peticiones maliciosas. También resiste mejor los ataques de prompt injection.
En capacidades de ciberseguridad está muy por debajo de Opus 4.8 y Mythos 5. Anthropic no lo entrenó para tareas de seguridad ofensiva. En pruebas de exploits para Firefox, nunca consiguió desarrollar un exploit completo funcional, aunque sí mostró una tasa ligeramente mayor de éxitos parciales que Sonnet 4.6 — algo que la compañía atribuye a la mejora general de inteligencia, no a entrenamiento específico.
El punto débil: en auditorías automatizadas de comportamiento, Sonnet 5 mostró una tasa algo más alta de comportamientos desalineados que Opus 4.8 y Claude Mythos Preview. No es alarmante, pero es una diferencia que Anthropic reconoce abiertamente.
Fabian Hedin, cofundador de Lovable, lo resumió bien: «rechaza peticiones inseguras de forma limpia y consistente». Punto para Anthropic.
El contexto: todos quieren ser agentivos
Sonnet 5 no llega solo. OpenAI lanzó GPT-5.6 Sol en preview la semana pasada, también con foco en agentividad: permite dividir trabajo entre subagentes para tareas autónomas largas. Google ya había movido ficha en mayo con Gemini 3.5 Flash, pasando de chatbot conversacional a herramienta que planifica, construye e itera.
El mensaje es claro: la capacidad agentiva ya no es un diferenciador, es la línea base. Lo que diferencia ahora es quién lo hace más barato, más fiable y con menos supervisión humana. Y en ese tablero, Anthropic acaba de colocar una pieza muy fuerte.
Lo que yo he visto
He estado usando Sonnet 5 desde que salió en Claude Code para tareas de desarrollo web. La diferencia con 4.6 es real. Tareas que antes requerían tres o cuatro intervenciones mías ahora se completan en una. No es perfecto — a veces se emociona y hace más de lo que le pides — pero el salto en autonomía es el mayor que he visto entre dos versiones consecutivas de Sonnet.
Si estás usando Claude gratis, ya lo tienes sin hacer nada. Si usas la API, los precios de lanzamiento son una oportunidad para probarlo en flujos agentivos sin arruinarte. Y si estabas pagando Opus 4.8 para tareas que no requerían el 100% de precisión, probablemente Sonnet 5 te cubra el 90% de los casos por la mitad de precio.