Reseña Claude Sonnet 5: potencia Opus a mitad de precio
La versión corta
Claude Sonnet 5 salió el 30 de junio de 2026. En una frase: es el primer Sonnet que te hace cuestionar si realmente necesitas Opus.
Tras ejecutar benchmarks y tareas reales, la tasa de finalización de tareas agénticas de Sonnet 5 está a distancia de golpe de Opus 4.8 — y en algunos casos lo iguala. Al 40% del costo.
Si sigues en Sonnet 4.6, actualizar es obvio. Si estás debatiendo si pagar por Opus, Sonnet 5 podría ahorrarte el gasto.
Qué cambió realmente
De “puede empezar” a “puede terminar”
Los modelos Sonnet anteriores tenían un problema conocido: abandonaban las tareas a medio camino. Le pedías refactorizar un módulo de 5 archivos y terminaba 3 antes de “resumir” y esperar otro prompt.
Sonnet 5 resuelve esto en gran medida. Los socios con acceso anticipado reportaron lo mismo de forma consistente — tareas que antes se estancaban ahora se ejecutan hasta el final.
Un ejemplo concreto: un ingeniero le pidió a Sonnet 5 investigar un bug. Sin indicación adicional, escribió un test que reproducía el error, implementó la corrección, guardó temporalmente el fix para confirmar que el bug regresaba, luego restauró el fix y lo commiteó. Un solo paso, sin intervención humana.
Ese tipo de comportamiento de auto-verificación estaba esencialmente ausente en Sonnet 4.6.
El rendimiento en programación sube de categoría
Los números oficiales del lanzamiento de Anthropic:
| Benchmark | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Verified | 65.3% | 72.1% | 75.6% |
| Terminal-bench | 43.2% | 55.7% | 59.1% |
| Humanity’s Last Exam (tools) | 46.8% | 58.3% | 66.1% |
| OSWorld-Verified | 78.5% | 88.2% | 91.4% |
| BrowseComp | 39.0% | 55.8% | 60.5% |
Puntos clave:
- SWE-bench Verified saltó de 65.3% a 72.1%, acercándose al 75.6% de Opus 4.8. La diferencia ya es de un solo dígito.
- BrowseComp (búsqueda agéntica) tuvo la mayor mejora — de 39% a 55.8%, casi 1.5x de mejora.
- OSWorld-Verified alcanzó 88.2%, demostrando que Sonnet 5 ya está maduro para automatización de navegador y tareas de escritorio.
Capacidad agéntica: el verdadero argumento de venta
Sonnet 5 se posiciona como “el Sonnet más agéntico hasta la fecha.” No es humo — hay cambios de verdad detrás.
El modelo ahora maneja:
- Planificación en múltiples pasos con ejecución secuencial
- Selección correcta de herramientas (navegador, terminal, APIs) con estrategias de respaldo ante fallos
- Coherencia de contexto sostenida en tareas largas sin “olvidar” el objetivo
- Verificación proactiva de resultados sin que se lo pidan
Anthropic proporciona curvas de costo-rendimiento a distintos niveles de esfuerzo. En resumen:
- Con esfuerzo medio, Sonnet 5 ofrece mucho mejor relación calidad-precio que Sonnet 4.6 y Opus 4.8
- Con esfuerzo alto, Sonnet 5 iguala a Opus 4.8 en ciertas tareas
- Esto se controla mediante el parámetro
effortde la API — usa esfuerzo bajo para tareas simples y ahorra dinero, súbelo para trabajos complejos
Esto significa que un solo modelo cubre todo, desde consultas casuales hasta ejecución agéntica compleja, sin cambiar entre modelos.
Precios: la ventana de lanzamiento importa
| Introductorio (hasta 31 ago) | Estándar | Opus 4.8 | |
|---|---|---|---|
| Input (por 1M tokens) | $2 | $3 | $5 |
| Output (por 1M tokens) | $10 | $15 | $25 |
Detalles importantes:
- El precio introductorio vence el 31 de agosto — aproximadamente el 67% del precio estándar. Si planeas migrar, empieza a probar ahora.
- Sonnet 5 usa un nuevo tokenizador que consume ~1.0-1.35x más tokens para el mismo texto. El precio introductorio está diseñado para que esta transición sea aproximadamente neutra en costos.
- Combinado con caché de prompts (hasta 90% de ahorro) y procesamiento por lotes (50% de ahorro), los costos reales pueden bajar significativamente.
Comparado con Opus 4.8, el precio estándar de Sonnet 5 es un 60% en input y output. Dado que la diferencia de rendimiento se redujo a porcentajes de un solo dígito, Sonnet 5 ofrece mejor ROI para la mayoría de cargas de trabajo.
Seguridad: mejoras medibles respecto a versiones anteriores
Esto no es relleno — hay datos que lo respaldan:
- Menor tasa de alucinación que Sonnet 4.6
- Menor tendencia a darte la razón solo por complacerte que Sonnet 4.6 — no inventa respuestas para quedar bien
- Mejor seguridad agéntica — más capacidad para rechazar solicitudes maliciosas y resistir inyección de prompts
- Puntuación general de alineación superior a Sonnet 4.6, aunque ligeramente por debajo de Opus 4.8
Un dato a tener en cuenta: Sonnet 5 viene con protecciones cibernéticas activadas por defecto, igual que Opus 4.7 y 4.8. No te ayudará a escribir código de exploit. Si tienes necesidades legítimas de pruebas de seguridad, tendrás que aplicar a través del Cyber Verification Program de Anthropic o usar Opus 4.8.
Quién debería actualizar
Actualiza ahora
- Equipos usando Sonnet 4.6 para agentes/automatización: La mejora en finalización de tareas de múltiples pasos es decisiva.
- Desarrolladores individuales usando Claude Code: Sonnet 5 ya es el modelo por defecto en planes Free y Pro — puede que ya lo estés usando.
- Cualquiera considerando Opus pero dudando por el precio: Prueba Sonnet 5 con esfuerzo alto primero. Podría ser suficiente.
Espera y evalúa
- Equipos ya en Opus 4.8 y satisfechos: Opus aún lidera en profundidad de razonamiento y las tareas más difíciles. No hay razón para bajar de categoría.
- Flujos de trabajo de pruebas de ciberseguridad: Las protecciones de Sonnet 5 son restrictivas. Opus 4.8 es más adecuado.
No necesitas hacer nada
- Usuarios de chat casual / tareas ligeras: Sonnet 4.6 o incluso Haiku ya te cubren.
Dónde usarlo
Sonnet 5 está disponible ampliamente:
- Claude.ai — Web, iOS, Android. Modelo por defecto para usuarios Free y Pro
- Claude Code — Herramienta de desarrollo CLI
- API — Nombre del modelo:
claude-sonnet-5 - Plataformas cloud — AWS (Amazon Bedrock), Google Cloud (Vertex AI), Microsoft Foundry
Cómo se compara con la competencia
El panorama de modelos de IA a mediados de 2026 está saturado. Así se posiciona Sonnet 5:
| Model | Position | Input $/1M | Output $/1M | Agentic Strength |
|---|---|---|---|---|
| Claude Sonnet 5 | Mid-high versatile | $2-3 | $10-15 | Strong |
| Claude Opus 4.8 | Flagship reasoning | $5 | $25 | Strongest |
| GPT-5.5 | Flagship coding | $5 | $30 | Strong |
| DeepSeek V4 Pro | Budget reasoning | $0.44 | $0.87 | Medium |
| GLM-5.2 | Bilingual coding | $0.93 | $3 | Medium |
La posición de Sonnet 5 es clara: no es el más barato ni el más potente, pero ofrece el mejor equilibrio entre “suficientemente bueno” y “asequible.” Para equipos que necesitan capacidad agéntica confiable sin pagar precios de modelo insignia, Sonnet 5 es una de las opciones más sensatas a mediados de 2026.
Conclusión
La cadencia de lanzamientos de Anthropic sigue acelerándose — Sonnet 3.5, 3.6, 3.7, 4, 4.5, 4.6, ahora 5. El salto en número de versión señala que no es una iteración menor.
La narrativa central de Sonnet 5 es la “democratización agéntica.” Tareas autónomas de múltiples pasos que antes requerían modelos de clase Opus ahora funcionan al precio de Sonnet. Esto tiene implicaciones reales en la estructura de costos del desarrollo de aplicaciones con IA.
El precio introductorio está vigente hasta el 31 de agosto. Si estás construyendo cualquier tipo de agente de IA, empieza a probar tu migración ahora.