Anthropic no ha publicado un benchmark directo entre Opus 5 y Sonnet 5. Cada post de lanzamiento compara su modelo con su predecesor y con Opus 4.8. Así que las cifras de abajo cuentan solo parte de la historia. El resto es el mismo juicio que harías con cualquier pareja Opus vs. Sonnet: cuánta capacidad máxima necesitas de verdad y cuánto estás dispuesto a pagar por ella.
\n¿Qué es Claude Opus 5?
\nOpus 5 es el modelo de gama alta de Anthropic, lanzado el 24 de julio de 2026, con un precio de 5 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida. Anthropic lo califica como estado del arte en Frontier-Bench y GDPval-AA, y cercano al modelo Fable 5 más grande a la mitad de precio. Es el modelo predeterminado en Claude Max y el más potente disponible en Claude Pro.
\nSu rasgo diferencial es la autoverificación: comprueba su propio trabajo, crea entornos de prueba cuando no hay un feed de datos y cuestiona instrucciones deficientes en lugar de acatarlas.
\n¿Qué es Claude Sonnet 5?
\nSonnet 5 es el modelo intermedio de Anthropic, lanzado el 30 de junio de 2026. Anthropic lo describe como su Sonnet más agente hasta la fecha, con un rendimiento cercano a Opus 4.8 a un precio inferior. Es el modelo predeterminado en los planes Free y Pro, y está disponible en Max, Team, Enterprise y la API.
\nPrecios: 2 $ por millón de tokens de entrada y 10 $ por millón de tokens de salida hasta el 31 de agosto de 2026; después, 3 $/15 $ estándar.
\nLa diferencia de nivel, en la práctica
\nEsto es lo que los posts de lanzamiento no explican tal cual, porque es cómo funciona en general la gama de modelos de Anthropic, no algo específico de esta pareja.
\nOpus es el modelo con mayor techo
\nRecurres a él cuando equivocarse sale caro, cuando una tarea es larga y autónoma sin supervisión intermedia, o cuando el problema es realmente novedoso y no una variación de algo que el modelo ya ha visto mil veces. Refactors profundos entre varios archivos, preguntas de investigación ambiguas, ejecuciones largas y agentivas donde los errores se acumulan: ese es territorio Opus. Pagas para que el modelo detecte sus propios fallos antes de que se conviertan en tu problema.
\nSonnet es el caballo de batalla
\nEstá diseñado para ser lo bastante rápido y barato como para funcionar de forma continua: asistentes de chat, clasificación a gran volumen, código iterativo donde tú revisas cada pocos pasos, aplicaciones sensibles a la latencia. Su techo de juicio es más bajo, pero en gran parte del trabajo real nunca llegas a tocarlo. El uso diario de la mayoría de equipos debería inclinarse hacia Sonnet, y recurrir a Opus de forma selectiva para las tareas que realmente lo necesiten.
\nEn concreto, Sonnet 5 es el intento de Anthropic de elevar ese techo más de lo habitual para un modelo de nivel medio —de ahí \"el Sonnet más agentivo hasta ahora\" y la afirmación de que se acerca a Opus 4.8 en algunas tareas. Ese es el contexto para leer los números de los benchmarks de abajo: Sonnet 5 no solo es barato; es barato y más cercano a la categoría Opus que los Sonnet anteriores.
\nLo que muestran realmente los números de lanzamiento
\nPrecio
\nLa diferencia más clara y menos ambigua. Sonnet 5 cuesta 2 $/10 $ (hasta el 31 de agosto) o 3 $/15 $ (estándar) frente a la tarifa plana de Opus 5 de 5 $/25 $: Sonnet 5 supone entre el 40% y el 60% del coste de Opus 5 según el periodo de precios.
\nAlineamiento
\nEl único punto donde ambos posts se nombran directamente. La auditoría automatizada de Anthropic encontró que Opus 5 \"se adhiere mejor a la Constitución de Claude que Opus 4.8, Sonnet 5 o Fable 5\" —un resultado explícito, no una inferencia. Opus 5 obtiene un 2,3 en esa auditoría, su puntuación más segura hasta la fecha. Sonnet 5 mejoró respecto a su predecesor (menos alucinación, menos servilismo, mejor resistencia a secuestros por prompt-injection), pero Anthropic señala que aún presenta una tasa de comportamiento desalineado superior a la de Opus 4.8.
\nCiberseguridad
\nAmbos modelos se mantuvieron sin entrenamiento ciber deliberado, pero el desempeño final difiere.
\nOpus 5 se acerca a Mythos 5 en la detección de vulnerabilidades, aunque queda por detrás a la hora de convertirlas en exploits. Sonnet 5 queda más atrás: Anthropic afirma directamente que Sonnet 5 tiene \"capacidades ciber sustancialmente peores que Opus 4.8 y Mythos 5\", y en una evaluación de desarrollo de exploits para Firefox no llegó a producir un exploit completamente funcional (0,0% de éxito, solo una ligera ventaja sobre Sonnet 4.6 en intentos parciales).
\nSi tu caso de uso toca algo cercano a ciberseguridad, esta brecha es real y favorece claramente a Opus 5.
\nProgramación y trabajo de conocimiento
\nAquí los dos posts usan conjuntos de benchmarks distintos, así que no hay un marcador limpio.
\nOpus 5 más que duplica a Opus 4.8 en Frontier-Bench v0.1 y queda a menos del 0,5% de Fable 5 en CursorBench 3.2 a la mitad de coste. Sonnet 5 se describe como cercano a Opus 4.8 en BrowseComp y OSWorld-Verified con alto esfuerzo.
\nLeído junto con la lógica de niveles anterior: Sonnet 5 se acerca en las tareas concretas que Anthropic ha destacado, pero las victorias de Opus 5 parecen más amplias y contundentes. Tómalo como orientativo, no como una medición cerrada.
\nCuándo elegir uno u otro
\nElige Opus 5 si
\nla tarea es crítica, de larga duración o realmente novedosa; trabajas en ciencias de la vida, química o trabajo agentivo complejo en múltiples pasos; necesitas el modelo más alineado disponible; hay algo relacionado con ciberseguridad en el alcance.
\nElige Sonnet 5 si
\nvas a ejecutar a gran escala, la latencia importa o la tarea está tan bien acotada que no necesitas el techo de juicio de Opus; usas Free o Pro, donde ya es el modelo predeterminado; el coste por token es tu restricción clave.
\nNinguno de los dos, si
\nnecesitas trabajo de ciberseguridad con menos limitaciones. Opus 5 retrocede automáticamente a Opus 4.8, y Sonnet 5 queda por detrás de Opus 4.8 directamente.
\nReflexiones finales
\nLa clave aquí es la misma que decide cualquier pregunta Opus vs. Sonnet: ¿esta tarea necesita el techo o basta con que se haga bien y a escala? Sonnet 5 eleva ese techo más que los Sonnet anteriores, que es la verdadera novedad de su lanzamiento. Pero donde Anthropic sí puso un número a ambos modelos —la auditoría de alineamiento—, Opus 5 salió por delante, y la historia de ciberseguridad apunta en la misma dirección. Usa Sonnet 5 por volumen; recurre a Opus 5 cuando no te puedes permitir una respuesta equivocada.

