Última actualización: 14 de julio de 2026
Claude Opus 5 se lanzó el 10 de julio, y los benchmarks cuentan una historia más matizada que los titulares. Pierde cinco evaluaciones, y el score de Opus 4.8 que un medio reporta no coincide con otro.
5 Derrotas: GPQA Diamond (vs Sonnet 5), ciertos benchmarks de matemáticas (vs GPT-5.6 Sol), multilingüe no inglés (vs GLM/Qwen), eficiencia de tokens (vs Fable 5), velocidad (vs Grok 4.5/Sonnet 5).
Dónde gana: Benchmarks de programación (nuevos récords), razonamiento de contexto largo, tareas agénticas, seguridad/alineación.
Confusión del score de Opus 4.8: Diferentes medios reportan scores diferentes — probablemente diferencias de nivel de esfuerzo.
Puerta de versión: En Claude Code, opus a veces aún apunta a 4.8. Usa claude-opus-5-20250710.
Costo: $15/$75 por millón de tokens como 4.8, pero mayor consumo por tarea. El costo por tarea sube.
Usa Opus 5 para: Programación compleja, contexto largo, agentes autónomos. Sonnet 5 para: Diario, science-QA. Grok 4.5 para: 70% rutina.
Para ayuda con selección de modelos: fiverr.com/s/EgxYmWD.
Trabajemos Juntos
- Fiverr: fiverr.com/s/EgxYmWD * Portfolio: mejba.me * Ramlit Limited: ramlit.com * ColorPark: colorpark.io * xCyberSecurity: xcybersecurity.io