Claude Opus 5: casi tan bueno como Fable 5, a mitad de precio
Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, el sucesor de Opus 4.8. Y aquí hay una sorpresa que vale la pena explicar bien: se esperaba que este modelo quedara claramente por debajo de Fable 5, el modelo insignia. En la práctica, en buena parte de los benchmarks publicados lo alcanza — y en varios lo supera — pero a la mitad del precio.
Eso tiene una consecuencia inmediata y muy concreta: Opus 5 ya es el modelo por defecto en Claude Max, el más potente disponible en Claude Pro, y el que vas a estar usando en Claude Code y en el resto del ecosistema de Anthropic sin que te queme los tokens al ritmo de Fable 5.
Vamos por partes.
El precio es la noticia, no el benchmark
Antes de entrar a las métricas, conviene entender de qué va realmente este lanzamiento, porque no es "el modelo más inteligente del mundo".
| Modelo | Entrada (por 1M tokens) | Salida (por 1M tokens) || | Claude Fable 5 | $10 | $50 | | Claude Opus 5 | $5 | $25 | | Claude Opus 4.8 | $5 | $25 |
Fíjate en la fila de abajo: el precio es idéntico al de Opus 4.8. No bajaron el costo del tier Opus; lo que hicieron fue meter mucho más rendimiento en el mismo precio. Si venías usando Opus 4.8, esto es una mejora gratuita. Si venías usando Fable 5 y te dolía la factura, ahora tienes algo que se le acerca bastante por la mitad.
Anthropic ni siquiera está reclamando la corona de "modelo más inteligente" — esa sigue siendo de Fable 5 y, en ciberseguridad, de Mythos 5. El argumento que están haciendo es otro, más aburrido y probablemente más importante: que la mayor parte del trabajo económicamente valioso con IA ocurre en una banda intermedia de dificultad, donde lo que importa no es el techo de capacidad sino cuánto cuesta cada tarea completada.
Es un desplazamiento de la competencia desde "quién tiene el modelo más potente" hacia "quién tiene el mejor costo por tarea resuelta". Y no es casualidad: es el cuarto modelo que Anthropic saca en menos de dos meses, después de Mythos 5, Fable 5 y Sonnet 5 en junio, en un mercado donde las empresas empezaron a pedir ROI antes de firmar el cheque.
Los números
Estos son los resultados que publicó Anthropic en su anuncio:
- Frontier-Bench v0.1: supera a todos los demás modelos y más que duplica el rendimiento de Opus 4.8, a menor costo por tarea.
- CursorBench 3.2 (a máximo effort): queda dentro del 0.5% del puntaje pico de Fable 5, a la mitad del costo por tarea.
- ARC-AGI 3 (resolución de problemas novedosos): su puntaje es tres veces el del siguiente mejor modelo.
- Zapier AutomationBench (tareas de negocio de principio a fin): ~1.5× la tasa de aprobación del siguiente mejor modelo al mismo costo. Incluso en su nivel de effort más bajo aprueba más tareas que cualquier otro modelo.
- OSWorld 2.0 (computer use): supera el mejor resultado de Fable 5 a poco más de un tercio del costo.
Si desarrollas software, las tres que te importan son Frontier-Bench, CursorBench y OSWorld. Ahí es donde este modelo está claramente enfocado.
Un punto de honestidad sobre los benchmarks: varias de estas cifras vienen de corridas internas de Anthropic, con su propio harness y con Opus 4.8 como fallback cuando los clasificadores de seguridad rechazaban una petición. No son mediciones independientes. La lectura razonable es "es un salto real y grande respecto a 4.8", no "queda demostrado que le gana a todo lo demás".
Y sobre los dominios donde no brilla: el desglose por área muestra que las ganancias no son parejas — la mejora está concentrada en código, agentes y computer use, no distribuida uniformemente en todas las profesiones. Vale la pena revisar los gráficos por dominio antes de asumir que es mejor que Fable 5 para tu caso específico. (Curiosamente, en el terreno legal, Harvey — la empresa de IA jurídica — sí reportó una mejora clara, así que ojo con generalizar desde un solo gráfico.)
La feature que casi nadie está comentando: el "effort" ajustable
Este es probablemente el cambio más importante del lanzamiento y el que menos titulares está generando.
Opus 5 trae un parámetro de effort configurable (low, medium, high, xhigh, max) que te deja intercambiar inteligencia por velocidad y ahorro de tokens. Los gráficos oficiales no muestran "rendimiento máximo" sino rendimiento a un costo dado, que es una forma bastante distinta de presentar un modelo.
Los testimonios de acceso anticipado van todos por la misma línea, y con números:
- Harvey (legal): rendimiento similar al de Opus 4.8 en modo de razonamiento máximo, generando 26% menos tokens en promedio.
- Fundamental Research Lab (modelado financiero): 9 puntos porcentuales más de precisión, con un tercio menos de turnos y llamadas a herramientas, y 60% menos tiempo.
- Lovable: 22% mejor que Opus 4.7 en sus tareas agénticas más difíciles, y con mucha menos varianza entre corridas.
- Box: 8% mejor que Opus 4.8 en general, con 11% en análisis de datos y 17% en due diligence.
- Una firma de trading reportó que llega a mejores respuestas usando aproximadamente un séptimo de los tokens de razonamiento y menos de la mitad de la latencia de Opus 4.8.
Léelo con calma: son clientes de acceso anticipado, es decir, testimonios curados por Anthropic. Pero el patrón es consistente y apunta a algo específico — la mejora no es solo "más inteligente", es "llega al mismo lugar gastando menos".
Dicho sin diplomacia: el "effort" ajustable es la industria admitiendo que llevábamos meses pagando razonamiento largo que no siempre lo valía.
Qué mejoró en la práctica
Más allá de las tablas, hay tres ejemplos del anuncio que ilustran mejor el cambio de comportamiento:
1. Se construyó sus propias herramientas. En una tarea de Frontier-Bench le dieron el dibujo de una pieza mecánica y le pidieron escribir código para reconstruirla como modelo 3D en FreeCAD — pero deliberadamente sin darle forma de ver el dibujo. Opus 5 escribió su propio pipeline de visión por computadora para extraer la geometría desde los píxeles crudos y reconstruyó la pieza completa. Lo logró de forma repetida; ningún modelo competidor lo resolvió en cinco intentos.
2. Encontró la causa raíz, no el síntoma. Ante un bug real en un gestor de paquetes open source popular, Opus 5 identificó la causa raíz y arregló un caso borde que el parche de la comunidad había pasado por alto. Un modelo competidor arregló solo el síntoma superficial y reportó el bug como resuelto.
3. Se verifica a sí mismo. Un ingeniero de una firma de trading construyó un feed de datos de mercado para un exchange nuevo en una sola sesión. Al no encontrar un feed en vivo contra el cual validar, Opus 5 construyó su propio arnés de pruebas.
Ese es el hilo común: verificación y persistencia. Menos "aquí está tu código, suerte" y más "revisé esto, encontré un problema, lo corregí".
Salidas visuales. También mejoró notablemente en gráficos, animaciones y visualizaciones — Anthropic publicó demos de un túnel de viento interactivo y una ilustración de una célula. Si generas artifacts, dashboards o material educativo, es de las diferencias que se notan de inmediato.
Seguridad: por qué este modelo no te lo van a quitar
Aquí está la parte técnicamente más interesante, y la razón por la que probablemente no veamos con Opus 5 el tipo de restricción o suspensión que afectó a otros lanzamientos recientes.
Anthropic dice que es su modelo más alineado hasta la fecha: puntúa 2.3 en su auditoría automatizada de comportamiento desalineado, el más bajo de sus modelos recientes. Menor tasa de comportamiento engañoso, y el menos susceptible a ser engañado para usos indebidos.
La decisión clave: deliberadamente no entrenaron a Opus 5 en tareas de ciberseguridad. Aun así mejoró bastante encontrando vulnerabilidades, casi al nivel de Mythos 5, simplemente por ser más capaz en general. Pero queda muy por detrás en explotarlas — es decir, en convertir una vulnerabilidad en una amenaza real. En la evaluación OSS-Fuzz esa brecha se ve clarísima: casi empatados en identificación, muy separados en desarrollo de exploits.
Consecuencias prácticas:
- Los clasificadores de ciberseguridad intervienen ~85% menos que en Fable 5. Permiten buscar vulnerabilidades en código fuente, pero bloquean escaneo basado en binarios, pentesting y generación de exploits.
- En Claude.ai, Claude Code y Claude Cowork, las peticiones marcadas hacen fallback automático a Opus 4.8.
- Quienes están en el Cyber Verification Program tienen acceso a una versión con menos restricciones.
- En biología usa salvaguardas similares a Opus 4.8, lo que lo convierte en el modelo más capaz de acceso general para investigación científica. Las peticiones de biología bloqueadas en Fable 5 ahora se enrutan a Opus 5.
En resumen: Mythos 5 sigue siendo el modelo especializado para trabajo serio de ciberseguridad y biología de largo horizonte. Opus 5 es el modelo para todos los demás — y en mi opinión, es más o menos lo que Fable 5 debió haber sido para el público general.
Detalles para desarrolladores
- String del modelo:
claude-opus-5 - Fast mode: corre ~2.5× la velocidad por defecto, al doble del precio base. Disponible en la Claude Platform y vía créditos de uso en Claude Code.
- Cambio de herramientas a mitad de conversación (beta): puedes cambiar qué tools tiene disponibles Claude sin invalidar el prompt cache. Para quien construye agentes de larga duración, esto ahorra dinero real.
- Fallbacks automáticos en la API (beta): las peticiones marcadas por los clasificadores en Opus 5 o Fable 5 pueden enrutarse automáticamente a otro modelo en lugar de ser bloqueadas.
- Sin requisitos de retención de datos en acceso general, igual que los Opus anteriores.
Entonces, ¿lo usas o no?
Guía rápida:
- Venías con Opus 4.8 → actualiza sin pensarlo. Mismo precio, bastante más capacidad.
- Venías con Fable 5 por costo → prueba Opus 5 a max effort. En código y agentes vas a notar poco la diferencia y la factura se parte por la mitad.
- Trabajas en ciberseguridad ofensiva o biología de largo horizonte → sigues necesitando Mythos 5.
- Construyes agentes que corren horas → aquí es donde el effort ajustable y el cache de herramientas cambian tu economía por completo. Empieza en effort bajo y sube solo donde midas que hace falta.
Y un consejo general: no asumas que "max effort" es siempre la respuesta correcta. La lección de este lanzamiento es justamente la contraria.
Si quieres profundizar, el anuncio oficial está en anthropic.com/news/claude-opus-5 y hay una guía de prompting específica para Opus 5 en la documentación de la Claude Platform. En los próximos videos voy a mostrar ejemplos prácticos usándolo. Cualquier duda o sugerencia, déjala en los comentarios.