Qué anunció Anthropic exactamente

El 24 de julio de 2026 Anthropic liberó Claude Opus 5 en su API, en Bedrock (AWS), Vertex AI (Google Cloud) y en Claude.ai directamente. La compañía lo describe como "un cambio de escalón para el tier Opus que potencia agentes de larga duración", con mejoras concretas en coding agéntico y trabajo profesional — los dos casos de uso que Anthropic viene priorizando desde el lanzamiento de Claude Code.

1MTokens de contexto (con prefijo CRIS)
us.Prefijo obligatorio cross-region
8Meses desde Opus 4.8

A diferencia de saltos anteriores donde Anthropic mezclaba mejoras parejas en todos los frentes, la comunicación oficial de Opus 5 es más quirúrgica: pone el foco en la capacidad de mantener coherencia y calidad de decisión a lo largo de sesiones de trabajo extendidas, no en ganar unos puntos de benchmark genérico.

Por qué "agentes de larga duración" es la frase clave

Los modelos Opus anteriores ya eran capaces de ejecutar tareas complejas, pero mostraban degradación de calidad a medida que una sesión de agente se extendía: el contexto se acumulaba, las decisiones tempranas quedaban "enterradas", y el modelo empezaba a repetir pasos o perder el objetivo original.

Opus 5 ataca directamente ese problema. En la práctica, esto se traduce en agentes que pueden ejecutar refactors de código de varias horas, pipelines de análisis de datos multi-etapa, o flujos de investigación con decenas de llamadas a herramientas — sin que un humano tenga que re-anclar el contexto cada 20 minutos.

Lo que esto no significa: Opus 5 no elimina la necesidad de checkpoints humanos en decisiones de alto riesgo (borrar datos, hacer deploys a producción, enviar comunicaciones a clientes). La mejora es de coherencia y persistencia de objetivo, no de autonomía sin supervisión.

Coding agéntico: la prioridad número uno

Anthropic sigue apostando fuerte a que el coding agéntico es el caso de uso que más valor genera hoy en empresas. Opus 5 muestra mejoras específicas en:

  • Refactors multi-archivo: mantiene coherencia de convenciones y patrones a través de decenas de archivos en un mismo cambio.
  • Debugging de sesión larga: menos "olvido" de hipótesis ya descartadas al investigar un bug complejo.
  • Uso de herramientas encadenadas: mejor planificación cuando una tarea requiere múltiples llamadas a MCP servers o tools externas en secuencia.

Para equipos que ya usan Claude Code en producción, la actualización es prácticamente transparente: el mismo flujo de trabajo, con menos intervenciones manuales para corregir el rumbo del agente.

Pricing y disponibilidad: lo que todavía no está confirmado

Al momento de este análisis, Anthropic no había publicado todavía el pricing oficial por token de Opus 5 en su documentación pública, y AWS tampoco lo había incorporado a su API de pricing. Los early adopters en Bedrock están operando con el mismo costo que Opus 4.8 como referencia hasta que se confirme el número real — una precaución razonable dado que Anthropic históricamente mantiene el tier Opus en la banda más cara de su catálogo.

Sí está confirmado: Opus 5 requiere el prefijo de Cross-Region Inference (us.) en Bedrock, igual que toda la familia Claude 2025+. Sin ese prefijo, las llamadas caen en throttling o directamente fallan con ValidationException — un detalle técnico que ya generó dolores de cabeza a varios equipos de infraestructura en el lanzamiento.

¿Vale la pena migrar ya?

Depende del perfil de uso. Si tu organización corre agentes que hoy se "pierden" en tareas largas — necesitan re-prompting frecuente, pierden el hilo en sesiones de más de 30-40 minutos, o repiten pasos ya completados — Opus 5 resuelve exactamente ese dolor y justifica probarlo de inmediato.

Si tu uso es mayormente conversacional o de tareas cortas, es probable que Sonnet 5 siga siendo la mejor relación costo-beneficio: Opus 5 está diseñado para el escenario específico de autonomía extendida, no para reemplazar al tier medio en el día a día.

Recomendación práctica: antes de migrar todo el tráfico, corré un piloto en el flujo agéntico más largo/costoso que tengas hoy (el que más se "descarrila"). Es ahí donde vas a ver la diferencia real, no en benchmarks genéricos.