
Claude Opus 5.2 vs Claude Opus 5: qué probar primero
La decisión de un vistazo
| Pregunta | Claude Opus 5 | "Claude Opus 5.2" | Qué hacer ahora |
|---|---|---|---|
| ¿Tiene nombre oficial? | Sí, lanzado el 24 de julio de 2026 | No; es una etiqueta de la comunidad | Trátalo como algo que vigilar, no como parte de tu hoja de ruta |
| ¿Hay un ID de API documentado? | claude-opus-5 | Ninguno encontrado en la documentación de Anthropic, en las listas de los SDK ni en las versiones de Claude Code | No pongas en la configuración un ID adivinado |
| ¿Precio y límites documentados? | $5 / $25 por MTok; 1M de contexto; 128K de salida | Desconocidos | Presupuesta contra Opus 5 |
| ¿Puedes hacer hoy pruebas emparejadas? | Sí, a través de canales documentados | No hay candidato invocable | Congela ya la referencia y el conjunto de replay |
| ¿Qué reportan los usuarios? | "Perezoso", le da demasiadas vueltas, necesita un "continúa" en tareas largas | "Way faster" (mucho más rápido), salida limpia, "not lazy" (solo en Claude Code) | Convierte cada reporte en una prueba medible |
| ¿Respaldo si llegas a cambiar? | Listado como activo, con retirada "not sooner than July 24, 2027" (no antes del 24 de julio de 2027) en las plataformas operadas por Anthropic | No aplica | Verifica la ruta concreta de EvoLink a la que volverías |
No hay ganador porque solo una columna es un producto documentado. El resultado útil de esta comparativa es la evidencia que un sucesor tiene que aportar.
Claude Opus 5.2 vs Opus 5: diferencias conocidas e incógnitas
La descripción general de modelos, la página de precios, las notas de versión de Anthropic y el changelog de Claude Code documentan Claude Opus 5 y nada más reciente en la línea Opus. Desde el 14 de septiembre, varias cuentas de X reportan que Claude Code enruta parte de las solicitudes de Opus 5 hacia una versión más nueva. Ninguna publicación incluye un identificador ni un registro de solicitud, los reportes no coinciden en qué apps y qué planes están afectados, y Anthropic no ha comentado nada.
- el "
claude-opus-5-2.yamlde Foundry" es una entrada de un registro comunitario cuyos valores son iguales a los de Opus 5; - "cinco niveles de esfuerzo, incluidos xhigh y max" es la escala que Opus 5 ya tiene documentada hoy;
- en agosto se rumoreó un "Opus 5.1" que nunca se lanzó con ese nombre;
- preguntarle al modelo quién es "Tibo" lee texto generado, no la identidad del modelo.
Qué reportan los usuarios y qué contaría como evidencia
| Reporte de la comunidad (Claude Code, 14–17 de septiembre) | La queja sobre Opus 5 a la que responde | Qué contaría como evidencia |
|---|---|---|
| "way faster" / le da menos vueltas | Pensamiento largo antes de producir la salida con esfuerzo high y xhigh | Mismo conjunto de tareas, mismo nivel de esfuerzo: tiempo real y tokens de salida por tarea aceptada, durante varios días |
| "not lazy", le gustan las tareas más largas | Pararse a mitad de tarea y pedirle al usuario que continúe | Empujones del usuario por tarea larga completada; tasa de finalización sin intervención |
| "really clean output" (salida muy limpia; X); código menos inflado o sobredimensionado (un hilo de Reddit que solo pudimos leer de segunda mano) | Implementaciones sobredimensionadas o verbosas | Tamaño del diff frente al alcance pedido; ediciones del revisor por cambio aceptado |
| Mejor en tareas visuales y 3D y "getting close to Astra-level" (acercándose al nivel de Astra), aunque el mismo usuario sigue poniendo a Astra por delante | Trabajo visual y espacial más flojo | Tareas visuales emparejadas con una rúbrica fija, si esa carga de trabajo te importa |
| Un usuario de un foro contó que lo tuvo una noche y que después lo volvió a perder | No es una queja; es una advertencia | Cualquier mejora tiene que mantenerse entre días y entre versiones del CLI antes de ser una referencia |
Qué mejora justifica un cambio, tarea por tarea
"Mejor" significa cosas distintas según la carga de trabajo. Decide por clase de tarea qué mides primero y qué tamaño de mejora justificaría el trabajo de migración. Los umbrales son tuyos; la tabla solo dice dónde mirar.
| Clase de tarea | Mide primero | Vigila también | Una mejora por la que merece la pena cambiar |
|---|---|---|---|
| Preguntas y respuestas interactivas y chat | p50 y p95 del tiempo hasta la primera respuesta útil | Tasa de aceptación, tokens de salida | La latencia pasa de "los usuarios la notan" a "los usuarios no la notan", sin que baje la aceptación |
| Programación a escala de repositorio | Tasa de tests superados en los cambios aceptados | Tamaño del diff frente al alcance pedido; tiempo de edición del revisor | Más cambios pasan los tests al primer intento, y los diffs se quedan dentro de los archivos pedidos |
| Agentes de larga duración | Tasa de finalización sin intervención humana | Empujones por tarea, recuperación de errores de herramientas, tokens totales por tarea completada | Las tareas que necesitaban un "continúa" o un rescate ahora terminan solas, sin que se disparen los tokens |
| Extracción estructurada | Tasa de éxito del parseo o de la validación del esquema | Número de reintentos, coste por registro válido | Menos salidas inválidas con un coste por registro válido igual o menor |
| Trabajo documental por lotes | Coste por documento aceptado | Rendimiento dentro de la ventana del lote, tasa de aciertos de caché | Menor coste por documento aceptado cumpliendo igualmente el plazo |
Si una clase de tarea no tiene hoy ningún problema medible con Opus 5, no tiene motivo para moverse, saque el modelo nuevo la puntuación que saque en otros sitios.
Lo que Claude Opus 5 ya ofrece
Opus 5 es el lado medible de esta comparativa:
- ID de modelo de la API
claude-opus-5, un snapshot fijo sin fecha; - $5 de entrada y $25 de salida por millón de tokens; escrituras de caché a $6.25 (5 minutos) y $10 (1 hora); lecturas de caché a $0.50; batch a mitad de precio; modo rápido en research preview a $10 / $50, solo en la API de Claude;
- contexto de 1M de tokens sin variante más pequeña; 128K de salida máxima;
- pensamiento adaptativo activado por defecto; esfuerzo low, medium, high (predeterminado), xhigh y max; el pensamiento solo se puede desactivar en high o inferior;
- los tokens de pensamiento se facturan como tokens de salida y cuentan para
max_tokens.
Qué cambiaron los lanzamientos anteriores de Opus, ordenado por impacto
No todos los cambios de un lanzamiento rompen una integración. Separar los tres tipos te dice qué tienes que volver a probar.
| Lanzamiento | Fecha | Cambio incompatible documentado | Cambio de coste o de comportamiento | Capacidad nueva |
|---|---|---|---|---|
| Opus 4.6 | 5 feb 2026 | — | Se introduce el pensamiento adaptativo | 1M de contexto; 128K de salida; compactación de contexto |
| Opus 4.7 | 16 abr 2026 | Los valores no predeterminados de temperature, top_p y top_k devuelven un 400 | Tokenizador nuevo: el mismo texto cuenta como más tokens | Esfuerzo xhigh; visión de mayor resolución |
| Opus 4.8 | 28 may 2026 | — | — | Modo rápido; mejoras agénticas y de razonamiento |
| Opus 5 | 24 jul 2026 | Pensamiento activado por defecto; desactivar el pensamiento en xhigh o max devuelve un 400 | Los tokens de pensamiento facturados como salida elevan el volumen de salida a las mismas tarifas; respuestas predeterminadas más largas | Mínimo de caché de 512 tokens; cambios de herramientas a mitad de conversación (beta) |
Comprobaciones de compatibilidad antes de cualquier cambio
| Superficie | Qué comprobar | Por qué |
|---|---|---|
| Identificador del modelo | El ID está documentado por Anthropic o por el canal de nube que usas; Bedrock y Google Cloud tienen sus propios formatos | Una cadena adivinada puede fallar o ser convertida por un proxy en alias de un modelo que no tiene nada que ver |
| Pensamiento y esfuerzo | Vuelve a ejecutar tu matriz de esfuerzo; prueba la vía de desactivación y el comportamiento del 400 | Opus 5 cambió ambas cosas; los valores predeterminados pueden volver a moverse |
| Recuento de tokens | Vuelve a medir los tokens de entrada, de salida y de caché por tarea | Los cambios de tokenizador y de pensamiento alteran la factura con un precio de lista que no cambia |
| Parámetros de muestreo | Busca con grep en la configuración los parámetros que el modelo rechaza | 4.7 convirtió en errores los valores de muestreo no predeterminados |
| Salida estructurada y herramientas | Repite los parsers y la validación de esquemas; inyecta fallos de herramientas | Las notas de Anthropic sobre Opus 5 dicen que el código que lee content[0].text debe seleccionar los bloques por type, porque una respuesta puede empezar con bloques de pensamiento |
| Respaldo | Registra cuándo un respaldo atendió la solicitud y conviértelo en una rama explícita del experimento | Los resultados con modelos mezclados contaminan la comparativa |
Sobre la identidad: registrar el campo de modelo devuelto, el ID de solicitud, el uso y la factura es necesario, y no es una prueba independiente de los pesos que hay debajo, porque cada uno de esos campos lo aporta un servidor o un proxy. Lo que sí puedes establecer es la coherencia entre el mapeo de ID documentado, los metadatos devueltos, los registros upstream de confianza y la facturación. Con eso basta para que una sustitución sea rastreable, que es el objetivo práctico.
La evaluación emparejada
1. Congela la referencia de Opus 5
Registra prompts, herramientas, nivel de esfuerzo, estado del contexto, tasa de tareas aceptadas, tiempo real, tokens de entrada y de salida, uso de caché, reintentos, tiempo del revisor y casos de fallo conocidos. Incluye las sesiones en las que Opus 5 te pidió "continuar" o sobredimensionó un cambio; eso es justo lo que afirman los reportes, y necesitas las cifras de antes.
2. Construye tres grupos de replay
- tareas que sabes que salen bien, para detectar regresiones;
- fallos conocidos de Opus 5 (pereza, verbosidad, darle demasiadas vueltas), para medir el valor de reemplazo;
- tareas frontera que hoy necesitan a una persona o una ruta distinta.

3. Añade el candidato solo cuando sea una ruta documentada y coherente
Un candidato entra en el harness cuando su ID lo publica Anthropic o tu canal de nube, una solicitud autenticada funciona, los metadatos devueltos coinciden con el mapeo documentado y el uso concilia con el precio publicado. A partir de ahí, usa los mismos prompts, herramientas, timeouts, política de esfuerzo, reglas de reintento y revisores que en la referencia.
Un ejemplo de coste resuelto
La cifra que decide un cambio no es el gasto total. Es lo que pagas por cada tarea que supera la aceptación:
Coste de API por tarea aceptada = gasto total de API del grupo de evaluación ÷ tareas que superaron la aceptaciónEn el numerador va todo lo que consumió el grupo: intentos fallidos, reintentos y llamadas de respaldo incluidos. Cuenta las escrituras y las lecturas de caché tal como se facturan de verdad. Los tokens de pensamiento ya se facturan como tokens de salida, así que no los sumes una segunda vez. Deja el tiempo de revisión humana en su propia columna en lugar de convertirlo en dólares de API.
| Grupo de referencia | Grupo candidato | |
|---|---|---|
| Tareas intentadas | 100 | 100 |
| Gasto total de API, incluidos fallos y reintentos | $12.00 | $14.00 |
| Tareas que superaron la aceptación | 80 | 95 |
| Coste de API por tarea aceptada | $12.00 ÷ 80 = $0.150 | $14.00 ÷ 95 = $0.147 |
| Tareas que una persona todavía tiene que corregir o rehacer | 20 | 5 |
El grupo candidato gastó $2.00 más y aun así sale algo más barato por tarea aceptada, porque una parte mayor de su gasto produjo trabajo aprovechable. El efecto más grande está en la última fila: quince tareas menos vuelven a manos de una persona. El caso contrario es igual de real. Si el candidato hubiera gastado $16.00 para 85 tareas aprobadas, su coste por tarea aceptada sería de $0.188, y la calidad extra tendría que justificar un coste unitario un 25% más alto. Haz la división antes de leer las cifras de titular.
Un registro de aceptación que puedes rellenar
Las puertas vagas como "sustancialmente mejor" o "la latencia se mantiene" no se pueden comprobar. Escribe el umbral antes de la ejecución, a partir del requisito de negocio de esa clase de tarea, y luego anota lo que pasó. Copia esta tabla una vez por clase de tarea.
| Campo | Tu umbral (fijado antes de la ejecución) | Resultado de la referencia | Resultado del candidato | ¿Cumple? |
|---|---|---|---|---|
| Clase de tarea y grupo de replay | — | |||
| Tamaño de la muestra (tareas intentadas) | mínimo: ____ | |||
| Tasa de aprobación (aprobadas ÷ intentadas) | al menos ____ % y no inferior a la referencia en el grupo de tareas que sabes que salen bien | |||
| Latencia p95 | como máximo ____ s | |||
| Coste de API por tarea aceptada | como máximo $ ____ | |||
| Reintentos y llamadas de respaldo por cada 100 tareas | como máximo ____ | |||
| Tiempo de corrección humana por tarea aceptada | como máximo ____ min | |||
| Empujones por tarea larga (solo agentes) | como máximo ____ | |||
| Coherencia durante ____ días | ningún umbral incumplido en ningún día |
Cambia tarea por tarea y prueba el camino de vuelta
El resultado realista es una política de enrutamiento, no un cambio global. Mueve las clases de tarea que superaron su registro, en el orden de la matriz de arriba, y deja el resto en Opus 5.

claude-opus-5 como activo, con retirada "not sooner than July 24, 2027" (no antes del 24 de julio de 2027), y dice que sus fechas se aplican a las plataformas operadas por Anthropic (la API de Claude, Claude Platform en AWS y Microsoft Foundry), mientras que Amazon Bedrock y Google Cloud fijan sus propios calendarios. Eso es una ventana de evaluación. No garantiza la capacidad, los permisos ni el estado de la ruta concreta a la que volverías. Antes de cualquier canary, envía tráfico real por la ruta de respaldo de Opus 5 que piensas usar, confirma la cuota y los permisos, y ensaya el cambio de configuración que devuelve el tráfico a ella.Mantén Opus 5 donde ya cumple tus objetivos de tasa de aprobación, latencia y coste, donde una migración no tiene una ventaja medida o donde tus registros todavía no pueden separar las llamadas primarias de las de respaldo. Esperar no es pasivo mientras recoges referencias; solo se vuelve pasivo cuando bloqueas una entrega por un modelo que no se ha anunciado.
La API unificada de EvoLink mantiene la elección del modelo en la configuración de enrutamiento y no en el código de la aplicación, lo que hace que añadir un aspirante salga barato y quitarlo también. Nada de este plan requiere que exista hoy una ruta de Opus 5.2.
Revisa la ruta actual de Claude Opus 5 Recibe la alerta de lanzamiento de la API de Claude Opus 5.2FAQ
¿Se ha anunciado Claude Opus 5.2?
A 18 de septiembre de 2026 no encontramos ninguna mención en el catálogo de modelos de Anthropic, en las notas de versión, en la página de precios ni en la sala de prensa. El Opus más reciente es Claude Opus 5.
¿Claude Opus 5.2 es mejor que Claude Opus 5?
No existe una comparativa basada en evidencia, porque no existe un Opus 5.2 documentado e invocable. Los reportes de la comunidad describen una salida más rápida y menos perezosa dentro de Claude Code, sin identificador de modelo y sin mediciones.
¿Qué dicen los usuarios que corrige Opus 5.2?
La velocidad, el darle demasiadas vueltas, la pereza en tareas largas y el código verboso o sobredimensionado. Son las categorías correctas para un conjunto de replay, y son afirmaciones, no resultados.
¿Cómo comparo el coste de forma justa?
Divide el gasto total de API del grupo de evaluación, incluidos fallos y reintentos, entre el número de tareas que superaron la aceptación. Compara esa cifra, no el gasto total ni el precio de lista, y reporta aparte el tiempo de corrección humana.
¿Un Opus más nuevo agotará más rápido mi cuota o mi presupuesto?
No se sabe hasta que se pueda medir. Algunos usuarios ya reportan un consumo mayor con Opus 5, y en Opus 5 los tokens de pensamiento se facturan como tokens de salida, así que un modelo que piensa más cuesta más con el mismo precio de lista. Mide los tokens de entrada, de salida y de caché por tarea aceptada con tu nivel de esfuerzo. Las cuotas de los planes de consumo en las apps de Claude son un asunto distinto de la facturación de la API.
¿Debería esperar a Opus 5.2 antes de empezar un proyecto?
No. Usa Claude Opus 5 para las entregas comprometidas, mantén la selección del modelo en la configuración y recoge las trazas que se convertirán en tu evaluación de actualización.
¿Puedo usar ya el ID de modelo claude-opus-5-2?
No. No encontramos ese identificador en ninguna documentación de Anthropic. Un ID adivinado fallará o, peor aún, un proxy de terceros lo asignará a un modelo que no tiene nada que ver.
¿Seguirá disponible Opus 5 si sale un Opus nuevo?
claude-opus-5 como activo, con retirada no antes del 24 de julio de 2027 en las plataformas que opera; Bedrock y Google Cloud fijan sus propias fechas. Eso no garantiza ninguna ruta concreta de un gateway, así que prueba la ruta de respaldo que piensas usar.¿Cómo debería comparar los dos después de un lanzamiento?
Usa prompts, herramientas, timeouts, niveles de esfuerzo, estado del contexto, reglas de reintento y revisores emparejados. Rellena un registro de aceptación por clase de tarea, compara el coste por tarea aceptada y mueve el tráfico por clase de tarea con un camino de vuelta ensayado.
Fuentes
- Anthropic: descripción general de modelos
- Anthropic: ID de modelo y versionado, incluido "Model weights versus serving infrastructure"
- Anthropic: novedades de Claude Opus 5 (cambios incompatibles y facturación de los tokens de pensamiento)
- Anthropic: parámetro effort
- Anthropic: precios
- Anthropic: modelos obsoletos (alcance por plataforma, parámetros obsoletos)
- Anthropic: Introducing Claude Opus 4.7
- Anthropic: Introducing Claude Opus 4.8
- Anthropic: Introducing Claude Opus 5
- X: @notjazii, 14 de septiembre de 2026
- X: @pankajkumar_dev, 15 de septiembre de 2026
- EvoLink: fecha de lanzamiento de Claude Opus 5.2
- EvoLink: disponibilidad de la API de Claude Opus 5.2
- EvoLink: Claude Opus 5


