GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5
Concepto de evaluación de Claude Opus 5.2 vs Claude Opus 5: dos canales de luz igual de brillantes, uno ámbar y otro azul hielo, entran al atardecer en una puerta de medición transparente, con un bucle de cristal que se curva hacia atrás como vía de reversión
model-comparison

Claude Opus 5.2 vs Claude Opus 5: qué probar primero

EvoLink Team
EvoLink Team
Equipo de producto
17 de septiembre de 2026
Actualizado el 18 de septiembre de 2026
21 min de lectura
Respuesta corta: sigue con Claude Opus 5 y empieza a medirlo como es debido. A 18 de septiembre de 2026, "Claude Opus 5.2" solo existe en publicaciones de la comunidad: no encontramos ningún modelo, ID de modelo, precio, especificación ni benchmark suyo en la documentación de Anthropic, así que no hay nada que comparar salvo reportes de una salida más rápida y menos "perezosa" dentro de Claude Code, ni ninguna ruta a la que cambiarse. Lo que sí puedes hacer ahora es convertir esos reportes en una evaluación que esté lista el día que aparezca una versión menor de verdad y que te diga, con números, si el cambio merece tu tráfico.
Esta guía es para equipos que ya tienen Opus 5 en producción. La evidencia que hay detrás de los reportes de enrutamiento, incluido el "slug de Foundry" rastreado, está en fecha de lanzamiento de Claude Opus 5.2; el estado de la disponibilidad por canal, del ID de modelo y del precio vive en la página de la API de Claude Opus 5.2. La pregunta, distinta, sobre la próxima generación está en Claude Opus 6 vs Claude Opus 5.

La decisión de un vistazo

PreguntaClaude Opus 5"Claude Opus 5.2"Qué hacer ahora
¿Tiene nombre oficial?Sí, lanzado el 24 de julio de 2026No; es una etiqueta de la comunidadTrátalo como algo que vigilar, no como parte de tu hoja de ruta
¿Hay un ID de API documentado?claude-opus-5Ninguno encontrado en la documentación de Anthropic, en las listas de los SDK ni en las versiones de Claude CodeNo pongas en la configuración un ID adivinado
¿Precio y límites documentados?$5 / $25 por MTok; 1M de contexto; 128K de salidaDesconocidosPresupuesta contra Opus 5
¿Puedes hacer hoy pruebas emparejadas?Sí, a través de canales documentadosNo hay candidato invocableCongela ya la referencia y el conjunto de replay
¿Qué reportan los usuarios?"Perezoso", le da demasiadas vueltas, necesita un "continúa" en tareas largas"Way faster" (mucho más rápido), salida limpia, "not lazy" (solo en Claude Code)Convierte cada reporte en una prueba medible
¿Respaldo si llegas a cambiar?Listado como activo, con retirada "not sooner than July 24, 2027" (no antes del 24 de julio de 2027) en las plataformas operadas por AnthropicNo aplicaVerifica la ruta concreta de EvoLink a la que volverías

No hay ganador porque solo una columna es un producto documentado. El resultado útil de esta comparativa es la evidencia que un sucesor tiene que aportar.

Claude Opus 5.2 vs Opus 5: diferencias conocidas e incógnitas

La descripción general de modelos, la página de precios, las notas de versión de Anthropic y el changelog de Claude Code documentan Claude Opus 5 y nada más reciente en la línea Opus. Desde el 14 de septiembre, varias cuentas de X reportan que Claude Code enruta parte de las solicitudes de Opus 5 hacia una versión más nueva. Ninguna publicación incluye un identificador ni un registro de solicitud, los reportes no coinciden en qué apps y qué planes están afectados, y Anthropic no ha comentado nada.

Cuatro cosas que circulan junto a los reportes están tratadas a fondo en el seguimiento del lanzamiento y aquí solo se resumen:
  • el "claude-opus-5-2.yaml de Foundry" es una entrada de un registro comunitario cuyos valores son iguales a los de Opus 5;
  • "cinco niveles de esfuerzo, incluidos xhigh y max" es la escala que Opus 5 ya tiene documentada hoy;
  • en agosto se rumoreó un "Opus 5.1" que nunca se lanzó con ese nombre;
  • preguntarle al modelo quién es "Tibo" lee texto generado, no la identidad del modelo.
Hay un hecho oficial que importa para todo lo que sigue. La documentación de versionado de Anthropic dice que los pesos del modelo son fijos para un ID dado, que una versión actualizada "ships under a new model ID" (se publica con un ID de modelo nuevo), y que la infraestructura de servicio, como el enrutador de solicitudes y la lógica de muestreo, puede cambiar y es "the most likely cause" (la causa más probable) de las diferencias de comportamiento en un ID estable. Por tanto, una sesión más rápida bajo el mismo nombre no es, por sí sola, un modelo nuevo. También significa que una versión menor de verdad llegaría como un ID nuevo que tú eliges adoptar, y eso es lo que hace posible una evaluación controlada.

Qué reportan los usuarios y qué contaría como evidencia

Los reportes coinciden en qué cambió, y eso los convierte en una especificación de pruebas aprovechable aunque no demuestren nada sobre un modelo.
Reporte de la comunidad (Claude Code, 14–17 de septiembre)La queja sobre Opus 5 a la que respondeQué contaría como evidencia
"way faster" / le da menos vueltasPensamiento largo antes de producir la salida con esfuerzo high y xhighMismo conjunto de tareas, mismo nivel de esfuerzo: tiempo real y tokens de salida por tarea aceptada, durante varios días
"not lazy", le gustan las tareas más largasPararse a mitad de tarea y pedirle al usuario que continúeEmpujones del usuario por tarea larga completada; tasa de finalización sin intervención
"really clean output" (salida muy limpia; X); código menos inflado o sobredimensionado (un hilo de Reddit que solo pudimos leer de segunda mano)Implementaciones sobredimensionadas o verbosasTamaño del diff frente al alcance pedido; ediciones del revisor por cambio aceptado
Mejor en tareas visuales y 3D y "getting close to Astra-level" (acercándose al nivel de Astra), aunque el mismo usuario sigue poniendo a Astra por delanteTrabajo visual y espacial más flojoTareas visuales emparejadas con una rúbrica fija, si esa carga de trabajo te importa
Un usuario de un foro contó que lo tuvo una noche y que después lo volvió a perderNo es una queja; es una advertenciaCualquier mejora tiene que mantenerse entre días y entre versiones del CLI antes de ser una referencia

Qué mejora justifica un cambio, tarea por tarea

"Mejor" significa cosas distintas según la carga de trabajo. Decide por clase de tarea qué mides primero y qué tamaño de mejora justificaría el trabajo de migración. Los umbrales son tuyos; la tabla solo dice dónde mirar.

Clase de tareaMide primeroVigila tambiénUna mejora por la que merece la pena cambiar
Preguntas y respuestas interactivas y chatp50 y p95 del tiempo hasta la primera respuesta útilTasa de aceptación, tokens de salidaLa latencia pasa de "los usuarios la notan" a "los usuarios no la notan", sin que baje la aceptación
Programación a escala de repositorioTasa de tests superados en los cambios aceptadosTamaño del diff frente al alcance pedido; tiempo de edición del revisorMás cambios pasan los tests al primer intento, y los diffs se quedan dentro de los archivos pedidos
Agentes de larga duraciónTasa de finalización sin intervención humanaEmpujones por tarea, recuperación de errores de herramientas, tokens totales por tarea completadaLas tareas que necesitaban un "continúa" o un rescate ahora terminan solas, sin que se disparen los tokens
Extracción estructuradaTasa de éxito del parseo o de la validación del esquemaNúmero de reintentos, coste por registro válidoMenos salidas inválidas con un coste por registro válido igual o menor
Trabajo documental por lotesCoste por documento aceptadoRendimiento dentro de la ventana del lote, tasa de aciertos de cachéMenor coste por documento aceptado cumpliendo igualmente el plazo

Si una clase de tarea no tiene hoy ningún problema medible con Opus 5, no tiene motivo para moverse, saque el modelo nuevo la puntuación que saque en otros sitios.

Lo que Claude Opus 5 ya ofrece

Opus 5 es el lado medible de esta comparativa:

  • ID de modelo de la API claude-opus-5, un snapshot fijo sin fecha;
  • $5 de entrada y $25 de salida por millón de tokens; escrituras de caché a $6.25 (5 minutos) y $10 (1 hora); lecturas de caché a $0.50; batch a mitad de precio; modo rápido en research preview a $10 / $50, solo en la API de Claude;
  • contexto de 1M de tokens sin variante más pequeña; 128K de salida máxima;
  • pensamiento adaptativo activado por defecto; esfuerzo low, medium, high (predeterminado), xhigh y max; el pensamiento solo se puede desactivar en high o inferior;
  • los tokens de pensamiento se facturan como tokens de salida y cuentan para max_tokens.
En EvoLink, la página de Claude Opus 5 lista la ruta actual. Comprueba con tu propia clave el ID documentado, el campo de modelo devuelto, el uso y la facturación antes de tratarla como referencia.

Qué cambiaron los lanzamientos anteriores de Opus, ordenado por impacto

No todos los cambios de un lanzamiento rompen una integración. Separar los tres tipos te dice qué tienes que volver a probar.

LanzamientoFechaCambio incompatible documentadoCambio de coste o de comportamientoCapacidad nueva
Opus 4.65 feb 2026Se introduce el pensamiento adaptativo1M de contexto; 128K de salida; compactación de contexto
Opus 4.716 abr 2026Los valores no predeterminados de temperature, top_p y top_k devuelven un 400Tokenizador nuevo: el mismo texto cuenta como más tokensEsfuerzo xhigh; visión de mayor resolución
Opus 4.828 may 2026Modo rápido; mejoras agénticas y de razonamiento
Opus 524 jul 2026Pensamiento activado por defecto; desactivar el pensamiento en xhigh o max devuelve un 400Los tokens de pensamiento facturados como salida elevan el volumen de salida a las mismas tarifas; respuestas predeterminadas más largasMínimo de caché de 512 tokens; cambios de herramientas a mitad de conversación (beta)
Todos estos lanzamientos figuraron a $5 / $25 por millón de tokens. Los intervalos entre ellos fueron de 42 a 70 días, y el 18 de septiembre es el día 56 después de Opus 5. Para el salto generacional anterior, consulta Claude Opus 5 vs Claude Opus 4.8. Ambos datos son historia, no un pronóstico: una futura versión menor podría traer cualquiera de los tres tipos de cambio, o ninguno.

Comprobaciones de compatibilidad antes de cualquier cambio

SuperficieQué comprobarPor qué
Identificador del modeloEl ID está documentado por Anthropic o por el canal de nube que usas; Bedrock y Google Cloud tienen sus propios formatosUna cadena adivinada puede fallar o ser convertida por un proxy en alias de un modelo que no tiene nada que ver
Pensamiento y esfuerzoVuelve a ejecutar tu matriz de esfuerzo; prueba la vía de desactivación y el comportamiento del 400Opus 5 cambió ambas cosas; los valores predeterminados pueden volver a moverse
Recuento de tokensVuelve a medir los tokens de entrada, de salida y de caché por tareaLos cambios de tokenizador y de pensamiento alteran la factura con un precio de lista que no cambia
Parámetros de muestreoBusca con grep en la configuración los parámetros que el modelo rechaza4.7 convirtió en errores los valores de muestreo no predeterminados
Salida estructurada y herramientasRepite los parsers y la validación de esquemas; inyecta fallos de herramientasLas notas de Anthropic sobre Opus 5 dicen que el código que lee content[0].text debe seleccionar los bloques por type, porque una respuesta puede empezar con bloques de pensamiento
RespaldoRegistra cuándo un respaldo atendió la solicitud y conviértelo en una rama explícita del experimentoLos resultados con modelos mezclados contaminan la comparativa

Sobre la identidad: registrar el campo de modelo devuelto, el ID de solicitud, el uso y la factura es necesario, y no es una prueba independiente de los pesos que hay debajo, porque cada uno de esos campos lo aporta un servidor o un proxy. Lo que sí puedes establecer es la coherencia entre el mapeo de ID documentado, los metadatos devueltos, los registros upstream de confianza y la facturación. Con eso basta para que una sustitución sea rastreable, que es el objetivo práctico.

La evaluación emparejada

1. Congela la referencia de Opus 5

Registra prompts, herramientas, nivel de esfuerzo, estado del contexto, tasa de tareas aceptadas, tiempo real, tokens de entrada y de salida, uso de caché, reintentos, tiempo del revisor y casos de fallo conocidos. Incluye las sesiones en las que Opus 5 te pidió "continuar" o sobredimensionó un cambio; eso es justo lo que afirman los reportes, y necesitas las cifras de antes.

2. Construye tres grupos de replay

  • tareas que sabes que salen bien, para detectar regresiones;
  • fallos conocidos de Opus 5 (pereza, verbosidad, darle demasiadas vueltas), para medir el valor de reemplazo;
  • tareas frontera que hoy necesitan a una persona o una ruta distinta.
Una evaluación planificada de Claude Opus 5 frente a Opus 5.2 envía conjuntos de tareas equivalentes por herramientas y comprobaciones de tiempo idénticas; la salida equilibrada ilustra una prueba justa, no una paridad medida
Una evaluación planificada de Claude Opus 5 frente a Opus 5.2 envía conjuntos de tareas equivalentes por herramientas y comprobaciones de tiempo idénticas; la salida equilibrada ilustra una prueba justa, no una paridad medida

3. Añade el candidato solo cuando sea una ruta documentada y coherente

Un candidato entra en el harness cuando su ID lo publica Anthropic o tu canal de nube, una solicitud autenticada funciona, los metadatos devueltos coinciden con el mapeo documentado y el uso concilia con el precio publicado. A partir de ahí, usa los mismos prompts, herramientas, timeouts, política de esfuerzo, reglas de reintento y revisores que en la referencia.

Un ejemplo de coste resuelto

La cifra que decide un cambio no es el gasto total. Es lo que pagas por cada tarea que supera la aceptación:

Coste de API por tarea aceptada = gasto total de API del grupo de evaluación ÷ tareas que superaron la aceptación

En el numerador va todo lo que consumió el grupo: intentos fallidos, reintentos y llamadas de respaldo incluidos. Cuenta las escrituras y las lecturas de caché tal como se facturan de verdad. Los tokens de pensamiento ya se facturan como tokens de salida, así que no los sumes una segunda vez. Deja el tiempo de revisión humana en su propia columna en lugar de convertirlo en dólares de API.

Las cifras de abajo son inventadas para mostrar la aritmética. No son mediciones de ningún modelo.
Grupo de referenciaGrupo candidato
Tareas intentadas100100
Gasto total de API, incluidos fallos y reintentos$12.00$14.00
Tareas que superaron la aceptación8095
Coste de API por tarea aceptada$12.00 ÷ 80 = $0.150$14.00 ÷ 95 = $0.147
Tareas que una persona todavía tiene que corregir o rehacer205

El grupo candidato gastó $2.00 más y aun así sale algo más barato por tarea aceptada, porque una parte mayor de su gasto produjo trabajo aprovechable. El efecto más grande está en la última fila: quince tareas menos vuelven a manos de una persona. El caso contrario es igual de real. Si el candidato hubiera gastado $16.00 para 85 tareas aprobadas, su coste por tarea aceptada sería de $0.188, y la calidad extra tendría que justificar un coste unitario un 25% más alto. Haz la división antes de leer las cifras de titular.

Un registro de aceptación que puedes rellenar

Las puertas vagas como "sustancialmente mejor" o "la latencia se mantiene" no se pueden comprobar. Escribe el umbral antes de la ejecución, a partir del requisito de negocio de esa clase de tarea, y luego anota lo que pasó. Copia esta tabla una vez por clase de tarea.

CampoTu umbral (fijado antes de la ejecución)Resultado de la referenciaResultado del candidato¿Cumple?
Clase de tarea y grupo de replay
Tamaño de la muestra (tareas intentadas)mínimo: ____
Tasa de aprobación (aprobadas ÷ intentadas)al menos ____ % y no inferior a la referencia en el grupo de tareas que sabes que salen bien
Latencia p95como máximo ____ s
Coste de API por tarea aceptadacomo máximo $ ____
Reintentos y llamadas de respaldo por cada 100 tareascomo máximo ____
Tiempo de corrección humana por tarea aceptadacomo máximo ____ min
Empujones por tarea larga (solo agentes)como máximo ____
Coherencia durante ____ díasningún umbral incumplido en ningún día
Una condición para ampliar el tráfico que se pueda ejecutar se lee así: enruta el 5% de esta clase de tarea al candidato cuando todas las filas se cumplan en al menos ____ tareas durante ____ días; vuelve al 0% el primer día en que se incumpla cualquier fila. No existe un umbral universal. Un bot de soporte y un trabajo nocturno de refactorización no deberían compartir el mismo.

Cambia tarea por tarea y prueba el camino de vuelta

El resultado realista es una política de enrutamiento, no un cambio global. Mueve las clases de tarea que superaron su registro, en el orden de la matriz de arriba, y deja el resto en Opus 5.

Una vía planificada de canary y reversión para Claude Opus 5.2: la mayor parte del tráfico sigue en la ruta ámbar de referencia, con una pequeña rama de evaluación y un camino de retorno explícito; no es un despliegue real en marcha
Una vía planificada de canary y reversión para Claude Opus 5.2: la mayor parte del tráfico sigue en la ruta ámbar de referencia, con una pequeña rama de evaluación y un camino de retorno explícito; no es un despliegue real en marcha
El camino de vuelta necesita su propia prueba. La página de modelos obsoletos de Anthropic lista claude-opus-5 como activo, con retirada "not sooner than July 24, 2027" (no antes del 24 de julio de 2027), y dice que sus fechas se aplican a las plataformas operadas por Anthropic (la API de Claude, Claude Platform en AWS y Microsoft Foundry), mientras que Amazon Bedrock y Google Cloud fijan sus propios calendarios. Eso es una ventana de evaluación. No garantiza la capacidad, los permisos ni el estado de la ruta concreta a la que volverías. Antes de cualquier canary, envía tráfico real por la ruta de respaldo de Opus 5 que piensas usar, confirma la cuota y los permisos, y ensaya el cambio de configuración que devuelve el tráfico a ella.

Mantén Opus 5 donde ya cumple tus objetivos de tasa de aprobación, latencia y coste, donde una migración no tiene una ventaja medida o donde tus registros todavía no pueden separar las llamadas primarias de las de respaldo. Esperar no es pasivo mientras recoges referencias; solo se vuelve pasivo cuando bloqueas una entrega por un modelo que no se ha anunciado.

La API unificada de EvoLink mantiene la elección del modelo en la configuración de enrutamiento y no en el código de la aplicación, lo que hace que añadir un aspirante salga barato y quitarlo también. Nada de este plan requiere que exista hoy una ruta de Opus 5.2.

Revisa la ruta actual de Claude Opus 5 Recibe la alerta de lanzamiento de la API de Claude Opus 5.2

FAQ

¿Se ha anunciado Claude Opus 5.2?

A 18 de septiembre de 2026 no encontramos ninguna mención en el catálogo de modelos de Anthropic, en las notas de versión, en la página de precios ni en la sala de prensa. El Opus más reciente es Claude Opus 5.

¿Claude Opus 5.2 es mejor que Claude Opus 5?

No existe una comparativa basada en evidencia, porque no existe un Opus 5.2 documentado e invocable. Los reportes de la comunidad describen una salida más rápida y menos perezosa dentro de Claude Code, sin identificador de modelo y sin mediciones.

¿Qué dicen los usuarios que corrige Opus 5.2?

La velocidad, el darle demasiadas vueltas, la pereza en tareas largas y el código verboso o sobredimensionado. Son las categorías correctas para un conjunto de replay, y son afirmaciones, no resultados.

¿Cómo comparo el coste de forma justa?

Divide el gasto total de API del grupo de evaluación, incluidos fallos y reintentos, entre el número de tareas que superaron la aceptación. Compara esa cifra, no el gasto total ni el precio de lista, y reporta aparte el tiempo de corrección humana.

¿Un Opus más nuevo agotará más rápido mi cuota o mi presupuesto?

No se sabe hasta que se pueda medir. Algunos usuarios ya reportan un consumo mayor con Opus 5, y en Opus 5 los tokens de pensamiento se facturan como tokens de salida, así que un modelo que piensa más cuesta más con el mismo precio de lista. Mide los tokens de entrada, de salida y de caché por tarea aceptada con tu nivel de esfuerzo. Las cuotas de los planes de consumo en las apps de Claude son un asunto distinto de la facturación de la API.

¿Debería esperar a Opus 5.2 antes de empezar un proyecto?

No. Usa Claude Opus 5 para las entregas comprometidas, mantén la selección del modelo en la configuración y recoge las trazas que se convertirán en tu evaluación de actualización.

¿Puedo usar ya el ID de modelo claude-opus-5-2?

No. No encontramos ese identificador en ninguna documentación de Anthropic. Un ID adivinado fallará o, peor aún, un proxy de terceros lo asignará a un modelo que no tiene nada que ver.

¿Seguirá disponible Opus 5 si sale un Opus nuevo?

Anthropic lista claude-opus-5 como activo, con retirada no antes del 24 de julio de 2027 en las plataformas que opera; Bedrock y Google Cloud fijan sus propias fechas. Eso no garantiza ninguna ruta concreta de un gateway, así que prueba la ruta de respaldo que piensas usar.

¿Cómo debería comparar los dos después de un lanzamiento?

Usa prompts, herramientas, timeouts, niveles de esfuerzo, estado del contexto, reglas de reintento y revisores emparejados. Rellena un registro de aceptación por clase de tarea, compara el coste por tarea aceptada y mueve el tráfico por clase de tarea con un camino de vuelta ensayado.

Fuentes

Fuentes oficiales revisadas por última vez el 18 de septiembre de 2026. Los hechos de Anthropic proceden de la documentación oficial; los reportes de la comunidad proceden de publicaciones de X que leímos directamente, de hilos de foros y de un hilo de Reddit transmitido de segunda mano, y están etiquetados como tales; el ejemplo de coste usa cifras inventadas; el estado de la ruta de EvoLink es independiente y no está verificado.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.