Kimi K3 ya está disponibleDescubrir Kimi K3
Claude Opus 5 conectado y enrutado mediante la API unificada de EvoLink para distintas cargas de producción
Tutorial

Cómo usar la API de Claude Opus 5: integración en producción y migración con EvoLink

Jessie
Jessie
COO
24 de julio de 2026
Actualizado el 25 de julio de 2026
20 min de lectura
Claude Opus 5 está disponible en EvoLink con el ID de modelo claude-opus-5. Cree una clave API EvoLink y luego envíe una solicitud de Claude Messages al punto final directo de EvoLink Messages. La ruta utiliza el EvoLink Claude Messages API, para que los equipos que ya usan una ruta Claude puedan migrar sin agregar una segunda integración de proveedor.
La disponibilidad no elimina la necesidad de validar la integración en producción. Mantenga el ID del modelo en la configuración, compruebe response.model, el uso, la facturación, el streaming y el comportamiento de las herramientas con su propia cuenta, y después despliegue el tráfico gradualmente por carga de trabajo. Así se distingue entre «la ruta está activa» y la afirmación más exigente de que cada flujo de la aplicación ha superado sus criterios de despliegue.
Esta guía va más allá de la primera solicitud. Explica cómo interactúan thinking, effort y max_tokens, qué cambia al migrar desde Opus 4.8, cómo gestionar rechazos y fallos de transporte, y dónde encaja Opus 5 en una política de enrutamiento de producción orientada al coste.

Claude Opus 5 Datos breves de la API

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 para codificación agente compleja y trabajo empresarial. La documentación oficial de Opus 5 define el contrato API principal.
CampoValor verificadoPor qué es importante
ID de modelo Anthropicclaude-opus-5Utilice el identificador exacto admitido por su proveedor de API
Ventana de contexto1 millón de tokensLos repositorios y conjuntos documentales grandes pueden caber en un solo contexto, aunque enviar todo el contexto disponible rara vez es la opción más económica
Salida máxima128.000 tokensmax_tokens limita conjuntamente el thinking y la salida visible
ThinkingActivado de forma predeterminadaUna solicitud de Opus 4.8 sin thinking cambia de comportamiento tras la migración
Niveles de esfuerzolow, medium, high, xhigh, maxEl esfuerzo es el principal control de inteligencia, latencia y uso de tokens
Precio base oficial5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salidaEl mismo precio base del token que Opus 4.8
EvoLink Punto final de mensajesPunto final de mensajes directosPunto final EvoLink recomendado para solicitudes de Claude de larga duración
EvoLink estado de la rutaDisponibleLlame a claude-opus-5 a través de la EvoLink Messages API y valide el comportamiento de producción con su propia carga de trabajo

La conclusión práctica es simple: Claude Opus 5 se puede llamar a través de EvoLink ahora, mientras que la compatibilidad de parámetros, la facturación y el comportamiento operativo aún deben validarse con una solicitud real a nivel de cuenta antes del lanzamiento completo de producción.

Por qué utilizar Claude Opus 5 a través de una API unificada

Llamar a un nuevo modelo es fácil. Mantener una aplicación flexible después de la semana de lanzamiento es más difícil.

Una integración directa puede ser la opción correcta cuando un equipo necesita todas las características nativas de Anthropic inmediatamente y tiene la intención de utilizar solo Claude. Una puerta de enlace unificada se vuelve más útil cuando la aplicación debe elegir entre modelos, contener costos, preservar un respaldo o cambiar de proveedor sin distribuir código específico del modelo a través del producto.

Por lo tanto, la función útil de EvoLink no es convertir cada solicitud en una solicitud de Opus 5. Es para mantener la selección del modelo en la capa de enrutamiento:

Application task
  -> routing policy
  -> selected model
  -> Messages API request
  -> actual-model and usage verification
  -> quality and cost record
  -> promote, retry, fall back, or roll back

Esta arquitectura brinda a un equipo cuatro ventajas concretas:

  1. Una superficie de integración. La aplicación envía mensajes estilo Claude a través de un punto final documentado.
  2. Selección de modelo configurable. La lógica empresarial describe el trabajo, como routine_coding o architecture_escalation, mientras que la configuración elige el modelo actual.
  3. Retroceso mensurable. Un reintento o cambio de modelo se convierte en un evento operativo explícito en lugar de un contaminante de referencia invisible.
  4. Flexibilidad de migración. El próximo cambio de modelo es principalmente una decisión de enrutamiento y evaluación, no una reescritura de solicitudes, códigos de producto y configuraciones del cliente.
Utilice la colección de modelos de Claude en EvoLink para la selección a nivel familiar. Para conocer la ruta exacta, los detalles del modelo actual y la superficie de precios, utilice la Claude Opus 5.

Realizar la primera llamada a la API de Claude Opus 5

1. Confirme el acceso a la cuenta antes de cambiar el código de producción

La ruta EvoLink está disponible. Antes de cambiar el tráfico de producción, confirme que su cuenta pueda llamarlo y que la ruta completa de la aplicación se comporte como se espera:

  • claude-opus-5 aparece en la lista para su cuenta EvoLink.
  • Una solicitud mínima devuelve HTTP 200.
  • response.model identifica el modelo esperado.
  • El registro de uso y el monto cobrado coinciden con la superficie de precios actual de EvoLink.
  • Las funciones requeridas, como la transmisión o las herramientas, funcionan en la misma ruta.

Si su cuenta no expone la ruta o falla una característica requerida, mantenga el modelo existente como alternativa y resuelva el problema de cuenta o compatibilidad antes de la implementación.

2. Almacene la clave API en el servidor

Cree una clave API EvoLink y cárguela desde una variable de entorno del lado del servidor:

export EVOLINK_API_KEY="your_api_key_here"
No exponga la clave en JavaScript del navegador, un componente de cliente, un repositorio público o una variable NEXT_PUBLIC_*.

3. Envíe una solicitud mínima

La solicitud mínima sigue la forma de la Messages API de Claude EvoLink:

curl --request POST \
  --url https://direct.evolink.ai/v1/messages \
  --header "Authorization: Bearer $EVOLINK_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 4096,
    "messages": [
      {
        "role": "user",
        "content": "Review this service architecture and identify the three highest-risk failure points."
      }
    ]
  }'

Comience sin parámetros opcionales. Una pequeña carga útil aísla la autenticación, la disponibilidad de rutas y el contrato de solicitud principal antes de que el esfuerzo, las herramientas, la transmisión o el almacenamiento en caché agreguen más modos de falla.

4. Verifique la respuesta, no solo el código de estado

Una respuesta HTTP exitosa demuestra que el punto final devolvió algo. No prueba por sí solo que el modelo previsto cumplió con la solicitud o que el resultado pertenece a una evaluación Opus 5.

Registre al menos:

  • response.model
  • response.stop_reason
  • uso de entrada y salida
  • solicitar latencia
  • solicitar identificación cuando esté disponible
  • ID de tarea de aplicación
  • reintento y recuento de respaldo

El siguiente ejemplo de TypeScript del lado del servidor distingue los errores de cliente que no se pueden reintentar de los fallos de capacidad que se pueden reintentar y verifica el modelo devuelto sin utilizar valores sin tipo:

type Usage = {
  input_tokens: number
  output_tokens: number
  cache_creation_input_tokens?: number
  cache_read_input_tokens?: number
}

type TextBlock = {
  type: 'text'
  text: string
}

type MessageResponse = {
  id: string
  model: string
  stop_reason: string | null
  content: TextBlock[]
  usage: Usage
}

const RETRYABLE_STATUS = new Set([429, 500, 503, 524])

function isMessageResponse(value: unknown): value is MessageResponse {
  if (typeof value !== 'object' || value === null) return false

  const record = value as Record<string, unknown>
  return (
    typeof record.id === 'string' &&
    typeof record.model === 'string' &&
    Array.isArray(record.content) &&
    typeof record.usage === 'object' &&
    record.usage !== null
  )
}

async function callClaudeOpus5(prompt: string): Promise<MessageResponse> {
  const credential = process.env.EVOLINK_API_KEY
  if (!credential) throw new Error('EVOLINK_API_KEY is not configured')

  for (let attempt = 0; attempt < 3; attempt += 1) {
    const response = await fetch('https://direct.evolink.ai/v1/messages', {
      method: 'POST',
      headers: {
        Authorization: `Bearer ${credential}`,
        'Content-Type': 'application/json',
      },
      body: JSON.stringify({
        model: 'claude-opus-5',
        max_tokens: 4096,
        messages: [{ role: 'user', content: prompt }],
      }),
      signal: AbortSignal.timeout(120_000),
    })

    if (response.ok) {
      const payload: unknown = await response.json()
      if (!isMessageResponse(payload)) {
        throw new Error('Unexpected Claude Messages API response')
      }

      if (payload.model !== 'claude-opus-5') {
        throw new Error(`Unexpected response model: ${payload.model}`)
      }

      return payload
    }

    if (!RETRYABLE_STATUS.has(response.status) || attempt === 2) {
      throw new Error(`Claude request failed with HTTP ${response.status}`)
    }

    const backoffMs = 1_000 * 2 ** attempt + Math.floor(Math.random() * 250)
    await new Promise((resolve) => setTimeout(resolve, backoffMs))
  }

  throw new Error('Claude request exhausted its retry policy')
}

Este es un patrón de referencia, no un sustituto de las pruebas a nivel de cuenta. En un servicio de gran volumen, agregue registros estructurados, correlación de solicitudes, controles de concurrencia y un respaldo elegido por su política de enrutamiento.

Cómo interactúan el pensamiento, el esfuerzo y max_tokens

Opus 5 cambia el comportamiento de una solicitud que de otro modo sería familiar. El pensamiento está activado de forma predeterminada y el esfuerzo controla la cantidad de cálculo que puede aplicar el modelo.

Claude Opus 5 flujo de trabajo de pensamiento y esfuerzo que muestra líneas de cálculo progresivamente más profundas y un resultado verificado
Claude Opus 5 flujo de trabajo de pensamiento y esfuerzo que muestra líneas de cálculo progresivamente más profundas y un resultado verificado
Configuración de pensamientoEsfuerzo¿Válido en el contrato Opus 5 de Anthropic?Implicación de producción
Predeterminado o adaptablelowLínea de evaluación de menor costo
Predeterminado o adaptablemediumLínea base de costos útiles y latencia
Predeterminado o adaptablehighRuta API predeterminada y sensible a la inteligencia general
Predeterminado o adaptablexhighPunto de partida recomendado para trabajos de codificación y agencia difíciles
Predeterminado o adaptablemaxTareas críticas para la capacidad en las que es aceptable el uso de tokens adicionales
Desactivadolow, medium o highRequiere validación adicional de la salida y de las llamadas a herramientas
Desactivadoxhigh o maxNoDevuelve un error 400
Anthropic recomienda empezar con xhigh para programación compleja y trabajo agentivo, usar high en otras cargas sensibles a la calidad y probar low o medium cuando se mantenga el nivel de aceptación. Con xhigh o max, parta de al menos 64K max_tokens para dejar espacio al thinking, los subagentes y las llamadas a herramientas.

Tres detalles previenen errores comunes de integración:

  1. max_tokens cubre el pensamiento y la salida visible. Un límite heredado de una ruta sin pensamiento de Opus 4.8 puede truncar una tarea de Opus 5 antes de lo esperado.
  2. El esfuerzo no controla de manera confiable la longitud visible de la respuesta. Solicite explícitamente una respuesta concisa o la longitud objetivo de la respuesta.
  3. El soporte del proveedor puede variar. Envíe output_config.effort únicamente a través de EvoLink después de que la documentación de su ruta actual o una prueba real confirme que el campo es aceptado.

Mantenga el pensamiento habilitado cuando sea práctico. Anthropic advierte que deshabilitar el pensamiento puede ocasionalmente hacer que una llamada a una herramienta aparezca como texto normal o exponga etiquetas internas similares a XML en la respuesta visible.

Migrar desde Claude Opus 4.8 sin llevar a cabo suposiciones antiguas

El cambio de ID del modelo es la parte fácil:

- "model": "claude-opus-4-8"
+ "model": "claude-opus-5"
La guía oficial de migración identifica los cambios de comportamiento que necesitan una revisión real de la aplicación. Para la decisión de reemplazo de la misma familia, utilice la comparación Claude Opus 5 vs Claude Opus 4.8; Esta guía se centra en la implementación de la migración.

Migración de solicitudes

  • Las solicitudes sin un campo thinking ahora se ejecutan con el pensamiento activado.
  • Vuelva a visitar max_tokens para ver flujos de trabajo que anteriormente se ejecutaban sin pensar.
  • No combine el pensamiento desactivado con xhigh o max.
  • Confirma que no queden valores de temperature, top_p o top_k de configuraciones anteriores a 4.8: Opus 4.8 ya los rechaza y Opus 5 mantiene el mismo comportamiento.
  • Pruebe el nuevo mínimo de caché de avisos de 512 tokens si los avisos repetidos anteriormente eran demasiado cortos para almacenarlos en caché.
  • Manejar stop_reason: "refusal" como resultado de la solicitud.

Migración de prompts

Es más probable que Opus 5 verifique su propio trabajo, narre el progreso y delegue en subagentes. Las indicaciones adaptadas a un modelo anterior pueden multiplicar accidentalmente esos comportamientos.

Actualice las indicaciones de cuatro maneras:

  • Especificar la respuesta prevista o la extensión del documento.
  • Eliminar instrucciones incondicionales para volver a verificar o agregar un verificador final.
  • Restringir el alcance para tareas limitadas.
  • Limitar la delegación de subagente a menos que el trabajo paralelo independiente lo justifique.
La guía de Anthropic para prompting con Opus 5 recomienda proporcionar por adelantado la especificación completa de la tarea para trabajos de codificación difíciles y evitar estructuras de verificación redundantes.

Migración del harness

Repita las tareas representativas en toda la aplicación, no solo en la llamada al modelo sin formato. Verificar:

  • selección de herramientas y argumentos
  • comportamiento del analizador de streaming
  • límites de tiempo de espera y reintento
  • manejo de rechazos
  • modelo devuelto real
  • uso de token y caché
  • longitud de salida
  • aceptación de la tarea por parte del revisor real o verificación posterior

Promocionar Opus 5 por carga de trabajo. Un modelo puede mejorar tareas de arquitectura difíciles y al mismo tiempo agregar costos innecesarios a la extracción de rutina.

Gestionar herramientas, streaming, rechazos y fallos de transporte

La EvoLink Messages API expone la transmisión, las herramientas, la elección de herramientas, el uso y los motivos de detención. Un ciclo de producción debería ramificarse a partir de la respuesta en lugar de asumir que cada 200 respuestas contiene una respuesta final.

Send message
  -> end_turn: return the answer
  -> tool_use: execute the allowed tool and continue
  -> refusal: apply the refusal and fallback policy
  -> max_tokens: mark the result incomplete
  -> transport error: retry only when the error is retryable

Establezca un recuento máximo de bucles de herramientas, valide cada argumento de herramienta y conserve el seguimiento necesario para explicar una tarea fallida. Nunca ejecute una llamada a una herramienta producida por un modelo sin autorización a nivel de aplicación y validación de esquema.

Trate los fracasos por clase:

ResultadoAcción recomendada
400 solicitud no válidaCorregir campos de modelo, pensamiento, esfuerzo, muestreo o esquema; no lo vuelvas a intentar ciegamente
Autenticación 401Credenciales correctas del lado del servidor
Facturación 402Restaurar créditos o cambiar la respuesta del producto
Modelo 404 no encontradoVuelva a verificar la enumeración del modelo EvoLink y el acceso a la cuenta
Límite de tasa 429Aplicar retroceso exponencial acotado con fluctuación
503 sobrecargadoVuelva a intentarlo dentro de un presupuesto estricto o pase a un sistema alternativo aprobado
524 tiempo de esperaUtilice el punto final directo, establezca un tiempo de espera prolongado para las tareas y evite trabajos duplicados sin seguimiento
stop_reason: "refusal"Registre el resultado y aplique la política alternativa o de mensajes de usuario de la carga de trabajo

Un rechazo no es lo mismo que una solicitud HTTP fallida. Anthropic lo documenta como un resultado de respuesta normal para Opus 5. El respaldo automático puede estar disponible en la API nativa de Anthropic, pero confirme el equivalente de EvoLink antes de colocar campos específicos del proveedor en una solicitud de puerta de enlace.

Medir el costo por tarea exitosa

Claude Opus 5 mantiene el mismo precio base oficial del token que Opus 4.8, pero el precio de lista no le dice al equipo de producción qué ruta es más barata.

Utilice esta métrica de decisión:

successful-task cost =
  input token cost
  + output token cost
  + retry cost
  + fallback cost
  + tool execution cost
  + human review or repair cost
Ejecute la misma evaluación de privacidad segura establecida en medium, high y xhigh. Registre si la tarea fue aprobada, no solo qué tan fluida sonó el resultado. Una solicitud de mayor esfuerzo puede resultar económica si evita los reintentos y la reparación manual. También puede ser un desperdicio cuando la tarea pasa por medium.

La tabla de evaluación debe incluir:

MétricaPor qué pertenece
Tasa de tareas aceptadasMide si el resultado fue utilizable
Total de tokens de entrada y salidaCaptura el modelo de factura completo
Caché lee y escribeMuestra si se está reutilizando el contexto repetido
Llamadas y fallos de herramientasExpone la sobrecarga del bucle del agente
Reintentos y retrocesosEvita costos ocultos de múltiples solicitudes
Latencia de extremo a extremoSepara el ajuste interactivo y de fondo
Tiempo de revisión humanaCapta la limpieza que el precio de los tokens omite

No publique una recomendación de esfuerzo universal a partir de un único mensaje. Elija la vía de menor esfuerzo que cumpla con el umbral de calidad para cada carga de trabajo y luego reserve el escalamiento para tareas en las que fallar sea costoso.

Enrutar Sonnet, Opus y Fable según la carga de trabajo

Anthropic posiciona a Opus 5 como la opción inicial para codificación agente compleja y trabajo empresarial, mientras que Fable 5 sigue siendo el modelo Claude de mayor capacidad lanzado generalmente. La guía Opus 5 vs Fable 5 convierte esa jerarquía en reglas de carga de trabajo.
Enrutamiento de producción y flujo de trabajo alternativo para Claude Opus 5 y otros carriles modelo en EvoLink
Enrutamiento de producción y flujo de trabajo alternativo para Claude Opus 5 y otros carriles modelo en EvoLink
Carga de trabajoRuta de inicio sugeridaSeñal de escalada
Clasificación, extracción y reescrituras brevesModelo de menor costoLos fallos de esquema o de calidad superan el umbral aceptado
Trabajo diario de asistente de codificación y producciónClaude Sonnet 5Fallos repetidos de depuración, amplio alcance del repositorio o mayor riesgo de decisión
Depuración compleja, arquitectura y largos bucles de agentesClaude Opus 5La tarea sigue sin resolverse y el valor esperado justifica la prima
Trabajo autónomo o de conocimiento de máxima dificultadClaude Fable 5Úselo solo cuando el valor medido de la tarea respalde el precio más alto

Guarde la decisión de enrutamiento en la configuración:

type Workload =
  | 'routine_text'
  | 'everyday_coding'
  | 'complex_agent'
  | 'frontier_escalation'

const modelByWorkload: Record<Workload, string> = {
  routine_text: 'configured-low-cost-model',
  everyday_coding: 'claude-sonnet-5',
  complex_agent: 'claude-opus-5',
  frontier_escalation: 'claude-fable-5',
}

La aplicación debe registrar tanto el modelo solicitado como el devuelto. Si se produce un retroceso, excluya ese rastro de un punto de referencia limpio de Opus 5 o etiquételo por separado.

Aquí es donde una API unificada gana su lugar. El valor no es el acceso a un nuevo modelo. El valor es la capacidad de cambiar la decisión de producción sin tener que reescribir la aplicación en cada versión. Si la elección cruza proveedores de modelos, utilice la Claude Opus 5 vs GPT-5.6 antes de cambiar la política de enrutamiento.

Lista de verificación de preparación para la producción

Antes de trasladar el tráfico real a Opus 5:

  • claude-opus-5 aparece en la lista para la cuenta EvoLink.
  • Una solicitud mínima devuelve el response.model esperado.
  • El uso y la facturación coinciden con la ruta documentada.
  • Se verifica el streaming si el producto depende de él.
  • [] Cada ruta de herramienta requerida tiene una solicitud válida y un seguimiento de resultados.
  • La aplicación distingue el rechazo del error HTTP.
  • [] Los errores reintentables y no reintentables siguen políticas diferentes.
  • Existe una ruta alternativa conocida y se ha utilizado.
  • [] Las tareas representativas se han repetido en múltiples niveles de esfuerzo.
  • [] Los umbrales de promoción utilizan la tasa de tareas aceptadas, la latencia y el costo de las tareas exitosas.
  • [] Los ID de modelo residen en la configuración en lugar de en la lógica empresarial.
  • Las condiciones de reversión son explícitas.

Preguntas frecuentes

¿Cuál es el ID del modelo de API Claude Opus 5?

El ID del modelo de solicitud EvoLink es claude-opus-5. Manténgalo configurado y verifique el modelo devuelto al evaluar el tráfico de producción.
Sí. Utilice claude-opus-5 con la EvoLink Claude Messages API. Consulte la Claude Opus 5 para conocer el producto actual y la superficie de precios.
Utilice el punto final de mensajes directos EvoLink. EvoLink recomienda la URL base directa para solicitudes de larga duración y trabajos que requieren tiempo de espera.

¿El pensamiento está habilitado de forma predeterminada en Claude Opus 5?

Sí. En Opus 5, omitir el campo thinking deja activado el pensamiento adaptativo. Esto difiere de las solicitudes de Opus 4.8 que se ejecutaban sin pensar cuando el campo estaba ausente.

¿Qué nivel de esfuerzo debo elegir?

Comience con xhigh para trabajos de codificación y agencia difíciles, high para otras tareas sensibles a la inteligencia y evalúe medium o low como costo y controles de latencia. Utilice max solo cuando el valor de la tarea justifique un gasto de token sin restricciones.

¿Cómo migro desde Claude Opus 4.8?

Actualice el ID del modelo, luego vuelva a probar los valores predeterminados de pensamiento, max_tokens, parámetros de muestreo, duración del mensaje, instrucciones de verificación, comportamiento del subagente, manejo de rechazos, uso y costo. Trate la migración como una evaluación del flujo de trabajo en lugar de un reemplazo de cadena.

¿Cuánto cuesta Claude Opus 5?

El precio base oficial de Anthropic es de $5 por millón de tokens de entrada y $25 por millón de tokens de salida, sin cambios desde Opus 4.8. Verifique la superficie de precios EvoLink actual para la ruta de puerta de enlace y compare los modelos según el costo de la tarea exitosa en lugar del precio simbólico solo.

Fuentes

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.