Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5
Ilustración conceptual de paneles de código conectados a un núcleo de IA luminoso mediante una pasarela API
guide

Cómo usar la API de GPT-6 Astra: primera llamada, niveles de esfuerzo y migración desde GPT-5.6

EvoLink Team
EvoLink Team
Product Team
5 de septiembre de 2026
16 min de lectura
GPT-6 Astra es el modelo insignia actual de OpenAI para programación de extremo a extremo difícil, uso del ordenador, investigación y trabajo con agentes. En EvoLink funciona con el ID gpt-6-astra, en el mismo endpoint compatible con OpenAI y con la misma clave API que GPT-5.6, un 10 % por debajo del precio de lista de OpenAI.
Esta guía es la referencia de integración. Cubre la primera petición en tres lenguajes, la diferencia entre Chat Completions y la API Responses para este modelo, cómo elegir un esfuerzo de razonamiento, los cambios exactos que necesita una integración de GPT-5.6 y las tres reglas de facturación que deciden si Astra cuesta más o menos que Sol en tu carga de trabajo. Para los precios actuales de EvoLink, la ficha del modelo y la calculadora de coste, usa la página de la API GPT-6 Astra.
Alcance del proveedor y de la pasarela. Las capacidades siguientes proceden de la documentación de OpenAI. EvoLink usa el endpoint indicado, pero una petición de texto correcta no demuestra soporte para imágenes, Batch/Flex/Fast, redirección por WebSocket, herramientas asíncronas, modo Pro, configuration_update ni la opción de caché 30m. Verifica cada función por separado en la ruta de EvoLink antes de usarla.

Tarjeta de referencia rápida

ElementoValor
ID de modelogpt-6-astra (sin alias gpt-6 en OpenAI ni en EvoLink)
Endpointhttps://api.evolink.ai/v1 (compatible con OpenAI)
Superficies de API (OpenAI)Responses, Chat Completions (sin tool calling), Batch; verificar por separado el soporte en EvoLink
Ventana de contexto1.050.000 tokens compartidos entre entrada y salida; entrada máxima 922.000; salida máxima 128.000
Entrada / salidaTexto e imagen de entrada; texto de salida
Corte de conocimiento30 de abril de 2026
Esfuerzo de razonamientolow, medium, high, xhigh, max; none y minimal devuelven un 400
Parámetros eliminadostemperature, top_p, logprobs
Caché de promptsSoportada; las escrituras cuestan 1,25× la entrada; la opción TTL es 30m
Precio de lista de OpenAI (entrada ≤ 272K)$10 entrada / $1 en caché / $12.50 escritura de caché / $50 salida por 1M de tokens
Tramo de contexto largo (entrada > 272K)Toda la petición a 2× las tarifas de entrada y caché y 1,5× la salida
Precio de EvoLink10 % por debajo del precio de lista de OpenAI; cifras actuales en la página de la API
No soportadoFine-tuning, Realtime, Assistants, Embeddings, generación de imágenes o audio

Configuración y primera petición

Crea una clave en Dashboard → Keys. La misma clave enruta GPT-5.6, Claude, Gemini y GPT-6 Astra.

Paso 2: instalar el SDK de OpenAI

pip install openai        # Python
npm install openai        # Node.js

Paso 3: hacer la primera petición

Empieza con una petición básica de Responses. OpenAI exige Responses para tool calling; las funciones avanzadas de Responses requieren verificación independiente en la ruta de EvoLink.

cURL:
curl https://api.evolink.ai/v1/responses \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Explica en un párrafo la diferencia entre lecturas y escrituras de caché.",
    "reasoning": {"effort": "medium"}
  }'
Python:
from openai import OpenAI

client = OpenAI(
    api_key="your-evolink-api-key",
    base_url="https://api.evolink.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    input="Explica en un párrafo la diferencia entre lecturas y escrituras de caché.",
    reasoning={"effort": "medium"},
)

print(response.output_text)
print(response.model, response.usage)
Node.js:
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "your-evolink-api-key",
  baseURL: "https://api.evolink.ai/v1",
});

const response = await client.responses.create({
  model: "gpt-6-astra",
  input: "Explica en un párrafo la diferencia entre lecturas y escrituras de caché.",
  reasoning: { effort: "medium" },
});

console.log(response.output_text);
console.log(response.model, response.usage);
Imprime response.model y response.usage en la primera llamada. La cadena de modelo devuelta debe ser gpt-6-astra, y el bloque de uso muestra los tokens de entrada, en caché, de razonamiento y de salida, que es lo que necesitarás para conciliar la factura.

Peticiones de solo texto en Chat Completions

Chat Completions funciona para peticiones de texto. No pases temperature, top_p ni tools:
response = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "Resume este changelog en tres puntos: ..."}],
    reasoning_effort="low",
)
print(response.choices[0].message.content)

Chat Completions vs API Responses

Esta tabla describe capacidades de la API de OpenAI, incluidas las entradas de texto e imagen. No es una matriz de soporte de EvoLink: verifica las imágenes y cada función opcional en tu ruta. Chat Completions no admite tool calling para este modelo.
FunciónChat CompletionsAPI Responses
Texto de entrada, texto de salida
Entrada de imagen
Streaming
Salidas estructuradas
Caché de prompts
Function / tool callingNo
Tool calling asíncronoNo
Redirección a mitad de turno (response.steer por WebSocket)No
Cambiar el esfuerzo a mitad de conversación conservando la caché (configuration_update)No
reasoning.mode: "pro"No
temperature, top_p, logprobsRechazadosRechazados

Si tu bucle de agente vive hoy en Chat Completions, muévelo a Responses o mantenlo en GPT-5.6, que todavía soporta tool calling ahí.

Una salvedad propia de Responses: previous_response_id no funciona para organizaciones con Zero Data Retention activada. Envía el historial de la conversación explícitamente en input.

Elegir un esfuerzo de razonamiento

Astra expone cinco niveles. La guía de OpenAI es breve: si usabas none o minimal en un modelo anterior, empieza en low y compara. Los desarrolladores que publicaron registros de migración en los primeros días tras el lanzamiento convergieron en medium como punto de partida por defecto para trabajo de código; son informes de la comunidad, no mediciones de EvoLink.
EsfuerzoPara qué sirveQué vigilar
lowExtracción, clasificación, reescrituras cortas, todo lo que corría en none en GPT-5.6Sigue teniendo tokens de razonamiento; no es un nivel gratuito
mediumPor defecto para tareas de código, uso de herramientas en varios pasos, trabajo documentalLas ejecuciones de terceros muestran un gran salto de calidad sobre low con un salto de coste moderado
highCambios a escala de repositorio, cadenas largas de investigaciónEl tiempo hasta el primer token y el gasto en tokens suben mucho
xhighTareas de agente difíciles en las que high no supera la prueba de aceptaciónCaro; verifícalo con tu propio conjunto de evaluación
maxPresupuesto de razonamiento sin restriccionesLas mediciones de terceros muestran minutos hasta el primer token; rara vez compensa fuera del batch offline

OpenAI documenta dos controles adicionales. Su soporte en EvoLink aún no está verificado; lo siguiente sirve como referencia de la API del proveedor:

  • configuration_update permite que una conversación de Responses cambie de esfuerzo entre turnos sin invalidar la caché de prompts. Empieza en medium y escala solo los turnos que fallan.
  • reasoning.mode: "pro" es un modo de calidad independiente en la API Responses; trátalo como un candidato de evaluación aparte, no como un sexto nivel de esfuerzo.

Fijar el esfuerzo por petición en Responses:

response = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "Refactoriza este módulo y explica cada cambio."}],
    reasoning={"effort": "high"},
    max_output_tokens=8000,
)

Tool calling en la API Responses

Las herramientas de tipo función usan el formato plano de Responses. El modelo puede devolver un elemento function_call; ejecútalo y devuelve el resultado como function_call_output.
tools = [{
    "type": "function",
    "name": "get_build_status",
    "description": "Devuelve el estado del último build de CI de una rama.",
    "parameters": {
        "type": "object",
        "properties": {"branch": {"type": "string"}},
        "required": ["branch"],
    },
}]

first = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "¿La rama main está en verde? Si no, resume el fallo."}],
    tools=tools,
    reasoning={"effort": "medium"},
)

calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
    # ejecuta tu herramienta aquí
    outputs.append({
        "type": "function_call_output",
        "call_id": call.call_id,
        "output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
    })

second = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "¿La rama main está en verde? Si no, resume el fallo."}]
          + list(first.output) + outputs,
    tools=tools,
    reasoning={"effort": "medium"},
)
print(second.output_text)
OpenAI también documenta tool calling asíncrono: "async": true en una herramienta de función permite que el modelo siga razonando durante su ejecución. El soporte en EvoLink aún no está verificado; un bucle síncrono correcto no demuestra soporte asíncrono.

Salidas estructuradas y streaming

Las salidas estructuradas funcionan en ambas superficies. En Responses, pasa un JSON Schema mediante text.format:
response = client.responses.create(
    model="gpt-6-astra",
    input="Extrae el ID de modelo, la ventana de contexto y el límite de salida de este texto: ...",
    text={
        "format": {
            "type": "json_schema",
            "name": "model_spec",
            "schema": {
                "type": "object",
                "properties": {
                    "model_id": {"type": "string"},
                    "context_tokens": {"type": "integer"},
                    "max_output_tokens": {"type": "integer"},
                },
                "required": ["model_id", "context_tokens", "max_output_tokens"],
                "additionalProperties": False,
            },
            "strict": True,
        }
    },
    reasoning={"effort": "low"},
)
print(response.output_text)
El streaming usa stream=True en cualquiera de las dos superficies. Con niveles de esfuerzo altos el primer token puede tardar decenas de segundos, así que haz streaming en cualquier ruta interactiva y muestra el progreso mientras corre el razonamiento.

Migrar desde GPT-5.6

La tabla siguiente recoge los requisitos de migración de OpenAI. En EvoLink, verifica cada campo de petición y función opcional antes de mover tráfico; cambiar el ID de modelo no basta para demostrar compatibilidad.

CambioGPT-5.6GPT-6 Astra
ID de modelogpt-5.6-sol, gpt-5.6-terra, gpt-5.6-lunagpt-6-astra
Parámetros de muestreotemperature, top_p aceptadosElimínalos; la petición falla con 400
Esfuerzo de razonamiento none / minimalAceptadoConvertir a low
Superficie de tool callingChat Completions o ResponsesSolo Responses
Opción de caché de promptsprompt_cache_retentionprompt_cache_options: {"ttl": "30m"}
Estado de conversación con Zero Data Retentionprevious_response_idEnviar el historial en input
Codex CLICualquier versión reciente0.153.0 o superior

El diff de una llamada típica a Chat Completions:

 response = client.chat.completions.create(
-    model="gpt-5.6-sol",
+    model="gpt-6-astra",
     messages=messages,
-    temperature=0.2,
-    reasoning_effort="none",
+    reasoning_effort="low",
 )
El comportamiento también cambia. La guía de OpenAI señala que Astra se mantiene coherente más tiempo en tareas de varios pasos, pide aclaraciones más a menudo, sigue con más literalidad las instrucciones de archivos como AGENTS.md y prefiere listas y tablas. Los primeros usuarios reportaron también el fallo contrario: un ticket pequeño convertido en un diff enorme. Mantén explícita la instrucción de «cambio mínimo» en el prompt de sistema y deja GPT-5.6 enrutable para un rollback.
Ejecuta el mismo conjunto fijo de tareas en ambos modelos antes de mover tráfico. La comparativa GPT-6 Astra vs GPT-5.6 tiene la fórmula del coste por tarea aceptada y una regla de enrutamiento para empezar.

Reglas de coste: 272K, caché, Batch y Flex

Tres reglas deciden si Astra cuesta más o menos que Sol en una carga de trabajo dada. Los ejemplos usan precios de lista de OpenAI; las tarifas de EvoLink son un 10 % más bajas y están en la página de la API.

Regla 1: por encima de 272K tokens de entrada, toda la petición cambia de precio

Las tarifas de entrada y caché se duplican y la tarifa de salida sube 1,5× para toda la petición, no solo para los tokens que superan el umbral.

PeticiónCoste de entradaCoste de salida (20K tokens)Total
272.000 tokens de entrada272K × $10 = $2.7220K × $50 = $1.00$3.72
280.000 tokens de entrada280K × $20 = $5.6020K × $75 = $1.50$7.10

Ocho mil tokens de más casi duplican la factura. Cuenta los tokens antes de enviar, compacta el contexto al acercarte al tramo, o enruta la petición a GPT-5.6 Sol, cuya tarifa de contexto largo es $8 / $30.

Regla 2: la caché compensa desde la primera reutilización

Una escritura de caché cuesta $12.50 por millón de tokens (1,25× la entrada) y una lectura $1.00. Para un prefijo compartido que se reenvía k veces más:
  • sin caché: 10 × (k + 1) dólares por millón de tokens de prefijo
  • con caché: 12.50 + 1 × k
Con k = 1 son $20 frente a $13.50, así que la caché gana desde la primera reutilización y la brecha crece a partir de ahí. Coloca el contenido estable (prompt de sistema, schemas de herramientas, documentos de referencia) al principio de la entrada, y ten en cuenta el TTL de 30 minutos: una sesión inactiva más tiempo vuelve a pagar la escritura.

Regla 3: Batch y Flex cuestan la mitad

En OpenAI, Batch y Flex cuestan el 50 % de Standard. Son candidatos para evaluaciones offline, procesos nocturnos y cargas históricas. Fast cuesta 2×, no ofrece SLA de latencia para Astra y no está disponible con residencia de datos en la UE. La disponibilidad y facturación de estos modos en EvoLink aún no están verificadas; no apliques descuentos del proveedor a una estimación de EvoLink sin confirmación de la ruta.

Las reglas combinadas

Las configuraciones siguientes son candidatos de evaluación basados en las capacidades de OpenAI. Usa Batch o configuration_update mediante EvoLink solo después de verificar esa función en tu ruta.
Carga de trabajoConfiguración segura más barata
Agente de código interactivo, contexto de 50K–150KResponses, medium, caché activada, contexto por debajo de 272K
Análisis nocturno de repositorioBatch, high, fragmentos por debajo de 272K
Extracción corta a gran escalaChat Completions, low, o GPT-5.6 Terra / Luna si la calidad lo permite
Cadena larga de investigación con reintentosResponses, medium con escalado mediante configuration_update, respaldo a Sol

Rate limits y respaldo

OpenAI publica los rate limits de Astra por nivel de uso. Las cifras importan porque una sola petición con el contexto completo puede superar el presupuesto de tokens por minuto.

Nivel de OpenAIPeticiones por minutoTokens por minuto
Nivel 1500500.000
Nivel 25.0001.000.000
Nivel 35.0002.000.000
Nivel 410.0004.000.000
Nivel 515.00040.000.000

En EvoLink los límites se fijan por cuenta; revisa tu dashboard antes de una prueba de carga. Tres modos de fallo merecen un tratamiento explícito:

  1. 400 por la forma de la petición. temperature, top_p, esfuerzo none o herramientas en Chat Completions. Corrige la petición; no reintentes.
  2. 429 o 5xx. Reintenta con backoff y después recurre a gpt-5.6-sol con la misma clave. La guía de timeouts, reintentos y respaldo cubre el patrón.
  3. Tarea detenida por el monitor de seguridad de OpenAI. Astra corre bajo una monitorización asíncrona de desalineación; cuando se activa, la tarea de API se detiene. Regístralo, avisa al operador y enruta la tarea a un modelo de respaldo en lugar de entrar en bucle.
def call_with_fallback(**kwargs):
    for model in ("gpt-6-astra", "gpt-5.6-sol"):
        try:
            return client.responses.create(model=model, **kwargs)
        except Exception as err:  # acótalo a 429/5xx en producción
            last = err
    raise last

Preguntas frecuentes

¿Qué ID de modelo uso para GPT-6?

gpt-6-astra. No existe un alias genérico gpt-6 en OpenAI ni en EvoLink, y la misma cadena funciona en Chat Completions y Responses.

¿Puedo usar herramientas con GPT-6 Astra en Chat Completions?

No. OpenAI documenta tool calling para este modelo solo en Responses; Chat Completions acepta texto e imágenes. La entrada de imágenes mediante EvoLink todavía requiere verificación de la ruta.

¿Con qué esfuerzo de razonamiento debería empezar?

Empieza en medium para código y agentes, o en low para tareas que usaban none o minimal. OpenAI documenta el escalado por tarea con configuration_update; úsalo mediante EvoLink solo después de verificar la ruta.

¿GPT-6 Astra acepta temperature?

No. temperature, top_p y logprobs devuelven un 400. Elimínalos de la petición.

¿Cómo se factura una petición por encima de 272K tokens de entrada?

Toda la petición pasa al tramo de contexto largo: 2× las tarifas de entrada y caché, 1,5× la salida. Cuenta primero los tokens y compacta o divide al acercarte al umbral.

¿Qué cambia al migrar desde GPT-5.6?

Cambia el ID de modelo, elimina temperature y top_p, sustituye none por low y mueve las tool calls a Responses. OpenAI también documenta un cambio en la opción de caché. El endpoint y la clave de EvoLink siguen iguales; verifica las opciones de caché y funciones avanzadas en la ruta antes de migrar.

¿GPT-6 Astra está en Amazon Bedrock?

No a 5 de septiembre de 2026. OpenAI nombró Bedrock como canal, pero las model cards de OpenAI en AWS aún terminan en GPT-5.6. Azure Foundry lo lista en disponibilidad general. El seguimiento del lanzamiento se actualiza cuando eso cambie.
En la página de la API GPT-6 Astra, que lista las tarifas del grupo por defecto un 10 % por debajo del precio de lista de OpenAI, el tramo de contexto largo y una calculadora.
Invocar GPT-6 Astra en EvoLink

Fuentes

Evidencias revisadas el 5 de septiembre de 2026. Los hechos del proveedor proceden de la documentación de OpenAI; las recomendaciones de esfuerzo de la comunidad se atribuyen y no son mediciones de EvoLink. Los precios actuales de EvoLink están en la página de la API.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.