
Cómo usar la API de GPT-6 Astra: primera llamada, niveles de esfuerzo y migración desde GPT-5.6

gpt-6-astra, en el mismo endpoint compatible con OpenAI y con la misma clave API que GPT-5.6, un 10 % por debajo del precio de lista de OpenAI.configuration_update ni la opción de caché 30m. Verifica cada función por separado en la ruta de EvoLink antes de usarla.Tarjeta de referencia rápida
| Elemento | Valor |
|---|---|
| ID de modelo | gpt-6-astra (sin alias gpt-6 en OpenAI ni en EvoLink) |
| Endpoint | https://api.evolink.ai/v1 (compatible con OpenAI) |
| Superficies de API (OpenAI) | Responses, Chat Completions (sin tool calling), Batch; verificar por separado el soporte en EvoLink |
| Ventana de contexto | 1.050.000 tokens compartidos entre entrada y salida; entrada máxima 922.000; salida máxima 128.000 |
| Entrada / salida | Texto e imagen de entrada; texto de salida |
| Corte de conocimiento | 30 de abril de 2026 |
| Esfuerzo de razonamiento | low, medium, high, xhigh, max; none y minimal devuelven un 400 |
| Parámetros eliminados | temperature, top_p, logprobs |
| Caché de prompts | Soportada; las escrituras cuestan 1,25× la entrada; la opción TTL es 30m |
| Precio de lista de OpenAI (entrada ≤ 272K) | $10 entrada / $1 en caché / $12.50 escritura de caché / $50 salida por 1M de tokens |
| Tramo de contexto largo (entrada > 272K) | Toda la petición a 2× las tarifas de entrada y caché y 1,5× la salida |
| Precio de EvoLink | 10 % por debajo del precio de lista de OpenAI; cifras actuales en la página de la API |
| No soportado | Fine-tuning, Realtime, Assistants, Embeddings, generación de imágenes o audio |
Configuración y primera petición
Paso 1: obtener una clave API de EvoLink
Paso 2: instalar el SDK de OpenAI
pip install openai # Python
npm install openai # Node.jsPaso 3: hacer la primera petición
Empieza con una petición básica de Responses. OpenAI exige Responses para tool calling; las funciones avanzadas de Responses requieren verificación independiente en la ruta de EvoLink.
curl https://api.evolink.ai/v1/responses \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "Explica en un párrafo la diferencia entre lecturas y escrituras de caché.",
"reasoning": {"effort": "medium"}
}'from openai import OpenAI
client = OpenAI(
api_key="your-evolink-api-key",
base_url="https://api.evolink.ai/v1",
)
response = client.responses.create(
model="gpt-6-astra",
input="Explica en un párrafo la diferencia entre lecturas y escrituras de caché.",
reasoning={"effort": "medium"},
)
print(response.output_text)
print(response.model, response.usage)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "your-evolink-api-key",
baseURL: "https://api.evolink.ai/v1",
});
const response = await client.responses.create({
model: "gpt-6-astra",
input: "Explica en un párrafo la diferencia entre lecturas y escrituras de caché.",
reasoning: { effort: "medium" },
});
console.log(response.output_text);
console.log(response.model, response.usage);response.model y response.usage en la primera llamada. La cadena de modelo devuelta debe ser gpt-6-astra, y el bloque de uso muestra los tokens de entrada, en caché, de razonamiento y de salida, que es lo que necesitarás para conciliar la factura.Peticiones de solo texto en Chat Completions
temperature, top_p ni tools:response = client.chat.completions.create(
model="gpt-6-astra",
messages=[{"role": "user", "content": "Resume este changelog en tres puntos: ..."}],
reasoning_effort="low",
)
print(response.choices[0].message.content)Chat Completions vs API Responses
| Función | Chat Completions | API Responses |
|---|---|---|
| Texto de entrada, texto de salida | Sí | Sí |
| Entrada de imagen | Sí | Sí |
| Streaming | Sí | Sí |
| Salidas estructuradas | Sí | Sí |
| Caché de prompts | Sí | Sí |
| Function / tool calling | No | Sí |
| Tool calling asíncrono | No | Sí |
Redirección a mitad de turno (response.steer por WebSocket) | No | Sí |
Cambiar el esfuerzo a mitad de conversación conservando la caché (configuration_update) | No | Sí |
reasoning.mode: "pro" | No | Sí |
temperature, top_p, logprobs | Rechazados | Rechazados |
Si tu bucle de agente vive hoy en Chat Completions, muévelo a Responses o mantenlo en GPT-5.6, que todavía soporta tool calling ahí.
previous_response_id no funciona para organizaciones con Zero Data Retention activada. Envía el historial de la conversación explícitamente en input.Elegir un esfuerzo de razonamiento
none o minimal en un modelo anterior, empieza en low y compara. Los desarrolladores que publicaron registros de migración en los primeros días tras el lanzamiento convergieron en medium como punto de partida por defecto para trabajo de código; son informes de la comunidad, no mediciones de EvoLink.| Esfuerzo | Para qué sirve | Qué vigilar |
|---|---|---|
low | Extracción, clasificación, reescrituras cortas, todo lo que corría en none en GPT-5.6 | Sigue teniendo tokens de razonamiento; no es un nivel gratuito |
medium | Por defecto para tareas de código, uso de herramientas en varios pasos, trabajo documental | Las ejecuciones de terceros muestran un gran salto de calidad sobre low con un salto de coste moderado |
high | Cambios a escala de repositorio, cadenas largas de investigación | El tiempo hasta el primer token y el gasto en tokens suben mucho |
xhigh | Tareas de agente difíciles en las que high no supera la prueba de aceptación | Caro; verifícalo con tu propio conjunto de evaluación |
max | Presupuesto de razonamiento sin restricciones | Las mediciones de terceros muestran minutos hasta el primer token; rara vez compensa fuera del batch offline |
OpenAI documenta dos controles adicionales. Su soporte en EvoLink aún no está verificado; lo siguiente sirve como referencia de la API del proveedor:
configuration_updatepermite que una conversación de Responses cambie de esfuerzo entre turnos sin invalidar la caché de prompts. Empieza enmediumy escala solo los turnos que fallan.reasoning.mode: "pro"es un modo de calidad independiente en la API Responses; trátalo como un candidato de evaluación aparte, no como un sexto nivel de esfuerzo.
Fijar el esfuerzo por petición en Responses:
response = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "Refactoriza este módulo y explica cada cambio."}],
reasoning={"effort": "high"},
max_output_tokens=8000,
)Tool calling en la API Responses
function_call; ejecútalo y devuelve el resultado como function_call_output.tools = [{
"type": "function",
"name": "get_build_status",
"description": "Devuelve el estado del último build de CI de una rama.",
"parameters": {
"type": "object",
"properties": {"branch": {"type": "string"}},
"required": ["branch"],
},
}]
first = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "¿La rama main está en verde? Si no, resume el fallo."}],
tools=tools,
reasoning={"effort": "medium"},
)
calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
# ejecuta tu herramienta aquí
outputs.append({
"type": "function_call_output",
"call_id": call.call_id,
"output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
})
second = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "¿La rama main está en verde? Si no, resume el fallo."}]
+ list(first.output) + outputs,
tools=tools,
reasoning={"effort": "medium"},
)
print(second.output_text)"async": true en una herramienta de función permite que el modelo siga razonando durante su ejecución. El soporte en EvoLink aún no está verificado; un bucle síncrono correcto no demuestra soporte asíncrono.Salidas estructuradas y streaming
text.format:response = client.responses.create(
model="gpt-6-astra",
input="Extrae el ID de modelo, la ventana de contexto y el límite de salida de este texto: ...",
text={
"format": {
"type": "json_schema",
"name": "model_spec",
"schema": {
"type": "object",
"properties": {
"model_id": {"type": "string"},
"context_tokens": {"type": "integer"},
"max_output_tokens": {"type": "integer"},
},
"required": ["model_id", "context_tokens", "max_output_tokens"],
"additionalProperties": False,
},
"strict": True,
}
},
reasoning={"effort": "low"},
)
print(response.output_text)stream=True en cualquiera de las dos superficies. Con niveles de esfuerzo altos el primer token puede tardar decenas de segundos, así que haz streaming en cualquier ruta interactiva y muestra el progreso mientras corre el razonamiento.Migrar desde GPT-5.6
La tabla siguiente recoge los requisitos de migración de OpenAI. En EvoLink, verifica cada campo de petición y función opcional antes de mover tráfico; cambiar el ID de modelo no basta para demostrar compatibilidad.
| Cambio | GPT-5.6 | GPT-6 Astra |
|---|---|---|
| ID de modelo | gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna | gpt-6-astra |
| Parámetros de muestreo | temperature, top_p aceptados | Elimínalos; la petición falla con 400 |
Esfuerzo de razonamiento none / minimal | Aceptado | Convertir a low |
| Superficie de tool calling | Chat Completions o Responses | Solo Responses |
| Opción de caché de prompts | prompt_cache_retention | prompt_cache_options: {"ttl": "30m"} |
| Estado de conversación con Zero Data Retention | previous_response_id | Enviar el historial en input |
| Codex CLI | Cualquier versión reciente | 0.153.0 o superior |
El diff de una llamada típica a Chat Completions:
response = client.chat.completions.create(
- model="gpt-5.6-sol",
+ model="gpt-6-astra",
messages=messages,
- temperature=0.2,
- reasoning_effort="none",
+ reasoning_effort="low",
)AGENTS.md y prefiere listas y tablas. Los primeros usuarios reportaron también el fallo contrario: un ticket pequeño convertido en un diff enorme. Mantén explícita la instrucción de «cambio mínimo» en el prompt de sistema y deja GPT-5.6 enrutable para un rollback.Reglas de coste: 272K, caché, Batch y Flex
Regla 1: por encima de 272K tokens de entrada, toda la petición cambia de precio
Las tarifas de entrada y caché se duplican y la tarifa de salida sube 1,5× para toda la petición, no solo para los tokens que superan el umbral.
| Petición | Coste de entrada | Coste de salida (20K tokens) | Total |
|---|---|---|---|
| 272.000 tokens de entrada | 272K × $10 = $2.72 | 20K × $50 = $1.00 | $3.72 |
| 280.000 tokens de entrada | 280K × $20 = $5.60 | 20K × $75 = $1.50 | $7.10 |
Ocho mil tokens de más casi duplican la factura. Cuenta los tokens antes de enviar, compacta el contexto al acercarte al tramo, o enruta la petición a GPT-5.6 Sol, cuya tarifa de contexto largo es $8 / $30.
Regla 2: la caché compensa desde la primera reutilización
k veces más:- sin caché:
10 × (k + 1)dólares por millón de tokens de prefijo - con caché:
12.50 + 1 × k
k = 1 son $20 frente a $13.50, así que la caché gana desde la primera reutilización y la brecha crece a partir de ahí. Coloca el contenido estable (prompt de sistema, schemas de herramientas, documentos de referencia) al principio de la entrada, y ten en cuenta el TTL de 30 minutos: una sesión inactiva más tiempo vuelve a pagar la escritura.Regla 3: Batch y Flex cuestan la mitad
En OpenAI, Batch y Flex cuestan el 50 % de Standard. Son candidatos para evaluaciones offline, procesos nocturnos y cargas históricas. Fast cuesta 2×, no ofrece SLA de latencia para Astra y no está disponible con residencia de datos en la UE. La disponibilidad y facturación de estos modos en EvoLink aún no están verificadas; no apliques descuentos del proveedor a una estimación de EvoLink sin confirmación de la ruta.
Las reglas combinadas
configuration_update mediante EvoLink solo después de verificar esa función en tu ruta.| Carga de trabajo | Configuración segura más barata |
|---|---|
| Agente de código interactivo, contexto de 50K–150K | Responses, medium, caché activada, contexto por debajo de 272K |
| Análisis nocturno de repositorio | Batch, high, fragmentos por debajo de 272K |
| Extracción corta a gran escala | Chat Completions, low, o GPT-5.6 Terra / Luna si la calidad lo permite |
| Cadena larga de investigación con reintentos | Responses, medium con escalado mediante configuration_update, respaldo a Sol |
Rate limits y respaldo
OpenAI publica los rate limits de Astra por nivel de uso. Las cifras importan porque una sola petición con el contexto completo puede superar el presupuesto de tokens por minuto.
| Nivel de OpenAI | Peticiones por minuto | Tokens por minuto |
|---|---|---|
| Nivel 1 | 500 | 500.000 |
| Nivel 2 | 5.000 | 1.000.000 |
| Nivel 3 | 5.000 | 2.000.000 |
| Nivel 4 | 10.000 | 4.000.000 |
| Nivel 5 | 15.000 | 40.000.000 |
En EvoLink los límites se fijan por cuenta; revisa tu dashboard antes de una prueba de carga. Tres modos de fallo merecen un tratamiento explícito:
- 400 por la forma de la petición.
temperature,top_p, esfuerzononeo herramientas en Chat Completions. Corrige la petición; no reintentes. - 429 o 5xx. Reintenta con backoff y después recurre a
gpt-5.6-solcon la misma clave. La guía de timeouts, reintentos y respaldo cubre el patrón. - Tarea detenida por el monitor de seguridad de OpenAI. Astra corre bajo una monitorización asíncrona de desalineación; cuando se activa, la tarea de API se detiene. Regístralo, avisa al operador y enruta la tarea a un modelo de respaldo en lugar de entrar en bucle.
def call_with_fallback(**kwargs):
for model in ("gpt-6-astra", "gpt-5.6-sol"):
try:
return client.responses.create(model=model, **kwargs)
except Exception as err: # acótalo a 429/5xx en producción
last = err
raise lastPreguntas frecuentes
¿Qué ID de modelo uso para GPT-6?
gpt-6-astra. No existe un alias genérico gpt-6 en OpenAI ni en EvoLink, y la misma cadena funciona en Chat Completions y Responses.¿Puedo usar herramientas con GPT-6 Astra en Chat Completions?
No. OpenAI documenta tool calling para este modelo solo en Responses; Chat Completions acepta texto e imágenes. La entrada de imágenes mediante EvoLink todavía requiere verificación de la ruta.
¿Con qué esfuerzo de razonamiento debería empezar?
medium para código y agentes, o en low para tareas que usaban none o minimal. OpenAI documenta el escalado por tarea con configuration_update; úsalo mediante EvoLink solo después de verificar la ruta.¿GPT-6 Astra acepta temperature?
temperature, top_p y logprobs devuelven un 400. Elimínalos de la petición.¿Cómo se factura una petición por encima de 272K tokens de entrada?
Toda la petición pasa al tramo de contexto largo: 2× las tarifas de entrada y caché, 1,5× la salida. Cuenta primero los tokens y compacta o divide al acercarte al umbral.
¿Qué cambia al migrar desde GPT-5.6?
temperature y top_p, sustituye none por low y mueve las tool calls a Responses. OpenAI también documenta un cambio en la opción de caché. El endpoint y la clave de EvoLink siguen iguales; verifica las opciones de caché y funciones avanzadas en la ruta antes de migrar.¿GPT-6 Astra está en Amazon Bedrock?
¿Dónde encuentro el precio de EvoLink para GPT-6 Astra?
Fuentes
- OpenAI: documentación del modelo GPT-6 Astra
- OpenAI: guía del modelo GPT-6 Astra (migración, parámetros no admitidos, herramientas solo en Responses)
- OpenAI: guía de razonamiento
- OpenAI: guía de caché de prompts
- OpenAI: guía del modo Fast
- OpenAI: guía de rate limits
- Precios de la API de OpenAI
- OpenAI: anuncio de GPT-6 Astra
- AWS: model cards de OpenAI en Amazon Bedrock
- Shinsuke Kagawa: pasar de GPT-5.6 Sol a GPT-6 Astra, empezar con esfuerzo medium


