Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen
Konzeptillustration: Code-Panels sind über ein API-Gateway mit einem leuchtenden KI-Kern verbunden
guide

GPT-6 Astra API nutzen: Erster Aufruf, Effort-Stufen & Migration von GPT-5.6

EvoLink Team
EvoLink Team
Product Team
5. September 2026
14 Min. Lesezeit
GPT-6 Astra ist OpenAIs aktuelles Flaggschiff für anspruchsvolles End-to-End-Coding, Computer Use, Recherche und Agenten-Arbeit. Auf EvoLink läuft es unter der Modell-ID gpt-6-astra, auf demselben OpenAI-kompatiblen Endpoint und API-Key wie GPT-5.6, 10 % unter dem OpenAI-Listenpreis.
Dieser Leitfaden ist die Integrationsreferenz. Er behandelt den ersten Request in drei Sprachen, den Unterschied zwischen Chat Completions und der Responses API für dieses Modell, die Wahl des Reasoning-Efforts, die exakten Änderungen für eine bestehende GPT-5.6-Integration und die drei Abrechnungsregeln, die entscheiden, ob Astra auf Ihrem Workload mehr oder weniger kostet als Sol. Aktuelle EvoLink-Preise, die Modellkarte und den Kostenrechner finden Sie auf der GPT-6 Astra API-Seite.
Anbieter- und Gateway-Funktionen. Die Modellfunktionen unten beziehen sich auf die OpenAI-Dokumentation. EvoLink nutzt den hier genannten Endpoint. Ein erfolgreicher Text-Request belegt jedoch keine Unterstützung für Bildeingaben, Batch/Flex/Fast, WebSocket-Steering, asynchrone Tools, Pro-Modus, configuration_update oder die Cache-Option 30m. Prüfen Sie diese Funktionen vor der Nutzung einzeln auf der EvoLink-Route.

Kurzreferenz

PunktWert
Modell-IDgpt-6-astra (kein gpt-6-Alias auf OpenAI oder EvoLink)
Endpointhttps://api.evolink.ai/v1 (OpenAI-kompatibel)
API-Oberflächen (OpenAI)Responses, Chat Completions (kein Tool Calling), Batch; EvoLink-Unterstützung separat prüfen
Kontextfenster1.050.000 Tokens für Input und Output gemeinsam; maximaler Input 922.000; maximaler Output 128.000
Input / OutputText und Bild rein; Text raus
Wissensstand30. April 2026
Reasoning-Effortlow, medium, high, xhigh, max; none und minimal liefern einen 400
Entfernte Parametertemperature, top_p, logprobs
Prompt-CachingUnterstützt; Cache-Writes kosten das 1,25-Fache des Inputs; TTL-Option ist 30m
OpenAI-Listenpreis (Input ≤ 272K)$10 Input / $1 gecacht / $12.50 Cache-Write / $50 Output pro 1M Tokens
Long-Context-Band (Input > 272K)Gesamter Request zum 2-Fachen bei Input und Cache und zum 1,5-Fachen beim Output
EvoLink-Preis10 % unter dem OpenAI-Listenpreis; aktuelle Zahlen auf der API-Seite
Nicht unterstütztFine-Tuning, Realtime, Assistants, Embeddings, Bild- oder Audioerzeugung

Setup und erster Request

Erstellen Sie einen Key unter Dashboard → Keys. Derselbe Key routet GPT-5.6, Claude, Gemini und GPT-6 Astra.

Schritt 2: OpenAI SDK installieren

pip install openai        # Python
npm install openai        # Node.js

Schritt 3: Den ersten Request senden

Beginnen Sie mit einem einfachen Responses-Request. OpenAI verlangt Responses für Tool Calling; erweiterte Responses-Funktionen müssen auf der EvoLink-Route separat geprüft werden.

cURL:
curl https://api.evolink.ai/v1/responses \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Erkläre in einem Absatz den Unterschied zwischen Cache-Reads und Cache-Writes.",
    "reasoning": {"effort": "medium"}
  }'
Python:
from openai import OpenAI

client = OpenAI(
    api_key="your-evolink-api-key",
    base_url="https://api.evolink.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    input="Erkläre in einem Absatz den Unterschied zwischen Cache-Reads und Cache-Writes.",
    reasoning={"effort": "medium"},
)

print(response.output_text)
print(response.model, response.usage)
Node.js:
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "your-evolink-api-key",
  baseURL: "https://api.evolink.ai/v1",
});

const response = await client.responses.create({
  model: "gpt-6-astra",
  input: "Erkläre in einem Absatz den Unterschied zwischen Cache-Reads und Cache-Writes.",
  reasoning: { effort: "medium" },
});

console.log(response.output_text);
console.log(response.model, response.usage);
Geben Sie beim ersten Aufruf response.model und response.usage aus. Der zurückgegebene Modellstring sollte gpt-6-astra lauten, und der Usage-Block zeigt Input-, gecachte, Reasoning- und Output-Tokens – genau das brauchen Sie für den Abgleich mit der Rechnung.

Reine Textanfragen über Chat Completions

Chat Completions funktioniert für reine Textanfragen. Übergeben Sie kein temperature, top_p oder tools:
response = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "Fasse dieses Changelog in drei Stichpunkten zusammen: ..."}],
    reasoning_effort="low",
)
print(response.choices[0].message.content)

Chat Completions vs. Responses API

Diese Tabelle beschreibt Funktionen der OpenAI API, einschließlich Text- und Bildeingaben. Sie ist keine EvoLink-Supportmatrix: Prüfen Sie Bildeingaben und jede optionale Funktion auf Ihrer Route. Chat Completions unterstützt bei diesem Modell kein Tool Calling.
FunktionChat CompletionsResponses API
Text rein, Text rausJaJa
Bild-InputJaJa
StreamingJaJa
Structured OutputsJaJa
Prompt-CachingJaJa
Function / Tool CallingNeinJa
Asynchrones Tool CallingNeinJa
Steuerung mitten im Turn (response.steer über WebSocket)NeinJa
Effort mitten im Gespräch ändern und Cache behalten (configuration_update)NeinJa
reasoning.mode: "pro"NeinJa
temperature, top_p, logprobsAbgelehntAbgelehnt

Läuft Ihre Agentenschleife heute auf Chat Completions, verlegen Sie sie auf Responses oder lassen Sie sie auf GPT-5.6, das dort weiterhin Tool Calling unterstützt.

Ein Responses-spezifischer Hinweis: previous_response_id funktioniert nicht für Organisationen mit aktivierter Zero Data Retention. Senden Sie den Gesprächsverlauf stattdessen explizit in input.

Den Reasoning-Effort wählen

Astra kennt fünf Stufen. OpenAIs eigene Empfehlung ist knapp: Wer auf einem früheren Modell none oder minimal genutzt hat, startet bei low und vergleicht. Entwickler, die in den ersten Tagen nach dem Release Migrationsprotokolle veröffentlicht haben, landeten für Coding-Arbeit bei medium als Standard-Startpunkt; das sind Community-Berichte, keine EvoLink-Messungen.
EffortWofür geeignetWorauf achten
lowExtraktion, Klassifikation, kurze Umformulierungen, alles, was auf GPT-5.6 mit none liefTrägt weiterhin Reasoning-Tokens; keine Gratisstufe
mediumStandard für Coding-Aufgaben, mehrstufige Tool-Nutzung, DokumentarbeitLäufe Dritter zeigen einen großen Qualitätssprung gegenüber low bei moderatem Kostensprung
highÄnderungen im Repository-Maßstab, lange Recherche-KettenZeit bis zum ersten Token und Token-Verbrauch steigen stark
xhighSchwere Agentenaufgaben, bei denen high den Abnahmetest nicht bestehtTeuer; mit eigenem Evaluierungsset verifizieren
maxUnbegrenztes Reasoning-BudgetMessungen Dritter zeigen Minuten bis zum ersten Token; lohnt sich außerhalb von Offline-Batch selten

OpenAI dokumentiert zwei zusätzliche Steuerungsmöglichkeiten. Ihre Unterstützung auf EvoLink ist noch nicht verifiziert; die folgenden Angaben dienen als Referenz für die Anbieter-API:

  • configuration_update erlaubt es, in einem Responses-Gespräch den Effort zwischen Turns zu ändern, ohne den Prompt-Cache zu verlieren. Starten Sie bei medium und erhöhen Sie nur die Turns, die scheitern.
  • reasoning.mode: "pro" ist ein separater Qualitätsmodus der Responses API; behandeln Sie ihn als eigenen Evaluierungskandidaten, nicht als sechste Effort-Stufe.

Effort pro Request in Responses setzen:

response = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "Refaktoriere dieses Modul und erkläre jede Änderung."}],
    reasoning={"effort": "high"},
    max_output_tokens=8000,
)

Tool Calling über die Responses API

Function-Tools nutzen das flache Responses-Tool-Format. Das Modell kann ein function_call-Element zurückgeben; führen Sie es aus und senden Sie das Ergebnis als function_call_output zurück.
tools = [{
    "type": "function",
    "name": "get_build_status",
    "description": "Gibt den Status des letzten CI-Builds für einen Branch zurück.",
    "parameters": {
        "type": "object",
        "properties": {"branch": {"type": "string"}},
        "required": ["branch"],
    },
}]

first = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "Ist der main-Branch grün? Falls nicht, fasse den Fehler zusammen."}],
    tools=tools,
    reasoning={"effort": "medium"},
)

calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
    # hier Ihr Tool ausführen
    outputs.append({
        "type": "function_call_output",
        "call_id": call.call_id,
        "output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
    })

second = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "Ist der main-Branch grün? Falls nicht, fasse den Fehler zusammen."}]
          + list(first.output) + outputs,
    tools=tools,
    reasoning={"effort": "medium"},
)
print(second.output_text)
OpenAI dokumentiert auch asynchrones Tool Calling: Mit "async": true an einem Function-Tool kann das Modell während der Tool-Ausführung weiter schlussfolgern. Die EvoLink-Unterstützung ist noch nicht verifiziert; eine funktionierende synchrone Schleife belegt keine asynchrone Unterstützung.

Structured Outputs und Streaming

Structured Outputs funktionieren auf beiden Oberflächen. Bei Responses übergeben Sie ein JSON-Schema über text.format:
response = client.responses.create(
    model="gpt-6-astra",
    input="Extrahiere Modell-ID, Kontextfenster und Output-Limit aus diesem Text: ...",
    text={
        "format": {
            "type": "json_schema",
            "name": "model_spec",
            "schema": {
                "type": "object",
                "properties": {
                    "model_id": {"type": "string"},
                    "context_tokens": {"type": "integer"},
                    "max_output_tokens": {"type": "integer"},
                },
                "required": ["model_id", "context_tokens", "max_output_tokens"],
                "additionalProperties": False,
            },
            "strict": True,
        }
    },
    reasoning={"effort": "low"},
)
print(response.output_text)
Streaming nutzt stream=True auf beiden Oberflächen. Bei hohen Effort-Stufen kann der erste Token Dutzende Sekunden brauchen – streamen Sie in jedem interaktiven Pfad und zeigen Sie Fortschritt an, während das Reasoning läuft.

Migration von GPT-5.6

Die folgende Tabelle nennt OpenAIs Migrationsanforderungen. Prüfen Sie auf EvoLink die Request-Felder und optionalen Funktionen einzeln, bevor Sie Traffic umstellen; ein neuer Modellname allein belegt keine Kompatibilität.

ÄnderungGPT-5.6GPT-6 Astra
Modell-IDgpt-5.6-sol, gpt-5.6-terra, gpt-5.6-lunagpt-6-astra
Sampling-Parametertemperature, top_p akzeptiertEntfernen; der Request scheitert sonst mit 400
Reasoning-Effort none / minimalAkzeptiertAuf low mappen
Tool-Calling-OberflächeChat Completions oder ResponsesNur Responses
Prompt-Cache-Optionprompt_cache_retentionprompt_cache_options: {"ttl": "30m"}
Gesprächszustand mit Zero Data Retentionprevious_response_idVerlauf in input senden
Codex CLIJede aktuelle Version0.153.0 oder neuer

Der Diff für einen typischen Chat-Completions-Aufruf:

 response = client.chat.completions.create(
-    model="gpt-5.6-sol",
+    model="gpt-6-astra",
     messages=messages,
-    temperature=0.2,
-    reasoning_effort="none",
+    reasoning_effort="low",
 )
Auch das Verhalten verschiebt sich. OpenAIs Leitfaden hält fest, dass Astra bei mehrstufigen Aufgaben länger kohärent bleibt, häufiger nachfragt, Anweisungen in Dateien wie AGENTS.md wörtlicher befolgt und Listen sowie Tabellen bevorzugt. Frühe Anwender berichteten auch das Gegenteil: Ein kleines Ticket wurde zu einem sehr großen Diff. Halten Sie die Anweisung „minimale Änderung“ im System-Prompt explizit und lassen Sie GPT-5.6 für ein Rollback routbar.
Fahren Sie dasselbe feste Aufgabenset auf beiden Modellen, bevor Sie Traffic verschieben. Der Vergleich GPT-6 Astra vs GPT-5.6 enthält die Formel für Kosten pro akzeptierter Aufgabe und eine Routing-Regel als Ausgangspunkt.

Kostenregeln: 272K, Caching, Batch und Flex

Drei Regeln entscheiden, ob Astra auf einem Workload mehr oder weniger kostet als Sol. Die Beispiele nutzen OpenAI-Listenpreise; EvoLinks Sätze liegen 10 % darunter und stehen auf der API-Seite.

Regel 1: Oberhalb von 272K Input-Tokens wird der gesamte Request neu bepreist

Input- und Cache-Sätze verdoppeln sich, der Output-Satz steigt um das 1,5-Fache – für den gesamten Request, nicht nur für die Tokens jenseits der Schwelle.

RequestInput-KostenOutput-Kosten (20K Tokens)Summe
272.000 Input-Tokens272K × $10 = $2.7220K × $50 = $1.00$3.72
280.000 Input-Tokens280K × $20 = $5.6020K × $75 = $1.50$7.10

Achttausend zusätzliche Tokens verdoppeln die Rechnung fast. Zählen Sie Tokens vor dem Senden, verdichten Sie den Kontext, wenn Sie sich dem Band nähern, oder routen Sie den Request zu GPT-5.6 Sol, dessen Long-Context-Satz bei $8 / $30 liegt.

Regel 2: Caching lohnt sich ab der ersten Wiederverwendung

Ein Cache-Write kostet $12.50 pro Million Tokens (1,25-Faches des Inputs), ein Cache-Read $1.00. Für ein gemeinsames Präfix, das k weitere Male gesendet wird:
  • ungecacht: 10 × (k + 1) Dollar pro Million Präfix-Tokens
  • gecacht: 12.50 + 1 × k
Bei k = 1 sind das $20 gegenüber $13.50 – Caching gewinnt also schon bei der ersten Wiederverwendung, und die Lücke wächst danach. Halten Sie stabile Inhalte (System-Prompt, Tool-Schemas, Referenzdokumente) am Anfang des Inputs und beachten Sie die TTL von 30 Minuten: Eine länger untätige Session zahlt den Write erneut.

Regel 3: Batch und Flex kosten die Hälfte

Bei OpenAI kosten Batch und Flex 50 % von Standard. Sie kommen für Offline-Evaluierungen, nächtliche Verarbeitung und Backfills infrage. Fast kostet das Doppelte, bietet für Astra kein Latenz-SLA und ist mit EU-Datenresidenz nicht verfügbar. Verfügbarkeit und Abrechnung dieser Modi auf EvoLink sind noch nicht verifiziert; übernehmen Sie Anbieter-Rabatte nicht ohne Prüfung der Route in eine EvoLink-Kalkulation.

Die Regeln zusammengenommen

Die folgenden Konfigurationen sind Evaluierungskandidaten auf Basis der OpenAI-Funktionen. Nutzen Sie Batch oder configuration_update über EvoLink erst nach Prüfung der jeweiligen Route.
WorkloadGünstigste sichere Konfiguration
Interaktiver Coding-Agent, 50K–150K KontextResponses, medium, Caching aktiv, Kontext unter 272K
Nächtliche Repository-AnalyseBatch, high, Chunks unter 272K
Kurze Extraktion in großer MengeChat Completions, low, oder GPT-5.6 Terra / Luna, wenn die Qualität es erlaubt
Lange Recherche-Kette mit RetriesResponses, medium mit Eskalation über configuration_update, Fallback zu Sol

Rate Limits und Fallback

OpenAI veröffentlicht die Astra-Rate-Limits nach Nutzungsstufe. Die Zahlen sind relevant, weil ein einziger Request mit vollem Kontext ein Token-Budget pro Minute übersteigen kann.

OpenAI-StufeRequests pro MinuteTokens pro Minute
Tier 1500500.000
Tier 25.0001.000.000
Tier 35.0002.000.000
Tier 410.0004.000.000
Tier 515.00040.000.000

Auf EvoLink werden Limits pro Konto gesetzt; prüfen Sie Ihr Dashboard vor Lasttests. Drei Fehlermodi verdienen explizite Behandlung:

  1. 400 wegen Request-Form. temperature, top_p, Effort none oder Tools auf Chat Completions. Korrigieren Sie den Request; kein Retry.
  2. 429 oder 5xx. Mit Backoff wiederholen, dann auf demselben Key zu gpt-5.6-sol zurückfallen. Der Leitfaden zu Timeout, Retry und Fallback beschreibt das Muster.
  3. Task von OpenAIs Safety-Monitor gestoppt. Astra läuft unter asynchronem Misalignment-Monitoring; löst es aus, stoppt der API-Task. Loggen Sie es, melden Sie es dem Operator und routen Sie die Aufgabe zu einem Fallback-Modell, statt zu schleifen.
def call_with_fallback(**kwargs):
    for model in ("gpt-6-astra", "gpt-5.6-sol"):
        try:
            return client.responses.create(model=model, **kwargs)
        except Exception as err:  # in Produktion auf 429/5xx eingrenzen
            last = err
    raise last

FAQ

Welche Modell-ID verwende ich für GPT-6?

gpt-6-astra. Es gibt keinen generischen gpt-6-Alias auf OpenAI oder EvoLink, und derselbe String funktioniert auf Chat Completions und Responses.

Kann ich Tools mit GPT-6 Astra über Chat Completions nutzen?

Nein. OpenAI dokumentiert Tool Calling für dieses Modell nur auf Responses; Chat Completions akzeptiert Text- und Bildeingaben. Bildeingaben über EvoLink müssen noch auf der Route geprüft werden.

Mit welchem Reasoning-Effort sollte ich starten?

Starten Sie mit medium für Coding- und Agentenaufgaben oder low für Aufgaben, die zuvor none oder minimal nutzten. OpenAI dokumentiert eine Eskalation pro Aufgabe mit configuration_update; nutzen Sie sie über EvoLink erst nach Prüfung der Route.

Akzeptiert GPT-6 Astra temperature?

Nein. temperature, top_p und logprobs liefern einen 400. Entfernen Sie sie aus dem Request.

Wie wird ein Request über 272K Input-Tokens abgerechnet?

Der gesamte Request wechselt ins Long-Context-Band: 2-Fache bei Input und Cache, 1,5-Fache beim Output. Zählen Sie zuerst Tokens und verdichten oder teilen Sie, wenn Sie sich der Schwelle nähern.

Was ändert sich bei der Migration von GPT-5.6?

Ändern Sie die Modell-ID, entfernen Sie temperature und top_p, ersetzen Sie none durch low und verlagern Sie Tool-Aufrufe auf Responses. OpenAI dokumentiert auch eine geänderte Cache-Option. EvoLink-Endpoint und Key bleiben gleich; prüfen Sie Cache-Optionen und erweiterte Funktionen vor der Migration auf der Route.

Ist GPT-6 Astra auf Amazon Bedrock?

Stand 5. September 2026 nicht. OpenAI hat Bedrock als Kanal genannt, aber die AWS-Model-Cards für OpenAI enden weiterhin bei GPT-5.6. Azure Foundry listet es als allgemein verfügbar. Der Release-Tracker wird bei Änderungen aktualisiert.
Auf der GPT-6 Astra API-Seite, die die Sätze der Standardgruppe 10 % unter dem OpenAI-Listenpreis, das Long-Context-Band und einen Rechner listet.
GPT-6 Astra auf EvoLink aufrufen

Quellen

Beweislage zuletzt geprüft am 5. September 2026. Anbieterfakten stammen aus der OpenAI-Dokumentation; Effort-Empfehlungen der Community sind zugeschrieben und keine EvoLink-Messungen. Aktuelle EvoLink-Preise stehen auf der API-Seite.

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.