
GPT-6 Astra API nutzen: Erster Aufruf, Effort-Stufen & Migration von GPT-5.6

gpt-6-astra, auf demselben OpenAI-kompatiblen Endpoint und API-Key wie GPT-5.6, 10 % unter dem OpenAI-Listenpreis.configuration_update oder die Cache-Option 30m. Prüfen Sie diese Funktionen vor der Nutzung einzeln auf der EvoLink-Route.Kurzreferenz
| Punkt | Wert |
|---|---|
| Modell-ID | gpt-6-astra (kein gpt-6-Alias auf OpenAI oder EvoLink) |
| Endpoint | https://api.evolink.ai/v1 (OpenAI-kompatibel) |
| API-Oberflächen (OpenAI) | Responses, Chat Completions (kein Tool Calling), Batch; EvoLink-Unterstützung separat prüfen |
| Kontextfenster | 1.050.000 Tokens für Input und Output gemeinsam; maximaler Input 922.000; maximaler Output 128.000 |
| Input / Output | Text und Bild rein; Text raus |
| Wissensstand | 30. April 2026 |
| Reasoning-Effort | low, medium, high, xhigh, max; none und minimal liefern einen 400 |
| Entfernte Parameter | temperature, top_p, logprobs |
| Prompt-Caching | Unterstützt; Cache-Writes kosten das 1,25-Fache des Inputs; TTL-Option ist 30m |
| OpenAI-Listenpreis (Input ≤ 272K) | $10 Input / $1 gecacht / $12.50 Cache-Write / $50 Output pro 1M Tokens |
| Long-Context-Band (Input > 272K) | Gesamter Request zum 2-Fachen bei Input und Cache und zum 1,5-Fachen beim Output |
| EvoLink-Preis | 10 % unter dem OpenAI-Listenpreis; aktuelle Zahlen auf der API-Seite |
| Nicht unterstützt | Fine-Tuning, Realtime, Assistants, Embeddings, Bild- oder Audioerzeugung |
Setup und erster Request
Schritt 1: EvoLink-API-Key anlegen
Schritt 2: OpenAI SDK installieren
pip install openai # Python
npm install openai # Node.jsSchritt 3: Den ersten Request senden
Beginnen Sie mit einem einfachen Responses-Request. OpenAI verlangt Responses für Tool Calling; erweiterte Responses-Funktionen müssen auf der EvoLink-Route separat geprüft werden.
curl https://api.evolink.ai/v1/responses \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "Erkläre in einem Absatz den Unterschied zwischen Cache-Reads und Cache-Writes.",
"reasoning": {"effort": "medium"}
}'from openai import OpenAI
client = OpenAI(
api_key="your-evolink-api-key",
base_url="https://api.evolink.ai/v1",
)
response = client.responses.create(
model="gpt-6-astra",
input="Erkläre in einem Absatz den Unterschied zwischen Cache-Reads und Cache-Writes.",
reasoning={"effort": "medium"},
)
print(response.output_text)
print(response.model, response.usage)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "your-evolink-api-key",
baseURL: "https://api.evolink.ai/v1",
});
const response = await client.responses.create({
model: "gpt-6-astra",
input: "Erkläre in einem Absatz den Unterschied zwischen Cache-Reads und Cache-Writes.",
reasoning: { effort: "medium" },
});
console.log(response.output_text);
console.log(response.model, response.usage);response.model und response.usage aus. Der zurückgegebene Modellstring sollte gpt-6-astra lauten, und der Usage-Block zeigt Input-, gecachte, Reasoning- und Output-Tokens – genau das brauchen Sie für den Abgleich mit der Rechnung.Reine Textanfragen über Chat Completions
temperature, top_p oder tools:response = client.chat.completions.create(
model="gpt-6-astra",
messages=[{"role": "user", "content": "Fasse dieses Changelog in drei Stichpunkten zusammen: ..."}],
reasoning_effort="low",
)
print(response.choices[0].message.content)Chat Completions vs. Responses API
| Funktion | Chat Completions | Responses API |
|---|---|---|
| Text rein, Text raus | Ja | Ja |
| Bild-Input | Ja | Ja |
| Streaming | Ja | Ja |
| Structured Outputs | Ja | Ja |
| Prompt-Caching | Ja | Ja |
| Function / Tool Calling | Nein | Ja |
| Asynchrones Tool Calling | Nein | Ja |
Steuerung mitten im Turn (response.steer über WebSocket) | Nein | Ja |
Effort mitten im Gespräch ändern und Cache behalten (configuration_update) | Nein | Ja |
reasoning.mode: "pro" | Nein | Ja |
temperature, top_p, logprobs | Abgelehnt | Abgelehnt |
Läuft Ihre Agentenschleife heute auf Chat Completions, verlegen Sie sie auf Responses oder lassen Sie sie auf GPT-5.6, das dort weiterhin Tool Calling unterstützt.
previous_response_id funktioniert nicht für Organisationen mit aktivierter Zero Data Retention. Senden Sie den Gesprächsverlauf stattdessen explizit in input.Den Reasoning-Effort wählen
none oder minimal genutzt hat, startet bei low und vergleicht. Entwickler, die in den ersten Tagen nach dem Release Migrationsprotokolle veröffentlicht haben, landeten für Coding-Arbeit bei medium als Standard-Startpunkt; das sind Community-Berichte, keine EvoLink-Messungen.| Effort | Wofür geeignet | Worauf achten |
|---|---|---|
low | Extraktion, Klassifikation, kurze Umformulierungen, alles, was auf GPT-5.6 mit none lief | Trägt weiterhin Reasoning-Tokens; keine Gratisstufe |
medium | Standard für Coding-Aufgaben, mehrstufige Tool-Nutzung, Dokumentarbeit | Läufe Dritter zeigen einen großen Qualitätssprung gegenüber low bei moderatem Kostensprung |
high | Änderungen im Repository-Maßstab, lange Recherche-Ketten | Zeit bis zum ersten Token und Token-Verbrauch steigen stark |
xhigh | Schwere Agentenaufgaben, bei denen high den Abnahmetest nicht besteht | Teuer; mit eigenem Evaluierungsset verifizieren |
max | Unbegrenztes Reasoning-Budget | Messungen Dritter zeigen Minuten bis zum ersten Token; lohnt sich außerhalb von Offline-Batch selten |
OpenAI dokumentiert zwei zusätzliche Steuerungsmöglichkeiten. Ihre Unterstützung auf EvoLink ist noch nicht verifiziert; die folgenden Angaben dienen als Referenz für die Anbieter-API:
configuration_updateerlaubt es, in einem Responses-Gespräch den Effort zwischen Turns zu ändern, ohne den Prompt-Cache zu verlieren. Starten Sie beimediumund erhöhen Sie nur die Turns, die scheitern.reasoning.mode: "pro"ist ein separater Qualitätsmodus der Responses API; behandeln Sie ihn als eigenen Evaluierungskandidaten, nicht als sechste Effort-Stufe.
Effort pro Request in Responses setzen:
response = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "Refaktoriere dieses Modul und erkläre jede Änderung."}],
reasoning={"effort": "high"},
max_output_tokens=8000,
)Tool Calling über die Responses API
function_call-Element zurückgeben; führen Sie es aus und senden Sie das Ergebnis als function_call_output zurück.tools = [{
"type": "function",
"name": "get_build_status",
"description": "Gibt den Status des letzten CI-Builds für einen Branch zurück.",
"parameters": {
"type": "object",
"properties": {"branch": {"type": "string"}},
"required": ["branch"],
},
}]
first = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "Ist der main-Branch grün? Falls nicht, fasse den Fehler zusammen."}],
tools=tools,
reasoning={"effort": "medium"},
)
calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
# hier Ihr Tool ausführen
outputs.append({
"type": "function_call_output",
"call_id": call.call_id,
"output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
})
second = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "Ist der main-Branch grün? Falls nicht, fasse den Fehler zusammen."}]
+ list(first.output) + outputs,
tools=tools,
reasoning={"effort": "medium"},
)
print(second.output_text)"async": true an einem Function-Tool kann das Modell während der Tool-Ausführung weiter schlussfolgern. Die EvoLink-Unterstützung ist noch nicht verifiziert; eine funktionierende synchrone Schleife belegt keine asynchrone Unterstützung.Structured Outputs und Streaming
text.format:response = client.responses.create(
model="gpt-6-astra",
input="Extrahiere Modell-ID, Kontextfenster und Output-Limit aus diesem Text: ...",
text={
"format": {
"type": "json_schema",
"name": "model_spec",
"schema": {
"type": "object",
"properties": {
"model_id": {"type": "string"},
"context_tokens": {"type": "integer"},
"max_output_tokens": {"type": "integer"},
},
"required": ["model_id", "context_tokens", "max_output_tokens"],
"additionalProperties": False,
},
"strict": True,
}
},
reasoning={"effort": "low"},
)
print(response.output_text)stream=True auf beiden Oberflächen. Bei hohen Effort-Stufen kann der erste Token Dutzende Sekunden brauchen – streamen Sie in jedem interaktiven Pfad und zeigen Sie Fortschritt an, während das Reasoning läuft.Migration von GPT-5.6
Die folgende Tabelle nennt OpenAIs Migrationsanforderungen. Prüfen Sie auf EvoLink die Request-Felder und optionalen Funktionen einzeln, bevor Sie Traffic umstellen; ein neuer Modellname allein belegt keine Kompatibilität.
| Änderung | GPT-5.6 | GPT-6 Astra |
|---|---|---|
| Modell-ID | gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna | gpt-6-astra |
| Sampling-Parameter | temperature, top_p akzeptiert | Entfernen; der Request scheitert sonst mit 400 |
Reasoning-Effort none / minimal | Akzeptiert | Auf low mappen |
| Tool-Calling-Oberfläche | Chat Completions oder Responses | Nur Responses |
| Prompt-Cache-Option | prompt_cache_retention | prompt_cache_options: {"ttl": "30m"} |
| Gesprächszustand mit Zero Data Retention | previous_response_id | Verlauf in input senden |
| Codex CLI | Jede aktuelle Version | 0.153.0 oder neuer |
Der Diff für einen typischen Chat-Completions-Aufruf:
response = client.chat.completions.create(
- model="gpt-5.6-sol",
+ model="gpt-6-astra",
messages=messages,
- temperature=0.2,
- reasoning_effort="none",
+ reasoning_effort="low",
)AGENTS.md wörtlicher befolgt und Listen sowie Tabellen bevorzugt. Frühe Anwender berichteten auch das Gegenteil: Ein kleines Ticket wurde zu einem sehr großen Diff. Halten Sie die Anweisung „minimale Änderung“ im System-Prompt explizit und lassen Sie GPT-5.6 für ein Rollback routbar.Kostenregeln: 272K, Caching, Batch und Flex
Regel 1: Oberhalb von 272K Input-Tokens wird der gesamte Request neu bepreist
Input- und Cache-Sätze verdoppeln sich, der Output-Satz steigt um das 1,5-Fache – für den gesamten Request, nicht nur für die Tokens jenseits der Schwelle.
| Request | Input-Kosten | Output-Kosten (20K Tokens) | Summe |
|---|---|---|---|
| 272.000 Input-Tokens | 272K × $10 = $2.72 | 20K × $50 = $1.00 | $3.72 |
| 280.000 Input-Tokens | 280K × $20 = $5.60 | 20K × $75 = $1.50 | $7.10 |
Achttausend zusätzliche Tokens verdoppeln die Rechnung fast. Zählen Sie Tokens vor dem Senden, verdichten Sie den Kontext, wenn Sie sich dem Band nähern, oder routen Sie den Request zu GPT-5.6 Sol, dessen Long-Context-Satz bei $8 / $30 liegt.
Regel 2: Caching lohnt sich ab der ersten Wiederverwendung
k weitere Male gesendet wird:- ungecacht:
10 × (k + 1)Dollar pro Million Präfix-Tokens - gecacht:
12.50 + 1 × k
k = 1 sind das $20 gegenüber $13.50 – Caching gewinnt also schon bei der ersten Wiederverwendung, und die Lücke wächst danach. Halten Sie stabile Inhalte (System-Prompt, Tool-Schemas, Referenzdokumente) am Anfang des Inputs und beachten Sie die TTL von 30 Minuten: Eine länger untätige Session zahlt den Write erneut.Regel 3: Batch und Flex kosten die Hälfte
Bei OpenAI kosten Batch und Flex 50 % von Standard. Sie kommen für Offline-Evaluierungen, nächtliche Verarbeitung und Backfills infrage. Fast kostet das Doppelte, bietet für Astra kein Latenz-SLA und ist mit EU-Datenresidenz nicht verfügbar. Verfügbarkeit und Abrechnung dieser Modi auf EvoLink sind noch nicht verifiziert; übernehmen Sie Anbieter-Rabatte nicht ohne Prüfung der Route in eine EvoLink-Kalkulation.
Die Regeln zusammengenommen
configuration_update über EvoLink erst nach Prüfung der jeweiligen Route.| Workload | Günstigste sichere Konfiguration |
|---|---|
| Interaktiver Coding-Agent, 50K–150K Kontext | Responses, medium, Caching aktiv, Kontext unter 272K |
| Nächtliche Repository-Analyse | Batch, high, Chunks unter 272K |
| Kurze Extraktion in großer Menge | Chat Completions, low, oder GPT-5.6 Terra / Luna, wenn die Qualität es erlaubt |
| Lange Recherche-Kette mit Retries | Responses, medium mit Eskalation über configuration_update, Fallback zu Sol |
Rate Limits und Fallback
OpenAI veröffentlicht die Astra-Rate-Limits nach Nutzungsstufe. Die Zahlen sind relevant, weil ein einziger Request mit vollem Kontext ein Token-Budget pro Minute übersteigen kann.
| OpenAI-Stufe | Requests pro Minute | Tokens pro Minute |
|---|---|---|
| Tier 1 | 500 | 500.000 |
| Tier 2 | 5.000 | 1.000.000 |
| Tier 3 | 5.000 | 2.000.000 |
| Tier 4 | 10.000 | 4.000.000 |
| Tier 5 | 15.000 | 40.000.000 |
Auf EvoLink werden Limits pro Konto gesetzt; prüfen Sie Ihr Dashboard vor Lasttests. Drei Fehlermodi verdienen explizite Behandlung:
- 400 wegen Request-Form.
temperature,top_p, Effortnoneoder Tools auf Chat Completions. Korrigieren Sie den Request; kein Retry. - 429 oder 5xx. Mit Backoff wiederholen, dann auf demselben Key zu
gpt-5.6-solzurückfallen. Der Leitfaden zu Timeout, Retry und Fallback beschreibt das Muster. - Task von OpenAIs Safety-Monitor gestoppt. Astra läuft unter asynchronem Misalignment-Monitoring; löst es aus, stoppt der API-Task. Loggen Sie es, melden Sie es dem Operator und routen Sie die Aufgabe zu einem Fallback-Modell, statt zu schleifen.
def call_with_fallback(**kwargs):
for model in ("gpt-6-astra", "gpt-5.6-sol"):
try:
return client.responses.create(model=model, **kwargs)
except Exception as err: # in Produktion auf 429/5xx eingrenzen
last = err
raise lastFAQ
Welche Modell-ID verwende ich für GPT-6?
gpt-6-astra. Es gibt keinen generischen gpt-6-Alias auf OpenAI oder EvoLink, und derselbe String funktioniert auf Chat Completions und Responses.Kann ich Tools mit GPT-6 Astra über Chat Completions nutzen?
Nein. OpenAI dokumentiert Tool Calling für dieses Modell nur auf Responses; Chat Completions akzeptiert Text- und Bildeingaben. Bildeingaben über EvoLink müssen noch auf der Route geprüft werden.
Mit welchem Reasoning-Effort sollte ich starten?
medium für Coding- und Agentenaufgaben oder low für Aufgaben, die zuvor none oder minimal nutzten. OpenAI dokumentiert eine Eskalation pro Aufgabe mit configuration_update; nutzen Sie sie über EvoLink erst nach Prüfung der Route.Akzeptiert GPT-6 Astra temperature?
temperature, top_p und logprobs liefern einen 400. Entfernen Sie sie aus dem Request.Wie wird ein Request über 272K Input-Tokens abgerechnet?
Der gesamte Request wechselt ins Long-Context-Band: 2-Fache bei Input und Cache, 1,5-Fache beim Output. Zählen Sie zuerst Tokens und verdichten oder teilen Sie, wenn Sie sich der Schwelle nähern.
Was ändert sich bei der Migration von GPT-5.6?
temperature und top_p, ersetzen Sie none durch low und verlagern Sie Tool-Aufrufe auf Responses. OpenAI dokumentiert auch eine geänderte Cache-Option. EvoLink-Endpoint und Key bleiben gleich; prüfen Sie Cache-Optionen und erweiterte Funktionen vor der Migration auf der Route.Ist GPT-6 Astra auf Amazon Bedrock?
Wo finde ich EvoLinks Preis für GPT-6 Astra?
Quellen
- OpenAI: GPT-6 Astra Modelldokumentation
- OpenAI: GPT-6 Astra Modell-Leitfaden (Migration, nicht unterstützte Parameter, Tools nur über Responses)
- OpenAI: Reasoning-Leitfaden
- OpenAI: Prompt-Caching-Leitfaden
- OpenAI: Fast-Mode-Leitfaden
- OpenAI: Rate-Limits-Leitfaden
- OpenAI API-Preise
- OpenAI: GPT-6 Astra Ankündigung
- AWS: OpenAI-Model-Cards in Amazon Bedrock
- Shinsuke Kagawa: Wechsel von GPT-5.6 Sol zu GPT-6 Astra – mit medium starten


