GPT Schnittstelle für alle Modelle - Responses vollständige Parameter
- OpenAI-kompatible Responses API für GPT-Textmodelle; das konkrete Modell wird über
modelgewählt (alle möglichen Werte siehe Vergleichstabelle beim Parametermodel) - Die gesamte Reihe besteht aus Reasoning-Modellen; die Reasoning-Tiefe wird über
reasoning.effortgesteuert, Reasoning-Token werden als Ausgabe-Token abgerechnet - Prompt-Caching greift automatisch: im Cache getroffene Eingabe-Token werden zum günstigeren Cache-Preis abgerechnet
- Unterstützt synchronen und Streaming-Modus (SSE)
- Serverseitige Tools:
web_search(Websuche),code_interpreter(Codeausführung),file_search(Dokumentensuche) - Gewöhnliche
function-Werkzeuge (clientseitige Funktionsaufrufe) werden ebenfalls unterstützt - Mehrere Gesprächsrunden lassen sich mit
previous_response_idverketten - Hinweis Der Unterstützungsumfang einiger Parameter unterscheidet sich je nach Modell; Einzelheiten siehe die Hinweise zu den jeweiligen Parametern unten
https://direct.evolink.ai und bietet bessere Unterstützung für Textmodelle sowie persistente Verbindungen. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient bei Textmodellen als Ausweichadresse.web_search, code_interpreter, file_search, mcp) werden auf dem Server ausgeführt, Ergebnisse müssen nicht vom Client zurückgesendet werden, und sie werden nur auf dieser API bereitgestellt. Der Chat-Completions-Endpunkt unterstützt ausschließlich gewöhnliche function-Werkzeugaufrufe.background: true wird nicht unterstützt, und es gibt keine Endpunkte zum Abfragen, Abbrechen oder Löschen einer Antwort anhand ihrer ID. Verwenden Sie bei langen Generierungen stream: true, um die Verbindung offen zu halten.Das Werkzeug image_generation ist auf dieser Modellreihe nicht verfügbar; verwenden Sie für die Bildgenerierung die APIs der Bildmodellreihe.id in der nächsten Runde als previous_response_id, um den Kontext fortzuführen. Antworten haben eine Aufbewahrungsfrist; nach deren Ablauf ist die ID ungültig und die Anfrage wird als neue Konversation behandelt. Für Szenarien mit hohen Anforderungen an die Kontextgenauigkeit wird empfohlen, den vollständigen input-Verlauf selbst zu pflegen.Autorisierungen
##Alle APIs erfordern Bearer-Token-Authentifizierung##
API-Schlüssel erhalten:
Besuchen Sie die API-Schlüsselverwaltungsseite, um Ihren API-Schlüssel zu erhalten
Zum Anfrage-Header hinzufügen:
Body
Aufzurufendes Modell:
gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna, gpt-5.5, gpt-5.4, gpt-5.2, gpt-5.1 "gpt-5.6-sol"
Modelleingabe: eine reine Zeichenkette oder ein Array von Eingabeelementen.
Das content eines Eingabeelements unterstützt zwei Blocktypen: input_text (Text) und input_image (Bild):
Bild
- Übergeben Sie in
image_urldie öffentliche URL des Bildes image_urlmuss eine Zeichenkette sein; die Schreibweise{ "url": "..." }gibt400zurückdetailsteht auf derselben Ebene wieimage_url(nicht darin verschachtelt):auto(Standard) /low/high/original- Das Bild muss herunterladbar sein, andernfalls wird
400zurückgegeben
Werkzeugergebnisse
- Das Array kann auch Werkzeugergebnis-Elemente aus der vorherigen Runde zurückgeben, etwa
function_call_output
Hinweis Die Blocktypen dieser API unterscheiden sich von denen der Chat Completions API (dort text / image_url). Sie dürfen nicht vermischt werden; eine falsche Verwendung gibt 400 zurück.
"Search for AI news from the past week and summarize it in three sentences."
Anweisungen auf Systemebene, gleichbedeutend mit dem Einfügen einer Systemnachricht ganz am Anfang von input. Wird die Konversation mit previous_response_id fortgesetzt, wird dieser Parameter nicht aus der vorherigen Runde übernommen und muss in jeder Runde übergeben werden.
"You are a concise assistant. Answer in no more than three sentences."
Ob eine Streaming-Antwort zurückgegeben wird (SSE-Events, endend mit response.completed). Standard false.
false
Maximale Anzahl zu generierender Token (einschließlich Reasoning-Token). Wird die Obergrenze erreicht, lautet status incomplete.
2048
Reasoning-Steuerung.
Die möglichen Werte von effort (Reasoning-Tiefe) unterscheiden sich je nach Modell:
summary (Reasoning-Zusammenfassung): auto / concise / detailed, in der gesamten Reihe verfügbar. Nach der Aktivierung erscheint in output ein reasoning-Element.
mode (Reasoning-Modus): standard / pro, nur von der gpt-5.6-Familie unterstützt.
context (Reasoning-Kontextbereich): auto / current_turn / all_turns, nur von der gpt-5.6-Familie unterstützt.
Reasoning-Token werden als Ausgabe-Token abgerechnet und in usage.output_tokens_details.reasoning_tokens gezählt.
Steuerung des Ausgabetexts:
format:{"type": "text"}(Standard),{"type": "json_object"}oder{"type": "json_schema", "name": "...", "schema": {...}, "strict": true}für strukturierte Ergebnisseverbosity:low/medium/high, steuert die Ausführlichkeit der Antwort
Werkzeugdeklarationen. Serverseitige Tools werden auf dem Server ausgeführt; Ergebnisse müssen nicht vom Client zurückgesendet werden:
Gewöhnliche function-Werkzeuge (clientseitige Funktionsaufrufe) werden ebenfalls unterstützt.
Hinweis image_generation ist auf dieser Modellreihe nicht verfügbar; verwenden Sie stattdessen die APIs der Bildmodellreihe.
Steuert die Tool-Auswahl: "auto" (Standard) / "none" / "required" oder ein Objekt, das ein bestimmtes Tool festlegt, z. B. {"type": "web_search"}.
none, auto, required Obergrenze für die Gesamtzahl der in dieser Antwort zulässigen Werkzeugaufrufe.
5
Ob das Modell innerhalb einer Runde mehrere Werkzeuge parallel aufrufen darf. Standard true.
Hinweis Nur die gpt-5.6-Familie und gpt-5.5 unterstützen die Einstellung false; auf gpt-5.4 / gpt-5.2 / gpt-5.1 hat dieser Parameter keine Wirkung und verhält sich stets wie true.
true
Die id der vorherigen Antwort, dient dazu, mehrere Gesprächsrunden zu verketten, ohne den Verlauf erneut zu übertragen.
Hinweis Muss zusammen mit store: true (Standardwert) verwendet werden. Antworten haben eine Aufbewahrungsfrist; nach deren Ablauf ist die ID ungültig, und die Anfrage wird als neue Konversation ohne Kontextübernahme behandelt. Für Szenarien mit hohen Anforderungen an die Kontextgenauigkeit wird empfohlen, den vollständigen input-Verlauf selbst zu pflegen.
"resp_0f5c2b2c20c39e8a006a7ef545443081979e478b10927984b5"
Ob diese Antwort serverseitig gespeichert wird; nur gespeicherte Antworten können über previous_response_id referenziert werden. Standard true.
Hinweis Nur die gpt-5.6-Familie und gpt-5.5 unterstützen die Einstellung false; auf gpt-5.4 / gpt-5.2 / gpt-5.1 hat dieser Parameter keine Wirkung und verhält sich stets wie true. Wenn keine Speicherung gewünscht ist, wählen Sie ein Modell, das das Abschalten unterstützt.
true
Zusätzliche Inhalte, die in der Antwort zurückgegeben werden sollen. Mögliche Werte:
reasoning.encrypted_contentmessage.output_text.logprobsweb_search_call.resultsweb_search_call.action.sourcesfile_search_call.resultscode_interpreter_call.outputsmessage.input_image.image_urlcomputer_call_output.output.image_url
Sampling-Temperatur, Wertebereich 0 bis 2. Niedrigere Werte machen die Ausgabe deterministischer.
Hinweis Auf gpt-5.4 / gpt-5.2 / gpt-5.1 hat der Wert 0 keine Wirkung (er wird wie nicht gesetzt behandelt und auf den Standardwert 1 zurückgesetzt); für deterministischere Ausgaben verwenden Sie einen Wert größer als 0, etwa 0.01.
0 <= x <= 20.7
Nucleus-Sampling-Parameter, Wertebereich 0 bis 1. Es wird empfohlen, ihn nicht zusammen mit temperature anzupassen.
0 <= x <= 10.9
Anzahl der pro Position zurückgegebenen Kandidaten-Token, Wertebereich 0 bis 20; muss zusammen mit include: ["message.output_text.logprobs"] verwendet werden.
Hinweis Nur von der gpt-5.6-Familie und gpt-5.5 unterstützt; andere Modelle unterstützen diesen Parameter nicht.
0 <= x <= 202
Frequency Penalty, Wertebereich -2 bis 2, verringert die Wahrscheinlichkeit wiederholter Inhalte.
Hinweis Nur von der gpt-5.6-Familie unterstützt; andere Modelle unterstützen diesen Parameter nicht.
-2 <= x <= 20.5
Presence Penalty, Wertebereich -2 bis 2, ermutigt das Modell, neue Themen anzusprechen.
Hinweis Nur von der gpt-5.6-Familie unterstützt; andere Modelle unterstützen diesen Parameter nicht.
-2 <= x <= 20.5
Verhalten, wenn der Kontext das Fenster überschreitet: disabled (Standard, gibt direkt einen Fehler zurück) oder auto (kürzt den mittleren Teil automatisch).
auto, disabled "auto"
Konfiguration der automatischen Verdichtung langer Konversationen, zum Beispiel [{"type": "compaction", "compact_threshold": 100000}]: Überschreitet der Kontext den Schwellenwert, wird der Verlauf automatisch verdichtet.
Hinweis Nur von der gpt-5.6-Familie unterstützt; andere Modelle unterstützen diesen Parameter nicht.
Cache-Gruppierungsschlüssel. Wenn Sie für Anfragen mit demselben Präfix denselben Wert übergeben, steigt die Trefferquote des Prompt-Caches.
"app-agent-v1"
Aufbewahrungsstrategie für den Prompt-Cache: in_memory (Standard) oder 24h (verlängert die Aufbewahrungsdauer des Caches).
in_memory, 24h "in_memory"
Verweist auf eine bereits erstellte Prompt-Vorlage, in der Form {"id": "pmpt_xxx", "version": "1", "variables": {...}}.
Benutzerdefinierte Schlüssel-Wert-Paare, die unverändert mit der Antwort zurückgegeben werden und die Kennzeichnung auf Anwendungsseite erleichtern. Schlüssel und Werte sind jeweils Zeichenketten.
Stabile Kennung des Endnutzers, dient der Nachverfolgung von Missbrauch.
Hinweis Nur von der gpt-5.6-Familie unterstützt; andere Modelle unterstützen diesen Parameter nicht.
"user-1024"
Kennung des Endnutzers, dient der Unterscheidung der Aufrufquelle.
"user-1024"
Antwort
Antwortgenerierung erfolgreich (JSON-Objekt oder – bei stream=true – ein SSE-Event-Stream, der mit response.completed endet)
Eindeutige ID dieser Antwort, kann als previous_response_id für die nächste Runde dienen
"resp_0f5c2b2c20c39e8a006a7ef545443081979e478b10927984b5"
Antworttyp
response "response"
Antwortstatus: completed für ein normales Ende, incomplete, wenn die Generierung etwa wegen Erreichen von max_output_tokens nicht abgeschlossen wurde, failed bei fehlgeschlagener Generierung
completed, incomplete, failed "completed"
Tatsächlich verwendeter Modellname
"gpt-5.6-sol"
Erstellungszeitstempel
1786705221
Ausgabeelemente in Generierungsreihenfolge: das reasoning-Element (Reasoning-Zusammenfassung / verschlüsselter Reasoning-Inhalt), Werkzeugaufruf-Elemente (etwa web_search_call, code_interpreter_call) und zuletzt das message-Element mit dem output_text-Inhalt.
Erläutert den Grund, wenn status gleich incomplete ist
Statistik zum Token-Verbrauch. Prompt-Caching greift automatisch; im Cache getroffene Eingabe-Token werden zum günstigeren Cache-Preis abgerechnet.
Benutzerdefinierte Schlüssel-Wert-Paare aus der Anfrage, unverändert zurückgegeben