DeepSeek V4 - Responses-API
- Aufruf der DeepSeek-V4-Modelle über das OpenAI-Responses-Protokoll
- Unterstützt
deepseek-v4-flash(schnell und universell) unddeepseek-v4-pro(tiefes Schlussfolgern) - Eingabeformen:
inputkann reiner Text oder ein Array von Eingabeelementen sein (Nachricht, Funktionsaufruf, Funktionsergebnis, Denkinhalt, Suchprotokoll) - Systemanweisungen: über
instructionsübergeben, entspricht einer vorangestellten system-Nachricht - Denkmodus: über
reasoning.effortgesteuert; der Denkinhalt wird als Ausgabeelementreasoningzurückgegeben - Streaming-Ausgabe: unterstützt semantische SSE-Ereignisse und endet mit
response.completed;[DONE]wird nicht gesendet - Werkzeugaufrufe: unterstützt Function Calling und die integrierte Websuche
web_search - Strukturierte Ausgabe: über
text.formatals JSON-Objekt oder JSON Schema aktivierbar - Kontext-Cache: Anfragen mit gleichem Präfix treffen den Cache automatisch und senken die Eingabekosten erheblich
Streaming-Ereignisse: response.created, response.output_item.added, response.reasoning_text.delta, response.output_text.delta; Abschlussereignisse sind response.completed / response.incomplete / response.failed. Jedes Ereignis enthält zur Sortierung ein sequence_number.
Felder ohne Wirkung: Die folgenden OpenAI-Felder können ohne Fehler gesendet werden, haben jedoch keine tatsächliche Wirkung.
| Feld | Verhalten |
|---|---|
store | Stets false, Antworten werden nicht gespeichert |
previous_response_id | Stets null, Fortsetzen einer Unterhaltung wird nicht unterstützt |
conversation | Nicht unterstützt |
background / metadata / include | Ignoriert |
prompt / truncation / service_tier | Ignoriert |
safety_identifier / context_management | Ignoriert |
stream_options | Ignoriert |
parallel_tool_calls | Ignoriert, parallele Werkzeugaufrufe sind stets aktiv |
max_tool_calls | Ignoriert |
Werkzeuge file_search / code_interpreter / mcp | Ignoriert |
Weitere Einschränkungen:
- Benutzerdefinierte Werkzeuge (
type: custom) unterstützen ausschließlichapply_patch - Das Werkzeug
web_searchignoriertsearch_context_sizeunduser_location - Bild- und Dateiblöcke werden in Platzhalter umgewandelt; DeepSeek V4 ist kein Bildmodell
- Übersteigt die Eingabe das Kontextfenster, wird direkt 400 zurückgegeben, ohne automatisches Kürzen
https://direct.evolink.ai und bietet bessere Unterstützung für Textmodelle sowie persistente Verbindungen. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient bei Textmodellen als Ausweichadresse.Autorisierungen
##Alle APIs erfordern Bearer-Token-Authentifizierung##
API-Schlüssel erhalten:
Besuchen Sie die API-Schlüsselverwaltungsseite, um Ihren API-Schlüssel zu erhalten
Zum Anfrage-Header hinzufügen:
Body
Modell-ID
deepseek-v4-flash: schnell und universell, geeignet für alltägliche Dialoge, Zusammenfassungen und Extraktiondeepseek-v4-pro: tiefes Schlussfolgern, geeignet für komplexe Mathematik, Code und mehrstufige Planung
deepseek-v4-flash, deepseek-v4-pro "deepseek-v4-flash"
Eingabe für das Modell. Mindestens eines von input und instructions muss angegeben werden.
- String-Form: Der gesamte Text wird als eine einzelne
user-Nachricht behandelt - Array-Form: Liste von Eingabeelementen mit den fünf Typen
message,function_call,function_call_output,reasoningundweb_search_call
Mehrstufige Unterhaltungen: Der Endpunkt ist zustandslos, daher muss zum Fortsetzen einer Unterhaltung der vollständige Verlauf im Array enthalten sein.
"Stelle Hangzhou in einem Satz vor."
Anweisungen auf Systemebene, gleichbedeutend mit einer ganz vorne eingefügten system-Nachricht; dient zum Festlegen von Rolle, Tonfall und Ausgabevorgaben.
"Du bist ein sorgfältiger technischer Redakteur. Halte die Antworten knapp."
Ob die Antwort gestreamt wird
false(Standard): gibt das vollständige Antwortobjekt auf einmal zurücktrue: sendet semantische SSE-Ereignisse; das letzte Ereignis istresponse.completed/response.incomplete/response.failed, und[DONE]wird nicht gesendet
false
Maximale Anzahl an Ausgabetokens für diese Generierung (einschließlich Denktokens). Bereich 1 bis 393216 (384K). Ohne Angabe entscheidet das Modell selbst.
1 <= x <= 3932164096
Sampling-Temperatur; höhere Werte machen die Ausgabe zufälliger. Im Denkmodus ohne Wirkung.
0 <= x <= 21
Schwellenwert für Nucleus-Sampling; es wird empfohlen, nur diesen oder temperature anzupassen. Im Denkmodus ohne Wirkung.
x <= 11
Gibt an jeder Position die wahrscheinlichsten Kandidaten-Tokens samt ihrer logarithmischen Wahrscheinlichkeiten zurück.
0 <= x <= 200
Konfiguration des Denkmodus. DeepSeek V4 aktiviert das Denken standardmäßig; der Denkinhalt wird als Ausgabeelement reasoning zurückgegeben und seine Tokens zählen zur Ausgabe und werden zum Ausgabepreis abgerechnet.
Konfiguration des Textausgabeformats.
Liste der Werkzeuge, die das Modell aufrufen kann. Funktionswerkzeuge werden vom Client ausgeführt, der das Ergebnis als function_call_output zurückgibt; web_search wird direkt serverseitig ausgeführt, ohne Beteiligung des Clients.
Strategie für Werkzeugaufrufe
none: Werkzeugaufrufe verbotenauto(Standard): das Modell entscheidetrequired: mindestens ein Werkzeug muss aufgerufen werden{"type": "function", "name": "get_weather"}: erzwingt den Aufruf einer bestimmten Funktion{"type": "web_search"}: erzwingt eine Websuche
"auto"
Antwort
Generierung erfolgreich
Antwortobjekt des Responses-Endpunkts.
Eindeutige Kennung dieser Antwort
"resp_9f2c1a4b8e7d"
Objekttyp, stets response
"response"
Erstellungszeit als Unix-Zeitstempel (Sekunden)
1755000000
Status der Antwort
completed: normal abgeschlossenin_progress: wird noch generiertincomplete: z. B. wegen der Länge gekürzt, sieheincomplete_detailsfailed: Generierung fehlgeschlagen, sieheerror
in_progress, completed, incomplete, failed "completed"
ID des Modells, das diese Antwort tatsächlich erzeugt hat
"deepseek-v4-flash"
Liste der Ausgabeelemente in Generierungsreihenfolge. Felder je Typ:
reasoning: der Denkvorgang, mitid,status,content(Liste vonreasoning_text-Blöcken) undsummarymessage: die endgültige Antwort, mitid,status,roleundcontent(Liste vonoutput_text-Blöcken)function_call: ein Funktionsaufruf des Modells, mitid,status,call_id,nameundarguments; der Client führt ihn aus und gibt das Ergebnis alsfunction_call_outputzurückweb_search_call: ein serverseitig ausgeführtes Websuchprotokoll, mitid,statusundaction(beschreibt die durchgeführte Suche)
Fehlerursache; bei Erfolg null
Grund der Kürzung; ohne Kürzung null
Statistik zur Tokennutzung (einschließlich Cache- und Denkanteilen)