DeepSeek V4 - API Responses
- Appel des modèles DeepSeek V4 via le protocole OpenAI Responses
- Prend en charge
deepseek-v4-flash(rapide et polyvalent) etdeepseek-v4-pro(raisonnement approfondi) - Formes d’entrée :
inputpeut être du texte brut ou un tableau d’éléments d’entrée (message, appel de fonction, résultat de fonction, réflexion, historique de recherche) - Instructions système : transmises via
instructions, équivalentes à un message system placé en tête - Mode réflexion : contrôlé par
reasoning.effort; le contenu de réflexion est renvoyé sous forme d’élément de sortiereasoning - Sortie en flux : prend en charge les événements SSE sémantiques et se termine par
response.completed;[DONE]n’est pas envoyé - Appel d’outils : prend en charge le Function Calling et la recherche web intégrée
web_search - Sortie structurée : activée via
text.formatpour un objet JSON ou un JSON Schema - Cache de contexte : les requêtes partageant un préfixe atteignent automatiquement le cache et réduisent fortement le coût d’entrée
Événements de flux : response.created, response.output_item.added, response.reasoning_text.delta, response.output_text.delta ; les événements terminaux sont response.completed / response.incomplete / response.failed. Chaque événement porte un sequence_number servant au classement.
Champs sans effet : les champs OpenAI suivants peuvent être envoyés sans erreur, mais n’ont aucun effet réel.
| Champ | Comportement |
|---|---|
store | Toujours false, les réponses ne sont pas stockées |
previous_response_id | Toujours null, la reprise de conversation n’est pas prise en charge |
conversation | Non pris en charge |
background / metadata / include | Ignoré |
prompt / truncation / service_tier | Ignoré |
safety_identifier / context_management | Ignoré |
stream_options | Ignoré |
parallel_tool_calls | Ignoré, les appels d’outils parallèles sont toujours actifs |
max_tool_calls | Ignoré |
Outils file_search / code_interpreter / mcp | Ignoré |
Autres limitations :
- Les outils personnalisés (
type: custom) ne prennent en charge queapply_patch - L’outil
web_searchignoresearch_context_sizeetuser_location - Les blocs de contenu image et fichier sont convertis en espaces réservés ; DeepSeek V4 n’est pas un modèle de vision
- Une entrée dépassant la fenêtre de contexte renvoie directement 400, sans troncature automatique
https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles de texte et des connexions persistantes. https://api.evolink.ai est le point d’accès principal pour les services multimodaux et sert d’adresse de secours pour les modèles de texte.Autorisations
##Toutes les API nécessitent une authentification Bearer Token##
Obtenir une clé API :
Visitez la Page de gestion des clés API pour obtenir votre clé API
Ajouter à l'en-tête de requête :
Corps
ID du modèle
deepseek-v4-flash: rapide et polyvalent, adapté aux conversations courantes, aux résumés et à l'extractiondeepseek-v4-pro: raisonnement approfondi, adapté aux mathématiques complexes, au code et à la planification en plusieurs étapes
deepseek-v4-flash, deepseek-v4-pro "deepseek-v4-flash"
Entrée du modèle. Au moins l'un des champs input et instructions doit être fourni.
- Forme chaîne : l'ensemble du texte est traité comme un unique message
user - Forme tableau : liste d'éléments d'entrée prenant en charge cinq types —
message,function_call,function_call_output,reasoning,web_search_call
Conversations multi-tours : le point de terminaison étant sans état, poursuivre une conversation impose de placer l'historique complet dans le tableau.
"Présente Hangzhou en une phrase."
Instructions de niveau système, équivalentes à un message system inséré tout au début ; sert à définir le rôle, le ton et les contraintes de sortie.
"Tu es un rédacteur technique rigoureux. Garde les réponses concises."
Indique si la réponse est diffusée en flux
false(par défaut) : renvoie l'objet de réponse complet en une foistrue: envoie des événements SSE sémantiques ; l'événement final estresponse.completed/response.incomplete/response.failed, et[DONE]n'est pas envoyé
false
Nombre maximal de tokens de sortie pour cette génération (tokens de réflexion inclus). Plage de 1 à 393216 (384K). Laissé vide, le modèle décide lui-même.
1 <= x <= 3932164096
Température d'échantillonnage ; plus elle est élevée, plus la sortie est aléatoire. Sans effet en mode réflexion.
0 <= x <= 21
Seuil d'échantillonnage nucleus ; il est conseillé de n'ajuster que celui-ci ou temperature. Sans effet en mode réflexion.
x <= 11
Renvoie à chaque position les tokens candidats les plus probables et leurs probabilités logarithmiques.
0 <= x <= 200
Configuration du mode réflexion. DeepSeek V4 active la réflexion par défaut ; le contenu de réflexion est renvoyé comme élément de sortie reasoning, et ses tokens comptent dans la sortie et sont facturés au tarif de sortie.
Configuration du format de sortie textuelle.
Liste des outils que le modèle peut appeler. Les outils de type fonction sont exécutés par le client, qui renvoie le résultat sous forme de function_call_output ; web_search est exécuté directement côté serveur, sans intervention du client.
Stratégie d'appel d'outils
none: appel d'outils interditauto(par défaut) : le modèle déciderequired: au moins un outil doit être appelé{"type": "function", "name": "get_weather"}: force l'appel d'une fonction précise{"type": "web_search"}: force une recherche web
"auto"
Réponse
Génération réussie
Objet de réponse du point de terminaison Responses.
Identifiant unique de cette réponse
"resp_9f2c1a4b8e7d"
Type d'objet, toujours response
"response"
Date de création sous forme d'horodatage Unix (secondes)
1755000000
État de la réponse
completed: terminée normalementin_progress: génération en coursincomplete: tronquée, par exemple pour cause de longueur ; voirincomplete_detailsfailed: échec de la génération ; voirerror
in_progress, completed, incomplete, failed "completed"
ID du modèle ayant réellement produit cette réponse
"deepseek-v4-flash"
Liste des éléments de sortie, dans l'ordre de génération. Champs par type :
reasoning: le processus de réflexion, avecid,status,content(liste de blocsreasoning_text) etsummarymessage: la réponse finale, avecid,status,roleetcontent(liste de blocsoutput_text)function_call: un appel de fonction du modèle, avecid,status,call_id,nameetarguments; le client l'exécute puis renvoie le résultat sous forme defunction_call_outputweb_search_call: un historique de recherche web exécutée côté serveur, avecid,statusetaction(décrivant la recherche effectuée)
Motif de l'échec ; null en cas de succès
Motif de la troncature ; null si la réponse n'est pas tronquée
Statistiques d'utilisation des tokens (avec les détails de cache et de raisonnement)