
Comment utiliser l'API DeepSeek V4 Pro sur EvoLink : du premier appel à Claude Code
POST https://direct.evolink.ai/v1/messages avec model: "deepseek-v4-pro" au format Anthropic Messages, et lisez la réponse dans content. Le même endpoint permet de faire tourner Claude Code sur DeepSeek V4 Pro en changeant deux variables d'environnement — sans toucher au code.deepseek-v4-pro, et depuis le 13 août 2026 (la date du changelog officiel), ce même ID sert le build 0813 mis à niveau (la version GA orientée agents). Vous n'avez pas à changer d'ID pour obtenir le nouveau build. Les anciens alias deepseek-chat et deepseek-reasoner ont été retirés en amont le 24 juillet 2026 — si votre code les utilise encore, ce guide est votre chemin de migration.Ce que vous allez mettre en place
- une première requête V4 Pro réussie au format Anthropic Messages ;
- une configuration Claude Code qui tourne sur V4 Pro via EvoLink ;
- le contrôle correct du mode thinking (et pourquoi
budget_tokensne fait silencieusement rien) ; - la gestion des trois mappings de paramètres qui cassent les migrations depuis Claude ;
- une stratégie 429/concurrence et un routage de repli pour la production.
Prérequis
- Un compte EvoLink et une clé API créée dans le tableau de bord.
- N'importe quel client HTTP. Les exemples ci-dessous utilisent cURL et du Python brut (
requests) pour que la forme de la requête soit explicite. - Le contrat de paramètres complet se trouve dans la documentation de l'API DeepSeek V4 Messages ; ce guide se concentre sur le flux et les pièges, pas sur la duplication de la référence.
Étape 1 — Votre première requête V4 Pro
curl https://direct.evolink.ai/v1/messages \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Refactor this function to be iterative: def f(n): return n*f(n-1) if n else 1"}
]
}'content. Avec le thinking activé (le comportement par défaut), le raisonnement du modèle arrive dans un bloc content de type: "thinking" suivi du bloc de réponse — lisez le dernier bloc de texte, et intégrez les tokens de thinking dans votre budget de coût de sortie (détails à l'étape 4).Le même appel en Python, sans dépendance lourde :
import requests, os
resp = requests.post(
"https://direct.evolink.ai/v1/messages",
headers={"Authorization": f"Bearer {os.environ['EVOLINK_API_KEY']}"},
json={
"model": "deepseek-v4-pro",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Summarize the tradeoffs of MoE routing in two sentences."}],
},
timeout=120,
)
resp.raise_for_status()
blocks = resp.json()["content"]
print(next(b["text"] for b in blocks if b["type"] == "text"))max_tokens accepte jusqu'à 384,000 — le plafond de sortie exceptionnellement élevé de V4 Pro — et la fenêtre de contexte est de 1M tokens.Étape 2 — Basculer Claude Code sur DeepSeek V4 Pro
Parce qu'EvoLink expose V4 Pro sur un endpoint Messages compatible Anthropic, Claude Code peut tourner dessus en remplaçant ses variables d'endpoint :
export ANTHROPIC_BASE_URL="https://direct.evolink.ai"
export ANTHROPIC_AUTH_TOKEN="your-evolink-api-key"
export ANTHROPIC_MODEL="deepseek-v4-pro"
claudeLa bascule s'arrête là : votre workflow d'agent, vos outils et vos prompts restent identiques. Les retours de la communauté décrivent systématiquement V4 Pro comme le plus fort sur les tâches de code longues et multi-étapes — le build 0813 a à peu près doublé ses scores sur les benchmarks d'agents en terminal — donc un harnais agentique comme Claude Code est exactement l'endroit où il justifie son écart de prix face aux modèles fermés.
Deux remarques pratiques sur cette configuration :
- L'appel d'outils passe par le flux Anthropic standard
tool_use/tool_result, donc les éditions de fichiers et les outils shell de Claude Code fonctionnent normalement. - V4 Pro n'a pas d'entrée vision. Les fonctionnalités de Claude Code qui joignent des captures d'écran ou des images ne fonctionneront pas sur cette route ; gardez un modèle avec capacités vision configuré pour ces tâches.
Étape 3 — Les trois pièges de migration
Voici les mappings qui diffèrent silencieusement de l'API native d'Anthropic. Tous les trois proviennent du contrat EvoLink actuel, vérifié le 13 août 2026.

budget_tokens est ignoré. Le champ natif d'Anthropic pour le budget de thinking ne fait rien ici. Le thinking est contrôlé par deux autres champs :{
"thinking": {"type": "enabled"},
"output_config": {"effort": "high"}
}effort accepte low, high ou max, et la valeur par défaut est high — medium et xhigh sont acceptés mais silencieusement mappés sur high, conformément à la table de correspondance officielle de DeepSeek. Si vous avez migré du code qui définit budget_tokens (ou qui supposait un défaut à medium) en vous demandant pourquoi le comportement ou la facturation ne changent jamais — voilà pourquoi.role: "system" est rejeté. Les prompts système doivent passer par le champ system de premier niveau, pas par un message avec un rôle system :{
"model": "deepseek-v4-pro",
"system": "You are a terse senior reviewer.",
"messages": [{"role": "user", "content": "Review this diff..."}]
}top_k, container, mcp_servers et metadata ne sont pas pris en charge sur cette route, et les types de contenu image/document sont rejetés. Retirez-les pendant la migration plutôt que de laisser les requêtes échouer en production.Étape 4 — Le thinking effort et son impact sur votre facture
DeepSeek facture les tokens de thinking comme des tokens de sortie, et V4 Pro est un gros penseur : des mesures communautaires l'ont montré consommant plusieurs fois plus de tokens de raisonnement que ses homologues fermés sur la même tâche. Conseils pratiques :
- La valeur par défaut est
effort: "high"— un réglage lourd pour du travail courant. Passez explicitement àlowpour les étapes en masse, gardezhighpour les tâches où une tentative ratée coûte plus cher que les tokens supplémentaires, et réservezmaxcomme palier d'escalade. - L'entrée avec cache hit est facturée à environ 1/120 du tarif cache miss jusqu'au 16 août 2026 à 16:00 UTC ; la nouvelle tarification déjà publiée par DeepSeek prend ensuite effet (double tarif heures pleines/heures creuses, avec un ratio de cache Pro passant à environ 1/30). Les sessions d'agent longues avec des prompts système stables en bénéficient toujours. Vérifiez les tarifs par token en direct sur la page des modèles DeepSeek sur EvoLink plutôt que de faire confiance aux chiffres d'un blog, y compris ceux-ci.
- Pour les étapes à fort volume et faible difficulté (classification, résumés), routez vers
deepseek-v4-flashet gardez Pro pour les étapes difficiles.
Étape 5 — Concurrence, erreurs 429 et solution de repli
429 au-delà. Les requêtes qui restent en file plus de 10 minutes avant l'inférence sont abandonnées. Pour la production :- Traitez
429comme de la contre-pression : backoff exponentiel avec jitter, et plafonnez les requêtes en vol sous votre limite mesurée. - Réglez des timeouts client généreux pour les tâches en effort
high— le temps de thinking précède le premier token. - Configurez une solution de repli : parce que la route EvoLink parle le même format Messages pour plusieurs modèles, un repli au niveau du routeur de
deepseek-v4-provers un autre modèle disponible est un changement de configuration, pas une réécriture. Les fils de discussion communautaires regorgent exactement de ce schéma — Flash pour les étapes en masse, Pro pour les étapes difficiles, un modèle fermé en dernier recours.
FAQ
deepseek-v4-pro. Depuis le 13 août 2026, il sert le build GA 0813 — même ID, modèle mis à niveau./v1/messages documentée ci-dessus. Consultez la documentation de l'API pour l'état actuel avant de câbler un client de style OpenAI.thinking.type (enabled/disabled) plus output_config.effort (low/high/max, high par défaut ; medium est accepté mais mappé sur high). Le budget_tokens d'Anthropic est ignoré sur cette route.Pour aller plus loin
- Les modèles DeepSeek sur EvoLink — tarifs en direct et accès aux modèles.
- DeepSeek V4 Pro 0813 : ce qui a changé — les évolutions agent et Codex du build GA.
- Guide de décision Pro vs Flash — quel niveau pour quelle charge de travail.


