
DeepSeek V4 Pro API auf EvoLink nutzen: Vom ersten Aufruf bis Claude Code
POST https://direct.evolink.ai/v1/messages mit model: "deepseek-v4-pro" im Anthropic-Messages-Format und lesen Sie die Antwort aus content. Über denselben Endpunkt lässt sich auch Claude Code auf DeepSeek V4 Pro umstellen — zwei Umgebungsvariablen ändern, keine Zeile Code.deepseek-v4-pro, und seit dem 13. August 2026 (dem Datum des offiziellen Changelogs) liefert dieselbe ID den aufgerüsteten 0813-Build aus (das agentenfokussierte GA-Release). Sie müssen die ID nicht ändern, um den neuen Build zu bekommen. Die alten Aliasse deepseek-chat und deepseek-reasoner wurden upstream am 24. Juli 2026 stillgelegt — wenn Ihr Code sie noch verwendet, ist diese Anleitung Ihr Migrationspfad.Was Sie in dieser Anleitung umsetzen
- eine erste erfolgreiche V4-Pro-Anfrage im Anthropic-Messages-Format;
- ein Claude-Code-Setup, das über EvoLink auf V4 Pro läuft;
- korrekte Steuerung des Thinking-Modus (und warum
budget_tokensstillschweigend nichts bewirkt); - den Umgang mit den drei Parameter-Mappings, an denen Claude-Migrationen scheitern;
- eine 429-/Concurrency-Strategie und eine Fallback-Route für die Produktion.
Voraussetzungen
- Ein EvoLink-Konto und ein API-Key aus dem Dashboard.
- Ein beliebiger HTTP-Client. Die Beispiele unten verwenden cURL und pures Python (
requests), damit die Request-Struktur explizit sichtbar bleibt. - Der vollständige Parametervertrag steht in der DeepSeek V4 Messages API-Dokumentation; diese Anleitung konzentriert sich auf Ablauf und Stolperfallen, statt die Referenz zu duplizieren.
Schritt 1 — Ihre erste V4-Pro-Anfrage
curl https://direct.evolink.ai/v1/messages \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Refactor this function to be iterative: def f(n): return n*f(n-1) if n else 1"}
]
}'content-Array. Ist Thinking aktiviert (die Voreinstellung), kommt das Reasoning des Modells als content-Block vom type: "thinking", gefolgt vom Antwortblock — lesen Sie den letzten Textblock und rechnen Sie die Thinking-Tokens in Ihre Ausgabekosten ein (mehr dazu in Schritt 4).Derselbe Aufruf in Python, ohne Dependency-Ballast:
import requests, os
resp = requests.post(
"https://direct.evolink.ai/v1/messages",
headers={"Authorization": f"Bearer {os.environ['EVOLINK_API_KEY']}"},
json={
"model": "deepseek-v4-pro",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Summarize the tradeoffs of MoE routing in two sentences."}],
},
timeout=120,
)
resp.raise_for_status()
blocks = resp.json()["content"]
print(next(b["text"] for b in blocks if b["type"] == "text"))max_tokens akzeptiert bis zu 384,000 — die ungewöhnlich hohe Ausgabeobergrenze von V4 Pro — und das Kontextfenster beträgt 1M Tokens.Schritt 2 — Claude Code auf DeepSeek V4 Pro umstellen
Weil EvoLink V4 Pro über einen Anthropic-kompatiblen Messages-Endpunkt bereitstellt, läuft Claude Code darauf, sobald Sie die Endpunkt-Variablen überschreiben:
export ANTHROPIC_BASE_URL="https://direct.evolink.ai"
export ANTHROPIC_AUTH_TOKEN="your-evolink-api-key"
export ANTHROPIC_MODEL="deepseek-v4-pro"
claudeDas ist der gesamte Umstieg: Ihr Agent-Workflow, Ihre Tools und Ihre Prompts bleiben unverändert. Community-Berichte beschreiben V4 Pro durchgängig als am stärksten bei langen, mehrstufigen Coding-Aufgaben — der 0813-Build hat seine Werte in Terminal-Agent-Benchmarks ungefähr verdoppelt — ein agentisches Harness wie Claude Code ist also genau der Ort, an dem es seinen Preisvorteil gegenüber geschlossenen Modellen ausspielt.
Zwei praktische Hinweise zu diesem Setup:
- Tool Calling läuft über den Standard-Anthropic-Flow mit
tool_use/tool_result, sodass die Dateibearbeitung und Shell-Tools von Claude Code normal funktionieren. - V4 Pro hat keinen Vision-Input. Claude-Code-Funktionen, die Screenshots oder Bilder anhängen, funktionieren auf dieser Route nicht; halten Sie für solche Aufgaben ein Vision-fähiges Modell konfiguriert.
Schritt 3 — Die drei Migrationsfallen
Dies sind die Mappings, die sich stillschweigend von Anthropics nativer API unterscheiden. Alle drei stammen aus dem aktuellen EvoLink-Vertrag, geprüft am 13. August 2026.

budget_tokens wird ignoriert. Anthropics natives Thinking-Budget-Feld bewirkt hier nichts. Thinking wird über zwei andere Felder gesteuert:{
"thinking": {"type": "enabled"},
"output_config": {"effort": "high"}
}effort akzeptiert low, high oder max, und der Standard ist high — medium und xhigh werden zwar akzeptiert, laut DeepSeeks offizieller Mapping-Tabelle aber stillschweigend auf high abgebildet. Wenn Sie migrierten Code haben, der budget_tokens setzt (oder von einem medium-Standard ausgegangen sind), und sich gewundert haben, warum sich Verhalten oder Abrechnung nie ändern — das ist der Grund.role: "system" wird abgelehnt. System-Prompts müssen über das Top-Level-Feld system laufen, nicht als Nachricht mit System-Rolle:{
"model": "deepseek-v4-pro",
"system": "You are a terse senior reviewer.",
"messages": [{"role": "user", "content": "Review this diff..."}]
}top_k, container, mcp_servers und metadata werden auf dieser Route nicht unterstützt, und Bild-/Dokument-Inhaltstypen werden abgelehnt. Entfernen Sie sie bei der Migration aktiv, statt Requests in der Produktion scheitern zu lassen.Schritt 4 — Thinking-Effort und was es mit Ihrer Rechnung macht
DeepSeek rechnet Thinking-Tokens als Ausgabetokens ab, und V4 Pro ist ein intensiver Denker: Community-Messungen haben gezeigt, dass es bei derselben Aufgabe ein Mehrfaches an Reasoning-Tokens verbraucht wie geschlossene Konkurrenzmodelle. Praktische Empfehlungen:
- Der Standard ist
effort: "high"— für Routinearbeit ein schweres Setting. Setzen Sie für Bulk-Schritte explizitlow, behalten Siehighfür Aufgaben, bei denen ein Fehlversuch mehr kostet als die zusätzlichen Tokens, und nutzen Siemaxals Eskalationsstufe. - Cache-Hit-Eingaben werden noch bis zum 16. August 2026, 16:00 UTC mit etwa 1/120 des Cache-Miss-Satzes abgerechnet; danach greift DeepSeeks bereits veröffentlichte Neubepreisung (Peak-/Off-Peak-Doppeltarife, Pro-Cache-Verhältnis dann etwa 1/30). Langlaufende Agent-Sessions mit stabilen System-Prompts profitieren weiterhin. Prüfen Sie die Live-Preise pro Token auf der DeepSeek-Modellpreisseite von EvoLink, statt den Zahlen irgendeines Blogs zu vertrauen, einschließlich dieses hier.
- Routen Sie hochvolumige Schritte mit geringer Schwierigkeit (Klassifikation, Zusammenfassungen) stattdessen zu
deepseek-v4-flashund heben Sie Pro für die harten Schritte auf.
Schritt 5 — Concurrency, 429 und Fallback
429 zurück. Anfragen, die vor der Inferenz länger als 10 Minuten in der Warteschlange stehen, werden verworfen. Für die Produktion:- Behandeln Sie
429als Backpressure-Signal: exponentielles Backoff mit Jitter, und halten Sie die In-Flight-Anfragen unter Ihrer gemessenen Obergrenze. - Setzen Sie Client-Timeouts für Aufgaben mit
high-Effort großzügig — die Denkzeit liegt vor dem ersten Token. - Konfigurieren Sie ein Fallback: Da die EvoLink-Route für mehrere Modelle dasselbe Messages-Format spricht, ist ein Fallback auf Router-Ebene von
deepseek-v4-prozu einem anderen verfügbaren Modell eine Konfigurationsänderung, kein Rewrite. Community-Threads sind voll von genau diesem Muster — Flash für Bulk-Schritte, Pro für harte Schritte, ein geschlossenes Modell als letztes Fallback.
FAQ
deepseek-v4-pro. Seit dem 13. August 2026 liefert sie den 0813-GA-Build aus — gleiche ID, aufgerüstetes Modell./v1/messages-Route. Prüfen Sie die API-Dokumentation auf den aktuellen Stand, bevor Sie einen OpenAI-artigen Client anbinden.thinking.type (enabled/disabled) plus output_config.effort (low/high/max, Standard high; medium wird akzeptiert, aber auf high abgebildet). Anthropics budget_tokens wird auf dieser Route ignoriert.Nächste Schritte
- DeepSeek-Modelle auf EvoLink — Live-Preise und Modellzugang.
- DeepSeek V4 Pro 0813: Was sich geändert hat — die Agent- und Codex-Änderungen des GA-Builds.
- Entscheidungshilfe Pro vs Flash — welche Stufe zu welchem Workload passt.


