Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen
Claude-Code-Workflow über einen Anthropic-kompatiblen Endpunkt auf die DeepSeek V4 Pro API umstellen
Tutorial

DeepSeek V4 Pro API auf EvoLink nutzen: Vom ersten Aufruf bis Claude Code

Jacey
Jacey
Founder
13. August 2026
7 Min. Lesezeit
Diese Anleitung bringt Sie als EvoLink-Nutzer vom API-Key zur funktionierenden DeepSeek V4 Pro-Integration. Der kürzeste Weg: Senden Sie POST https://direct.evolink.ai/v1/messages mit model: "deepseek-v4-pro" im Anthropic-Messages-Format und lesen Sie die Antwort aus content. Über denselben Endpunkt lässt sich auch Claude Code auf DeepSeek V4 Pro umstellen — zwei Umgebungsvariablen ändern, keine Zeile Code.
Ein Fakt gehört gleich an den Anfang, weil ihn die meisten Tutorials falsch wiedergeben: Die aufrufbare Modell-ID lautet deepseek-v4-pro, und seit dem 13. August 2026 (dem Datum des offiziellen Changelogs) liefert dieselbe ID den aufgerüsteten 0813-Build aus (das agentenfokussierte GA-Release). Sie müssen die ID nicht ändern, um den neuen Build zu bekommen. Die alten Aliasse deepseek-chat und deepseek-reasoner wurden upstream am 24. Juli 2026 stillgelegt — wenn Ihr Code sie noch verwendet, ist diese Anleitung Ihr Migrationspfad.
DeepSeek-Modelle auf EvoLink öffnen
Zuletzt geprüft: 13. August 2026.

Was Sie in dieser Anleitung umsetzen

  1. eine erste erfolgreiche V4-Pro-Anfrage im Anthropic-Messages-Format;
  2. ein Claude-Code-Setup, das über EvoLink auf V4 Pro läuft;
  3. korrekte Steuerung des Thinking-Modus (und warum budget_tokens stillschweigend nichts bewirkt);
  4. den Umgang mit den drei Parameter-Mappings, an denen Claude-Migrationen scheitern;
  5. eine 429-/Concurrency-Strategie und eine Fallback-Route für die Produktion.

Voraussetzungen

  • Ein EvoLink-Konto und ein API-Key aus dem Dashboard.
  • Ein beliebiger HTTP-Client. Die Beispiele unten verwenden cURL und pures Python (requests), damit die Request-Struktur explizit sichtbar bleibt.
  • Der vollständige Parametervertrag steht in der DeepSeek V4 Messages API-Dokumentation; diese Anleitung konzentriert sich auf Ablauf und Stolperfallen, statt die Referenz zu duplizieren.

Schritt 1 — Ihre erste V4-Pro-Anfrage

curl https://direct.evolink.ai/v1/messages \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "max_tokens": 1024,
    "messages": [
      {"role": "user", "content": "Refactor this function to be iterative: def f(n): return n*f(n-1) if n else 1"}
    ]
  }'
Eine erfolgreiche Antwort liefert ein content-Array. Ist Thinking aktiviert (die Voreinstellung), kommt das Reasoning des Modells als content-Block vom type: "thinking", gefolgt vom Antwortblock — lesen Sie den letzten Textblock und rechnen Sie die Thinking-Tokens in Ihre Ausgabekosten ein (mehr dazu in Schritt 4).

Derselbe Aufruf in Python, ohne Dependency-Ballast:

import requests, os

resp = requests.post(
    "https://direct.evolink.ai/v1/messages",
    headers={"Authorization": f"Bearer {os.environ['EVOLINK_API_KEY']}"},
    json={
        "model": "deepseek-v4-pro",
        "max_tokens": 1024,
        "messages": [{"role": "user", "content": "Summarize the tradeoffs of MoE routing in two sentences."}],
    },
    timeout=120,
)
resp.raise_for_status()
blocks = resp.json()["content"]
print(next(b["text"] for b in blocks if b["type"] == "text"))
max_tokens akzeptiert bis zu 384,000 — die ungewöhnlich hohe Ausgabeobergrenze von V4 Pro — und das Kontextfenster beträgt 1M Tokens.

Schritt 2 — Claude Code auf DeepSeek V4 Pro umstellen

Weil EvoLink V4 Pro über einen Anthropic-kompatiblen Messages-Endpunkt bereitstellt, läuft Claude Code darauf, sobald Sie die Endpunkt-Variablen überschreiben:

export ANTHROPIC_BASE_URL="https://direct.evolink.ai"
export ANTHROPIC_AUTH_TOKEN="your-evolink-api-key"
export ANTHROPIC_MODEL="deepseek-v4-pro"
claude

Das ist der gesamte Umstieg: Ihr Agent-Workflow, Ihre Tools und Ihre Prompts bleiben unverändert. Community-Berichte beschreiben V4 Pro durchgängig als am stärksten bei langen, mehrstufigen Coding-Aufgaben — der 0813-Build hat seine Werte in Terminal-Agent-Benchmarks ungefähr verdoppelt — ein agentisches Harness wie Claude Code ist also genau der Ort, an dem es seinen Preisvorteil gegenüber geschlossenen Modellen ausspielt.

Zwei praktische Hinweise zu diesem Setup:

  • Tool Calling läuft über den Standard-Anthropic-Flow mit tool_use / tool_result, sodass die Dateibearbeitung und Shell-Tools von Claude Code normal funktionieren.
  • V4 Pro hat keinen Vision-Input. Claude-Code-Funktionen, die Screenshots oder Bilder anhängen, funktionieren auf dieser Route nicht; halten Sie für solche Aufgaben ein Vision-fähiges Modell konfiguriert.

Schritt 3 — Die drei Migrationsfallen

Dies sind die Mappings, die sich stillschweigend von Anthropics nativer API unterscheiden. Alle drei stammen aus dem aktuellen EvoLink-Vertrag, geprüft am 13. August 2026.

Drei Request-Pfade laufen an einem Endpunkt-Knoten zusammen: sauber gemappte Parameter passieren zum Erfolg, während nicht unterstützte Felder den Warnpfad auslösen
Drei Request-Pfade laufen an einem Endpunkt-Knoten zusammen: sauber gemappte Parameter passieren zum Erfolg, während nicht unterstützte Felder den Warnpfad auslösen
1. budget_tokens wird ignoriert. Anthropics natives Thinking-Budget-Feld bewirkt hier nichts. Thinking wird über zwei andere Felder gesteuert:
{
  "thinking": {"type": "enabled"},
  "output_config": {"effort": "high"}
}
effort akzeptiert low, high oder max, und der Standard ist highmedium und xhigh werden zwar akzeptiert, laut DeepSeeks offizieller Mapping-Tabelle aber stillschweigend auf high abgebildet. Wenn Sie migrierten Code haben, der budget_tokens setzt (oder von einem medium-Standard ausgegangen sind), und sich gewundert haben, warum sich Verhalten oder Abrechnung nie ändern — das ist der Grund.
2. role: "system" wird abgelehnt. System-Prompts müssen über das Top-Level-Feld system laufen, nicht als Nachricht mit System-Rolle:
{
  "model": "deepseek-v4-pro",
  "system": "You are a terse senior reviewer.",
  "messages": [{"role": "user", "content": "Review this diff..."}]
}
3. Nicht unterstützte Felder schlagen fehl oder laufen ins Leere. top_k, container, mcp_servers und metadata werden auf dieser Route nicht unterstützt, und Bild-/Dokument-Inhaltstypen werden abgelehnt. Entfernen Sie sie bei der Migration aktiv, statt Requests in der Produktion scheitern zu lassen.

Schritt 4 — Thinking-Effort und was es mit Ihrer Rechnung macht

DeepSeek rechnet Thinking-Tokens als Ausgabetokens ab, und V4 Pro ist ein intensiver Denker: Community-Messungen haben gezeigt, dass es bei derselben Aufgabe ein Mehrfaches an Reasoning-Tokens verbraucht wie geschlossene Konkurrenzmodelle. Praktische Empfehlungen:

  • Der Standard ist effort: "high" — für Routinearbeit ein schweres Setting. Setzen Sie für Bulk-Schritte explizit low, behalten Sie high für Aufgaben, bei denen ein Fehlversuch mehr kostet als die zusätzlichen Tokens, und nutzen Sie max als Eskalationsstufe.
  • Cache-Hit-Eingaben werden noch bis zum 16. August 2026, 16:00 UTC mit etwa 1/120 des Cache-Miss-Satzes abgerechnet; danach greift DeepSeeks bereits veröffentlichte Neubepreisung (Peak-/Off-Peak-Doppeltarife, Pro-Cache-Verhältnis dann etwa 1/30). Langlaufende Agent-Sessions mit stabilen System-Prompts profitieren weiterhin. Prüfen Sie die Live-Preise pro Token auf der DeepSeek-Modellpreisseite von EvoLink, statt den Zahlen irgendeines Blogs zu vertrauen, einschließlich dieses hier.
  • Routen Sie hochvolumige Schritte mit geringer Schwierigkeit (Klassifikation, Zusammenfassungen) stattdessen zu deepseek-v4-flash und heben Sie Pro für die harten Schritte auf.

Schritt 5 — Concurrency, 429 und Fallback

Der Upstream-Anbieter setzt kein Rate Limit pro Token durch — nur einen Concurrency-Cap auf Kontoebene (500 gleichzeitige Anfragen für Modelle der Pro-Klasse upstream) und gibt jenseits davon 429 zurück. Anfragen, die vor der Inferenz länger als 10 Minuten in der Warteschlange stehen, werden verworfen. Für die Produktion:
  1. Behandeln Sie 429 als Backpressure-Signal: exponentielles Backoff mit Jitter, und halten Sie die In-Flight-Anfragen unter Ihrer gemessenen Obergrenze.
  2. Setzen Sie Client-Timeouts für Aufgaben mit high-Effort großzügig — die Denkzeit liegt vor dem ersten Token.
  3. Konfigurieren Sie ein Fallback: Da die EvoLink-Route für mehrere Modelle dasselbe Messages-Format spricht, ist ein Fallback auf Router-Ebene von deepseek-v4-pro zu einem anderen verfügbaren Modell eine Konfigurationsänderung, kein Rewrite. Community-Threads sind voll von genau diesem Muster — Flash für Bulk-Schritte, Pro für harte Schritte, ein geschlossenes Modell als letztes Fallback.

FAQ

Wie lautet die Modell-ID von DeepSeek V4 Pro auf EvoLink? deepseek-v4-pro. Seit dem 13. August 2026 liefert sie den 0813-GA-Build aus — gleiche ID, aufgerüstetes Modell.
Kann ich das OpenAI SDK statt des Messages-Formats verwenden? Der geprüfte aktuelle Vertrag für V4 Pro auf EvoLink ist die oben dokumentierte Anthropic-kompatible /v1/messages-Route. Prüfen Sie die API-Dokumentation auf den aktuellen Stand, bevor Sie einen OpenAI-artigen Client anbinden.
Wie steuere ich das Thinking? thinking.type (enabled/disabled) plus output_config.effort (low/high/max, Standard high; medium wird akzeptiert, aber auf high abgebildet). Anthropics budget_tokens wird auf dieser Route ignoriert.
Unterstützt V4 Pro Bilder oder PDFs? Nein. Das Modell ist rein textbasiert; Bild- und Dokument-Inhaltstypen werden abgelehnt. Routen Sie Vision-Aufgaben zu einem Vision-fähigen Modell.
Warum bekomme ich 429-Fehler? Sie sind am Concurrency-Cap, nicht an einem Token-Limit. Reduzieren Sie parallele Anfragen und fügen Sie Backoff hinzu; Kapazitätserhöhungen können upstream beantragt werden.
Ist V4 Pro Open Source? Die Gewichte der April-Preview sind MIT-lizenziert auf Hugging Face. Die Gewichte des 0813-Builds waren Stand 13. August 2026 nicht veröffentlicht.
Pro oder Flash für meinen Workload? Die Faustregel aus der Produktion: Flash für Klassifikation, Zusammenfassungen und kurze Edits; Pro für Agent-Ketten mit 8+ Schritten und faktensensible Arbeit. Die gemessenen Unterschiede stehen im vollständigen Pro-vs-Flash-Vergleich.

Nächste Schritte

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.