Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen

Qwen3.8 Max API

Alibaba Qwen-Textgenerierung-ab $1.765 / 1 Mio. Eingabe-Token$1.765 offizieller Preis-Verfügbar
1M KontextSteuerbares ReasoningFunction Calling + Structured OutputExplizites + implizites CachingChat + Responses + Messages
API-Dokumentation
ProduktionsrouteLive
Anbieter
Alibaba Qwen
Modell
Qwen3.8 Max
Kontextfenster
1.048.576 Token
Protokolle
Chat · Responses · Messages

Qwen3.8 Max auswählen

Premium-Reasoning über drei API-Protokolle für Repository-weite Entwicklung, lange Dokumente, große Evidenzmengen, lang laufende Agenten und komplexe Wissensarbeit mit einem Kontextfenster von 1.048.576 Token.

Qwen3.8 Max

Alibabas Tongyi-Qwen-Flaggschiff Max

Ausgewählt
Ab $1.765 / 1 Mio. Eingabe-Token$1.765 offizieller Preisqwen3.8-max
Geeignet für

Repository-weite Entwicklung, Synthese mehrerer Dokumente, Tool-intensive Agenten über Chat, Responses oder Messages und schwierige Aufgaben, bei denen weniger Retries und Korrekturen eine Premiumroute rechtfertigen.

Eingabe
$1.765 / 1M120 cr / 1M$1.765 offizieller Preis
Ausgabe
$5.295 / 1M360 cr / 1M$5.295 offizieller Preis
Cache-Schreiben
$2.206 / 1M150 cr / 1M$2.206 offizieller Preis
Cache-Lesen · implizit
$0.353 / 1M24 cr / 1M$0.353 offizieller Preis
Cache-Lesen · explizit
$0.177 / 1M12 cr / 1M$0.177 offizieller Preis

Qwen3.8 Max Preise

Schätzen Sie die Kosten einer Anfrage mit dem interaktiven Rechner. Für alle Nutzergruppen gilt der kostenbasierte Qwen3.8-Max-Preis.

Qwen3.8 Max

Token-Rechner

Token-Mix einer Anfrage eingeben.
Cache-Lesemodus

Eine Anfrage nutzt genau einen Modus. Explizit: cache_control senden, Cache-Erstellung zu 125 % des Eingabepreises und Treffer zu 10 %. Implizit: keine Markierung, keine Schreibgebühr und Treffer zu 20 %.

Geschätzte Anfragekosten

Qwen3.8 Max
Selbstkostenpreis
USD$0.0035
Credits0.2328
Eingabe-Token0.12 cr
Cache-Schreib-Token0 cr
Cache-Lese-Token · Implizit0.0048 cr
Ausgabe-Token0.108 cr

Mindestabrechnung: 0,01 Credits pro Anfrage.

Budgetübersicht

Ungefähre Anzahl von Anfragen mit dem aktuellen Token-Mix.
Credits hinzufügen
$10
Etwa 2920 Anfragen

Für einen ersten Test

$50
Etwa 14604 Anfragen

Für reguläre Entwicklung

$100
Etwa 29209 Anfragen

Für Produktionsevaluation

Modellpreise

Qwen3.8 Max

Alle Kontextlängen
Eingabe-Token
$1.765 / 1M120 cr / 1M$1.765 offizieller Preis
Ausgabe-Token
$5.295 / 1M360 cr / 1M$5.295 offizieller Preis
Cache-Schreib-Token
$2.206 / 1M150 cr / 1M$2.206 offizieller Preis
Cache-Lesen · implizit
$0.353 / 1M24 cr / 1M$0.353 offizieller Preis
Cache-Lesen · explizit
$0.177 / 1M12 cr / 1M$0.177 offizieller Preis

USD und Credits werden je 1 Mio. Token angegeben. Cache-Schreiben gilt nur für explizite Caches. Eine Anfrage verwendet entweder explizites oder implizites Cache-Lesen. Live-Backendpreise haben Vorrang vor diesen Fallback-Preisen.

Preise für integrierte Tools

Websuche · turboChat
$0.0005 pro Aufruf0.03 cr pro Aufruf
Websuche · maxChat
$0.0006 pro Aufruf0.04 cr pro Aufruf
Websuche-ToolResponses
$0.0006 pro Aufruf0.04 cr pro Aufruf
Text-zu-Bild-SucheResponses
$0.0036 pro Aufruf0.24 cr pro Aufruf
Bild-zu-Bild-SucheResponses
$0.0071 pro Aufruf0.48 cr pro Aufruf
PDF-ParsingChat
$0.0030 pro Seite0.2 cr pro Seite

Integrierte Tools werden zusätzlich zu den Token abgerechnet und nur, wenn das Tool tatsächlich läuft — eine Anfrage ohne Suche zahlt nichts davon. Anthropic Messages ignoriert integrierte Tools upstream, dort läuft nichts und es wird nichts berechnet.

Qwen3.8 Max API für lange Kontexte, Reasoning und Agenten

Nutzen Sie Alibabas Tongyi-Qwen-Flaggschiff über die einheitliche EvoLink API. Qwen3.8 Max stellt dasselbe Modell per OpenAI Chat Completions, OpenAI Responses und Anthropic Messages mit vollständigem Byte-Passthrough bereit. Das Modell bietet ein Kontextfenster mit 1.048.576 Token, steuerbares Reasoning sowie explizites und implizites Prompt-Caching für Repository-weite Entwicklung, lange Dokumente und mehrstufige Tool-Workflows.

Qwen3.8 Max
Qwen3.8 Max Einsatzbereiche

Wo Qwen3.8 Max in einen produktiven Modell-Stack gehört

Ein Flaggschiffmodell sollte nicht jede Anfrage standardmäßig übernehmen. Es lohnt sich vor allem, wenn langer Kontext, anhaltendes Reasoning oder komplexe Tool-Ketten Retries, Übergaben und manuelle Nacharbeit verringern.

Repository-weite Programmierung

Geeignet für Entwicklungsaufgaben, die Architekturunterlagen, verbundene Dienste, Testhistorie, große Diffs und über viele Dateien verteilte Vorgaben zusammenführen. Messen Sie akzeptierte Patches und Review-Zeit statt isolierter Codequalität.

Analyse langer Dokumente

Zusammengehörige Spezifikationen, Studien, Verträge, Logs oder Wissensquellen bleiben in einem Arbeitskontext. Retrieval und Dokumentstruktur bleiben wichtig: Ein 1M-Token-Fenster macht irrelevanten Kontext nicht nützlich.

Tool-Agenten über drei Protokolle

Passt zu mehrstufiger Tool-Auswahl, strukturierten Ausgaben und wiederholten externen Aktionen über Chat, Responses oder Messages. Nachrichten, Thinking, Tool-Call-IDs, Argumente und Ergebnisse müssen zwischen Turns vollständig erhalten bleiben.

Wann ein leichteres Modell besser ist

Kurze Chats, Klassifikation, Umschreiben, einfache Extraktion und latenzkritische UI-Aktionen benötigen selten maximales Reasoning oder 1M Kontext. Lassen Sie diese Aufgaben auf einer günstigeren Route und eskalieren Sie nur bei entsprechender Schwierigkeit.

Protokoll- und Cache-Eigenschaften

Was Qwen3.8 Max bei EvoLink unterscheidet

Dies sind vertragliche Fähigkeiten der EvoLink-Route, keine Benchmark-Aussagen. Prüfen Sie Latenz, Qualität und Cache-Verhalten mit eigenen Aufgaben, bevor das Modell zur Standardroute wird.

Byte-Passthrough über drei Protokolle

OpenAI Chat, OpenAI Responses und Anthropic Messages erreichen dasselbe Modell per Byte-Passthrough. Thinking, Signaturen und Cache-Marker werden im Gateway nicht verlustbehaftet neu serialisiert.

Explizites und implizites Prompt-Caching

Mit cache_control markieren Sie wiederverwendbare Präfixe; explizite Treffer kosten 10 % des Eingabepreises, implizites Caching greift automatisch zu 20 %. Pro Anfrage ist nur ein Modus möglich, und das Gateway behält cache_control-Marker bei.

Steuerbarer Reasoning-Aufwand

Reasoning ist standardmäßig auf xhigh aktiv und kann über reasoning_effort auf medium oder low gestellt werden. Das Gateway reicht das Feld unverändert durch. reasoning_effort und thinking_budget dürfen nicht gemeinsam gesendet werden.

Thinking zwischen Turns erneut senden

preserve_thinking ist standardmäßig aktiv. Jeder assistant-Eintrag mit reasoning_content muss unverändert erneut gesendet werden und darf nicht in content aufgehen. Wiederholtes Reasoning zählt als Eingabe-Token und wird berechnet.

Kernfähigkeiten

Warum Qwen3.8 Max diese Workloads bewältigen kann

Den größten Nutzen bringt das Zusammenspiel aus langem Kontext, anhaltendem Reasoning und wiederverwendbaren Prompt-Präfixen. Kontextkapazität allein verbessert keine Antwort; relevant bleiben passende Evidenz, klare Struktur und ein Ausgabebudget.

1M Token als Arbeitsraum, nicht als Füllziel

Das Fenster mit 1.048.576 Token kann zusammengehörigen Code, Spezifikationen und frühere Tool-Ergebnisse ohne übermäßiges Chunking bereithalten. Retrieval und Kontextkomprimierung bleiben wichtig, weil irrelevante Inhalte Aufmerksamkeit und Verarbeitungskosten binden.

Anhaltendes Reasoning braucht ein Ausgabebudget

Reasoning- und Antwort-Token zählen beide zur Nutzung. Behandeln Sie das Ausgabelimit als Kapazität statt als normale Antwortlänge und setzen Sie mit reasoning_effort ein aufgabengerechtes Budget.

Caching lohnt sich bei stabilen Präfixen

Repository-Anweisungen, System-Prompts, Referenzen und Tool-Schemas bieten das größte Cache-Potenzial, wenn ihre Reihenfolge stabil bleibt. Häufige Modell- oder Strukturänderungen können eine erneute Verarbeitung des langen Präfixes auslösen.

Function Calling, integrierte Tools und Structured Output

Qwen führt Function Calling, integrierte Tools und Structured Output für das Produktionsmodell auf. Prüfen Sie vor größerem Traffic über die EvoLink-Route, ob das genaue Tool- und Schema-Verhalten zu Ihrem Workflow passt.

Qwen3.8 Max API Produktionsprüfung

Was vor produktivem Traffic geprüft werden muss

Auch ein passender Workload kann durch eine falsche ID, das falsche Max-Token-Feld oder verlorenen Agentenstatus scheitern. Prüfen Sie die Anfrageoberfläche, bevor Sie die Modellqualität bewerten.

01

Die Modell-ID qwen3.8-max verwenden

Die EvoLink-Route verwendet qwen3.8-max für Chat Completions, Responses und Anthropic Messages.

Modell-ID
02

Das richtige Max-Token-Feld je Endpunkt verwenden

Chat nutzt max_completion_tokens, Responses nutzt max_output_tokens und Anthropic Messages verlangt max_tokens. Ein falsches Feld kann ignoriert oder upstream abgelehnt werden.

Endpunkte
03

Thinking und Tool-Status vollständig wiederholen

Mehrstufige Agenten benötigen vollständige Nachrichten, Thinking- und Signature-Blöcke, Tool-Call-IDs, Argumente und Ergebnisse. Nur den finalen Text zu behalten unterbricht die Zustandskontinuität.

Tool-Status
04

reasoning_content in jedem Turn zurücksenden

preserve_thinking ist standardmäßig aktiv. Jeder assistant-Eintrag mit reasoning_content muss unverändert zurückgesendet werden und darf nicht in content zusammengeführt werden. Diese Token werden als Eingabe berechnet.

Thinking-Replay
05

Explizite Caches über Chat oder Messages erstellen

Cache-Lesen funktioniert über alle drei Protokolle. Große explizite Caches sind am Responses-Endpunkt upstream jedoch am wenigsten zuverlässig. Markieren Sie cache_control-Präfixe über Chat Completions oder Anthropic Messages und lesen Sie sie über ein beliebiges Protokoll.

Caching
Produktionsökonomie

Kosten pro akzeptierter Aufgabe statt nur Tokenpreise vergleichen

Qwen3.8 Max rechtfertigt eine Premiumroute nur, wenn es bei demselben Produktions-Workload Chunking, Retries, fehlerhafte Tool-Ketten oder manuelle Nacharbeit reduziert. Vergleichen Sie identische Aufgabensätze.

Erfolg im ersten VersuchAkzeptierte ErgebnisseAnzahl der RetriesAusgabe-TokenCache-TrefferrateGültige Tool-AufrufeZeit bis zum akzeptierten ErgebnisKorrektur- und Fallback-Rate

Wenn das Modell mit weniger Retries und Review-Aufwand nutzbare Ergebnisse liefert, kann der kostenbasierte Tokenpreis die Gesamtkosten senken. Bleibt dieser Vorteil aus, sollte die Aufgabe auf einer leichteren Route bleiben.

Führende Long-Context-Modelle nach Workload-Tests vergleichen

EvoLink

Prüfen Sie zuerst, ob Qwen3.8 Max Retries und Review-Aufwand in Ihren Aufgaben reduziert. Vergleichen Sie danach Preis, Kontext, Caching und Workload-Eignung.

Qwen3.8 Max
Eingabe / Ausgabe$1.765 / $5.295
Kontext1M
CachingExplizit + implizit
Geeignet fürRepository-weite Entwicklung, Synthese mehrerer Dokumente, Tool-intensive Agenten über Chat, Responses oder Messages und schwierige Aufgaben, bei denen weniger Retries und Korrekturen eine Premiumroute rechtfertigen.
Claude Opus 5
Eingabe / Ausgabe$4.75 / $23.75
Kontext1M
CachingLesen + Schreiben
Geeignet fürPremium-Basislinie für lang laufende Coding-Agenten, komplexe Reviews und urteilsintensive professionelle Workflows.
Kimi K3
Eingabe / Ausgabe$3 / $15
Kontext1M
CachingLesen + Schreiben
Geeignet fürMoonshot-Long-Context-Route der Mittelklasse für Repository-weite Entwicklung und die Analyse mehrerer Dokumente.

Verwandte Modelle

Claude Opus 5

Claude Opus 5

Premium-Basislinie für lang laufende Coding-Agenten, komplexe Reviews und urteilsintensive professionelle Workflows.

Modell ansehen
Kimi K3

Kimi K3

Moonshot-Long-Context-Route der Mittelklasse für Repository-weite Entwicklung und die Analyse mehrerer Dokumente.

Modell ansehen
DeepSeek V4

DeepSeek V4

Kostenbewusste Basislinie für Coding, Reasoning und Agenten mit hohem Volumen und 1M Kontext.

Modell ansehen
GPT-5.6

GPT-5.6

Sol-, Terra- und Luna-Stufen zum Vergleich von Fähigkeit, Latenz und kostenbasiertem Routing.

Modell ansehen

Leitfäden zu Release, Evidenz und Integration von Qwen3.8 Max

Qwen3.8 Max Release und Funktionen

Qwen3.8 Max Release und Funktionen

Produktionsrelease, Unterschiede zu frühen Kanälen, offizielle Fähigkeiten und Open-Weight-Status voneinander abgrenzen.

Leitfaden lesen
Qwen3.8 Max Benchmark-Evidenz

Qwen3.8 Max Benchmark-Evidenz

Offizielle Ergebnisse, Evidenz Dritter und den Produktions-Testplan von EvoLink prüfen.

Leitfaden lesen
Qwen3.8 Max vs Qwen3.7 Max

Qwen3.8 Max vs Qwen3.7 Max

Mit einer reversiblen Checkliste zwischen Beibehalten, Canary und vollständiger Migration wählen.

Leitfaden lesen
Qwen3.8 Max vs Kimi K3

Qwen3.8 Max vs Kimi K3

Coding, Agenten, langen Kontext, Kosten sowie Haupt-, Challenger- und Fallback-Rollen vergleichen.

Leitfaden lesen

Qwen3.8 Max API FAQ

Welche Modell-ID verwendet die Qwen3.8 Max API?

Verwenden Sie bei EvoLink qwen3.8-max für Chat Completions, Responses und Anthropic Messages.

Welche API-Protokolle werden unterstützt?

OpenAI Chat Completions, OpenAI Responses und Anthropic Messages. Alle drei bedienen dasselbe Modell mit vollständigem Byte-Passthrough.

Welches Max-Token-Feld sollte ich verwenden?

Chat nutzt max_completion_tokens, Responses nutzt max_output_tokens und Anthropic Messages verlangt max_tokens. Das native Endpunktfeld ist am sichersten.

Unterstützt das Modell 1M Token Kontext?

Die EvoLink-Route führt ein Kontextfenster von 1.048.576 Token. Nutzen Sie es für tatsächlich zusammengehörige Dateien, Dokumente und Agentenstatus statt zum standardmäßigen Auffüllen.

Wie funktioniert das Reasoning?

Reasoning ist standardmäßig aktiv und über reasoning_effort mit xhigh, medium oder low steuerbar. reasoning_effort und thinking_budget dürfen nicht gemeinsam gesendet werden. Thinking- und Signature-Blöcke bleiben am Messages-Endpunkt erhalten.

Muss reasoning_content in mehrstufigen Chats erneut gesendet werden?

Ja. preserve_thinking ist standardmäßig aktiv. Jeder assistant-Eintrag mit reasoning_content muss unverändert zurückgesendet werden und darf nicht in content aufgehen. Diese Token werden als Eingabe berechnet.

Wie funktioniert Caching und was kostet es?

Explizites Caching über cache_control und automatisches implizites Caching werden unterstützt; eine Anfrage nutzt nur einen Modus. Explizite Treffer kosten 10 %, implizite 20 %. Explizites Schreiben kostet 125 % der Eingabe, implizites Caching hat keine Schreibgebühr.

Kann ich das OpenAI SDK oder Anthropic Messages verwenden?

Ja. Behalten Sie denselben EvoLink API-Schlüssel, wählen Sie qwen3.8-max und verwenden Sie Chat Completions, Responses oder Anthropic Messages.

Eignet sich das Modell als Standard für Echtzeit oder hohes Volumen?

Meist nicht ohne Tests. Maximales Reasoning und lange Ausgaben erhöhen bei einfachen Aufgaben Latenz und Kosten. Kurze Chats, Klassifikation und leichte Extraktion sollten auf einer kleineren Route bleiben.

Wie wird das Modell abgerechnet?

Die Abrechnung umfasst Eingabe, Ausgabe, Cache-Schreiben und Cache-Lesen zum Selbstkostenpreis, wobei Cache-Lesen einen expliziten und impliziten Tarif hat. Live-Backendpreise haben Vorrang.