
Grok 4.6 vs. Grok 4.5: Benchmarks, Kosten und Upgrade
xhigh, höhere Cache-Kosten und vom Hersteller gemeldete Benchmark-Gewinne. Aktuelle Route und Preis stehen auf der Grok 4.6 API-Seite.Schneller Vergleich
| Faktor | Grok 4.6 | Grok 4.5 | Routing-Folge |
|---|---|---|---|
| Modell-ID | grok-4.6 | grok-4.5 | IDs gehören in Konfiguration, nicht in App-Verzweigungen. |
| Kontext | 500K | 500K | Kapazität allein ist kein Upgrade-Grund. |
| Reasoning | low, medium, high, xhigh | low, medium, high | xhigh nur bei entsprechend wertvollen Aufgaben testen. |
| Standardpreis pro 1M | $2 Input / $0,50 Cache / $6 Output | $2 / $0,30 / $6 | Cache-lastige Workloads können auf 4.5 günstiger bleiben. |
| Long-Context-Preis | $4 / $1 / $12 | $4 / $0,60 / $12 | Der Cache-Unterschied bleibt über 200K bestehen. |
| Erster Test | Schwieriges Coding, Agenten, visuelle Apps | Stabile Grok-Workloads | Nach Workload statt Modellalter migrieren. |
Was sich tatsächlich geändert hat
xAI beschreibt Grok 4.6 als neu trainiert für längere agentische Aufgaben, unbekannte Codebasen, Strukturierung, Feature-Implementierung und Selbsttests. Das sind Herstellerangaben und gute Testziele, aber kein Ersatz für Tests mit eigenen Repositories, Tools und Latenzbudgets.
Grok 4.5 bleibt eine belastbare Basis. Entscheidend ist, ob 4.6 Fehlschläge, Retries, Tool-Schleifen oder Review-Aufwand ausreichend reduziert.
So sind die offiziellen Benchmarks zu lesen
xAI meldet Gewinne unter anderem auf CursorBench, DeepSWE, FrontierCode, Artificial Analysis und GDPVal. Beispiele sind 69,9 gegenüber 66,7 auf CursorBench und 65,9 gegenüber 54,0 auf DeepSWE. Diese Herstellerwerte wählen sinnvolle Tests aus, beweisen aber keinen identischen Gewinn in jeder Umgebung.
| Frage | Sichere Interpretation | Produktionsschritt |
|---|---|---|
| Liegt 4.6 im Launch-Bericht höher? | Ja, in der veröffentlichten Herstelleranalyse. | Ähnliche eigene Workloads reproduzieren. |
| Beweist das geringere Kosten? | Nein, Retries, Tools und Review fehlen. | Kosten pro akzeptierter Aufgabe messen. |
| Muss 4.5 ausgemustert werden? | Nein, Traffic profitiert unterschiedlich. | Segmentieren und nur Gewinner canaryen. |
Die Kosten sind nicht identisch
Input und Output sind direkt gleich bepreist, Prompt-Caching nicht: Grok 4.6 kostet unter 200K $0,50 je Million Cached Input, Grok 4.5 $0,30. Bei langen Agentensitzungen kann das relevant sein. EvoLink-Preise können abweichen; vergleichen Sie Live-Module und echte Nutzung.
accepted_task_cost = input + cached_input + output + tool_calls
+ retries + fallback_calls + reviewer_timeWelche Workloads sollten zuerst wechseln?
| Workload | Startpunkt | Freigaberegel |
|---|---|---|
| Feature in unbekanntem Repository | Grok 4.6 Shadow Test | Höhere Abschluss- und Testpassrate |
| Lang laufender Tool-Agent | Gepaartes Replay | Weniger Schleifen und Eingriffe |
| Visuelles Frontend | Grok 4.6 Evaluation | Responsive, zugänglich, designkonform |
| Stabiler Chat oder Extraktion | Zunächst Grok 4.5 | Nur bei besserer Qualität oder Gesamtkosten |
| Cache-lastige Sitzungen | Beide bei gleichem Kontext | Cache-Preis und Trefferquote einbeziehen |

Ein sicherer EvoLink-Upgrade-Plan
grok-4.5als Rollback-Route behalten.- 20–50 repräsentative Aufgaben mit identischem Kontext und Tools auf
grok-4.6wiederholen. - Akzeptanz, Latenz, Tokenmix, Tool Calls, Retries und Review messen.
- Shadow Traffic vor nutzersichtbaren Ergebnissen einsetzen.
- Nur gewinnende Workload-Klassen canaryen.
- Bei Identitäts-, Zuverlässigkeits-, Kosten- oder Qualitätsregression zurückrollen.
EvoLink reduziert Integrationsaufwand durch ein Gateway; modellabhängiges Verhalten braucht weiterhin klare Abnahmetests.
FAQ
Ist Grok 4.6 besser als Grok 4.5?
Herstellerwerte sind höher, doch für Ihr System entscheiden reale Workloads, Tool-Zuverlässigkeit, Latenz und akzeptierte Aufgabenkosten.
Verwenden beide dieselbe Modell-ID?
grok-4.6 beziehungsweise grok-4.5.Sind die Preise identisch?
Input und Output stimmen direkt überein, Cached Input nicht. Prüfen Sie den Live-Preis der EvoLink-Route.
Haben beide 500K Kontext?
Ja. Beide offiziellen Modellseiten dokumentieren 500.000 Token.
Sollten bestehende Apps sofort wechseln?
Nein. Starten Sie mit Replay, Shadow Traffic und kleinem Canary bei aktivem Fallback.
Was sollte während der Migration gemessen werden?
Akzeptanz, Latenz, Tokenmix, Tool-Erfolg, Retries, menschliche Korrektur und Gesamtkosten je akzeptierter Aufgabe.


