GPT Image 2.5 Flare & Sunburst sind jetzt auf EvoLink verfügbarGPT Image 2.5 testen

GLM-5.3 API

Greifen Sie über die einheitliche Chat-API von EvoLink auf GLM-5.3 von Z.ai zu – auch gesucht als Zhipu GLM-5.3 / GLM 5.3 –. Testen Sie Coding mit langem Kontext, mehrstufige Agents, Prompt-Caching vor der Integration.

Z.aiTextgenerierungVerfügbar
ab $1.400 / 1 Mio. Input-Tokens
API-Dokumentation
Reasoning immer aktivPrompt-CachingTool-AufrufeChat + Messages
ProduktionsrouteLive
Kontext
1M Kontext · max. 131K Ausgabe
Geeignet für
Coding-Agenten, lange Aufgabenketten, toollastige Workflows
Eingabe
Text
Ausgabe
Text · JSON (strukturierte Ausgabe) · Tool-Aufrufe

GLM-5.3 auswählen

Das Flaggschiff-Reasoning-Modell von Z.ai für Coding-Agenten und langlaufende Engineering-Aufgaben: 1 Mio. Tokens Kontext, dauerhaft aktives Reasoning, Tool-Calling und Prompt-Caching über Chat Completions und Anthropic Messages.

GLM-5.3

Z.ai Flaggschiff-Reasoning-Modell

Ausgewählt
Modell-ID
glm-5.3
Geeignet für

Coding-Agenten auf Repository-Ebene, lange Aufgabenketten, tool-intensive Workflows und Agent-Schleifen mit stabilem Prefix, bei denen Cache-Reads den Großteil des Inputs tragen.

Eingabe
$1.400 / 1M95.2 cr / 1M
Cache-Lesen
$0.261 / 1M17.7 cr / 1M
Ausgabe
$4.400 / 1M299.2 cr / 1M

Alle Tarife gelten pro 1M Tokens, in USD und Credits, und entsprechen der aktuellen Preisgestaltung Ihres Kontos.

GLM-5.3 Preise

Schätzen Sie vor der Integration die Kosten einer GLM-5.3-Anfrage. Der Rechner verwendet die aktuellen Tarife Ihres Kontos; offizielle Preise dienen als Vergleich.

Anfragen-Rechner

Geben Sie den Token-Mix einer Anfrage und die Anzahl erfolgreicher Tool-Aufrufe ein.

Geschätzte Kosten pro Anfrage

GLM-5.3
USD$0.0028
Credits0.1886
Eingabe-Tokens0.0952 cr
Cache-Lese-Tokens0.0036 cr
Ausgabe-Tokens0.0898 cr

Mindestgebühr: 0.01 Credits pro Anfrage.

Budget-Leitfaden

Ungefähre Anfragen mit dem aktuellen Token-Mix.
Credits aufladen
$10
Etwa 3605 Anfragen

Für schnelle Tests

$50
Etwa 18027 Anfragen

Für die laufende Entwicklung

$100
Etwa 36055 Anfragen

Für die Produktionsbewertung

Tarife serverseitiger Tools

Nur erfolgreiche serverseitige Aufrufe werden pro Aufruf berechnet; fehlgeschlagene Versuche kosten keine Tool-Gebühr, Tokens werden weiterhin berechnet.
  • Websuche$0.010/ Aufruf0.68 cr / Aufruf

GLM-5.3 API für Coding-Agenten und langlaufendes Engineering

Z.ais Flaggschiff-Reasoning-Modell für $1,40 Input und $4,40 Output pro 1 Mio. Token über die einheitliche EvoLink API aufrufen. Modell-ID glm-5.3, 1 Mio. Kontext, dauerhaftes low/high/max Reasoning, Tool-Calling und Prompt-Caching.

GLM-5.3 wird auf EvoLink unter der Modell-ID glm-5.3 über Chat Completions · Responses · Anthropic Messages bereitgestellt – mit demselben API-Key und Guthaben wie jedes andere Modell. Es bietet ein Kontextfenster von 1M und bis zu 131K Ausgabe-Tokens, dazu Coding mit langem Kontext, mehrstufige Agents, Prompt-Caching.

GLM-5.3

GLM-5.3 Spezifikationen und Fähigkeiten

Die Zahlen stammen aus der EvoLink-Routenkonfiguration; die Fähigkeiten entsprechen dem, was die API heute bereitstellt.

Kontextfenster
1M Tokens
Max. Ausgabe
131K Tokens
Eingabe
Text
Ausgabe
Text · JSON (strukturierte Ausgabe) · Tool-Aufrufe
Reasoning
Dauerhaft aktives Reasoning
Tool-Nutzung
Function Calling mit mehrstufigen Tool-Sequenzen
Prompt-Caching
Automatische Cache-Lesezugriffe zu niedrigerem Tarif
Serverseitige Tools
Websuche, abgerechnet pro erfolgreichem Aufruf
Protokolle
Chat Completions · Responses · Anthropic Messages
Modell-ID
glm-5.3

Warum GLM-5.3 diese Workloads bewältigen kann

Drei Eigenschaften tragen den Großteil. Jede impliziert zugleich eine Art, das Modell falsch zu nutzen — daher lohnt sich das Verständnis, bevor Produktions-Traffic fließt.

1 Mio. Tokens Arbeitskontext zum Einheitspreis

Es gibt keine Long-Context-Preisstufe — der Satz bei Token 900.000 entspricht dem bei Token 1.000. Das nimmt einen häufigen Grund für aggressives Kürzen, macht das Füllen des Fensters aber weder kostenlos noch genauer.

Byte-genaue Weitergabe des Requests

Abgesehen vom Modellnamen erreicht der Request-Body den Upstream unverändert, sodass GLM-spezifische Felder, Prompt-Cache-Prefix-Hashes und Reasoning-Signaturen auf beiden Endpunkten erhalten bleiben.

Reasoning-Tokens in der Output-Abrechnung enthalten

Reasoning wird innerhalb der Completion-Tokens abgerechnet, nicht als eigene Position. Das Limit von 131.072 Output-Tokens umfasst also Reasoning und finale Antwort gemeinsam. Output-Budgets nach Aufgabe setzen, nicht nach dem Limit.

Wo GLM-5.3 im produktiven Modell-Stack sinnvoll ist

GLM-5.3 kostet mehr als GLM-5.2 und deutlich mehr als Flash. Es sollte also nicht allein deshalb zur Standardroute werden, weil es das neueste Modell ist. Am stärksten ist es dort, wo tieferes Reasoning einen Retry oder eine Runde manueller Korrektur einspart.

GLM-5.3 für Coding auf Repository-Ebene

Zusammenhängende Module, Tests und Konventionen liegen in einem 1-Mio.-Token-Kontext, statt einen Coding-Agenten Datei für Datei zu füttern. Der Gewinn zeigt sich in weniger kaputten dateiübergreifenden Änderungen, nicht in schöneren Einzeldatei-Vervollständigungen.

GLM-5.3 für lange Aufgabenketten

Plan-Execute-Verify-Schleifen über viele Schritte profitieren am meisten, weil ein früher Reasoning-Fehler sich über die gesamte Kette fortpflanzt. Messen Sie die Rate abgeschlossener Ketten, nicht die Qualität einzelner Schritte.

GLM-5.3 für tool-intensive Agenten

Große Tool-Schemata und lange Instruktionsblöcke liegen im gecachten Prefix, sodass die Grenzkosten eines weiteren Schritts nahe am Cache-Read-Satz bleiben statt am vollen Input-Satz.

GLM-5.3 über Anthropic-Protokoll-Clients

Anfragen an /v1/messages werden byte-genau durchgereicht, Prompt-Cache-Prefixe und Reasoning-Signaturen bleiben erhalten. Coding-CLIs mit Claude-Protokoll können direkt auf EvoLink zeigen und glm-5.3 wählen — ohne Übersetzungsschicht.

Was GLM-5.3 verändert — und was es bricht

GLM-5.3 ist kein Drop-in-Ersatz für GLM-5.2. Eine Parameteränderung ist ein harter Bruch, und der Preis hat sich bewegt. Diese vier Punkte vor dem Umstellen einer Produktionsroute lesen.

Breaking Change: Reasoning lässt sich nicht mehr abschalten

GLM-5.3 denkt immer und lehnt thinking.type: "disabled" ab. Jeder von GLM-5.2 migrierte Client, der den deaktivierten Modus weiterhin sendet, schlägt schlicht fehl. Offizieller Ersatz: thinking.type: "enabled" mit reasoning_effort: "low".

Drei Reasoning-Stufen, Standard ist max

reasoning_effort akzeptiert low, high und max und steht standardmäßig auf max. Da Output-Tokens die Reasoning-Tokens enthalten, verschiebt die Stufe die Kosten direkt — den Standard bei Routineaufrufen in großer Menge stehen zu lassen, ist der häufigste Weg, bei 5.3 zu viel auszugeben.

Cache-Reads sind der günstigste Hebel auf dieser Seite

Cache-Read-Tokens kosten rund ein Fünftel von frischem Input. In langen Agent-Schleifen, in denen System-Prompt und Tool-Schemata den Input dominieren, wirkt ein byte-stabiles Prefix stärker auf die Rechnung als die Modellwahl selbst.

Teurer als GLM-5.2, ohne Rabatt

Der Input liegt rund 40% über dem aktuellen GLM-5.2-Satz, weil 5.3 ohne Aktionsrabatt zum Upstream-Preis abgerechnet wird. Nur dorthin routen, wo das zusätzliche Reasoning messbar den Preis wert ist; der Rest bleibt auf 5.2 oder Flash.

Zwei Wege, GLM-5.3 zu nutzen: EvoLink API oder Agent

Nutzen Sie die EvoLink API für Produkt-Backends und Batch-Jobs oder rufen Sie GLM-5.3 aus Codex, Claude oder Gemini für Coding- und Analyse-Workflows auf. Beide Wege teilen denselben EvoLink API-Key, das Guthaben, die Modell-ID und die Anfragehistorie.

Option 1

Mit der EvoLink API integrieren

Ideal für: Produkt-Backends, Batch-Jobs, automatisierte Pipelines

Senden Sie OpenAI-kompatible Chat-Completions- (oder Anthropic-Messages-) Anfragen an EvoLink und steuern Sie Modell-ID, System-Prompt, Ausgabebudget, Tools und strukturierte Ausgabe.

  1. 1Erstellen Sie einen EvoLink API-Key in der Konsole
  2. 2Richten Sie Ihr OpenAI- oder Anthropic-SDK auf die EvoLink-Basis-URL und wählen Sie die oben gezeigte Modell-ID
  3. 3Senden Sie eine repräsentative Anfrage und lesen Sie im Feld usage Eingabe-, Cache- und Ausgabe-Tokens ab
  4. 4Setzen Sie max_tokens und Wiederholungen pro Aufgabe; behalten Sie Tool-Call-IDs und -Ergebnisse über Runden hinweg
Option 2

Mit einem Agenten aufrufen

Ideal für: Coding-, Review- und Analyseaufgaben in Codex, Claude und Gemini

Geben Sie dem Agenten Aufgabe, Eingaben und Abnahmekriterien. Er baut die Anfrage, ruft GLM-5.3 über EvoLink auf und liefert die Antwort samt Token-Verbrauch.

  1. 1Setzen Sie EVOLINK_API_KEY in Ihrer lokalen Umgebung; nie in Code oder Prompt
  2. 2Beschreiben Sie Aufgabe, einzubeziehende Eingaben und das erwartete Ausgabeformat
  3. 3Lassen Sie den Agenten GLM-5.3 über EvoLink aufrufen und die Anfrage vor dem Senden zeigen
  4. 4Lassen Sie den Agenten Antwort, Token-Verbrauch und etwaige Fehlermeldungen berichten

GLM-5.3 API-Codebeispiel und Fehlerbehandlung

Dieses Beispiel zeigt die kürzeste lauffähige Anfrage: ein OpenAI-kompatibler Chat-Completions-Aufruf mit System-Prompt, Nutzernachricht und Ausgabebudget. Die vollständige Parameter- und Antwortreferenz finden Sie im API-Tab.

Vollständige API-Doku ansehen
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      { "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
      { "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
    ],
    "reasoning_effort": "low",
    "max_tokens": 2048,
    "stream": true
  }'

# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).

Ungültige Anfrage oder nicht unterstützter Parameter

Prüfen Sie Modell-ID, messages-Array und Parameterbereiche anhand der API-Referenz; entfernen Sie Felder, die diese Route nicht unterstützt.

Authentifizierungs- oder Guthabenproblem

Prüfen Sie das Authorization-Bearer-Token und bestätigen Sie das verfügbare Guthaben in der Konsole.

Kontextlänge überschritten

Die Prompt-Tokens übersteigen das Kontextfenster von GLM-5.3. Kürzen Sie oder rufen Sie nur relevante Belege ab und nutzen Sie gecachte Präfixe wieder.

Ratenlimit (429)

Mit Backoff und Jitter erneut versuchen; Anfragen bündeln oder in eine Warteschlange stellen statt parallel zu senden.

Inhalt oder Tool-Aufruf abgelehnt

Prüfen Sie sensible Inhalte, fehlerhafte Tool-Call-Argumente und JSON-Schema-Abweichungen vor dem erneuten Versuch.

Was vor dem Routing von Produktions-Traffic auf GLM-5.3 zu prüfen ist

Vier Prüfungen fangen fast alle Migrationsprobleme bei diesem Modell ab. Die ersten beiden sind harte Fehler, die letzten beiden stille Kostenprobleme.

01

glm-5.3 als Modell-ID verwenden

Dieselbe ID gilt für Chat Completions und Anthropic Messages und entspricht exakt dem Upstream-Namen — kein Alias zu übersetzen.

Erforderlich
02

Jedes thinking.type: "disabled" entfernen

Der einzige harte Bruch gegenüber GLM-5.2. Durch thinking.type: "enabled" plus reasoning_effort: "low" ersetzen und die Regressions-Prompts erneut ausführen.

Breaking
03

reasoning_effort bewusst setzen

Standard ist max. Routine- und latenzkritische Aufrufe auf low senken und prüfen, ob die Akzeptanzquote hält, bevor die Ersparnis eingeplant wird.

Kosten
04

Prüfen, ob Cache-Reads wirklich greifen

Kontrollieren, ob gecachte Tokens in der zurückgegebenen usage erscheinen. Verschiebt sich das Prefix zwischen Aufrufen, wird jede Anfrage zum vollen Input-Satz abgerechnet — in der Antwort selbst ist das unsichtbar.

Kosten

Cache-Reads kosten rund ein Fünftel von frischem Input

Gecachter Input wird zu einem eigenen, niedrigeren Satz abgerechnet — ein stabiler System-Prompt, Repository-Regeln und Tool-Schemata bleiben über lange Agent-Schleifen hinweg günstig. Eine Gebühr für Cache-Writes gibt es nicht, da der Upstream keine Cache-Creation-Tokens meldet.

1 Mio. Tokens Kontext, 131K Output-Limit

Halten Sie zusammenhängenden Code, Spezifikationen und Agent-State in einem Arbeitskontext. Das Limit ist Kapazität, kein Ziel: gezielt abrufen, das Prefix stabil halten, damit es cacht, und Output-Budgets nach Aufgabe setzen.

Bei GLM-5.3 die Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis

GLM-5.3 ist pro Token teurer als GLM-5.2 und Flash. Das zählt nur zusammen damit, wie oft jedes Modell ein Ergebnis liefert, das Sie tatsächlich ausliefern. Diese Signale eine Woche lang auf eigenen Workloads verfolgen, bevor eine Route festgelegt wird.

First-Pass-ErfolgsquoteAkzeptierte ErgebnisseRetries pro AufgabeReasoning-Anteil an Output-TokensCache-TrefferquoteGültige Tool-CallsZeit bis zum akzeptierten ErgebnisFallback-Rate

Eine Route, die pro Token 40% mehr kostet, aber einen von drei Retries einspart, ist in der Praxis günstiger. Eine Route, die 40% mehr kostet und nichts verändert, ist nur ein teurerer Standard. Unterscheiden lässt sich beides ausschließlich durch Messung an denselben Aufgaben.

Vor dem Wechsel mit GLM-5.2 und Kimi K3 vergleichen

EvoLink

GLM-5.3 liegt preislich über GLM-5.2. Die eigentliche Frage ist, ob weniger Retries und weniger manuelle Korrektur die Differenz auf Ihren Workloads decken. Erst messen, dann die Produktionsroute festlegen.

GLM-5.3
Input / Output$1.4 / $4.4
Kontext1M
CachingCache-Reads
Am besten fürCoding-Agenten auf Repository-Ebene, lange Aufgabenketten, tool-intensive Workflows und Agent-Schleifen mit stabilem Prefix, bei denen Cache-Reads den Großteil des Inputs tragen.
GLM-5.2
Input / Output$1 / $3.5
Kontext1M
CachingCache-Reads
Am besten fürDas bisherige GLM-Flaggschiff, weiterhin günstiger pro Token. Sinnvoll, wo 5.3 keinen messbaren Vorteil bringt — und für Clients, die auf deaktiviertes Reasoning angewiesen sind.
Kimi K3
Input / Output$3 / $15
Kontext1.05M
CachingAutomatische Cache-Reads
Am besten fürMoonshots Reasoning-Route mit 1 Mio. Kontext. Nützliche herstellerübergreifende Vergleichsbasis für Long-Context-Coding und Agenten.

GLM-Modellfamilie

Gleicher API-Key, gleiches Guthaben – Stufe wechseln, ohne die Integration zu ändern.

GLM-5.3

GLM-5.3

Aktuelles Modell

Z.ai Flaggschiff-Reasoning-Modell

GLM-5.2

GLM-5.2

Das bisherige GLM-Flaggschiff, weiterhin günstiger pro Token. Sinnvoll, wo 5.3 keinen messbaren Vorteil bringt — und für Clients, die auf deaktiviertes Reasoning angewiesen sind.

Modell ansehen
GLM-5.3 Flash

GLM-5.3 Flash

Gleiche 5.3-Generation zu etwa einem Neuntel des Preises, dazu native Bild-, Video- und Datei-Eingabe. Der richtige Standard für hohe Volumina und multimodale Arbeit.

Modell ansehen

Weitere Textmodelle auf EvoLink neben GLM-5.3

Kimi K3

Kimi K3

Moonshots Reasoning-Route mit 1 Mio. Kontext. Nützliche herstellerübergreifende Vergleichsbasis für Long-Context-Coding und Agenten.

Modell ansehen
DeepSeek V4 Pro

DeepSeek V4 Pro

Kostensensible Long-Context-Basis für Massen-Reasoning, wenn der Token-Preis die Routing-Entscheidung dominiert.

Modell ansehen
GPT-5.6

GPT-5.6

OpenAIs gestaffelte Frontier-Familie (Sol/Terra/Luna) für flexibles Routing nach Leistung, Latenz und Kosten.

Modell ansehen
Claude Opus 4.8

Claude Opus 4.8

Anthropics Premium-Route für lang laufende Agents, komplexe Reviews und urteilsintensive Aufgaben.

Modell ansehen

Weiterführende Artikel zu GLM-5.3

GLM-5.3 Flash vs GLM-5.3

GLM-5.3 Flash vs GLM-5.3

Die Familienroute nach Modalität, Schwierigkeit und Kosten pro akzeptiertem Ergebnis wählen — mit einer Flash-first-Eskalationsstrategie.

Artikel lesen
GLM-5.3 ist da: Was ausgeliefert wurde

GLM-5.3 ist da: Was ausgeliefert wurde

Was das Release vom 14. August bei Spezifikationen, Modell-IDs und gestaffeltem Zugang tatsächlich bestätigt hat — und was offen blieb.

Artikel lesen
GLM-5.3 vs GLM-5.2

GLM-5.3 vs GLM-5.2

Gleiches Basismodell, alle Gewinne aus dem Post-Training — plus der Breaking Change, dass Reasoning nicht mehr abschaltbar ist. Wann 5.2 bleiben sollte.

Artikel lesen
GLM-5.3 vs Claude

GLM-5.3 vs Claude

Benchmarks, API-Verträge und die reale Verfügbarkeit im Vergleich, bevor Coding-Agenten auf eines von beiden geroutet werden.

Artikel lesen
GLM-5.3 Cybersecurity-Benchmarks

GLM-5.3 Cybersecurity-Benchmarks

Was die CyberGym- und ExploitBench-Zahlen nach Z.ais eigener Darstellung behaupten und wie Verteidiger sie lesen sollten.

Artikel lesen
Ein Gateway für 3 Coding-CLIs

Ein Gateway für 3 Coding-CLIs

Konfigurationspfade, Umgebungsvariablen und eine Troubleshooting-Checkliste für den Betrieb mehrerer Coding-CLIs über einen Endpunkt.

Artikel lesen

GLM-5.3 API — häufige Fragen

Ist die GLM-5.3 API über EvoLink verfügbar?

Ja. GLM-5.3 ist als Produktionsmodell verfügbar, erreichbar über Chat Completions und Anthropic Messages.

Welche Modell-ID nutze ich für die GLM-5.3 API?

glm-5.3 für beide Endpunkte. Der EvoLink-Modellname entspricht exakt dem Upstream-Namen.

Kann ich das OpenAI SDK oder Anthropic Messages weiterverwenden?

Ja. Richten Sie den Client mit demselben API-Key auf EvoLink und wählen Sie glm-5.3. Bis auf den Modellnamen wird der Request byte-genau durchgereicht, sodass Prompt-Cache-Prefixe und Reasoning-Signaturen erhalten bleiben.

Kann ich Reasoning wie bei GLM-5.2 deaktivieren?

Nein. GLM-5.3 denkt immer und lehnt thinking.type: "disabled" ab. Bei der Migration von GLM-5.2 auf thinking.type: "enabled" mit reasoning_effort: "low" umstellen — das ist der offizielle Ersatz.

Wie wähle ich reasoning_effort?

Standard ist max. Für Routineänderungen, Klassifikation und latenzkritische Aufrufe low; für Architektur, Debugging und lange Aufgabenketten high oder max. Output-Tokens enthalten Reasoning-Tokens, die Stufe verändert also direkt die Kosten.

Warum ist GLM-5.3 teurer als GLM-5.2?

GLM-5.3 wird zum Upstream-Satz ohne Rabatt abgerechnet, GLM-5.2 läuft auf einem Aktionspreis — der Input liegt rund 40% höher. Auf 5.3 umleiten, wo das zusätzliche Reasoning Retries einspart, sonst bei 5.2 oder GLM-5.3 Flash bleiben.

Wie wird Prompt-Caching abgerechnet?

Cache-Reads haben einen eigenen Satz, etwa ein Fünftel von frischem Input. Cache-Writes werden nicht berechnet, da der Upstream keine Cache-Creation-Tokens meldet. Für dauerhafte Treffer das Prompt-Prefix byte-stabil halten.

Wie groß sind Kontextfenster und Output-Limit?

1.000.000 Tokens Kontext und bis zu 131.072 Output-Tokens, zu einem einheitlichen Satz über das gesamte Fenster — es gibt keine Long-Context-Preisstufe.

GLM-5.3 oder GLM-5.3 Flash?

Flash kostet etwa ein Neuntel und akzeptiert Bild-, Video- und Datei-Eingaben. Für hohe Volumina, Multimodales und Routine mit Flash starten; zu GLM-5.3 wechseln, wenn eine Aufgabe tieferes Reasoning braucht und die Akzeptanzquote den Aufpreis trägt.

Verarbeitet GLM-5.3 Bilder?

Nein, GLM-5.3 ist reines Text-Modell. Für Bild-, Video- und Datei-Eingaben GLM-5.3 Flash verwenden.

Wie vergleiche ich GLM-5.3 mit Claude, GPT oder Kimi?

GLM-5.3 nach Kosten pro akzeptierter Aufgabe für Coding-Agenten und lange Ketten bewerten, Claude und GPT als Frontier-Referenz heranziehen und Kimi K3 als herstellerübergreifenden Long-Context-Vergleich nutzen.

Was sollte eine Produktionsbewertung messen?

First-Pass-Erfolg, akzeptierte Ergebnisse, Retries, Reasoning-Anteil am Output, Cache-Trefferquote, gültige Tool-Calls, Zeit bis zum akzeptierten Ergebnis und Fallback-Rate.