GPT Image 2.5 Flare & Sunburst sind jetzt auf EvoLink verfügbarGPT Image 2.5 testen
Redaktionelle Illustration: Ein verwalteter Agentenkern koordiniert Aufgaben und die Bereitstellung eines fertigen Berichts
Produktlaunch

OpenAI Agents API Release: Funktionen und Aufgabenkosten

Jessie
Jessie
COO
2. Oktober 2026
12 Min. Lesezeit
Die OpenAI Agents API stellt den Codex-Harness als verwalteten Dienst für Anwendungen bereit. Die Ankündigung vom 10. September 2026 beschreibt eine öffentliche Beta: OpenAI betreibt die Agentenschleife; dein Produkt stellt Aufgaben, Fachwerkzeuge und bei Bedarf eine Ausführungsumgebung bereit. Damit verändert sich die Entscheidung zwischen Eigenentwicklung und Dienstleistung bei lang laufenden Agenten. Ein neues Basismodell ist das nicht. Offizielle Ankündigung.

Hinter dem Release stehen konkrete Betriebsfragen: Läuft eine Aufgabe nach einem Verbindungsabbruch weiter? Bleiben wichtige Vorgaben nach der Kontextkomprimierung erhalten? Rechtfertigen parallele Subagenten ihre zusätzlichen Kosten durch kürzere Bearbeitung? Welche Arbeit verbleibt in deiner Anwendung?

Diese Analyse verbindet die dokumentierten Mechanismen mit einem überprüfbaren Testszenario. Stand 2. Oktober 2026: Die EvoLink-Integration wird vorbereitet und ist noch nicht aufrufbar. Die Produktseite informiert über Zugang und Benachrichtigungen. Die folgenden Beispiele sind Testvorschläge, keine Messergebnisse von EvoLink.

OpenAI Agents API: Was wurde veröffentlicht?

FrageAktueller StandKonsequenz für die Einführung
Nur Ankündigung oder nutzbares Anbieterprodukt?Öffentliche Beta am 10. September angekündigtGegen die Beta-Dokumentation prüfen, keine GA-Zusagen voraussetzen
Agents SDK unter neuem Namen?Nein: API als gehostete Laufzeit, SDK in deiner AnwendungEine Migration verändert Betriebsverantwortung
Ist der Codex-Harness ein Modell?Nein: Er koordiniert Modellaufrufe, Werkzeuge und laufende ArbeitDen gesamten Ablauf bewerten, nicht nur die Modellqualität
Über EvoLink verfügbar?Integration läuft; Aufrufe noch nicht geöffnetDen verifizierten Weg behalten und einen Pilotfall vorbereiten
Bedeutet eine öffentliche API offene Modellgewichte?Aus diesem Laufzeit-Release folgt keine Aussage zu Gewichten oder ModelllizenzenQuellcode der Laufzeit, Dienstbedingungen und Modelllizenz getrennt prüfen

Die Namensähnlichkeit ist relevant: Ein Tutorial zur Installation des Agents SDK demonstriert nicht automatisch die neue verwaltete API. Ebenso belegt ein OpenAI-kompatibler Modellendpunkt keine Unterstützung dauerhafter Agentensitzungen. Identifiziere vor der Übernahme eines Beispiels das tatsächlich verwendete Produkt.

Warum der Zugang zum Codex-Harness relevant ist

Bei Coding- und Analyseprodukten ist der Modellaufruf nur ein Teil der Arbeit. Die Anwendung muss außerdem Werkzeugaktionen auswählen, Ergebnisse weiterreichen, Kontext erhalten und nach Unterbrechungen fortfahren. Der verwaltete Dienst bündelt diese Abläufe in einer Laufzeit. Der größte Nutzen entsteht, wenn deren Wartung einen erheblichen Teil der Teamarbeit ausmacht.

Nicht jede Anwendung sollte deshalb wechseln. Eine kurze, feste Sequenz aus Klassifikation, Validierung und strukturierter Antwort kann bereits einfach und zuverlässig orchestriert sein. Interessanter wird der Dienst, wenn Zwischenergebnisse den nächsten Schritt bestimmen und viele Werkzeugaufrufe nötig sind. Der Vergleich von API, SDK und Responses behandelt diese Entscheidung.

Trenne in der Aufwandserfassung Verbesserungen der Fachaufgabe von Wartung der Ausführungsmechanik. Nur wenn Letztere ins Gewicht fällt und die Dienstgrenze zum Produkt passt, kann die verwaltete Laufzeit einen sinnvollen betrieblichen Vorteil bringen.

Ablauf mit OpenAI Agents API: Eingabedateien, iterative Ausführung, Ergebnisprüfung und Übergabe
Ablauf mit OpenAI Agents API: Eingabedateien, iterative Ausführung, Ergebnisprüfung und Übergabe
Ablaufkonzept: Eingabe → Agentenausführung → Abnahme durch die Anwendung → Übergabe. Die Anwendung prüft die tatsächliche Datei und die Geschäftsregeln, bevor die Aufgabe als erledigt gilt.

Lange Sitzungen und Kontextkomprimierung: Kontinuität prüfen

OpenAI beschreibt automatische Kontextkomprimierung als Bestandteil des Harness, damit Arbeit über Kontextfenster hinweg fortgesetzt werden kann. Zu prüfen ist die Kontinuität einer langen Aufgabe, nicht ein unbegrenzt perfektes Gedächtnis. Erläuterung zum Release.

Ein vorgeschlagener Repository-Test lautet: Pagination korrigieren, öffentliches Antwortformat erhalten, Authentifizierung unverändert lassen und relevante Testergebnisse beifügen. Gib nach mehreren Analyse- und Bearbeitungsschritten einen zusätzlichen Grenzfall vor. Entscheidend ist, ob der finale Patch weiterhin alle ursprünglichen Vorgaben erfüllt. Ein langes Gesprächsprotokoll beweist das nicht.

Speichere die Abnahmeregeln im Aufgabenprotokoll der Anwendung. Vergleiche bei der Prüfung geänderte Dateien, Antwort-Fixture und Testbelege mit diesen Regeln. So lassen sich Probleme der Kontextverarbeitung von einer unpräzisen ursprünglichen Aufgabenbeschreibung unterscheiden. Gleichzeitig entsteht eine unabhängige Grundlage für spätere Laufzeitvergleiche.

Dasselbe gilt bei Datenanalysen: Ein Bericht kann sprachlich konsistent bleiben und trotzdem den Abrechnungszeitraum verändern oder einen gewünschten Ausschluss verlieren. Prüfe solche unveränderlichen Vorgaben ausdrücklich. Eine persistente Sitzung ist keine getestete Garantie, dass jede Geschäftsregel jede Fortsetzung übersteht.

Tool Search und programmatische Aufrufe reduzieren unterschiedliche Arbeit

Tool Search lädt relevante Werkzeugdefinitionen bei Bedarf. Programmatic Tool Calling lässt Code Ergebnisse kombinieren oder filtern, bevor eine kleinere Ergebnismenge zum Modell zurückkehrt. Ersteres betrifft die Fähigkeiten im Kontext, Letzteres die Organisation der Arbeit mit diesen Fähigkeiten.

Ein Assistent zur Kundenkontenanalyse könnte viele CRM-Operationen kennen, aber für eine Frage nur wenige benötigen. Unabhängig davon muss er möglicherweise mehrere Kontodatensätze abrufen und zusammenrechnen. Das passende Werkzeug zu finden beseitigt nicht die Kosten für Datenabruf und Verarbeitung.

Halte deshalb getrennt fest, ob das richtige Werkzeug gewählt wurde und ob die berechneten Werte einer unabhängigen Berechnung entsprechen. Eine kurze Endantwort beweist keine korrekte Aggregation. Testdaten sollten fehlende Datensätze, leere Ergebnisse und widersprüchliche Einheiten enthalten.

Unsere Empfehlung: Kundenwirksame Schreibaktionen nicht in einem undurchsichtigen Aggregationsschritt verstecken. Die Analyse schlägt eine Änderung vor; Anwendungscode prüft Ziel und Berechtigung vor der Ausführung. Das ist eine Gestaltungsempfehlung, keine Aussage über bereits verfügbare EvoLink-Werkzeugfunktionen.

Parallele Subagenten: getrennte Arbeit statt pauschaler Beschleunigung

Die Multi-Agent-Dokumentation beschreibt Subagenten mit eigenen Kontexten unter Koordination eines Hauptagenten. Einzelne Dokumentprüfungen oder voneinander unabhängige Untersuchungen sind deshalb plausible Kandidaten. Eine feste Beschleunigung für deine Aufgabe folgt daraus nicht.

Bei einer vorgeschlagenen Störungsanalyse können Deployment-Änderungen, Fehlerbeispiele und den Zustand der Abhängigkeiten getrennt und schreibgeschützt untersucht werden. Jeder Teil liefert Belege, eine Hypothese und die Grenzen der Verlässlichkeit seiner Einschätzung. Der koordinierende Agent prüft die Vereinbarkeit der Erklärungen, bevor er eine Gegenmaßnahme vorschlägt.

Drei Agenten, die dieselbe Konfigurationsdatei ändern, können dagegen Konflikte und Abstimmungsarbeit erzeugen. Beginne mit getrennter Beweissammlung und einer verantwortlichen Instanz für die finale Änderung. Miss die Zeit bis zum abgenommenen Gesamtergebnis einschließlich Zusammenführung und Konfliktklärung, nicht nur die schnellste Teilaufgabe.

Vergleiche einen einzelnen Agenten mit einer begrenzten Subagenten-Konfiguration auf denselben Störungsfällen. Erfasse Gesamtkosten und manuelle Korrekturen neben der Dauer. Eine schnellere, aber schlechter überprüfbare Antwort verfehlt die Produktanforderung.

Gehostete Sandbox, eigene Umgebung oder keine Sandbox?

OpenAI dokumentiert drei Modi: keine Ausführungsumgebung, eine OpenAI-gehostete Sandbox oder eine selbst gehostete Umgebung. Externe Werkzeuge erfordern nicht automatisch Dateisystem und Shell. Architektur.
Vorgeschlagene AufgabeErster TestkandidatBegründungVerantwortung der Anwendung
Kontenabfrage über GeschäftsfunktionenOhne SandboxDienstergebnisse genügen, lokale Berechnung ist unnötigBenutzer authentifizieren und Zugriffsrechte auf Datensätze durchsetzen
CSV-Analyse mit ArbeitsmappeGehostete SandboxDateien, Pakete und Ergebnisse stehen im MittelpunktSummen prüfen und abgenommenes Ergebnis speichern
Repository-Arbeit mit speziellen AbhängigkeitenSelbst gehostete UmgebungBestehende Rechenumgebung oder Werkzeuge können entscheidend seinRechenressourcen bereitstellen, isolieren, wiederherstellen und stilllegen
„Bring your own sandbox“ betrifft den Ausführungsort. Laut Self-Hosted-Leitfaden verbindet sich ein Executor nach außen mit dem verwalteten Dienst. Dein eigener Executor verlagert den gehosteten Harness nicht in deine Infrastruktur.
Unterscheide außerdem Arbeitsdateien von veröffentlichten Artefakten. Der Dateileitfaden beschreibt unterschiedliche Abrufwege für gehostete und selbst gehostete Umgebungen. Am Ende eines Berichtsablaufs muss die tatsächliche Datei abgerufen und geprüft werden. „Die Datei ist fertig“ ist selbst kein Liefergegenstand.
In einer OpenAI-gehosteten Umgebung werden Dateien unter /workspace/outputs laut Leitfaden bei Abschluss des Turns als unveränderliche Artefakte veröffentlicht. Ordne beim Abruf sowohl den abgeschlossenen Turn als auch den Dateipfad zu, damit eine überarbeitete Analyse nicht versehentlich den alten Bericht ausliefert. Veröffentlichte Artefakte überdauern die Umgebung; benötigte Kopien müssen vor dem Löschen der Sitzung gesichert werden.
In einer selbst gehosteten Umgebung rufst du Dateien über deine Infrastruktur oder den Sandbox-Anbieter ab und kopierst sie vor Ablauf der Umgebung in den Anwendungsspeicher. Schreiben nach /workspace/outputs veröffentlicht sie nicht über OpenAIs Artifacts API. Hinter derselben Schaltfläche „Bericht herunterladen“ stehen somit zwei Abrufadapter. Abruf und Lebensdauer.
Konzept der Dateibereitstellung mit OpenAI Agents API: Zwei Abrufwege führen Berichte aus gehosteten und selbst gehosteten Umgebungen in den Anwendungsspeicher
Konzept der Dateibereitstellung mit OpenAI Agents API: Zwei Abrufwege führen Berichte aus gehosteten und selbst gehosteten Umgebungen in den Anwendungsspeicher
Oben: Abruf gehosteter Artefakte. Unten: Dateiabruf über eigene Infrastruktur. Aufbewahrung und Auslieferung bleiben in beiden Fällen Aufgaben der Anwendung.

Von der Agentenausführung zum herunterladbaren Bericht

Ein möglicher Produktablauf für die CSV-Aufgabe sieht so aus. Das sind Anwendungszustände, keine API-Ereignisnamen:

Anzeige für KundenAktion der AnwendungVoraussetzung für den nächsten Schritt
Verarbeitung läuftGeschäftsauftrag mit Sitzung verknüpfen und Fortschritt verfolgenEin Ergebnis liegt zur Prüfung vor
Ergebnisse werden geprüftRichtige Berichtsversion abrufen; Summen und Ausnahmen prüfenArbeitsmappe erfüllt gespeicherte Abnahmeregeln
Download bereitAbgenommenes Ergebnis speichern und Downloadrechte durchsetzenDatei ist tatsächlich abrufbar
Verbindung wird wiederhergestelltNach Stream-Abbruch bestehende Sitzung und gespeicherte Arbeit lesenFeststellen, ob der ursprüngliche Auftrag läuft oder ein Ergebnis vorliegt
Prüfung erforderlichVerwertbare Ergebnisse erhalten und offene Frage erklärenKorrigierte Eingabe, Prüfentscheidung oder kontrollierter Wiederholungsversuch
Der Quickstart verlangt die Prüfung von Ausführungsergebnissen nach Turn-Abschluss und das Lesen gespeicherter Sitzungsdaten vor einem erneuten Versuch nach Verbindungsabbruch. Deshalb sollte die Oberfläche zuerst „Ergebnisse werden geprüft“ anzeigen. Ein kurzfristiger Browserabbruch löst so nicht standardmäßig einen zweiten kostenpflichtigen Auftrag aus.

Keine zusätzliche API-Gebühr heißt nicht kostenlos

Laut Ankündigung erhebt OpenAI keine separate Agents-API-Gebühr. Modell-, Werkzeug- und Containerkosten bleiben relevant. Daraus folgt weder ein kostenloser Agent noch EvoLinks künftiger Preis. Ankündigung, offizielle Kostenkategorien.

Führe ein Aufgaben-Kostenbuch mit Modell-, Werkzeug- und Umgebungskosten, Fehlversuchen und abgenommenen Ergebnissen. Eigene Betriebs- und Prüfzeit gehört in eine separate Spalte. Sonst wird eine reine Token-Schätzung mit vollständigen Produktionskosten verglichen.

Rechenbeispiel, kein Angebot und kein Benchmark: Ein Batch verursacht 24 USD Modellkosten, 6 USD Werkzeugkosten und 10 USD Umgebungskosten. Bestehen 80 Ergebnisse die Abnahme, sind es 40 USD / 80 = 0,50 USD je akzeptiertem Ergebnis. Teilen durch 100 eingereichte Aufgaben ergäbe 0,40 USD und würde 20 Fehlschläge verdecken. Werden zehn Fehlschläge durch weitere Arbeit für 8 USD gerettet, ergibt sich 48 USD / 90, also rund 0,53 USD je akzeptiertem Ergebnis. Mehr nutzbare Ergebnisse können einen höheren Stückpreis rechtfertigen. Alle Beträge sind USD.
Miss bei ungenutzten Umgebungen tatsächliche Lebensdauer und Abrechnung, statt von einem aktiven Lauf hochzurechnen. Sitzungsdauer, Rechenumgebungsdauer und Wartezeit des Kunden sind verschiedene Messgrößen. Der Lifecycle-Leitfaden trennt Sitzung und Umgebung ausdrücklich. Diese Trennung gehört auch in die Kalkulation.

Welche Beta-Grenzen die Entscheidung verändern

Die am 2. Oktober geprüfte Übersicht nennt Datenresidenz ausschließlich in den USA und keine Unterstützung für Zero Data Retention (ZDR), auch bei selbst gehosteten Sandboxes. Wenn das den Anforderungen widerspricht, scheidet der aktuelle Dienst aus; das ist keine später nachzureichende Einstellung.
Auch die Werkzeuggrenze muss präzise sein: Laut Functions-Leitfaden verarbeitet die Anwendung Funktionsaufrufe und gibt Ergebnisse zurück. Eine angehängte Sandbox verschiebt diese Handler nicht automatisch dorthin. Plane deren Worker und Fehlerbehandlung weiter ein.
Schließlich beweist ein abgeschlossener Turn nicht, dass jede gewünschte Aktion erfolgreich war. Der Quickstart unterscheidet Abschluss, Fehler und Leerlauf. Die fachliche Abnahme muss sich auf das Artefakt oder das Ergebnis im Zielsystem stützen, nicht auf ein einzelnes Statuslabel.

Ein erster Test, der eine Entscheidung ermöglicht

Wähle einen bewusst begrenzten Bericht: zwei CSV-Exporte abgleichen, nicht zugeordnete Zeilen erklären und Arbeitsmappe samt Zusammenfassung erzeugen. Dies ist ein redaktioneller Testentwurf, kein Ergebnisbericht.

TestfallDaten oder UnterbrechungAbnahmebeleg
Normale EingabeZwei Exporte mit bekannter ÜbereinstimmungssummeSummen stimmen mit unabhängiger Berechnung überein
Mehrdeutige DatenDoppelte Kennungen und fehlende WährungUnklarheiten werden angezeigt, keine still erfundene Zuordnung
Client-AbbruchStream nach Arbeitsbeginn schließenBestehende Arbeit wird gefunden, kein blindes Neueinreichen
Geänderte AnweisungWährend der Aufgabe einen Ausschluss ergänzenFinale Summen und Erklärung berücksichtigen die Änderung
ErgebnisabrufRechenumgebung nach Sicherung beendenAnwendung kann das abgenommene Ergebnis abrufen und öffnen
BudgetprüfungSämtliche Versuche einbeziehenAusgaben und Zahl akzeptierter Ergebnisse sind nachvollziehbar
Erfasse Aufgabenversion, Modell, Laufzeitkonfiguration, Route, Zeitstempel und Abnahme zusammen. Behalte Fehlschläge, statt nur eine gelungene Demo zu zeigen. Übernimm den Ablauf erst, wenn er die bestehende Qualitätsanforderung erfüllt und einen messbaren Vorteil bei Dauer, Betriebsarbeit oder Kosten bietet. Für sofort benötigte Modellaufrufe bleiben verifizierte Integrationen beziehungsweise der EvoLink-Modellkatalog relevant; verwaltete Sitzungen sind separat zu bewerten.

Häufige Fragen

Wann wurde OpenAI Agents API veröffentlicht?

Die öffentliche Beta wurde am 10. September 2026 angekündigt. Daraus folgt weder GA noch ein EvoLink-Startdatum.

Ist das das Codex-Modell oder das Agents SDK?

Es ist ein verwalteter Dienst um den Codex-Harness. Modellwahl und SDK-Orchestrierung innerhalb einer Anwendung sind eigene Konzepte.

Bedeutet automatische Komprimierung unbegrenztes Gedächtnis?

Nein. Prüfe, ob Vorgaben und Belege über lange Arbeit hinweg nutzbar bleiben. Die fachliche Abnahmedokumentation muss außerhalb des Gesprächs gespeichert werden.

Senken Subagenten immer Kosten oder Latenz?

Nein. Parallelität liefert kein aufgabenunabhängiges Ergebnis. Koordination, doppelte Arbeit und Endprüfung gehören in den Vergleich.

Ist Agents API kostenlos?

Auch ohne separate API-Gebühr fallen Modell-, Werkzeug- und Umgebungskosten an. Unsere Berechnung ist beispielhaft; EvoLink hat noch keine Preise angekündigt.

Kann alles in meiner VPC bleiben?

Das folgt nicht aus einer selbst gehosteten Sandbox. Ausführungsumgebung und verwalteter Dienst sind getrennte Grenzen; aktuelle Residenz- und Aufbewahrungsbedingungen bleiben relevant.

Noch nicht. Updates abonnieren, während die Integration vorbereitet wird. Das ist eine Benachrichtigungsanfrage, kein API-Zugangsschlüssel.

Wann wird dieser Artikel aktualisiert?

Bei einem neuen Beta-/GA-Vertrag, geänderten Umgebungs- oder Datenkontrollen, verifiziertem Gateway-Support oder reproduzierbaren Testergebnissen. Dann ändern sich Fakten und Empfehlungen, nicht bloß das Datum.

Quellen und weiterführende Informationen

Technische Quellen stehen an den jeweiligen Aussagen. Die Marktrecherche erfasste außerdem die API-oder-SDK-Frage auf HN und die Debatte zur Ablösung von Frameworks. Sie erklären die behandelten Fragen, belegen aber weder API-Funktionen noch gemessene Einsparungen.
Der Laufzeitvergleich behandelt Framework-Wahl, Vergleichstests und Rückkehr zur bisherigen Lösung. Die EvoLink-Statusseite informiert über den Gateway-Zugang.