OpenAI Codex vs. Claude Code: zwei Coding-Agenten im Vergleich
Codex von OpenAI und Claude Code von Anthropic lösen dieselbe Aufgabe: ein Projekt lesen, Änderungen planen, Befehle ausführen. Wir vergleichen Tarife, Anweisungsdateien, Sicherheitsmodell und Einsatzorte anhand der Herstellerdokumentation und zeigen, wie ein fairer Test im eigenen Projekt aussieht.

OpenAI Codex und Claude Code sind zwei agentische Programmierwerkzeuge, die ein Projekt lesen, mehrstufige Änderungen planen, Befehle ausführen und das Ergebnis zur Prüfung vorlegen. Welches besser passt, entscheidet sich weniger an der Technik als an drei praktischen Fragen: welches Abo schon im Haus ist, wie viel Autonomie man dem Agenten zugesteht, und wie sich beide an einer echten Aufgabe aus dem eigenen Code schlagen.
Viele Vergleiche im Netz verkünden einen klaren Sieger, oft ohne offenzulegen, woran gemessen wurde. Wir gehen einen anderen Weg: Wir stellen gegenüber, was sich aus der Herstellerdokumentation belegen lässt, und beschreiben, wie ein fairer Test aussieht, den jedes KMU in zwei Tagen selbst durchführen kann. Einen breiteren Überblick inklusive Cursor und Devin Desktop (vormals Windsurf) bietet unser grosser Vergleich der KI-Coding-Tools.
Was beide Werkzeuge gemeinsam haben
Beide Agenten denken in Aufgaben statt in Codezeilen. Man beschreibt, was sich ändern soll, zum Beispiel «Das Kontaktformular soll zusätzlich eine Telefonnummer abfragen und validieren». Der Agent sucht die betroffenen Dateien, schlägt Änderungen vor, führt Tests aus und korrigiert sich, wenn etwas scheitert.
Beide lesen ausserdem eine Anweisungsdatei im Projekt, die Aufbau, Befehle und Regeln beschreibt. Und beide laufen an mehreren Orten: in der Kommandozeile, als Erweiterung im Editor und in einer grafischen Anwendung. Für die Wahl zwischen ihnen zählen deshalb die Details.
Tarife und Zugang: das bestehende Abo entscheidet oft
Der pragmatischste Unterschied liegt im Vertrag. Beide Anbieter binden ihr Coding-Werkzeug an ihr Chat-Abo, nicht an einen separaten Vertrag.
| OpenAI Codex | Claude Code | |
|---|---|---|
| Einstieg | in ChatGPT Free enthalten, mit eingeschränktem Zugang | nicht im Gratis-Tarif, ab Claude Pro |
| Einzeltarife | Go 8 USD, Plus 20 USD, Pro ab 100 USD pro Monat | Pro 20 USD (17 USD bei Jahresabo), Max ab 100 USD pro Monat |
| Team | Business 25 USD pro Nutzer monatlich, 20 USD bei Jahresabrechnung | Team Standard 25 USD pro Platz, 20 USD bei Jahresabo |
| Quelle | OpenAI Pricing | claude.com/pricing |
Stand: 2026-09-23, Preise in US-Dollar ohne Mehrwertsteuer, Enterprise-Tarife nicht aufgeführt. Die Nutzungsgrenzen innerhalb der Tarife sind bei beiden Anbietern nicht als feste Mengen ausgewiesen und lassen sich nicht direkt vergleichen.
Für ein KMU folgt daraus eine einfache Regel: Wer im Team ohnehin ChatGPT nutzt, kann Codex ohne neuen Vertrag testen. Wer bereits mit Claude arbeitet, hat Claude Code dabei. Ein zweites Abo nur für einen Test ist selten nötig, ein Monat Einzeltarif reicht.
Einsatzorte: Terminal, Editor, Web
Laut OpenAI läuft Codex ab dem Plus-Tarif im Web, in der Kommandozeile, als IDE-Erweiterung und auf iOS; ab dem Business-Tarif kommen Desktop- und Mobile-Apps hinzu. Mit einem API-Schlüssel ist Codex in der Kommandozeile, im SDK und in der IDE-Erweiterung nutzbar (Stand: 2026-09-23).
Claude Code läuft im Terminal, in Editoren wie VS Code und JetBrains sowie in einer Desktop-App. Für ein Team heisst das: Beide Werkzeuge lassen sich dort einsetzen, wo die Entwickler ohnehin arbeiten. Der Einsatzort ist selten das Entscheidungskriterium.
Anweisungsdateien: AGENTS.md und CLAUDE.md
Beide Agenten beginnen jede Sitzung ohne Erinnerung an die letzte. Was dauerhaft gilt, steht in einer Textdatei im Projekt.
Codex liest AGENTS.md. Laut OpenAI-Dokumentation sucht Codex zuerst im persönlichen Codex-Verzeichnis (typischerweise ~/.codex) und dann vom Stamm des Repositorys bis zum aktuellen Ordner. Die Dateien werden aneinandergehängt, näher liegende Dateien stehen später und haben damit Vorrang. Standardmässig gilt eine Grenze von 32 KiB für die zusammengesetzten Anweisungen.
Claude Code liest CLAUDE.md. Laut Anthropic-Dokumentation lädt Claude Code die CLAUDE.md-Dateien des aktuellen Ordners und aller darüberliegenden beim Start, Dateien in Unterordnern bei Bedarf. Dazu kommt eine persönliche Datei unter ~/.claude/CLAUDE.md. Wichtig: Claude Code kann auch eine vorhandene AGENTS.md lesen.
Praktisch bedeutet das: Wer beide Werkzeuge testen will, pflegt die Projektbeschreibung am besten einmal in einer AGENTS.md und verweist aus der CLAUDE.md darauf. Wie eine solche Datei im Alltag aussieht und warum sie der eigentliche Hebel ist, zeigen wir in unserem Praxisbericht Claude Code in der Praxis.
Sicherheitsmodell: Sandbox gegen Berechtigungsmodi
Hier liegt der grösste konzeptionelle Unterschied.
Codex setzt auf eine Sandbox. Laut OpenAI-Dokumentation zu Freigaben und Sicherheit gibt es drei Modi: read-only, workspace-write als Standard, in dem Codex im Arbeitsordner lesen, schreiben und Befehle ausführen darf, und danger-full-access ohne Sandbox, den OpenAI nicht empfiehlt. Der Netzwerkzugriff ist standardmässig ausgeschaltet und muss ausdrücklich aktiviert werden (Stand: 2026-09-23).
Claude Code setzt auf Berechtigungsmodi und Hooks. Laut Anthropic-Dokumentation reicht die Spanne von «Manual», in dem ohne Nachfrage nur gelesen wird, über acceptEdits und einen Planungsmodus bis zu einem Auto-Modus, in dem ein zweites Modell Aktionen im Hintergrund prüft. Der Modus bypassPermissions ist ausdrücklich nur für isolierte Container und virtuelle Maschinen gedacht. Zusätzlich kann ein sogenannter PreToolUse-Hook einzelne Befehle hart blockieren, unabhängig davon, was das Modell entscheidet. Eine optionale Bash-Sandbox gibt es ebenfalls (Stand: 2026-09-23).
Kein Modus ersetzt die Prüfung
Weder eine Sandbox noch ein Berechtigungsmodus prüft, ob der erzeugte Code sicher ist. Sie begrenzen nur, was der Agent während der Arbeit anrichten kann. Fehlende Zugriffskontrollen oder offene Schlüssel im generierten Code fallen erst bei einer menschlichen Durchsicht auf.Für KMU ist die Frage deshalb nicht, welches Modell sicherer ist, sondern welches besser zur eigenen Arbeitsweise passt. Wer Agenten eher als abgeschlossene Werkstatt betreiben will, findet im Sandbox-Ansatz von Codex eine klare Standardeinstellung. Wer feinere, projektbezogene Regeln braucht, etwa «Löschbefehle nie» oder «Datenbank-Migrationen nur mit Nachfrage», kann das bei Claude Code über Regeln und Hooks abbilden.
Warum wir hier keinen Sieger nennen
Ein belastbarer Vergleich zweier Agenten braucht dieselbe Aufgabe, dasselbe Projekt, dieselbe Anweisungsdatei und eine Bewertung, die vorher feststeht. Einen solchen Test haben wir für diesen Artikel nicht veröffentlicht, und wir füllen die Lücke nicht mit Eindrücken. Benchmarks der Hersteller helfen wenig, weil sie selten die Art Code abbilden, die in einem Schweizer KMU tatsächlich gewartet wird: eine gewachsene Website, ein internes Werkzeug, eine Schnittstelle zum Buchhaltungssystem.
Was wir stattdessen anbieten, ist der Ablauf, mit dem sich die Frage im eigenen Haus beantworten lässt.
So testest du beide Agenten fair
- Drei echte Aufgaben auswählen. Eine kleine Korrektur (etwa ein Validierungsfehler im Formular), eine mittlere Erweiterung (ein neues Feld mit Datenbank und Anzeige) und eine projektweite Änderung (etwa ein Wechsel der Datumsformatierung überall auf Schweizer Schreibweise).
- Gleiche Ausgangslage schaffen. Beide Agenten arbeiten auf einem eigenen Zweig desselben Stands, mit derselben AGENTS.md.
- Bewertung vorher festlegen. Laufen Typprüfung, Tests und Build durch? Wie viele Dateien wurden geändert, und waren alle nötig? Wie oft musste nachgefragt oder korrigiert werden? Würde ein Entwickler die Änderung so übernehmen?
- Die Nachbearbeitung messen, nicht die Geschwindigkeit. Ein Agent, der doppelt so schnell liefert, aber doppelt so viel Nacharbeit erzeugt, ist langsamer.
- Ergebnis dokumentieren. Eine kurze Tabelle pro Aufgabe genügt. Sie ist nach drei Monaten wertvoller als jede Erinnerung, weil sich beide Werkzeuge laufend verändern.
Der wichtigste Punkt ist der vierte. Gerade bei agentischen Werkzeugen entsteht der Aufwand selten beim Erzeugen, sondern beim Verstehen und Aufräumen. Wie sich ungeprüfte Abkürzungen über Monate zu technischer Schuld aufsummieren, beschreiben wir im Artikel Vibe Coding und technische Schulden.
Welches Werkzeug für welches Team?
Eine ehrliche Empfehlung ohne Messung kann nur entlang der Rahmenbedingungen verlaufen:
- Das Team arbeitet mit ChatGPT: Codex zuerst testen. Kein neuer Vertrag, die Sandbox-Standardeinstellung ist für den Einstieg angenehm restriktiv.
- Das Team arbeitet mit Claude: Claude Code zuerst testen. Wer projektbezogene Regeln hart durchsetzen will, profitiert von Hooks.
- Sensible Daten im Code oder in Testdaten: Unabhängig vom Werkzeug Tarif und Datenverarbeitung prüfen. Welche Zusicherungen zur Datennutzung ein Tarif macht, steht in den Bedingungen des jeweiligen Anbieters und unterscheidet sich zwischen Einzel- und Firmentarifen; das revidierte Datenschutzgesetz verlangt, dass man weiss, wohin Daten fliessen.
- Kein Entwickler im Haus: Weder Codex noch Claude Code ersetzt jemanden, der Änderungen beurteilt. Für diesen Fall sind begleitete Modelle sinnvoller.
Wer den Test nicht selbst aufsetzen möchte oder die Agenten gleich in einem Projekt einsetzen will, findet bei unserer KI-gestützten Entwicklung den begleiteten Weg: erfahrene Entwickler steuern die Agenten und prüfen jede Änderung, bevor etwas produktiv geht.
Fazit
Codex und Claude Code sind sich ähnlicher, als die Diskussion vermuten lässt. Beide bearbeiten ganze Projekte, beide lesen eine Projektbeschreibung, beide sind an ein Chat-Abo gekoppelt. Unterschiede liegen im Zugang, der bei Codex schon im Gratis-Tarif beginnt, und im Sicherheitsmodell, das bei Codex auf eine restriktive Sandbox und bei Claude Code auf abgestufte Berechtigungen mit Hooks setzt. Welcher Agent im eigenen Code die besseren Ergebnisse liefert, beantwortet kein Artikel, sondern ein Test mit drei echten Aufgaben.
Häufige Fragen
Was ist der Unterschied zwischen Codex und Claude Code?+
Beide sind agentische Coding-Werkzeuge. Codex stammt von OpenAI und ist in allen ChatGPT-Tarifen enthalten, Claude Code stammt von Anthropic und ist ab dem bezahlten Pro-Tarif enthalten. Unterschiede zeigen sich im Sicherheitsmodell: Codex arbeitet standardmässig in einer Sandbox ohne Netzwerkzugriff, Claude Code steuert Freigaben über Berechtigungsmodi und optionale Hooks (Stand: 2026-09-23).
Ist Codex kostenlos?+
OpenAI nennt Codex als Bestandteil der Tarife Free, Go, Plus, Pro, Business, Edu und Enterprise. Im Free- und Go-Tarif ist der Zugang laut OpenAI jedoch eingeschränkter als in den bezahlten Stufen. Stand: 2026-09-23.
Welcher Coding-Agent ist besser?+
Das lässt sich nicht pauschal sagen, und wir nennen keinen Sieger ohne eigene Messung. Die Qualität hängt stark vom Projekt, von der Anweisungsdatei und von der Aufgabe ab. Aussagekräftig ist nur ein Test mit denselben zwei, drei echten Aufgaben aus dem eigenen Code.
Kann ich AGENTS.md auch mit Claude Code nutzen?+
Ja. Laut Anthropic-Dokumentation kann Claude Code die AGENTS.md-Dateien eines Repositories lesen, allein oder neben einer CLAUDE.md. Das erleichtert Teams, die beide Werkzeuge testen, die Pflege einer gemeinsamen Projektbeschreibung.
Über den Autor
Daniel MüllerSenior Developer & SEO-Stratege
Daniel Müller ist Senior Developer und SEO-Stratege bei DLM Digital in Zürich. Mit über 10 Jahren Erfahrung in Webentwicklung, SEO, GEO/AEO und KI-Integration begleitet er Schweizer KMU bei der digitalen Transformation. Im DLM Magazin schreibt er über KI, Vibe Coding und moderne Suchmaschinen-Sichtbarkeit.


