KI · Juli 16, 2026 · 5 Min.

Vier AI-Coding-Agenten im Praxistest: Cursor, Codex, GLM und Grok Build

Cursor Composer 2.5, Codex mit GPT-5.5, GLM 5.2 und Grok Build bekamen dieselbe Laravel-Aufgabe. Das sind meine Ergebnisse aus dem Praxistest.

Falls du lieber liest als ein 22-minütiges Video schaust: Hier ist meine Working Session als Zusammenfassung.

Ich habe vier AI-Coding-Agenten auf dieselbe reale Aufgabe angesetzt. Sie sollten die neue Meeting-Metrics-Homepage aus bestehenden HTML-Prototypen in unsere Laravel-Blade-App übertragen. Der Test fand in einer grossen Codebase mit echten Designvorgaben, mehreren Seiten und einigen Stolperfallen statt.

Die Aufgabe: vom HTML-Prototyp zur Laravel-App

Die neue Homepage lag bereits als HTML vor. Sie enthielt unter anderem einen Rechner für die eingesparte Meeting-Zeit, Funktionsübersichten, Use Cases, Informationen zur Schweizer Datenhoheit, Preise und ein FAQ. Diese Seiten sollten technisch sauber in die bestehende Laravel-Anwendung integriert werden, ohne dass das Design dabei verloren geht.

Der Arbeitsauftrag war bewusst konkret: Prototypen und Codebase prüfen, den Archivordner ignorieren, in einem eigenen Git-Worktree arbeiten, bei Bedarf Subagenten einsetzen und das Resultat anschliessend im Browser auf mehreren Breakpoints mit dem HTML vergleichen. Den ausführlichen Prompt liess ich zunächst von Codex aus dem vorhandenen Projektkontext erstellen.

Vier Agenten, vier Worktrees

Ich startete vier parallele Varianten auf derselben Basis:

  • Cursor Composer 2.5
  • Codex mit GPT-5.5
  • GLM 5.2
  • Grok Build

Jeder Agent arbeitete in einem eigenen Worktree. Dadurch konnte ich dieselbe Aufgabe mehrfach ausführen lassen, ohne dass sich die Änderungen gegenseitig beeinflussten. Danach liessen sich die Varianten direkt im Browser und später auch im Code vergleichen.

So haben die vier Varianten abgeschnitten

Cursor Composer war am schnellsten

Composer lieferte nach ungefähr fünf Minuten eine erste Version, die visuell sehr nah am HTML-Prototyp lag. Kleinere Dinge fehlten noch, etwa die Support-Bubble und Teile der Navigation. Die Follow-ups wurden schnell umgesetzt. Rein nach Geschwindigkeit und erstem visuellen Eindruck war Composer in dieser Session vorne.

Codex brauchte eine deutlichere Korrektur

Die erste Codex-Version sah zwar nach einer fertigen Website aus, traf die Vorlage aber nicht: Schriften und Buttons stimmten nicht, Abschnitte fehlten und der Rechner war nicht vorhanden. Dabei stellte sich heraus, dass Version 5 des HTML-Prototyps die richtige Referenz war und nicht Version 6.

Nach einem klaren Follow-up mit der korrekten Datei und der Anweisung, HTML und Laravel-Seite mit Browser und Subagenten zu vergleichen, kam Codex deutlich näher an das gewünschte Resultat. Der erste Lauf war schwach, der zweite wesentlich brauchbarer.

GLM 5.2 war die Überraschung

Von GLM erwartete ich weniger, das Resultat war aber erstaunlich nah an der Vorlage. Animationen und viele Bereiche waren bereits vorhanden. Es gab trotzdem Fehler: Der Titel fehlte, einige Abschnitte blieben weiss und einzelne Buttons waren nicht korrekt. Für einen ersten Lauf war das solide und in Teilen besser als die erste Codex-Version.

Grok Build hatte die grössten Probleme

Grok Build setzte die Aufgabe in diesem Test am wenigsten zuverlässig um. Styling und Funktionalität passten zunächst nicht, und auch nach Follow-ups war mehr Korrektur nötig als bei den anderen Varianten. Der Vergleich bezieht sich auf diese konkrete Laravel-Aufgabe.

Was ich aus dem Test mitnehme

Die Token-Geschwindigkeit allein sagte wenig über die Qualität aus. Relevant war, ob der Agent die richtige Referenzdatei nutzte, die bestehende App verstand und sein Ergebnis tatsächlich im Browser überprüfte.

Die Worktrees waren dafür besonders praktisch. Ich konnte mehrere Ansätze parallel laufen lassen, Screenshots und Verhalten vergleichen und später die beste Codebasis auswählen. Ein gutes Bild im Browser reicht allerdings noch nicht. Vor der Entscheidung muss ich prüfen, ob wirklich Laravel-Komponenten entstanden sind oder ob ein Agent lediglich grosse HTML-Blöcke in eine Datei kopiert hat.

Mein Zwischenstand aus dieser Session: Cursor Composer lieferte das stärkste Verhältnis aus Geschwindigkeit und visueller Nähe. GLM 5.2 hat mich positiv überrascht. Codex konnte nach klarer Korrektur aufholen, während Grok Build in diesem Lauf zurücklag. Die endgültige Wahl fällt erst nach dem Code-Review.

Mehr über Meeting Metrics

Bajram

Emini Arts Team

Teilen Twitter LinkedIn