Agentic Development: Von der Assistenz zur Autonomie
Der Motor ist nicht Ihr Wettbewerbsvorteil
Fünf Wörter aus einer Reifenwerbung sagen, worum es hier geht. Der Motor war nie das Problem. Entscheidend war immer, was davon auf der Strasse ankommt. Bei der Softwareentwicklung mit KI ist der Motor heute für alle gleich. Ihr Mitbewerber nutzt dasselbe Modell wie Sie, zum selben Preis, ab morgen früh. Der Unterschied entsteht erst danach — in dem, was um das Modell herum gebaut ist. Wer dabei am Steuer sitzt, bleibt unverändert: Sie fahren. Wir liefern den Grip — das Gerüst, das aus Motorleistung eine Strecke macht, die Sie auch bei Tempo halten können.«Power is nothing without control.»
Werbeclaim von Pirelli, seit 1994
Was Agentic Development konkret heisst
Stufe 1 · Context Engineering
Was der Agent weiss und was im Kontextfenster landet.
Stufe 2 · Harness Engineering
Was Agenten führt und prüft, bevor ein Mensch den Code sieht.
Stufe 3 · Spec-based Development
Was vorher entschieden ist und wie Abweichungen sichtbar werden.
Stufe 4 · Der agentische Ablauf
Wie der Ablauf funktioniert und wer die Feder hält.
Stufe 5 · Multi-Agent Development
Wie viele Agenten gleichzeitig arbeiten und wo die Grenzen liegen.
Wer macht was
Der Agent arbeitet
Jeder Schritt bleibt einzeln nachweisbar
Der Mensch entscheidet
Beides zusammengehalten vom Harness
Das Harness sichert ab
So können mehrere Entwickler gleichzeitig mehrere Agenten führen, ohne sich in die Quere zu kommen — nicht weil alle gut aufpassen, sondern weil das Harness es ausschliesst.
Was der Agent weiss
Die Forschung stützt das: Chroma hat gemessen, dass die Leistung mit wachsender Eingabe fällt — unabhängig von der nominellen Fenstergrösse. Ein grosses Kontextfenster ist ein Budget, keine Kapazität.Woran Sie merken, dass sie fehlt: Agenten, die in der zehnminütigen Demo überzeugen und über eine lange Sitzung verfallen. Der Fehler wird dem Modell zugeschrieben; tatsächlich ist das Aufmerksamkeitsbudget erschöpft und das Fenster voll veralteter Details.Bei uns entsteht daraus etwas Sichtbares: die Skills. Was ein Agent über ein Repository wissen muss — Konventionen, Ablagen, wie hier gebaut wird — steht als wiederverwendbare Arbeitsanweisung da, statt in jedem Auftrag neu erraten zu werden. Sie liegen offen auf GitHub.«Context engineering is the natural successor to prompt engineering: the question is no longer which words to use but which configuration of context most reliably produces the behaviour you want.»
Anthropic, «Effective context engineering for AI agents», September 2025
Was der Agent weiss, hilft nur, wenn es zum richtigen Zeitpunkt greift. Das ist die nächste Stufe.
Was Agenten führt und prüft
Böckeler ordnet die Kontrollen zusätzlich nach Art und Zeitpunkt: Berechenbare Kontrollen sind schnell und eindeutig — Typprüfung, Linter, strukturelle Tests. Urteilende Kontrollen tragen semantisches Urteil — Konventionen, Skills, Review-Agenten. Verteilt werden sie nach Kosten: billige vor dem Commit, teure nach der Integration, Drift-Sensoren fortlaufend daneben.Woran Sie merken, dass es fehlt: Sie sind der Sensor. Jeder Fehler kommt über ein menschliches Review zurück, derselbe nächste Woche wieder, und die Korrektur steht in einer Chatnachricht, die niemand versionieren kann.Bei uns greifen Guides an definierten Punkten automatisch. Die Sensors bilden eine Kette: Linting, Kompilieren, Unit, Mock, Integration, UI. Vieles davon ist generisch und wiederverwendbar (wie ESLint oder Prettier) und hängt nicht vom fachlichen Kontext ab. Die Reihenfolge ist die Regel: Was eine Maschine eindeutig entscheiden kann, entscheidet eine Maschine. KI kommt erst dort zum Zug, wo ein Urteil nötig ist.«Feedback alone gives you an agent that repeats its mistakes; feedforward alone gives you one that encodes rules and never learns whether they held.»
Birgitta Böckeler, Thoughtworks, «Harness Engineering for Coding Agent Users», April 2026
Prüfen kann nur, was vorher jemand als Erwartung formuliert hat. Das ist die nächste Stufe.
Was vorher entschieden ist
Ein freigegebener Plan ist die Bedingung dafür, dass eine Schleife überhaupt eine Abbruchbedingung hat.
Wie der Ablauf funktioniert
Discovery
human-ledEine freigegebene Story: dieses Problem wird gelöst, an dieser Stelle im System
Der Mensch schreibt, Agenten beraten
Design
human-ledFreigegebene Pläne, geschnitten in Pakete, die wirklich parallel laufen
Der Mensch entscheidet, der Agent formuliert
Development
agent-ledUmsetzung in getrennten Arbeitsbereichen
Der Agent baut, der Mensch führt zusammen
Testing
agent-ledEine geprüfte Freigabe
Der Agent schreibt das Skript, das Team arbeitet es ab
Das Endgame
So nennen wir den Teil, in dem wir unser eigenes Ergebnis spielen — nicht um zu bestätigen, dass der Hauptweg funktioniert, sondern um zu finden, was rechts und links davon schiefgeht. Automatisierte Tests decken, was vorher als Erwartung formuliert war. Was dahinter liegt, schreibt der Agent als Skript; das Team arbeitet es ab, dort wo nur ein Mensch urteilen kann: Brauchbarkeit, Bedienbarkeit, was im Ablauf fehlt. Fokussierte Arbeit am richtigen Ort, statt Suchen im Ganzen.Diese vier Stufen tragen einen Agenten. Die fünfte fragt, was passiert, wenn es mehrere sind.
Wie viele gleichzeitig
Anthropic misst damit bessere Ergebnisse als mit einem einzelnen Agenten — und einen erheblich höheren Token-Verbrauch. Cognition widerspricht, und zwar ausdrücklich für das Programmieren:«An orchestrator plans, spins up three to five subagents with fresh context windows, then synthesises with a separate citation pass. Workers never talk to each other.»
Anthropic, «How we built our multi-agent research system», Juni 2025
«Parallel agents make independent decisions on a shared problem, and independent decisions produce conflicting output.»
Cognition, «Don't build multi-agents», Juni 2025
Das Drei-Stufen-Modell
Arbeitsweise
Klassisches Coden: Entwickler schreibt jede Zeile Code selbst
Assistiertes Coden (Copilot): KI schlägt Code-Schnipsel oder Zeilen vor
Agentic Development: KI übernimmt komplexe Tasks und ganze Features eigenständig
Autonomie
Klassisches Coden: Keine (vollständig manuell)
Assistiertes Coden (Copilot): Gering (reagiert auf direkten Kontext)
Agentic Development: Hoch (plant, führt aus und korrigiert sich selbst)
Kontext
Klassisches Coden: Im Kopf des Entwicklers
Assistiertes Coden (Copilot): Lokale Datei und offene Tabs
Agentic Development: Spezifiziert: Repo-Konventionen, Architektur, Skills
Verifikation
Klassisches Coden: Manuelles Testen und Review
Assistiertes Coden (Copilot): Entwickler prüft jeden Vorschlag sofort
Agentic Development: Automatisierte Tests, Typen, CI und Review-Gates
Rolle des Menschen
Klassisches Coden: Handwerker (schreibt Code)
Assistiertes Coden (Copilot): Pilot (steuert und korrigiert)
Agentic Development: Architekt und Reviewer (plant und prüft)
Zeitgewinn
Klassisches Coden: Keiner
Assistiertes Coden (Copilot): Schnelleres Tippen von Routine-Code
Agentic Development: Fokus auf Systemdesign, Sicherheit und Nutzerwert
Wirkliche Beschleunigung entsteht nicht durch schnelleres Tippen, sondern durch Autonomie. Ein Team, das Agenten führt und prüft, produziert verlässliche Software in einem Bruchteil der Zeit.
Keine Überraschungen
Der Agent baut das System. Er ist nicht Teil davon.
Wir lassen keine Agenten unkontrolliert überwachen und steuern. Wir nutzen sie, um die Systeme zu bauen und zu betreiben, die genau das tun — Automatisierung, Pipelines, Metriken, Dashboards, Release-Engineering. Was danach in Produktion läuft, ist deterministisch: gleiche Eingabe, gleiches Ergebnis. Der Agent hat es gebaut, er entscheidet nicht darin mit.
Weniger Code, nicht mehr
Jede Zeile Code hat Fehler. Ein Agent schreibt zehnmal so schnell — das ist nur dann ein Gewinn, wenn am Ende nicht zehnmal so viel Code steht. Wir messen nicht, wie viel entstanden ist, sondern wie wenig nötig war.
Schneller heisst mehr Sicherheitsnetz, nicht weniger
Wenn Änderungen schneller landen, braucht es mehr Metriken, mehr Monitoring, schnellere Review- und Deploy-Prozesse — um mitzuhalten und um Fehler schnell zu korrigieren. Das agentische Setup selbst ist eine Investition, damit es vorhersagbare Ergebnisse liefert. Es reicht nicht, dasselbe schneller zu tun; es muss besser werden.
Wo das Gerüst an seine Grenze kommt
Ein Ticket aus unserem eigenen Plattform-Projekt: rund 600 Zeilen über drei Schichten, saubere Tests, grüner Build, ordentlich dokumentiert. Jede Prüfung war grün — und das Ergebnis wollte trotzdem niemand haben. Kein Sensor der Welt beantwortet die Frage, ob das Gebaute das Gemeinte ist.
Deshalb verschiebt sich die Arbeit nach vorn. Bei uns heisst das konkret: rund vier Stunden am Tag mit Markdown statt mit Code. Ist der Plan präzise genug, überrascht der Pull Request nicht mehr — und der Aufwand für die Prüfung fällt in sich zusammen.
Was sich im Handwerk ändert, wenn Agenten mitarbeiten
Wir bauen den Prototyp statt des Entwurfs
Früher entstand die Idee in Figma oder Miro und wurde danach nachgebaut. Heute ist der interaktive Prototyp schneller fertig als das Bild davon — und man kann ihn benutzen, statt ihn sich vorzustellen. Diskussionen über Zwischenstände werden dadurch kürzer und ehrlicher.
Wir jagen keine 100 % Testabdeckung
Ein Agent schreibt Tests fast gratis, und genau das ist die Falle: Wer alles testet, testet nichts richtig — man bekommt Prüfungen, die nur noch Aufwand binden. Das Definition of Done sagt, was geprüft gehört. Und wo ein Agent urteilt statt rechnet, misst eine Zeilenabdeckung ohnehin die falsche Sache; dort prüfen Evals, ob das Urteil taugt.
Wir führen Agenten, statt Aufgaben abzuarbeiten
Die Arbeit verschiebt sich vom Schreiben zum Schneiden, Prüfen und Entscheiden. Das ist anspruchsvoller, nicht bequemer — und es ist der Grund, warum Erfahrung wichtiger wird statt unwichtiger.
Wann der Agent führt — und wann der Mensch
Agent-led — der Agent führt
- Gleichartige Änderungen über viele Dateien
- Testabdeckung dort nachziehen, wo sie fehlt
- Eine Migration Schritt für Schritt
- Eine fremde Codebasis erkunden
- Einen Prototyp bauen, um eine Frage zu klären
Human-led — der Mensch führt
- Wenn die Anforderung noch unklar ist
- Wenn eine Architekturentscheidung Erfahrung braucht
- Wenn ein Fehler teuer wäre
- Wenn zu entscheiden ist, was «fertig» heisst
- Und das soll auch so bleiben
Zwei Bundesportale auf einer Plattform — und unser eigenes Werkzeug
Naturgefahren.ch
Das Naturgefahrenportal führt Gefahrendaten aus mehreren Quellen zusammen und erzeugt daraus Warnungen fürs Web — barrierefrei, nach WCAG 2.1 AA zertifiziert.
Seit Projektstart entsteht jede Änderung über den agentischen Ablauf.
Bei einer Unwetterlage greifen alle gleichzeitig zu — deshalb ist das Qualitätstor davor nicht verhandelbar.
naturgefahren.ch öffnenMeteoSchweiz
137 Wetterprodukte, ein eigenes Karten-Framework — für das Bundesamt für Meteorologie und Klimatologie.
Ebenfalls seit Januar 2026: keine Änderung mehr ausserhalb des agentischen Ablaufs.
Die automatisierten Qualitätstore dieser Anwendung sind kein Nebenprodukt — sie sind das Gerüst, das genau das zulässt.
Was wir für MeteoSchweiz gebaut habenOfferten-Generator
Unser eigenes Produkt, in zwei Stufen: Mit dem Prototyp pitchen wir beim Kunden — fünf Varianten laufen öffentlich. Wird daraus ein Auftrag, entsteht daraus die produktive Anwendung auf der CDS-Plattform, mit Zugangskontrolle und weiteren Generatoren.
Beide Stufen entstehen über den agentischen Ablauf — der erste Prototyp lief im März 2026, an einem einzigen Vormittag.
Der Prototyp aus dem Pitch ist die Grundlage der produktiven Anwendung — nicht ein Wegwerfstück daneben. Hier haben wir angefangen, an uns selbst, bevor wir es Kunden empfohlen haben.
Zum Offerten-Generator
Wer in einem solchen Projekt eigentlich schreibt
Fast die Hälfte der Beiträge kommt nicht aus der Entwicklung
Vertrieb, Finanzen und die Produktverantwortung schreiben mit — nicht als Reviewer am Rand, sondern als Autoren im Log. Wer Anforderungen kennt, kann sie einbringen, ohne sie zu übersetzen.
Die Freigaben stehen namentlich im Log
Wo ein Mensch entschieden hat, steht ein Eintrag mit seinem Namen: Plan freigegeben, Zusammenführung freigegeben. Diese Einträge tragen keine Agenten-Signatur — sie sind die Stellen, an denen jemand die Verantwortung übernommen hat.
Ein Agent ist Teammitglied mit eigenem Konto
In unserem eigenen Firmen-Repository arbeitet Qubert unter eigener Adresse mit — unser erster autonom mitarbeitender Agent. Man sieht in der Historie, wer was geschrieben hat, weil er nicht unter fremdem Namen committet.
Das ist der Punkt: Nicht dass Agenten schneller tippen, sondern dass ein Team breiter wird. Wer die Fachlichkeit kennt, kommt näher an das Ergebnis heran.
Welche Stufe fehlt Ihnen?
Fünf Stufen, und jede trägt schon für sich. Die darunter fehlt selten aus Absicht — meist hat sie nur nie jemand benannt.
Lieber persönlich?
Max — Rufen Sie an oder schreiben Sie eine E-Mail — was Ihnen lieber ist.