Zum Hauptinhalt springen

Agentic Coding: Warum es sich schneller anfühlt und trotzdem mehr Kraft kostet

Agentic Coding soll produktiver machen. Studien zeigen: Entwickler werden gemessen langsamer, fühlen sich aber schneller, und die Erschöpfung ist real. Ein Blick in die Forschung, plus eine eigene Anekdote.

Tobe
BlogVeröffentlich am 13.09.26, Tobias Lorsbach

Ich habe kürzlich eine PHP-5-Anwendung auf PHP 8.4 migriert, mit einem Coding-Agenten. Klingt nach der Art Aufgabe, für die genau solche Tools gebaut wurden: viel Fleißarbeit, klare Regeln, wenig Kreativität nötig. In der Praxis habe ich jede einzelne Zeile mitgelesen, den Stream live verfolgt, und musste ständig eingreifen, korrigieren, den Agenten wieder auf Kurs bringen. Am Ende war ich näher an totaler Erschöpfung als bei jedem klassischen Refactoring der letzten Jahre. Inklusive Schlafstörungen.

Ich habe kurz gedacht, das liegt an mir. Dann habe ich nachgeschaut, ob es dafür Forschung gibt. Es gibt sie. Und sie ist eindeutiger, als ich erwartet habe.

Die Zahl, die jeder zitiert, und die man leicht falsch versteht

Die meistzitierte Studie dazu kommt von METR, einer Non-Profit-Forschungsorganisation. 16 erfahrene Open-Source-Entwickler, 246 echte Aufgaben in Repos mit im Schnitt über einer Million Zeilen Code. Die Hälfte der Aufgaben durfte mit KI-Tools erledigt werden, die andere Hälfte nicht.

Ergebnis: Mit KI-Unterstützung waren die Entwickler 19 % langsamer. Gleichzeitig waren sie überzeugt, 20 % schneller gewesen zu sein. Eine Lücke von 39 Prozentpunkten zwischen gefühlter und tatsächlicher Leistung, bei Leuten, die ihr eigenes Handwerk seit Jahren kennen.

Das ist keine Aussage über schlechte KI-Modelle. Das ist eine Aussage darüber, wie schlecht wir darin sind, unsere eigene kognitive Belastung einzuschätzen, während wir sie erleben.

Wichtig zur Einordnung: Diese Studie ist von Juli 2025, gemessen mit den Modellen und Tools von Anfang 2025. Anderthalb Jahre sind in diesem Tempo eine halbe Ewigkeit. METR selbst hat 2026 versucht, die Studie mit aktuellen Modellen und breiterer Agentic-Tool-Nutzung (u. a. Claude Code) zu wiederholen, musste aber einräumen, dass die neuen Daten unbrauchbar sind: zu viele Entwickler weigerten sich inzwischen, überhaupt ohne KI zu arbeiten, was die Kontrollgruppe verzerrt. Aus Gesprächen mit den Teilnehmern vermutet METR, dass aktuelle Tools tatsächlich einen echten Speedup liefern, kann das aber nicht mehr sauber belegen. Mit anderen Worten: Die 19 % sind der beste verfügbare Messwert, nicht der aktuellste Stand der Technik, und genau das Abhängigkeitsmuster, das eine saubere Nachmessung verhindert, ist selbst schon ein Beleg für den Rest dieses Artikels.

Warum Zusehen anstrengender ist als Machen

Eine aktuellere Studie erklärt, warum das so ist. “When Help Hurts: Verification Load and Fatigue with AI Coding Assistants”, vorgestellt auf der CHI 2026, ließ 60 Entwickler Aufgaben mit und ohne KI lösen. Die KI-Unterstützung senkte die gefühlte Arbeitslast messbar und sparte 22 % Zeit. Trotzdem stiegen Stress und Erschöpfung über die Sitzung hinweg, getrieben von etwas, das die Autoren “Verification Load” nennen.

Der Mechanismus dahinter, gut zusammengefasst von Braingrid: Wenn du selbst Code schreibst, hältst du Absicht und Umsetzung gleichzeitig im Kopf, das Prüfen läuft nebenbei mit, fast kostenlos. Wenn du fremden, KI-generierten Code prüfst, musst du die Absicht erst rekonstruieren, dann eine Umsetzung nachvollziehen, die ein statistisches Modell getroffen hat, das du nicht kennst. Das sind zwei Jobs gleichzeitig, nicht einer. Genau das, was ich beim Stream-Mitlesen gemacht habe.

Der Grund, warum “einfach weniger genau hinschauen” nicht funktioniert

Die Human-Factors-Forschung kennt dieses Problem schon länger, nur aus anderen Bereichen: Flugsicherung, automatisiertes Fahren, Qualitätskontrolle. Sobald ein Mensch von aktivem Handeln zu reiner Überwachung einer Automatisierung wechselt, sinkt die Aufmerksamkeit über die Zeit messbar, das sogenannte Vigilance Decrement.

Das Perfide daran: Je zuverlässiger die Automatisierung meistens ist, desto schwerer fällt es, für den seltenen Fehler wachsam zu bleiben. Verlässliche Leistung senkt paradoxerweise die Wachsamkeit. Bei einem Coding-Agenten, der neun von zehn Zeilen richtig macht, ist genau das die Falle: Du kannst dir das Wegschauen nicht leisten, aber dein Gehirn will es trotzdem.

Die “4x”-Zahl, eingeordnet

Ich habe die Behauptung gehört, Agentic Coding sei viermal so anstrengend wie klassisches Programmieren. Eine einzelne Studie mit genau dieser Zahl habe ich nicht gefunden. Was ich gefunden habe, sind mehrere unabhängige Messungen, die sich in dieser Größenordnung treffen:

  • LinearB hat 8,1 Millionen Pull Requests ausgewertet: KI-unterstützte PRs warten 4,6-mal so lange auf einen Reviewer, PRs von eigenständigen Coding-Agenten sogar 5,3-mal so lange.
  • Faros AI misst bei hoher KI-Adoption 51 % größere PRs, 59,7 % mehr bearbeitete Dateien pro PR, und, das ist der beunruhigende Teil, 31 % mehr PRs, die komplett ohne Review gemergt werden. Überforderung führt nicht zu mehr Sorgfalt, sondern dazu, dass Review einfach ausfällt.
  • Eine Sonar-Umfrage fand: 96 % der Entwickler misstrauen KI-generiertem Code, 48 % committen ihn trotzdem ungeprüft. Das ist keine Nachlässigkeit, das ist Entscheidungsermüdung unter Last.

“4x” ist wahrscheinlich eine plausible Verdichtung solcher Zahlen, keine einzelne saubere Messung. Aber die Richtung stimmt, aus mehreren unabhängigen Quellen.

Schlaf, Wochenenden, Kündigungsgedanken

LeadDev hat Entwickler-Anekdoten gesammelt, die sich lesen wie eine kollektive Bestätigung meiner eigenen Nacht: Steve Yegge beschreibt plötzliches Einschlafen nach langen Agentic-Coding-Sessions und nennt das Ganze “genuinely addictive”. Ein Senior Engineer bei Paramount arbeitet inzwischen regelmäßig durch Nächte und Wochenenden, weil er nicht aufhören kann, wenn gerade etwas vorangeht.

Das sind keine Einzelfälle. ActivTrak hat die Arbeitsdaten von 163.638 Beschäftigten zwischen 2023 und 2025 ausgewertet: Seit KI-Einführung stiegen die produktiven Samstagsstunden um 46 %, die Sonntagsstunden um 58 %. Eine BCG-Studie mit knapp 1.500 Beschäftigten fand bei Betroffenen von sogenanntem “AI brain fry” 33 % mehr Entscheidungsermüdung, 39 % mehr schwerwiegende Fehler, und eine um 34 % höhere Bereitschaft, den Job zu wechseln.

Die gute Nachricht: Es ist nicht überall gleich schlimm

Zwei Befunde relativieren das Bild, und die gehören fairerweise dazu. Der DORA-Report 2025, die größte jährliche Erhebung zur Softwareentwicklung, fand: Burnout blieb durch KI-Adoption insgesamt weitgehend unverändert. Und die CHI-Studie von oben zeigt, dass einfache Aufgaben mit Inline-Vorschlägen tatsächlich weniger Last erzeugen als ganz ohne KI.

Die Erschöpfung konzentriert sich auf komplexe, riskante Aufgaben mit hohem Verifikationsbedarf. Legacy-Migrationen gehören laut mehreren dokumentierten Fällen genau in diese Kategorie: Eine 12-Wochen-Modernisierung einer 10-Millionen-Zeilen-Java-Anwendung ohne ausreichenden Kontext für den Agenten endete mit mehr technischen Schulden statt weniger. In einem anderen Fall verschwanden während einer KI-gestützten Migration schlicht 17 REST-Endpunkte, unbemerkt, bis jemand sie vermisste. Meine PHP-Migration war also nicht der falsche Anwendungsfall für Agentic Coding, sie war der dokumentierte Worst Case dafür.

Was das praktisch bedeutet

Ein paar Konsequenzen, die sich aus der Forschung ziehen lassen, nicht nur aus meinem Bauchgefühl:

Migrationen in Etappen mit echten Checkpoints, nicht in einem Rutsch. Modul für Modul, mit einem bewussten Stopp nach jedem Schritt, statt eine Stunde am Stück den Stream zu überwachen. Vigilanz lässt nach etwa 20 bis 30 Minuten spürbar nach, ganz unabhängig vom Werkzeug.

Pausen aktiv einplanen, nicht dem Zufall überlassen. Manuelles Programmieren hatte eingebaute Erholung: Tippen, auf den Compiler warten, kurz nachdenken. Agenten liefern im Sekundentakt, dieser Rhythmus fällt weg, wenn man ihn nicht bewusst ersetzt.

Nicht mehr als ein bis zwei Agenten parallel laufen lassen, wenn die Aufgabe echte Aufmerksamkeit braucht. Die BCG-Daten zeigen den Sprung in Fehlerquote und Ermüdung genau ab diesem Punkt.

Bei einfachen, klar umrissenen Aufgaben ruhig vertrauen. Genau da zeigt die Forschung tatsächlich weniger Last, nicht mehr. Das schlechte Gewissen gehört in die komplexen Fälle, nicht überallhin.

Fazit

Agentic Coding macht dich nicht automatisch produktiver. Es verschiebt Arbeit von “Tippen” zu “Prüfen”, und Prüfen ist für unser Gehirn die anstrengendere Aufgabe von beiden, besonders wenn viel auf dem Spiel steht. Das ist kein Grund, das Werkzeug wegzulegen. Es ist ein Grund, ehrlicher darüber zu reden, was es kostet, und wann sich der Preis lohnt.

Wie war deine letzte Nacht nach einer langen Agentic-Coding-Session? Ehrlich sein.

Falls du gerade selbst vor einer größeren Legacy-Migration stehst und nicht allein durch jede Zeile Stream scrollen willst, melde dich einfach bei mir.

Ich bin Tobias und arbeite seit über zwei Dekaden leidenschaftlich als Webdeveloper, aktuell mit einem sehr wachen Blick auf das, was Agentic Coding wirklich kostet.


  • METR: Randomisierte Studie, 16 erfahrene Open-Source-Entwickler, 246 Aufgaben, 19 % langsamer mit KI-Tools bei gefühlten 20 % schneller · metr.org
  • METR-Update 2026: Versuchte Nachmessung mit aktuellen Modellen, gescheitert an Selektionsverzerrung, weil Entwickler sich weigerten, ohne KI zu arbeiten · metr.org
  • “When Help Hurts” (CHI 2026): N=60, KI senkt gefühlte Last (−18,2 TLX-Punkte) und Zeit (−22 %), verschiebt Aufwand aber messbar in die Verifikation · dl.acm.org
  • LinearB Software Engineering Benchmarks: 8,1 Mio. Pull Requests, KI-PRs warten 4,6× länger auf Review, Agenten-PRs 5,3× länger · zusammengefasst bei sph.sh
  • LeadDev: Entwickler-Interviews zu Schlafverlust und Suchtmuster bei Agentic Coding, plus ActivTrak-Auswertung von 163.638 Beschäftigten (2023–2025) · leaddev.com
  • BCG “AI brain fry”-Studie: ~1.500 Befragte, Zahlen zu Entscheidungsermüdung, Fehlerquote und Kündigungsabsicht bei intensiver KI-Nutzung · zusammengefasst bei Built In
  • DORA State of AI-assisted Software Development 2025: Burnout insgesamt unverändert, Vertrauen in KI-Code und Review-Aufwand im Detail · dora.dev
  • Stack Overflow Developer Survey 2025: 49.009 Antworten, Vertrauen in KI-Genauigkeit von 40 % auf 29 % gefallen · survey.stackoverflow.co
Vibe-Coding 2 Enterprise

Dein Prototyp funktioniert. Ist er auch startklar?

Security, Datenschutz, Barrierefreiheit, Testing, Infrastruktur, das denkt beim Prompten kaum jemand mit. Ich mach deinen KI-gebauten Prototyp bereit für echte Nutzer.

Kommentare

Kommentar schreiben

0 / 5000 Zeichen

* Pflichtfelder

Noch keine Kommentare. Sei der Erste!