METR – Update zur Messung von Entwicklerproduktivität mit AI
Bibliografische Angaben
Joel Becker, Nate Rush, Tom Cunningham, David Rein und Khalid Mahamud, METR, 24. Februar 2026.
Original: We Are Changing Our Developer Productivity Experiment Design
Aussagen der Quelle
- Eine frühere randomisierte Studie mit Werkzeugen von Anfang 2025 fand bei erfahrenen Maintainers im Mittel eine Verlangsamung um 19 Prozent.
- Eine spätere Untersuchung mit 57 Entwicklern, 143 Repositories und mehr als 800 Tasks zeigte Rohdaten in Richtung Beschleunigung, wurde von METR aber wegen starker Selektions- und Messprobleme nicht als verlässliche Schätzung bewertet.
- Erfahrene Nutzer wollten bestimmte Aufgaben nicht mehr ohne AI bearbeiten und wählten für Experimente andere Tasks aus.
- Parallele Agentenarbeit macht reine Bearbeitungszeit schwer messbar; außerdem können sich Aufgabentyp und Qualität zwischen Bedingungen unterscheiden.
- METR folgert, dass Produktivitätsmessung mit steigender Fähigkeit und veränderter Arbeitsweise neue Versuchsdesigns benötigt.
Relevanz für den Garden
Die Quelle warnt sowohl vor dauerhaften Schlussfolgerungen aus frühen negativen Befunden als auch vor unkritischen Selbstauskünften über große Beschleunigung. Sie erweitert Messung um Task Substitution, Parallelität und Wertunterschiede.
Grenzen
Die Population besteht aus Open-Source-Entwicklern auf eigenen Repositories und repräsentiert keine vollständige Produktorganisation. Die neueren Rohdaten sind laut Autoren gerade nicht belastbar genug für eine kausale Effektschätzung.