Prime Radiant – smevals
Bibliografische Angaben
Simon Willison, Prime Radiant, 31. Juli 2026.
Original: smevals – a Small Eval Suite for Evaluating Models, Prompts, and Harnesses
Aussagen der Quelle
- Evals sollten eine konkrete Frage beantworten und in einzelne Tasks, vergleichbare Konfigurationen, protokollierte Runs und explizite Grades zerlegt werden.
- Eine Konfiguration kann neben dem Modell auch System Prompt, Modellparameter und Harness variieren. Damit lässt sich deren Wirkung statt nur die Modellwirkung untersuchen.
- Grading kann deterministische Checks und modellbasierte Beurteilungen kombinieren; erforderliche Checks und Schwellenwerte machen Erfolg explizit.
- Läufe und Artefakte werden gespeichert, sodass verbesserte Grader auf vorhandene Ergebnisse erneut angewendet werden können.
- Die Dokumentation ist auch für Coding Agents geschrieben, die initiale Eval-Suites erzeugen können.
Relevanz für den Garden
Die Quelle operationalisiert Harness Engineering als experimentelle Fähigkeit: Teams formulieren Aufgabenklassen, Erfolgskriterien, Vergleichskonfigurationen und reproduzierbare Auswertungen. Das ermöglicht eine auf den eigenen Kontext bezogene Auswahl günstiger Modelle und Harness-Varianten.
Grenzen
Der Beitrag dokumentiert ein junges Werkzeug anhand kleiner Beispiele. Ein Eval misst nur die modellierten Aufgaben und Orakel; modellbasierte Grader können eigene Fehler und Verzerrungen einbringen. Nachweise für organisationsweite Lieferwirkung liefert die Quelle nicht.