Prime Radiant – smevals

Bibliografische Angaben

Simon Willison, Prime Radiant, 31. Juli 2026.

Original: smevals – a Small Eval Suite for Evaluating Models, Prompts, and Harnesses

Aussagen der Quelle

  • Evals sollten eine konkrete Frage beantworten und in einzelne Tasks, vergleichbare Konfigurationen, protokollierte Runs und explizite Grades zerlegt werden.
  • Eine Konfiguration kann neben dem Modell auch System Prompt, Modellparameter und Harness variieren. Damit lässt sich deren Wirkung statt nur die Modellwirkung untersuchen.
  • Grading kann deterministische Checks und modellbasierte Beurteilungen kombinieren; erforderliche Checks und Schwellenwerte machen Erfolg explizit.
  • Läufe und Artefakte werden gespeichert, sodass verbesserte Grader auf vorhandene Ergebnisse erneut angewendet werden können.
  • Die Dokumentation ist auch für Coding Agents geschrieben, die initiale Eval-Suites erzeugen können.

Relevanz für den Garden

Die Quelle operationalisiert Harness Engineering als experimentelle Fähigkeit: Teams formulieren Aufgabenklassen, Erfolgskriterien, Vergleichskonfigurationen und reproduzierbare Auswertungen. Das ermöglicht eine auf den eigenen Kontext bezogene Auswahl günstiger Modelle und Harness-Varianten.

Grenzen

Der Beitrag dokumentiert ein junges Werkzeug anhand kleiner Beispiele. Ein Eval misst nur die modellierten Aufgaben und Orakel; modellbasierte Grader können eigene Fehler und Verzerrungen einbringen. Nachweise für organisationsweite Lieferwirkung liefert die Quelle nicht.