// HEISE ONLINE — INTELLIGENZA ARTIFICIALE
GitHub ReviewBench: Benchmark für KI-gestützte Code-Reviews
Mit ReviewBench will GitHub Code-Reviews durch KI fair vergleichbar machen. Auf Platz eins landet ausgerechnet Copilot, ein unabhängiger Test sieht das anders.
Am 5. Oktober hat GitHub ReviewBench vorgestellt, einen Benchmark, der die Qualität KI-gestützter Code-Reviews beurteilt. Das soll Entwicklerinnen und Entwicklern dabei helfen, verschiedene KI-Reviewer fair zu vergleichen und deren Nutzen in der Praxis besser vorhersagen zu können.
ReviewBench basiert auf 219 echten Pull Requests (PRs) aus 187 Open-Source-Repositories in 19 Programmiersprachen. Die Datenauswahl orientiere sich an 103,9 Millionen GitHub-Pull-Requests, um möglichst realistisch zu sein, sagt GitHub in seinem Blogbeitrag zu ReviewBench. Bei den Programmiersprachen erreicht TypeScript den größten Anteil, gefolgt von Python und C#.
Als Referenz dient ReviewBench ein Datensatz bekannter Befunde aus mehreren Quellen. Zu ihnen gehören Kommentare menschlicher Reviewer und Probleme, die sich aus späteren Commits der PR-Autoren ableiten lassen, außerdem LLM-basierte Reviewer und Werkzeuge zur statischen Codeanalyse.
Als Bewertungsmodell nutzt ReviewBench Claude Sonnet 5. Es prüft anhand eines Kriterienkatalogs, ob ein Befund zutrifft, relevant und nicht trivial ist. Ein Abgleichverfahren ermittelt, ob die Befunde des Agenten demselben zugrunde liegenden Problem im Referenzdatensatz entsprechen.
Die Referenzbefunde ließ GitHub von unabhängigen Senior Engineers bewerten, die nicht am Aufbau des Benchmark-Datensatzes beteiligt waren. Laut GitHub stuften sie die Befunde in 96,6 Prozent der Fälle genauso als zutreffend oder unzutreffend ein wie ReviewBench.
ReviewBench soll GitHub dabei geholfen haben, Verbesserungen bei Copilot Code Review (CCR) zuverlässiger zu messen und zu validieren. Passenderweise landet CCR im ReviewBench-Ranking prompt auf dem ersten Platz. Die ersten Einträge der Bestenliste hat GitHub allerdings selbst erzeugt, die anderen Hersteller haben diese Tests weder durchgeführt noch geprüft.
Die Onlinebestenliste des unabhängigen Martian Code Review Bench sieht für CCR weniger schmeichelhaft aus: Dort belegt Copilot Code Review mit Stand 6. Oktober nur Platz fünf, ebenso wie im Offline-Ranking. Allerdings verfolgt Martian auch einen anderen Testansatz: Neben einem Offline-Benchmark misst Martian online, ob Entwicklerinnen und Entwickler die Vorschläge der KI-Reviewer in echten Pull Requests tatsächlich umsetzen.
Entwicklerinnen und Entwickler, die ihren KI-Code-Review-Agenten mit ReviewBench testen möchten, melden sich auf der Website von ReviewBench mit ihrem GitHub-Konto an und registrieren den Agenten samt Container-Image und Konfiguration. Anschließend können sie ihren Agenten zunächst an 25 Pull Requests testen und optimieren. Für die finale Bewertung durchläuft der Agent den vollständigen Datensatz mit 219 Pull Requests dreimal. Nach einer Prüfung durch die Maintainer landen die Ergebnisse in der Bestenliste, sofern es der erste Eintrag des Agenten ist oder er seinen bisherigen Wert übertrifft.
Quellcode, Datensätze und Dokumentation von ReviewBench sind auf GitHub verfügbar.