KI-Bewertungsergebnisse waren lange Zeit über Paper, Leaderboards und Logs verstreut, was es schwierig machte, ihnen zu vertrauen oder sie zu vergleichen. Jetzt schließen die EvalEval-Koalition und Hugging Face diese Lücke. Das im Februar 2026 gestartete EvalEval-Projekt (EEE) führte ein standardisiertes JSON-Schema für die Meldung von Bewertungsergebnissen ein. Hugging Faces Community Evals, ebenfalls im Februar 2026 gestartet, dezentralisiert die Darstellung von Benchmark-Ergebnissen auf dem Hub. Zusammen bieten sie ein einheitliches System für Nutzer, Forscher und politische Entscheidungsträger, um Modellbewertungen zu überprüfen und zu vergleichen.
Bewertungsergebnisse sind entscheidend für die Messung von Modellfähigkeiten, den Vergleich von Modellen und die Bewertung der Sicherheit, variieren jedoch oft stark. Beispielsweise wurde LLaMA 65B sowohl mit 63,7 als auch mit 48,8 bei MMLU gemeldet, je nachdem, wer den Test durchgeführt hat und wie. Diese Diskrepanzen resultieren aus nicht gemeldeten Bewertungseinstellungen. EEE adressiert dies, indem es ein einziges JSON-Schema definiert, das festhält, wer die Bewertung durchgeführt hat, welches Modell verwendet wurde, wie darauf zugegriffen wurde, Generierungseinstellungen, Metrikdefinitionen und optional stichprobenbezogene Ausgaben in einer begleitenden JSONL-Datei.

Das Schema, das mit Input von Forschern und politischen Experten entwickelt wurde, akzeptiert Ergebnisse aus jeder Quelle – Harness-Logs, Leaderboard-Scrapes oder Paper-Zahlen – und wandelt sie in ein einheitliches Format um. Das GitHub-Repository enthält Konverter, Beispiele und einen Leitfaden für Mitwirkende. Seit seiner Einführung ist der EEE-Datenspeicher auf Hugging Face auf rund 229.000 Bewertungsergebnisse von über 22.000 Modellen und 2.200 Benchmarks angewachsen, die aus 31 verschiedenen Berichtsformaten stammen. Die Reproduktion dieser Läufe von Grund auf würde Hunderttausende von Dollar kosten, was den Wert der Erhaltung dieser Daten unterstreicht.
Jetzt, mit tieferer Integration, können Mitwirkende EEE-Ergebnisse an Hugging Face Community Evals senden, indem sie einen Konverter verwenden, der EEE-Datensätze in die YAML-Dateien umwandelt, die Hugging Face erwartet. Dies eliminiert die Notwendigkeit, Ergebnisse in zwei Formaten zu pflegen. Erstpartei-Bewerter, die ihre eigenen Modelle melden, und Drittpartei-Bewerter, die über andere berichten, können an beide Systeme einreichen. Bei Einreichung über das offizielle Hugging Face-Konto einer Organisation erhalten die Ergebnisse auf EvalEval ein verifiziertes Häkchen, das Authentizität signalisiert.
Wie Hugging Face Community Evals mit EvalEval funktioniert
Hugging Face Community Evals operiert auf zwei Ebenen. Erstens lebt ein Benchmark in einem Dataset-Repository, das mit einer eval.yaml-Datei registriert ist, die ein Leaderboard aller gemeldeten Ergebnisse sammelt und anzeigt. Zweitens befinden sich die Ergebnisse eines Modells in .eval_results/*.yaml-Dateien im Modell-Repository, die auf der Modellkarte erscheinen und in das Benchmark-Leaderboard einfließen. Ergebnisse werden mit Abzeichen versehen, die anzeigen, ob sie vom Autor, von der Community oder unabhängig verifiziert eingereicht wurden. Jeder kann ein Ergebnis per Pull-Request einreichen, und Modellautoren können Ergebnisse in ihren Repositories verwalten.
Wenn ein Ergebnis sowohl an EEE als auch an Community Evals gesendet wird, erscheint es auf der Hugging Face-Modellseite und dem Benchmark-Leaderboard, mit einem Quellabzeichen, das auf den vollständigen EEE-Datensatz verlinkt. Dieser Datensatz enthält die Generierungskonfiguration, die Harness-Version, Reproduzierbarkeitshinweise und Daten auf Instanzebene.
„Die beiden Ziele verfolgen unterschiedliche Aufgaben für dasselbe Ziel. Hugging Face platziert Ihr Ergebnis dort, wo Leute Modelle ansehen, mit einem Link zurück zur Quelle. EEE bewahrt den vollständigen strukturierten Datensatz, der das Ergebnis interpretierbar macht, und ermöglicht darauf aufbauend Eval Cards.“ – EvalEval-Koalition

Die Kreuzkompatibilität bedeutet, dass dieselbe Bewertung sowohl auf Modellkarten als auch in Eval Cards erscheint, die EEE-Laufdaten mit Benchmark- und Modellmetadaten zu einem interpretierbaren Datensatz kombinieren.
Wie es funktioniert
Hugging Face speichert Bewertungsergebnisse in Modell-Repositories als YAML-Dateien unter .eval_results/. Erforderliche Felder umfassen das Benchmark-Dataset, die Aufgabe und den Wert. Ein Quellblock erstellt einen Rücklink zu EEE. Beispiel:
- dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEvalDer Konverter ordnet vorhandene EEE-Datensätze diesen Feldern zu: source_data.hf_repo zu dataset.id, evaluation_name zu task_id, score_details.score zu value und evaluation_timestamp zu date. Er unterstützt derzeit vier offizielle Benchmarks: MMLU-Pro, GPQA, HLE und GSM8K.
Der Konverter tut mehr als nur Daten umzuformen. Er lädt eine EEE-Datenspeicher-Sammlung herunter, überprüft Objekt-Hashes und identifiziert Ergebnisse für unterstützte Benchmarks. Bevor er etwas schreibt, prüft er vorhandene .eval_results YAML-Dateien auf dem Hauptzweig des Modells und in offenen PRs, vergleicht nach Dataset und Aufgabe. Bereits vorhandene Ergebnisse werden als solche markiert, Konflikte werden gekennzeichnet, und fehlende Modell-Repositories werden notiert. Alles andere wird als bereit markiert.

Nichts wird ohne Benutzerfreigabe gepusht. Das Tool schreibt lokale YAML-Vorschauen und eine Überprüfungsdatei, zeigt einen Bericht über bereite und problematische Einträge an und öffnet nur PRs, nachdem der Benutzer „OPEN PRS“ eingegeben und eine Commit-Nachricht eingegeben hat. Wiederholungen verwenden zwischengespeicherte Ergebnisse, es sei denn, --force wird übergeben.
Hier starten
Um zu beginnen, reichen Sie Ihre vollständigen Datensätze im EEE-Datenspeicher ein. Die Verwendung von EEE erfordert nur einen zusätzlichen Schritt, den der Konverter weitgehend automatisiert. Die Integration stellt sicher, dass Bewertungsergebnisse nicht nur sichtbar, sondern auch interpretierbar sind, und schafft Vertrauen in KI-Modellvergleiche. Mit dem Wachstum des Datenspeichers strebt die Koalition an, die Unterstützung für weitere Benchmarks auszuweiten und eine breitere Akzeptanz in der KI-Community zu fördern.



