AI-evaluatieresultaten waren lange tijd verspreid over papers, leaderboards en logs, waardoor ze moeilijk te vertrouwen of vergelijken waren. Nu dichten de EvalEval Coalition en Hugging Face die kloof. Gelanceerd in februari 2026, introduceerde het EvalEval-project (EEE) een gestandaardiseerd JSON-schema voor het rapporteren van evaluatieresultaten. Hugging Face's Community Evals, ook gelanceerd in februari 2026, decentraliseert hoe benchmarkscores op de Hub verschijnen. Samen bieden ze een uniform systeem voor gebruikers, onderzoekers en beleidsmakers om modelevaluaties te verifiëren en vergelijken.

Evaluatieresultaten zijn cruciaal voor het meten van modelcapaciteiten, het vergelijken van modellen en het beoordelen van veiligheid, maar ze lopen vaak sterk uiteen. Zo is LLaMA 65B gerapporteerd op zowel 63,7 als 48,8 op MMLU, afhankelijk van wie de test uitvoerde en hoe. Deze verschillen komen door niet-gerapporteerde evaluatie-instellingen. EEE pakt dit aan door een enkel JSON-schema te definiëren dat vastlegt wie de evaluatie uitvoerde, welk model werd gebruikt, hoe het werd benaderd, generatie-instellingen, metricdefinities en optioneel per-sample uitvoer in een bijbehorend JSONL-bestand.

Verified Evaluators on Eval Cards

Het schema, ontwikkeld met input van onderzoekers en beleidsexperts, accepteert resultaten uit elke bron—harness logs, leaderboard scrapes of paper getallen—en zet ze om naar een consistent formaat. De GitHub-repository bevat converters, voorbeelden en een bijdragersgids. Sinds de lancering is de EEE-datastore op Hugging Face gegroeid tot ongeveer 229.000 evaluatieresultaten van meer dan 22.000 modellen en 2.200 benchmarks, afkomstig uit 31 verschillende rapportageformaten. Het reproduceren van die runs vanaf nul zou honderdduizenden dollars kosten, wat de waarde van het bewaren van deze data onderstreept.

Nu, met diepere integratie, kunnen bijdragers EEE-resultaten naar Hugging Face Community Evals sturen met een converter die EEE-records omzet in de YAML-bestanden die Hugging Face verwacht. Dit elimineert de noodzaak om resultaten in twee formaten bij te houden. First-party evaluatoren die hun eigen modellen rapporteren en third-party evaluatoren die over anderen rapporteren, kunnen aan beide systemen bijdragen. Wanneer ingediend via het officiële Hugging Face-account van een organisatie, krijgen resultaten een geverifieerd vinkje op EvalEval, wat authenticiteit aangeeft.

Hoe Hugging Face Community Evals werkt met EvalEval

Hugging Face Community Evals werkt op twee fronten. Ten eerste leeft een benchmark in een dataset-repo die is geregistreerd met een eval.yaml-bestand, dat een leaderboard verzamelt en weergeeft van alle gerapporteerde scores. Ten tweede staan de scores van een model in .eval_results/*.yaml-bestanden in de model-repo, die verschijnen op de modelkaart en bijdragen aan het benchmark leaderboard. Scores hebben badges die aangeven of ze door de auteur, door de community of onafhankelijk geverifieerd zijn. Iedereen kan een score indienen via een pull request, en modelauteurs kunnen resultaten beheren op hun repos.

Wanneer een resultaat naar zowel EEE als Community Evals wordt gestuurd, verschijnt het op de Hugging Face-modelpagina en het benchmark leaderboard, met een bronbadge die teruglinkt naar het volledige EEE-record. Dat record bevat generatieconfiguratie, harness-versie, reproduceerbaarheidsnotities en gegevens op instantieniveau.

"De twee bestemmingen doen verschillende taken voor hetzelfde doel. Hugging Face plaatst je resultaat waar mensen naar modellen kijken, met een link terug naar de bron. EEE bewaart het volledige gestructureerde record dat het resultaat interpreteerbaar maakt en ondersteunt Eval Cards er bovenop." — EvalEval Coalition

EvalEval as source on SmolLM2 Model Page

Cross-compatibiliteit betekent dat dezelfde evaluatie zowel op modelkaarten als in Eval Cards verschijnt, die EEE-run data combineren met benchmark- en modelmetadata tot een interpreteerbaar record.

Hoe het werkt

Hugging Face slaat eval-scores op in model-repos als YAML-bestanden onder .eval_results/. Verplichte velden zijn de benchmarkdataset, taak en waarde. Een bronblok maakt een teruglink naar EEE. Bijvoorbeeld:

 - dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEval

De converter wijst bestaande EEE-records toe aan deze velden: source_data.hf_repo aan dataset.id, evaluation_name aan task_id, score_details.score aan value en evaluation_timestamp aan date. Het ondersteunt momenteel vier officiële benchmarks: MMLU-Pro, GPQA, HLE en GSM8K.

De converter doet meer dan data hervormen. Het downloadt een EEE-datastore collectie, controleert object-hashes en identificeert scores voor ondersteunde benchmarks. Voordat het iets schrijft, controleert het bestaande .eval_results YAML-bestanden op de main branch van het model en in open PR's, en vergelijkt op dataset en taak. Scores die al aanwezig zijn, worden gemarkeerd, conflicten worden aangegeven en ontbrekende model-repos worden genoteerd. Al het andere wordt gemarkeerd als gereed.

TUI of the Converter

Er wordt niets gepusht zonder goedkeuring van de gebruiker. De tool schrijft lokale YAML-voorbeelden en een reviewbestand, toont een rapport van gereed en problematische items, en opent alleen PR's nadat de gebruiker "OPEN PRS" typt en een commit-bericht invoert. Herhalingen gebruiken in de cache opgeslagen resultaten, tenzij --force wordt doorgegeven.

Begin hier

Om te beginnen, dien je je volledige records in bij de EEE-datastore. Het gebruik van EEE vereist slechts één extra stap, die de converter grotendeels automatiseert. De integratie zorgt ervoor dat evaluatieresultaten niet alleen zichtbaar zijn, maar ook interpreteerbaar, wat vertrouwen opbouwt in AI-modelvergelijkingen. Naarmate de datastore groeit, wil de coalitie de ondersteuning voor meer benchmarks uitbreiden en bredere adoptie in de AI-gemeenschap stimuleren.