I risultati delle valutazioni dell'IA sono stati a lungo sparsi tra articoli, classifiche e log, rendendo difficile fidarsi o confrontarli. Ora, la Coalizione EvalEval e Hugging Face stanno colmando questa lacuna. Lanciato a febbraio 2026, il progetto EvalEval (EEE) ha introdotto uno schema JSON standardizzato per riportare i risultati delle valutazioni. Community Evals di Hugging Face, anch'esso lanciato a febbraio 2026, decentralizza il modo in cui i punteggi dei benchmark appaiono sull'Hub. Insieme, forniscono un sistema unificato per utenti, ricercatori e decisori politici per verificare e confrontare le valutazioni dei modelli.

I risultati delle valutazioni sono fondamentali per misurare le capacità dei modelli, confrontarli e valutarne la sicurezza, ma spesso variano enormemente. Ad esempio, LLaMA 65B è stato riportato sia a 63.7 che a 48.8 su MMLU, a seconda di chi ha eseguito il test e come. Queste discrepanze derivano da impostazioni di valutazione non riportate. EEE affronta questo problema definendo un unico schema JSON che registra chi ha eseguito la valutazione, quale modello è stato utilizzato, come è stato accesso, le impostazioni di generazione, le definizioni delle metriche e, opzionalmente, gli output per campione in un file JSONL complementare.

Verified Evaluators on Eval Cards

Lo schema, sviluppato con il contributo di ricercatori ed esperti di politiche, accetta risultati da qualsiasi fonte (log di harness, scraping di classifiche o numeri da articoli) e li converte in un formato coerente. Il repository GitHub include convertitori, esempi e una guida per i contributori. Dal suo lancio, il datastore EEE su Hugging Face è cresciuto fino a circa 229.000 risultati di valutazione su oltre 22.000 modelli e 2.200 benchmark, provenienti da 31 diversi formati di reporting. Riprodurre quelle esecuzioni da zero costerebbe centinaia di migliaia di dollari, sottolineando il valore di preservare questi dati.

Ora, con un'integrazione più profonda, i contributori possono inviare i risultati EEE a Hugging Face Community Evals utilizzando un convertitore che trasforma i record EEE nei file YAML che Hugging Face si aspetta. Questo elimina la necessità di mantenere i risultati in due formati. I valutatori di prima parte che riportano i propri modelli e i valutatori di terze parti che riportano su altri possono inviare a entrambi i sistemi. Quando inviati tramite l'account ufficiale Hugging Face di un'organizzazione, i risultati ricevono un segno di spunta verificato su EvalEval, a indicare l'autenticità.

Come funziona Hugging Face Community Evals con EvalEval

Hugging Face Community Evals opera su due fronti. In primo luogo, un benchmark risiede in un repository di dataset registrato con un file eval.yaml, che raccoglie e mostra una classifica di tutti i punteggi riportati. In secondo luogo, i punteggi di un modello risiedono in file .eval_results/*.yaml all'interno del repository del modello, appaiono sulla scheda del modello e alimentano la classifica del benchmark. I punteggi sono accompagnati da badge che indicano se sono inviati dall'autore, dalla comunità o verificati indipendentemente. Chiunque può inviare un punteggio tramite una pull request, e gli autori del modello possono gestire i risultati sui propri repository.

Quando un risultato viene inviato sia a EEE che a Community Evals, appare sulla pagina del modello Hugging Face e sulla classifica del benchmark, con un badge di origine che rimanda al record EEE completo. Quel record include la configurazione di generazione, la versione dell'harness, note sulla riproducibilità e dati a livello di istanza.

"Le due destinazioni svolgono lavori diversi verso lo stesso obiettivo. Hugging Face mette il tuo risultato dove le persone guardano i modelli, con un collegamento alla fonte. EEE mantiene il record strutturato completo che rende il risultato interpretabile e alimenta le Eval Cards sopra di esso." — Coalizione EvalEval

EvalEval as source on SmolLM2 Model Page

La compatibilità incrociata significa che la stessa valutazione appare sia sulle schede dei modelli che sulle Eval Cards, che combinano i dati di esecuzione EEE con i metadati del benchmark e del modello in un record interpretabile.

Come funziona

Hugging Face memorizza i punteggi di valutazione nei repository dei modelli come file YAML sotto .eval_results/. I campi obbligatori includono il dataset di benchmark, il task e il valore. Un blocco source crea un collegamento a EEE. Ad esempio:

 - dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEval

Il convertitore mappa i record EEE esistenti a questi campi: source_data.hf_repo a dataset.id, evaluation_name a task_id, score_details.score a value e evaluation_timestamp a date. Attualmente supporta quattro benchmark ufficiali: MMLU-Pro, GPQA, HLE e GSM8K.

Il convertitore fa più che rimodellare i dati. Scarica una raccolta del datastore EEE, controlla gli hash degli oggetti e identifica i punteggi per i benchmark supportati. Prima di scrivere qualsiasi cosa, controlla i file .eval_results YAML esistenti sul branch principale del modello e nelle PR aperte, confrontando per dataset e task. I punteggi già presenti vengono contrassegnati come tali, i conflitti vengono segnalati e i repository di modelli mancanti vengono annotati. Tutto il resto viene contrassegnato come pronto.

TUI of the Converter

Niente viene inviato senza l'approvazione dell'utente. Lo strumento scrive anteprime YAML locali e un file di revisione, mostra un report delle voci pronte e problematiche, e apre PR solo dopo che l'utente digita "OPEN PRS" e inserisce un messaggio di commit. Le riesecuzioni riutilizzano i risultati memorizzati nella cache a meno che non venga passato --force.

Inizia da qui

Per iniziare, invia i tuoi record completi al datastore EEE. Usare EEE richiede solo un passaggio aggiuntivo, che il convertitore automatizza in gran parte. L'integrazione garantisce che i risultati delle valutazioni non siano solo visibili ma anche interpretabili, costruendo fiducia nei confronti dei modelli di IA. Man mano che il datastore cresce, la coalizione mira ad espandere il supporto per più benchmark e incoraggiare un'adozione più ampia nella comunità dell'IA.