Výsledky hodnocení AI byly dlouho roztroušeny po článcích, leaderboardech a logách, což ztěžovalo jejich důvěryhodnost a srovnání. Nyní tuto mezeru uzavírají koalice EvalEval a Hugging Face. Projekt EvalEval (EEE), spuštěný v únoru 2026, zavedl standardizované JSON schéma pro vykazování výsledků hodnocení. Komunitní hodnocení Hugging Face (Community Evals), rovněž spuštěné v únoru 2026, decentralizuje způsob, jakým se skóre benchmarků objevují na Hubu. Dohromady poskytují jednotný systém pro uživatele, výzkumníky a tvůrce politik, aby mohli ověřovat a porovnávat hodnocení modelů.

Výsledky hodnocení jsou klíčové pro měření schopností modelů, jejich porovnávání a posuzování bezpečnosti, ale často se značně liší. Například LLaMA 65B byla hlášena na 63,7 i 48,8 v MMLU, v závislosti na tom, kdo test prováděl a jak. Tyto nesrovnalosti pramení z neuvedených nastavení hodnocení. EEE to řeší definováním jediného JSON schématu, které zaznamenává, kdo hodnocení provedl, který model byl použit, jak byl přistupován, nastavení generování, definice metrik a volitelně výstupy na úrovni jednotlivých vzorků v doprovodném JSONL souboru.

Verified Evaluators on Eval Cards

Schéma, vytvořené s přispěním výzkumníků a odborníků na politiku, přijímá výsledky z jakéhokoli zdroje – logy z harnessů, scrapované leaderboardy nebo číselné údaje z článků – a převádí je do konzistentního formátu. GitHub repozitář obsahuje konvertory, příklady a průvodce pro přispěvatele. Od svého spuštění narostlo úložiště EEE na Hugging Face na přibližně 229 000 výsledků hodnocení napříč více než 22 000 modely a 2 200 benchmarky, získaných z 31 různých formátů vykazování. Reprodukovat tyto běhy od začátku by stálo statisíce dolarů, což podtrhuje hodnotu uchovávání těchto dat.

Nyní, s hlubší integrací, mohou přispěvatelé posílat výsledky EEE do Komunitních hodnocení Hugging Face pomocí konvertoru, který transformuje záznamy EEE do YAML souborů, které Hugging Face očekává. Tím odpadá nutnost udržovat výsledky ve dvou formátech. Prvostranoví hodnotitelé, kteří vykazují vlastní modely, i třetí strany, které vykazují výsledky na cizích modelech, mohou odesílat do obou systémů. Při odeslání prostřednictvím oficiálního účtu organizace na Hugging Face získají výsledky na EvalEval ověřovací zaškrtnutí, signalizující autenticitu.

Jak Komunitní hodnocení Hugging Face spolupracuje s EvalEval

Komunitní hodnocení Hugging Face funguje na dvou frontách. Za prvé, benchmark žije v dataset repozitáři registrovaném s eval.yaml souborem, který shromažďuje a zobrazuje leaderboard všech hlášených skóre. Za druhé, skóre modelu jsou uložena v souborech .eval_results/*.yaml v repozitáři modelu, objevují se na kartě modelu a napájejí leaderboard benchmarku. Skóre jsou opatřena odznaky, které označují, zda jsou autorová, komunitní nebo nezávisle ověřená. Kdokoli může odeslat skóre pomocí pull requestu a autoři modelů mohou spravovat výsledky na svých repozitářích.

Když je výsledek odeslán do EEE i Komunitních hodnocení, objeví se na stránce modelu na Hugging Face a na leaderboardu benchmarku s odznakem zdroje odkazujícím zpět na plný záznam EEE. Tento záznam obsahuje konfiguraci generování, verzi harnessu, poznámky k reprodukovatelnosti a data na úrovni instancí.

„Oba cíle dělají různé práce směřující ke stejnému záměru. Hugging Face umístí váš výsledek tam, kde lidé sledují modely, s odkazem zpět na zdroj. EEE uchovává plný strukturovaný záznam, který výsledek interpretuje, a pohání na něm postavené Eval Cards.“ — Koalice EvalEval

EvalEval as source on SmolLM2 Model Page

Křížová kompatibilita znamená, že stejné hodnocení se objeví jak na kartách modelů, tak v Eval Cards, které kombinují data z běhu EEE s metadaty benchmarku a modelu do interpretovatelného záznamu.

Jak to funguje

Hugging Face ukládá skóre hodnocení v repozitářích modelů jako YAML soubory v .eval_results/. Povinná pole zahrnují dataset benchmarku, úlohu a hodnotu. Blok source vytváří zpětný odkaz na EEE. Například:

 - dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEval

Konvertor mapuje existující záznamy EEE na tato pole: source_data.hf_repo na dataset.id, evaluation_name na task_id, score_details.score na value a evaluation_timestamp na date. Aktuálně podporuje čtyři oficiální benchmarky: MMLU-Pro, GPQA, HLE a GSM8K.

Konvertor dělá víc než jen přetváření dat. Stáhne kolekci úložiště EEE, zkontroluje hashe objektů a identifikuje skóre pro podporované benchmarky. Před zápisem čehokoli prověří existující YAML soubory .eval_results na hlavní větvi modelu a v otevřených PR, porovnává podle datasetu a úlohy. Již přítomná skóre označí, konflikty signalizuje a chybějící repozitáře modelů zaznamená. Vše ostatní je označeno jako připravené.

TUI of the Converter

Bez schválení uživatelem se nic neposouvá. Nástroj zapíše lokální YAML náhledy a kontrolní soubor, zobrazí zprávu o připravených a problematických položkách a otevře PR až poté, co uživatel napíše „OPEN PRS“ a zadá zprávu k revizi. Při opakovaném spuštění se používají kešované výsledky, pokud není zadán --force.

Začněte zde

Chcete-li začít, odešlete své plné záznamy do úložiště EEE. Použití EEE vyžaduje pouze jeden krok navíc, který konvertor z velké části automatizuje. Integrace zajišťuje, že výsledky hodnocení jsou nejen viditelné, ale také interpretovatelné, čímž buduje důvěru ve srovnávání AI modelů. Jak úložiště roste, koalice usiluje o rozšíření podpory na další benchmarky a podporu širšího přijetí v komunitě AI.