Az AI-értékelések eredményei sokáig szétszórtan hevertek tanulmányokban, ranglistákon és naplókban, ami megnehezítette a megbízhatóságukat vagy az összehasonlításukat. Most az EvalEval Koalíció és a Hugging Face áthidalja ezt a hiányt. A 2026 februárjában indult EvalEval projekt (EEE) bevezetett egy szabványos JSON sémát az értékelési eredmények jelentésére. A Hugging Face Community Evals, szintén 2026 februárjában indult, decentralizálja, hogyan jelennek meg a benchmark pontszámok a Hubon. Együtt egy egységes rendszert biztosítanak a felhasználók, kutatók és döntéshozók számára a modellértékelések ellenőrzésére és összehasonlítására.
Az értékelési eredmények kritikus fontosságúak a modellképességek méréséhez, a modellek összehasonlításához és a biztonság felméréséhez, de gyakran erősen eltérnek egymástól. Például a LLaMA 65B esetében 63,7 és 48,8 közötti értékeket is jelentettek az MMLU-n, attól függően, hogy ki és hogyan futtatta a tesztet. Ezek az eltérések a nem jelentett értékelési beállításokból fakadnak. Az EEE ezt úgy oldja meg, hogy egyetlen JSON sémát definiál, amely rögzíti, ki futtatta az értékelést, melyik modellt használták, hogyan érték el, a generálási beállításokat, a metrikadefiníciókat, és opcionálisan a mintánkénti kimeneteket egy kísérő JSONL fájlban.

A séma, amelyet kutatók és szakpolitikai szakértők közreműködésével alakítottak ki, bármilyen forrásból – harness naplókból, ranglistákról vagy tanulmányokból származó számokból – elfogadja az eredményeket, és egységes formátumba konvertálja azokat. A GitHub tároló tartalmaz konvertereket, példákat és egy közreműködői útmutatót. Az indulás óta a Hugging Face-en lévő EEE adattár körülbelül 229 000 értékelési eredményre nőtt, több mint 22 000 modellből és 2 200 benchmarkból, 31 különböző jelentési formátumból. Ezeknek a futtatásoknak a nulláról történő reprodukálása több százezer dollárba kerülne, ami aláhúzza ezen adatok megőrzésének értékét.
Most, a mélyebb integrációnak köszönhetően, a közreműködők elküldhetik az EEE eredményeket a Hugging Face Community Evals számára egy konverter segítségével, amely az EEE rekordokat a Hugging Face által várt YAML fájlokká alakítja. Ezzel megszűnik az eredmények két formátumban való karbantartásának szükségessége. Az első féltől származó értékelők, akik saját modelljeiket jelentik, és a harmadik féltől származó értékelők, akik mások modelljeiről számolnak be, mindkét rendszerbe beküldhetik az eredményeket. Ha egy szervezet hivatalos Hugging Face fiókján keresztül küldik be, az eredmények egy ellenőrzött pipát kapnak az EvalEval-on, jelezve a hitelességet.
Hogyan működik a Hugging Face Community Evals az EvalEval-lel
A Hugging Face Community Evals két fronton működik. Először is, egy benchmark egy adatkészlet repóban él, amelyet egy eval.yaml fájllal regisztrálnak, amely összegyűjti és megjeleníti az összes jelentett pontszám ranglistáját. Másodszor, egy modell pontszámai a .eval_results/*.yaml fájlokban találhatók a modell repóban, megjelennek a modellkártyán, és táplálják a benchmark ranglistát. A pontszámok jelvényekkel járnak, amelyek jelzik, hogy szerző által beküldött, közösség által beküldött vagy függetlenül ellenőrzött. Bárki beküldhet egy pontszámot egy pull request segítségével, és a modell szerzői kezelhetik az eredményeket a repóikban.
Amikor egy eredményt elküldenek mind az EEE-nek, mind a Community Evals-nak, az megjelenik a Hugging Face modelloldalán és a benchmark ranglistán, egy forrásjelvénnyel, amely visszamutat a teljes EEE rekordra. Ez a rekord tartalmazza a generálási konfigurációt, a harness verziót, a reprodukálhatósági megjegyzéseket és a példányszintű adatokat.
„A két célállomás különböző feladatokat lát el ugyanazon cél érdekében. A Hugging Face oda helyezi az eredményedet, ahol az emberek a modelleket nézik, egy visszamutató linkkel a forráshoz. Az EEE megtartja a teljes strukturált rekordot, amely értelmezhetővé teszi az eredményt, és erre épülve Eval Kártyákat működtet.” – EvalEval Koalíció

A keresztkompatibilitás azt jelenti, hogy ugyanaz az értékelés megjelenik mind a modellkártyákon, mind az Eval Kártyákon, amelyek az EEE futtatási adatait kombinálják a benchmark és modell metaadatokkal egy értelmezhető rekorddá.
Hogyan működik
A Hugging Face az értékelési pontszámokat a modell repókban YAML fájlokként tárolja a .eval_results/ mappában. A kötelező mezők közé tartozik a benchmark adatkészlet, a feladat és az érték. Egy source blokk visszamutató linket hoz létre az EEE-hez. Például:
- dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEvalA konverter a meglévő EEE rekordokat ezekre a mezőkre képezi le: source_data.hf_repo -> dataset.id, evaluation_name -> task_id, score_details.score -> value, evaluation_timestamp -> date. Jelenleg négy hivatalos benchmarkot támogat: MMLU-Pro, GPQA, HLE és GSM8K.
A konverter többet tesz, mint az adatok átalakítása. Letölt egy EEE adattár gyűjteményt, ellenőrzi az objektum hash-eket, és azonosítja a támogatott benchmarkok pontszámait. Mielőtt bármit írna, ellenőrzi a meglévő .eval_results YAML fájlokat a modell fő ágán és a nyitott PR-ekben, összehasonlítva adatkészlet és feladat alapján. A már meglévő pontszámokat megjelöli, az ütközéseket jelzi, a hiányzó modell repókat pedig feljegyzi. Minden mást készként jelöl meg.

Semmi sem kerül feltolásra a felhasználó jóváhagyása nélkül. Az eszköz helyi YAML előnézeteket és egy felülvizsgálati fájlt ír, megjelenít egy jelentést a kész és problémás bejegyzésekről, és csak akkor nyit PR-eket, ha a felhasználó beírja az „OPEN PRS” parancsot és megad egy commit üzenetet. Az újrafuttatások a gyorsítótárazott eredményeket használják fel, hacsak nem adják meg a --force kapcsolót.
Kezdje itt
A kezdéshez küldje el teljes rekordjait az EEE adattárba. Az EEE használata csak egy további lépést igényel, amelyet a konverter nagyrészt automatizál. Az integráció biztosítja, hogy az értékelési eredmények ne csak láthatóak, hanem értelmezhetőek is legyenek, ezzel építve a bizalmat az AI modellösszehasonlításokban. Ahogy az adattár növekszik, a koalíció célja, hogy több benchmark támogatását bővítse, és ösztönözze a szélesebb körű elfogadást az AI közösségben.



