Wyniki ewaluacji AI od dawna były rozproszone po artykułach, rankingach i logach, co utrudniało ich weryfikację i porównywanie. Teraz Koalicja EvalEval i Hugging Face zamykają tę lukę. Uruchomiony w lutym 2026 roku projekt EvalEval (EEE) wprowadził ustandaryzowany schemat JSON do raportowania wyników ewaluacji. Community Evals od Hugging Face, również uruchomione w lutym 2026 roku, decentralizuje sposób wyświetlania wyników benchmarków na Hubie. Razem zapewniają ujednolicony system dla użytkowników, badaczy i decydentów do weryfikacji i porównywania ewaluacji modeli.

Wyniki ewaluacji są kluczowe do pomiaru możliwości modeli, porównywania ich i oceny bezpieczeństwa, ale często różnią się diametralnie. Na przykład LLaMA 65B uzyskiwała wyniki 63,7 i 48,8 w MMLU, w zależności od tego, kto i jak przeprowadził test. Te rozbieżności wynikają z niezgłaszanych ustawień ewaluacji. EEE rozwiązuje ten problem, definiując jeden schemat JSON, który rejestruje, kto przeprowadził ewaluację, który model został użyty, jak uzyskano do niego dostęp, ustawienia generowania, definicje metryk i opcjonalnie wyniki dla poszczególnych próbek w towarzyszącym pliku JSONL.

Verified Evaluators on Eval Cards

Schemat, stworzony przy udziale badaczy i ekspertów ds. polityki, przyjmuje wyniki z dowolnego źródła – logów harness, scrape'ów rankingów czy danych z artykułów – i przekształca je w spójny format. Repozytorium GitHub zawiera konwertery, przykłady i przewodnik dla współtwórców. Od momentu uruchomienia magazyn danych EEE na Hugging Face rozrósł się do około 229 000 wyników ewaluacji dla ponad 22 000 modeli i 2 200 benchmarków, pochodzących z 31 różnych formatów raportowania. Odtworzenie tych przebiegów od podstaw kosztowałoby setki tysięcy dolarów, co podkreśla wartość zachowania tych danych.

Teraz, dzięki głębszej integracji, współtwórcy mogą wysyłać wyniki EEE do Hugging Face Community Evals za pomocą konwertera, który przekształca rekordy EEE w pliki YAML oczekiwane przez Hugging Face. Eliminuje to konieczność utrzymywania wyników w dwóch formatach. Ewaluatorzy pierwszej strony raportujący własne modele oraz ewaluatorzy zewnętrzni raportujący wyniki dla innych mogą przesyłać dane do obu systemów. Gdy wyniki są przesyłane za pośrednictwem oficjalnego konta organizacji na Hugging Face, otrzymują zweryfikowany znacznik na EvalEval, sygnalizujący autentyczność.

Jak Hugging Face Community Evals współpracuje z EvalEval

Hugging Face Community Evals działa na dwóch frontach. Po pierwsze, benchmark żyje w repozytorium danych zarejestrowanym z plikiem eval.yaml, który gromadzi i wyświetla ranking wszystkich zgłoszonych wyników. Po drugie, wyniki modelu znajdują się w plikach .eval_results/*.yaml w repozytorium modelu, pojawiają się na karcie modelu i zasilają ranking benchmarku. Wyniki mają odznaki wskazujące, czy zostały przesłane przez autora, społeczność, czy są niezależnie zweryfikowane. Każdy może przesłać wynik przez pull request, a autorzy modeli mogą zarządzać wynikami w swoich repozytoriach.

Gdy wynik jest wysyłany zarówno do EEE, jak i Community Evals, pojawia się na stronie modelu Hugging Face i w rankingu benchmarku, z odznaką źródła prowadzącą do pełnego rekordu EEE. Ten rekord zawiera konfigurację generowania, wersję harness, uwagi dotyczące powtarzalności i dane na poziomie instancji.

„Te dwa miejsca docelowe wykonują różne zadania w kierunku tego samego celu. Hugging Face umieszcza Twój wynik tam, gdzie ludzie patrzą na modele, z linkiem zwrotnym do źródła. EEE przechowuje pełny ustrukturyzowany rekord, który czyni wynik interpretowalnym i zasila Eval Cards na jego podstawie.” — Koalicja EvalEval

EvalEval as source on SmolLM2 Model Page

Kompatybilność krzyżowa oznacza, że ta sama ewaluacja pojawia się zarówno na kartach modeli, jak i w Eval Cards, które łączą dane z przebiegu EEE z metadanymi benchmarku i modelu w interpretowalny rekord.

Jak to działa

Hugging Face przechowuje wyniki ewaluacji w repozytoriach modeli jako pliki YAML w katalogu .eval_results/. Wymagane pola obejmują zestaw danych benchmarku, zadanie i wartość. Blok źródłowy tworzy link zwrotny do EEE. Na przykład:

 - dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEval

Konwerter mapuje istniejące rekordy EEE na te pola: source_data.hf_repo na dataset.id, evaluation_name na task_id, score_details.score na value, a evaluation_timestamp na date. Obecnie obsługuje cztery oficjalne benchmarki: MMLU-Pro, GPQA, HLE i GSM8K.

Konwerter robi więcej niż tylko przekształcanie danych. Pobiera kolekcję magazynu danych EEE, sprawdza skróty obiektów i identyfikuje wyniki dla obsługiwanych benchmarków. Przed zapisaniem czegokolwiek audytuje istniejące pliki .eval_results YAML w głównej gałęzi modelu i w otwartych PR-ach, porównując według zestawu danych i zadania. Wyniki już obecne są oznaczane jako takie, konflikty są flagowane, a brakujące repozytoria modeli są odnotowywane. Wszystko inne jest oznaczane jako gotowe.

TUI of the Converter

Nic nie jest wypychane bez zgody użytkownika. Narzędzie zapisuje lokalne podglądy YAML i plik przeglądu, pokazuje raport gotowych i problematycznych wpisów, a PR-y otwiera dopiero po wpisaniu przez użytkownika „OPEN PRS” i podaniu komunikatu zatwierdzenia. Ponowne uruchomienia korzystają z buforowanych wyników, chyba że podano --force.

Zacznij tutaj

Aby rozpocząć, prześlij swoje pełne rekordy do magazynu danych EEE. Korzystanie z EEE wymaga tylko jednego dodatkowego kroku, który konwerter w dużej mierze automatyzuje. Integracja zapewnia, że wyniki ewaluacji są nie tylko widoczne, ale także interpretowalne, budując zaufanie do porównań modeli AI. W miarę wzrostu magazynu danych koalicja planuje rozszerzyć wsparcie dla większej liczby benchmarków i zachęcić do szerszego przyjęcia w społeczności AI.