Les résultats d'évaluation de l'IA ont longtemps été dispersés entre articles, classements et journaux, rendant difficile leur fiabilité ou leur comparaison. Désormais, la coalition EvalEval et Hugging Face comblent cette lacune. Lancé en février 2026, le projet EvalEval (EEE) a introduit un schéma JSON standardisé pour rapporter les résultats d'évaluation. Les Community Evals de Hugging Face, également lancés en février 2026, décentralisent la façon dont les scores de référence apparaissent sur le Hub. Ensemble, ils offrent un système unifié permettant aux utilisateurs, chercheurs et décideurs de vérifier et comparer les évaluations de modèles.

Les résultats d'évaluation sont essentiels pour mesurer les capacités des modèles, les comparer et évaluer leur sécurité, mais ils varient souvent énormément. Par exemple, LLaMA 65B a été rapporté à la fois à 63,7 et 48,8 sur MMLU, selon qui a effectué le test et comment. Ces écarts proviennent de paramètres d'évaluation non rapportés. EEE répond à cela en définissant un schéma JSON unique qui enregistre qui a réalisé l'évaluation, quel modèle a été utilisé, comment il a été accédé, les paramètres de génération, les définitions des métriques, et optionnellement les sorties par échantillon dans un fichier JSONL associé.

Verified Evaluators on Eval Cards

Le schéma, élaboré avec la contribution de chercheurs et d'experts en politiques, accepte les résultats de toute source—journaux de tests, extractions de classements ou chiffres d'articles—et les convertit dans un format cohérent. Le dépôt GitHub inclut des convertisseurs, des exemples et un guide du contributeur. Depuis son lancement, le magasin de données EEE sur Hugging Face a atteint environ 229 000 résultats d'évaluation pour plus de 22 000 modèles et 2 200 références, provenant de 31 formats de rapport différents. Reproduire ces exécutions à partir de zéro coûterait des centaines de milliers de dollars, soulignant la valeur de la préservation de ces données.

Désormais, avec une intégration plus poussée, les contributeurs peuvent envoyer les résultats EEE aux Community Evals de Hugging Face via un convertisseur qui transforme les enregistrements EEE en fichiers YAML attendus par Hugging Face. Cela élimine le besoin de maintenir les résultats dans deux formats. Les évaluateurs internes rapportant leurs propres modèles et les évaluateurs tiers rapportant sur d'autres peuvent soumettre aux deux systèmes. Lorsqu'ils sont soumis via le compte Hugging Face officiel d'une organisation, les résultats reçoivent une coche de vérification sur EvalEval, signalant leur authenticité.

Comment Hugging Face Community Evals fonctionne avec EvalEval

Hugging Face Community Evals opère sur deux fronts. Premièrement, une référence vit dans un dépôt de jeu de données enregistré avec un fichier eval.yaml, qui collecte et affiche un classement de tous les scores rapportés. Deuxièmement, les scores d'un modèle résident dans des fichiers .eval_results/*.yaml au sein du dépôt du modèle, apparaissant sur la fiche du modèle et alimentant le classement de la référence. Les scores sont accompagnés de badges indiquant s'ils sont soumis par l'auteur, par la communauté ou vérifiés indépendamment. N'importe qui peut soumettre un score via une pull request, et les auteurs de modèles peuvent gérer les résultats sur leurs dépôts.

Lorsqu'un résultat est envoyé à la fois à EEE et à Community Evals, il apparaît sur la page du modèle Hugging Face et sur le classement de la référence, portant un badge source renvoyant à l'enregistrement EEE complet. Cet enregistrement inclut la configuration de génération, la version du harnais, les notes de reproductibilité et les données au niveau des instances.

« Les deux destinations remplissent des fonctions différentes pour un même objectif. Hugging Face place votre résultat là où les gens regardent les modèles, avec un lien vers la source. EEE conserve l'enregistrement structuré complet qui rend le résultat interprétable et alimente les Eval Cards par-dessus. » — Coalition EvalEval

EvalEval as source on SmolLM2 Model Page

La compatibilité croisée signifie que la même évaluation apparaît à la fois sur les fiches de modèles et dans les Eval Cards, qui combinent les données d'exécution EEE avec les métadonnées de la référence et du modèle pour former un enregistrement interprétable.

Comment ça marche

Hugging Face stocke les scores d'évaluation dans les dépôts de modèles sous forme de fichiers YAML dans .eval_results/. Les champs obligatoires incluent le jeu de données de référence, la tâche et la valeur. Un bloc source crée un lien retour vers EEE. Par exemple :

 - dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEval

Le convertisseur fait correspondre les enregistrements EEE existants à ces champs : source_data.hf_repo à dataset.id, evaluation_name à task_id, score_details.score à value, et evaluation_timestamp à date. Il prend actuellement en charge quatre références officielles : MMLU-Pro, GPQA, HLE et GSM8K.

Le convertisseur fait plus que remodeler les données. Il télécharge une collection du magasin de données EEE, vérifie les hachages des objets et identifie les scores pour les références prises en charge. Avant d'écrire quoi que ce soit, il audite les fichiers .eval_results YAML existants sur la branche principale du modèle et dans les pull requests ouvertes, en comparant par jeu de données et tâche. Les scores déjà présents sont marqués comme tels, les conflits sont signalés, et les dépôts de modèles manquants sont notés. Tout le reste est marqué comme prêt.

TUI of the Converter

Rien n'est poussé sans l'approbation de l'utilisateur. L'outil écrit des aperçus YAML locaux et un fichier de révision, affiche un rapport des entrées prêtes et problématiques, et n'ouvre des PR qu'après que l'utilisateur tape « OPEN PRS » et saisisse un message de commit. Les réexécutions réutilisent les résultats mis en cache sauf si --force est passé.

Commencez ici

Pour commencer, soumettez vos enregistrements complets au magasin de données EEE. Utiliser EEE ne nécessite qu'une étape supplémentaire, que le convertisseur automatise en grande partie. L'intégration garantit que les résultats d'évaluation sont non seulement visibles mais aussi interprétables, renforçant la confiance dans les comparaisons de modèles d'IA. À mesure que le magasin de données grandit, la coalition vise à étendre la prise en charge à davantage de références et à encourager une adoption plus large au sein de la communauté IA.