Os resultados de avaliação de IA há muito estão espalhados por artigos, rankings e logs, dificultando a confiança ou comparação. Agora, a Coalizão EvalEval e a Hugging Face estão fechando essa lacuna. Lançado em fevereiro de 2026, o projeto EvalEval (EEE) introduziu um esquema JSON padronizado para relatar resultados de avaliação. O Community Evals da Hugging Face, também lançado em fevereiro de 2026, descentraliza como as pontuações de benchmark aparecem no Hub. Juntos, eles fornecem um sistema unificado para usuários, pesquisadores e formuladores de políticas verificarem e compararem avaliações de modelos.
Os resultados de avaliação são críticos para medir capacidades de modelos, comparar modelos e avaliar segurança, mas muitas vezes variam enormemente. Por exemplo, o LLaMA 65B foi relatado tanto como 63,7 quanto 48,8 no MMLU, dependendo de quem executou o teste e como. Essas discrepâncias decorrem de configurações de avaliação não relatadas. O EEE aborda isso definindo um único esquema JSON que registra quem executou a avaliação, qual modelo foi usado, como foi acessado, configurações de geração, definições de métricas e, opcionalmente, saídas por amostra em um arquivo JSONL complementar.

O esquema, construído com contribuições de pesquisadores e especialistas em políticas, aceita resultados de qualquer fonte—logs de harness, raspagens de rankings ou números de artigos—e os converte em um formato consistente. O repositório GitHub inclui conversores, exemplos e um guia para contribuidores. Desde seu lançamento, o armazenamento de dados EEE no Hugging Face cresceu para aproximadamente 229.000 resultados de avaliação em mais de 22.000 modelos e 2.200 benchmarks, extraídos de 31 formatos de relato diferentes. Reproduzir essas execuções do zero custaria centenas de milhares de dólares, destacando o valor de preservar esses dados.
Agora, com integração mais profunda, contribuidores podem enviar resultados EEE para o Hugging Face Community Evals usando um conversor que transforma registros EEE nos arquivos YAML que a Hugging Face espera. Isso elimina a necessidade de manter resultados em dois formatos. Avaliadores de primeira parte relatando seus próprios modelos e avaliadores de terceira parte relatando sobre outros podem enviar para ambos os sistemas. Quando enviados por meio de uma conta oficial da Hugging Face de uma organização, os resultados recebem uma marca de verificação no EvalEval, sinalizando autenticidade.
Como o Hugging Face Community Evals Funciona com o EvalEval
O Hugging Face Community Evals opera em duas frentes. Primeiro, um benchmark vive em um repositório de dataset registrado com um arquivo eval.yaml, que coleta e exibe um ranking de todas as pontuações relatadas. Segundo, as pontuações de um modelo residem em arquivos .eval_results/*.yaml dentro do repositório do modelo, aparecendo no cartão do modelo e alimentando o ranking do benchmark. As pontuações vêm com selos indicando se são enviadas pelo autor, pela comunidade ou verificadas independentemente. Qualquer pessoa pode enviar uma pontuação por meio de um pull request, e os autores do modelo podem gerenciar resultados em seus repositórios.
Quando um resultado é enviado tanto para o EEE quanto para o Community Evals, ele aparece na página do modelo no Hugging Face e no ranking do benchmark, carregando um selo de origem que linka de volta ao registro completo do EEE. Esse registro inclui configuração de geração, versão do harness, notas de reprodutibilidade e dados no nível de instância.
"Os dois destinos fazem trabalhos diferentes para o mesmo objetivo. A Hugging Face coloca seu resultado onde as pessoas olham para modelos, com um link de volta à fonte. O EEE mantém o registro estruturado completo que torna o resultado interpretável e alimenta os Eval Cards sobre ele." — Coalizão EvalEval

A compatibilidade cruzada significa que a mesma avaliação aparece tanto nos cartões de modelo quanto nos Eval Cards, que combinam dados de execução do EEE com metadados de benchmark e modelo em um registro interpretável.
Como Funciona
A Hugging Face armazena pontuações de avaliação em repositórios de modelo como arquivos YAML sob .eval_results/. Campos obrigatórios incluem o dataset do benchmark, a tarefa e o valor. Um bloco de origem cria um backlink para o EEE. Por exemplo:
- dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEvalO conversor mapeia registros EEE existentes para esses campos: source_data.hf_repo para dataset.id, evaluation_name para task_id, score_details.score para value e evaluation_timestamp para date. Atualmente, ele suporta quatro benchmarks oficiais: MMLU-Pro, GPQA, HLE e GSM8K.
O conversor faz mais do que remodelar dados. Ele baixa uma coleção do armazenamento de dados EEE, verifica hashes de objetos e identifica pontuações para benchmarks suportados. Antes de escrever qualquer coisa, ele audita arquivos .eval_results YAML existentes no branch principal do modelo e em PRs abertos, comparando por dataset e tarefa. Pontuações já presentes são marcadas como tal, conflitos são sinalizados e repositórios de modelo ausentes são anotados. Todo o resto é marcado como pronto.

Nada é enviado sem aprovação do usuário. A ferramenta escreve prévias YAML locais e um arquivo de revisão, mostra um relatório de entradas prontas e problemáticas, e só abre PRs após o usuário digitar "OPEN PRS" e inserir uma mensagem de commit. Reexecuções reutilizam resultados em cache, a menos que --force seja passado.
Comece Aqui
Para começar, envie seus registros completos para o armazenamento de dados EEE. Usar o EEE requer apenas uma etapa adicional, que o conversor automatiza em grande parte. A integração garante que os resultados de avaliação não sejam apenas visíveis, mas também interpretáveis, construindo confiança nas comparações de modelos de IA. À medida que o armazenamento de dados cresce, a coalizão pretende expandir o suporte para mais benchmarks e incentivar uma adoção mais ampla na comunidade de IA.



