Los resultados de evaluación de IA han estado dispersos durante mucho tiempo en artículos, tablas de clasificación y registros, lo que dificulta confiar en ellos o compararlos. Ahora, la Coalición EvalEval y Hugging Face están cerrando esa brecha. Lanzado en febrero de 2026, el proyecto EvalEval (EEE) introdujo un esquema JSON estandarizado para reportar resultados de evaluación. Community Evals de Hugging Face, también lanzado en febrero de 2026, descentraliza la forma en que aparecen las puntuaciones de referencia en el Hub. Juntos, proporcionan un sistema unificado para que usuarios, investigadores y responsables políticos verifiquen y comparen evaluaciones de modelos.

Los resultados de evaluación son críticos para medir las capacidades de los modelos, comparar modelos y evaluar la seguridad, pero a menudo varían enormemente. Por ejemplo, se ha reportado que LLaMA 65B obtiene tanto 63.7 como 48.8 en MMLU, dependiendo de quién ejecutó la prueba y cómo. Estas discrepancias provienen de configuraciones de evaluación no reportadas. EEE aborda esto definiendo un único esquema JSON que registra quién ejecutó la evaluación, qué modelo se usó, cómo se accedió a él, configuraciones de generación, definiciones de métricas y, opcionalmente, resultados por muestra en un archivo JSONL complementario.

Verified Evaluators on Eval Cards

El esquema, creado con aportes de investigadores y expertos en políticas, acepta resultados de cualquier fuente (registros de harness, extracciones de tablas de clasificación o cifras de artículos) y los convierte en un formato consistente. El repositorio de GitHub incluye convertidores, ejemplos y una guía para colaboradores. Desde su lanzamiento, el almacén de datos de EEE en Hugging Face ha crecido hasta aproximadamente 229,000 resultados de evaluación en más de 22,000 modelos y 2,200 puntos de referencia, extraídos de 31 formatos de reporte diferentes. Reproducir esas ejecuciones desde cero costaría cientos de miles de dólares, lo que subraya el valor de preservar estos datos.

Ahora, con una integración más profunda, los colaboradores pueden enviar resultados de EEE a Hugging Face Community Evals usando un convertidor que transforma los registros de EEE en los archivos YAML que Hugging Face espera. Esto elimina la necesidad de mantener resultados en dos formatos. Los evaluadores de primera parte que reportan sus propios modelos y los evaluadores de tercera parte que reportan sobre otros pueden enviar a ambos sistemas. Cuando se envían a través de la cuenta oficial de Hugging Face de una organización, los resultados reciben una marca de verificación verificada en EvalEval, lo que indica autenticidad.

Cómo funciona Hugging Face Community Evals con EvalEval

Hugging Face Community Evals opera en dos frentes. Primero, un punto de referencia reside en un repositorio de conjunto de datos registrado con un archivo eval.yaml, que recopila y muestra una tabla de clasificación de todas las puntuaciones reportadas. Segundo, las puntuaciones de un modelo residen en archivos .eval_results/*.yaml dentro del repositorio del modelo, aparecen en la tarjeta del modelo y alimentan la tabla de clasificación del punto de referencia. Las puntuaciones vienen con insignias que indican si son enviadas por el autor, por la comunidad o verificadas de forma independiente. Cualquier persona puede enviar una puntuación mediante una solicitud de extracción, y los autores del modelo pueden gestionar los resultados en sus repositorios.

Cuando un resultado se envía tanto a EEE como a Community Evals, aparece en la página del modelo de Hugging Face y en la tabla de clasificación del punto de referencia, con una insignia de origen que enlaza al registro completo de EEE. Ese registro incluye la configuración de generación, la versión del harness, notas de reproducibilidad y datos a nivel de instancia.

"Los dos destinos hacen trabajos diferentes hacia el mismo objetivo. Hugging Face coloca tu resultado donde la gente mira los modelos, con un enlace de vuelta a la fuente. EEE mantiene el registro estructurado completo que hace que el resultado sea interpretable y potencia las Eval Cards sobre él." — Coalición EvalEval

EvalEval as source on SmolLM2 Model Page

La compatibilidad cruzada significa que la misma evaluación aparece tanto en las tarjetas de modelo como en las Eval Cards, que combinan datos de ejecución de EEE con metadatos del punto de referencia y del modelo en un registro interpretable.

Cómo funciona

Hugging Face almacena las puntuaciones de evaluación en los repositorios de modelos como archivos YAML bajo .eval_results/. Los campos obligatorios incluyen el conjunto de datos de referencia, la tarea y el valor. Un bloque source crea un enlace de vuelta a EEE. Por ejemplo:

 - dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEval

El convertidor asigna los registros EEE existentes a estos campos: source_data.hf_repo a dataset.id, evaluation_name a task_id, score_details.score a value, y evaluation_timestamp a date. Actualmente admite cuatro puntos de referencia oficiales: MMLU-Pro, GPQA, HLE y GSM8K.

El convertidor hace más que remodelar datos. Descarga una colección del almacén de datos EEE, verifica los hashes de los objetos e identifica puntuaciones para los puntos de referencia compatibles. Antes de escribir algo, audita los archivos .eval_results YAML existentes en la rama principal del modelo y en las solicitudes de extracción abiertas, comparando por conjunto de datos y tarea. Las puntuaciones ya presentes se marcan como tales, los conflictos se señalan y los repositorios de modelos faltantes se anotan. Todo lo demás se marca como listo.

TUI of the Converter

No se envía nada sin la aprobación del usuario. La herramienta escribe vistas previas YAML locales y un archivo de revisión, muestra un informe de entradas listas y problemáticas, y solo abre solicitudes de extracción después de que el usuario escriba "OPEN PRS" e ingrese un mensaje de commit. Las reejecuciones reutilizan resultados en caché a menos que se pase --force.

Empieza aquí

Para comenzar, envía tus registros completos al almacén de datos EEE. Usar EEE solo requiere un paso adicional, que el convertidor automatiza en gran medida. La integración garantiza que los resultados de evaluación no solo sean visibles sino también interpretables, generando confianza en las comparaciones de modelos de IA. A medida que el almacén de datos crece, la coalición busca ampliar el soporte para más puntos de referencia y fomentar una adopción más amplia en la comunidad de IA.