Yapay zeka değerlendirme sonuçları uzun süredir makaleler, lider tabloları ve günlükler arasında dağınık haldeydi; bu da onlara güvenmeyi veya karşılaştırmayı zorlaştırıyordu. Şimdi, EvalEval Koalisyonu ve Hugging Face bu boşluğu kapatıyor. Şubat 2026'da başlatılan EvalEval projesi (EEE), değerlendirme sonuçlarını raporlamak için standart bir JSON şeması sundu. Yine Şubat 2026'da başlatılan Hugging Face Topluluk Değerlendirmeleri, benchmark puanlarının Hub'da görünme şeklini merkeziyetsizleştiriyor. Birlikte, kullanıcılar, araştırmacılar ve politika yapıcılar için model değerlendirmelerini doğrulamak ve karşılaştırmak üzere birleşik bir sistem sağlıyorlar.
Değerlendirme sonuçları, model yeteneklerini ölçmek, modelleri karşılaştırmak ve güvenliği değerlendirmek için kritik öneme sahiptir, ancak genellikle büyük farklılıklar gösterir. Örneğin, LLaMA 65B için MMLU'da hem %63,7 hem de %48,8 raporlanmıştır; bu, testi kimin ve nasıl yaptığına bağlıdır. Bu tutarsızlıklar, raporlanmayan değerlendirme ayarlarından kaynaklanır. EEE, bunu, değerlendirmeyi kimin yaptığını, hangi modelin kullanıldığını, modele nasıl erişildiğini, üretim ayarlarını, metrik tanımlarını ve isteğe bağlı olarak örnek başına çıktıları bir yardımcı JSONL dosyasında kaydeden tek bir JSON şeması tanımlayarak ele alır.

Araştırmacılar ve politika uzmanlarının katkılarıyla oluşturulan şema, herhangi bir kaynaktan (harness günlükleri, lider tablosu kazımaları veya makale sayıları) gelen sonuçları kabul eder ve bunları tutarlı bir formata dönüştürür. GitHub deposu dönüştürücüler, örnekler ve bir katkıda bulunan kılavuzu içerir. Lansmanından bu yana, Hugging Face'deki EEE veri deposu, 31 farklı raporlama formatından alınan 22.000'den fazla model ve 2.200 benchmark üzerinde yaklaşık 229.000 değerlendirme sonucuna ulaştı. Bu çalışmaları sıfırdan yeniden üretmek yüz binlerce dolara mal olurdu; bu da bu verileri korumanın değerini vurguluyor.
Artık daha derin entegrasyonla, katkıda bulunanlar, EEE kayıtlarını Hugging Face'in beklediği YAML dosyalarına dönüştüren bir dönüştürücü kullanarak EEE sonuçlarını Hugging Face Topluluk Değerlendirmelerine gönderebilir. Bu, sonuçları iki formatta tutma ihtiyacını ortadan kaldırır. Kendi modellerini raporlayan birinci taraf değerlendiriciler ve başkalarının modellerini raporlayan üçüncü taraf değerlendiriciler her iki sisteme de gönderim yapabilir. Bir kuruluşun resmi Hugging Face hesabı üzerinden gönderildiğinde, sonuçlar EvalEval'de doğrulanmış bir onay işareti alır ve bu da özgünlüğü belirtir.
Hugging Face Topluluk Değerlendirmeleri EvalEval ile Nasıl Çalışır
Hugging Face Topluluk Değerlendirmeleri iki cephede çalışır. İlk olarak, bir benchmark, raporlanan tüm puanların bir lider tablosunu toplayan ve görüntüleyen bir eval.yaml dosyasıyla kayıtlı bir veri kümesi deposunda yaşar. İkinci olarak, bir modelin puanları, model deposundaki .eval_results/*.yaml dosyalarında bulunur, model kartında görünür ve benchmark lider tablosunu besler. Puanlar, yazar tarafından gönderilmiş, topluluk tarafından gönderilmiş veya bağımsız olarak doğrulanmış olduklarını belirten rozetlerle gelir. Herkes bir çekme isteğiyle puan gönderebilir ve model yazarları kendi depolarındaki sonuçları yönetebilir.
Bir sonuç hem EEE'ye hem de Topluluk Değerlendirmelerine gönderildiğinde, Hugging Face model sayfasında ve benchmark lider tablosunda görünür ve tam EEE kaydına geri bağlantı veren bir kaynak rozeti taşır. Bu kayıt, üretim yapılandırması, harness sürümü, tekrarlanabilirlik notları ve örnek düzeyinde verileri içerir.
"İki hedef aynı amaca yönelik farklı işler yapar. Hugging Face, sonucunuzu insanların modellere baktığı yere, kaynağa geri bağlantıyla koyar. EEE, sonucu yorumlanabilir kılan tam yapılandırılmış kaydı tutar ve bunun üzerine Değerlendirme Kartlarını güçlendirir." — EvalEval Koalisyonu

Çapraz uyumluluk, aynı değerlendirmenin hem model kartlarında hem de EEE çalışma verilerini benchmark ve model meta verileriyle birleştirerek yorumlanabilir bir kayıt oluşturan Değerlendirme Kartlarında görünmesi anlamına gelir.
Nasıl Çalışır
Hugging Face, değerlendirme puanlarını model depolarında .eval_results/ altında YAML dosyaları olarak saklar. Zorunlu alanlar benchmark veri kümesi, görev ve değeri içerir. Bir kaynak bloğu EEE'ye geri bağlantı oluşturur. Örneğin:
- dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEvalDönüştürücü, mevcut EEE kayıtlarını şu alanlarla eşler: source_data.hf_repo -> dataset.id, evaluation_name -> task_id, score_details.score -> value ve evaluation_timestamp -> date. Şu anda dört resmi benchmark'ı desteklemektedir: MMLU-Pro, GPQA, HLE ve GSM8K.
Dönüştürücü, yalnızca veriyi yeniden şekillendirmekten fazlasını yapar. Bir EEE veri deposu koleksiyonunu indirir, nesne karmalarını kontrol eder ve desteklenen benchmark'lar için puanları belirler. Herhangi bir şey yazmadan önce, modelin ana dalındaki ve açık çekme isteklerindeki mevcut .eval_results YAML dosyalarını denetler ve bunları veri kümesi ve göreve göre karşılaştırır. Halihazırda mevcut olan puanlar bu şekilde işaretlenir, çakışmalar belirtilir ve eksik model depoları not edilir. Diğer her şey hazır olarak işaretlenir.

Kullanıcı onayı olmadan hiçbir şey itilmez. Araç, yerel YAML önizlemeleri ve bir inceleme dosyası yazar, hazır ve sorunlu girişlerin bir raporunu gösterir ve yalnızca kullanıcı "OPEN PRS" yazıp bir taahhüt mesajı girdikten sonra çekme istekleri açar. --force geçilmediği sürece yeniden çalıştırmalar önbelleğe alınmış sonuçları yeniden kullanır.
Buradan Başlayın
Başlamak için, tam kayıtlarınızı EEE veri deposuna gönderin. EEE kullanmak, dönüştürücünün büyük ölçüde otomatikleştirdiği yalnızca bir ek adım gerektirir. Entegrasyon, değerlendirme sonuçlarının yalnızca görünür değil aynı zamanda yorumlanabilir olmasını sağlayarak yapay zeka model karşılaştırmalarında güven oluşturur. Veri deposu büyüdükçe, koalisyon daha fazla benchmark için desteği genişletmeyi ve yapay zeka topluluğu genelinde daha geniş benimsemeyi teşvik etmeyi hedefliyor.



