Kết quả đánh giá AI từ lâu đã nằm rải rác trong các bài báo, bảng xếp hạng và nhật ký, khiến việc tin tưởng hay so sánh chúng trở nên khó khăn. Giờ đây, Liên minh EvalEval và Hugging Face đang thu hẹp khoảng cách đó. Ra mắt vào tháng 2 năm 2026, dự án EvalEval (EEE) đã giới thiệu một lược đồ JSON chuẩn hóa để báo cáo kết quả đánh giá. Hugging Face Community Evals, cũng ra mắt vào tháng 2 năm 2026, phân quyền cách các điểm chuẩn xuất hiện trên Hub. Cùng nhau, chúng cung cấp một hệ thống thống nhất để người dùng, nhà nghiên cứu và nhà hoạch định chính sách xác minh và so sánh các đánh giá mô hình.
Kết quả đánh giá rất quan trọng để đo lường khả năng của mô hình, so sánh các mô hình và đánh giá độ an toàn, nhưng chúng thường khác nhau rất nhiều. Ví dụ, LLaMA 65B đã được báo cáo ở cả 63,7 và 48,8 trên MMLU, tùy thuộc vào ai chạy thử nghiệm và cách thức thực hiện. Những khác biệt này bắt nguồn từ các cài đặt đánh giá không được báo cáo. EEE giải quyết vấn đề này bằng cách xác định một lược đồ JSON duy nhất ghi lại ai đã chạy đánh giá, mô hình nào được sử dụng, cách truy cập, cài đặt sinh, định nghĩa chỉ số và tùy chọn đầu ra theo từng mẫu trong một tệp JSONL đi kèm.

Lược đồ, được xây dựng với sự đóng góp từ các nhà nghiên cứu và chuyên gia chính sách, chấp nhận kết quả từ bất kỳ nguồn nào—nhật ký harness, dữ liệu quét bảng xếp hạng hoặc số liệu từ bài báo—và chuyển đổi chúng thành một định dạng nhất quán. Kho lưu trữ GitHub bao gồm các bộ chuyển đổi, ví dụ và hướng dẫn cho người đóng góp. Kể từ khi ra mắt, kho dữ liệu EEE trên Hugging Face đã phát triển lên khoảng 229.000 kết quả đánh giá trên hơn 22.000 mô hình và 2.200 điểm chuẩn, được trích xuất từ 31 định dạng báo cáo khác nhau. Việc tái tạo các lần chạy đó từ đầu sẽ tốn hàng trăm nghìn đô la, nhấn mạnh giá trị của việc bảo tồn dữ liệu này.
Giờ đây, với sự tích hợp sâu hơn, người đóng góp có thể gửi kết quả EEE đến Hugging Face Community Evals bằng cách sử dụng một bộ chuyển đổi biến đổi các bản ghi EEE thành các tệp YAML mà Hugging Face yêu cầu. Điều này loại bỏ nhu cầu duy trì kết quả ở hai định dạng. Các nhà đánh giá bên thứ nhất báo cáo mô hình của chính họ và các nhà đánh giá bên thứ ba báo cáo về mô hình của người khác đều có thể gửi đến cả hai hệ thống. Khi được gửi qua tài khoản Hugging Face chính thức của một tổ chức, kết quả sẽ nhận được dấu kiểm đã xác minh trên EvalEval, báo hiệu tính xác thực.
Cách Hugging Face Community Evals hoạt động với EvalEval
Hugging Face Community Evals hoạt động trên hai mặt trận. Đầu tiên, một điểm chuẩn nằm trong kho dữ liệu tập dữ liệu đã đăng ký với tệp eval.yaml, thu thập và hiển thị bảng xếp hạng của tất cả điểm số được báo cáo. Thứ hai, điểm số của một mô hình nằm trong các tệp .eval_results/*.yaml trong kho mô hình, xuất hiện trên thẻ mô hình và đưa vào bảng xếp hạng điểm chuẩn. Điểm số đi kèm với huy hiệu cho biết chúng do tác giả gửi, cộng đồng gửi hay được xác minh độc lập. Bất kỳ ai cũng có thể gửi điểm số qua yêu cầu kéo (pull request) và tác giả mô hình có thể quản lý kết quả trên kho của họ.
Khi một kết quả được gửi đến cả EEE và Community Evals, nó sẽ xuất hiện trên trang mô hình Hugging Face và bảng xếp hạng điểm chuẩn, mang huy hiệu nguồn liên kết trở lại bản ghi EEE đầy đủ. Bản ghi đó bao gồm cấu hình sinh, phiên bản harness, ghi chú về khả năng tái tạo và dữ liệu cấp độ mẫu.
"Hai điểm đến thực hiện các công việc khác nhau hướng tới cùng một mục tiêu. Hugging Face đặt kết quả của bạn nơi mọi người xem xét các mô hình, với một liên kết trở lại nguồn. EEE giữ bản ghi có cấu trúc đầy đủ giúp kết quả có thể diễn giải được và hỗ trợ Thẻ Đánh giá (Eval Cards) trên nền tảng đó." — Liên minh EvalEval

Tính tương thích chéo có nghĩa là cùng một đánh giá xuất hiện cả trên thẻ mô hình và trong Thẻ Đánh giá, kết hợp dữ liệu chạy EEE với siêu dữ liệu điểm chuẩn và mô hình thành một bản ghi có thể diễn giải được.
Cách thức hoạt động
Hugging Face lưu trữ điểm đánh giá trong các kho mô hình dưới dạng tệp YAML trong .eval_results/. Các trường bắt buộc bao gồm tập dữ liệu điểm chuẩn, tác vụ và giá trị. Một khối nguồn tạo liên kết ngược đến EEE. Ví dụ:
- dataset: id: openai/gsm8k task_id: gsm8k value: 96.8 date: '2024-07-16' notes: '8-shot CoT' source: url: https://huggingface.co/datasets/evaleval/EEE_datastore/blob/main/flat/objects/<xx>/<yy>/<uuid>.json name: EvalEvalBộ chuyển đổi ánh xạ các bản ghi EEE hiện có vào các trường này: source_data.hf_repo vào dataset.id, evaluation_name vào task_id, score_details.score vào value và evaluation_timestamp vào date. Hiện tại, nó hỗ trợ bốn điểm chuẩn chính thức: MMLU-Pro, GPQA, HLE và GSM8K.
Bộ chuyển đổi làm nhiều hơn là chỉ định hình lại dữ liệu. Nó tải xuống một bộ sưu tập kho dữ liệu EEE, kiểm tra hàm băm đối tượng và xác định điểm số cho các điểm chuẩn được hỗ trợ. Trước khi ghi bất cứ điều gì, nó kiểm tra các tệp .eval_results YAML hiện có trên nhánh chính của mô hình và trong các PR đang mở, so sánh theo tập dữ liệu và tác vụ. Các điểm số đã có được đánh dấu như vậy, xung đột được gắn cờ và các kho mô hình bị thiếu được ghi chú. Mọi thứ khác được đánh dấu là sẵn sàng.

Không có gì được đẩy lên nếu không có sự chấp thuận của người dùng. Công cụ ghi các bản xem trước YAML cục bộ và một tệp đánh giá, hiển thị báo cáo về các mục sẵn sàng và có vấn đề, và chỉ mở PR sau khi người dùng gõ "OPEN PRS" và nhập thông điệp commit. Các lần chạy lại sử dụng lại kết quả đã lưu trong bộ nhớ đệm trừ khi có cờ --force.
Bắt đầu từ đây
Để bắt đầu, hãy gửi các bản ghi đầy đủ của bạn vào kho dữ liệu EEE. Sử dụng EEE chỉ yêu cầu một bước bổ sung, mà bộ chuyển đổi phần lớn tự động hóa. Sự tích hợp đảm bảo rằng kết quả đánh giá không chỉ hiển thị mà còn có thể diễn giải được, xây dựng niềm tin vào các so sánh mô hình AI. Khi kho dữ liệu phát triển, liên minh đặt mục tiêu mở rộng hỗ trợ cho nhiều điểm chuẩn hơn và khuyến khích việc áp dụng rộng rãi hơn trong cộng đồng AI.



