Back to explore

Đánh giá Jev: So sánh độ chính xác và hiệu chuẩn

Đánh giá Jev và chín checkpoint mở trên 22 tác vụ cho thấy Jev dẫn đầu về độ chính xác macro, nhưng một mô hình 4B mở tạo ra xác suất được hiệu chuẩn tốt hơn; jev-bench hoàn toàn mở.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X