Back to explore

معايير Jev: تقييم الدقة مقابل المعايرة

أظهر تقييم Jev وتسع نقاط تحقق مفتوحة عبر 22 مهمة أن Jev يتقدم في الدقة الكلية، لكن نموذجًا مفتوحًا بحجم 4B ينتج احتمالات أفضل معايرة؛ وjev-bench مفتوح بالكامل.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X