Back to explore

Бенчмарки Jev: оцінка точності та калібрування

Оцінка Jev і дев'яти відкритих чекпойнтів на 22 завданнях показує, що Jev лідирує за макроточністю, але відкрита модель 4B дає краще відкалібровані ймовірності; jev-bench повністю відкритий.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X