Data Jevals: tolok ukur independen untuk TypeSafe Jev
Data benchmark independen yang membandingkan Jev (model System One) dari TypeSafe AI dengan berbagai LLM dalam skor keputusan, akurasi, kalibrasi, biaya, dan latensi.
Repositori ini adalah reproduksi terbuka dari model Jev TypeSafe AI, menyediakan mesin keputusan bertipe non-autoregresif dengan 150M parameter. Mencapai akurasi 0,697 pada benchmark typed-decisions (Jev: 0,727), dengan kalibrasi lebih baik, dan dapat dilatih gratis di Colab.
该仓库明确复现 TypeSafe AI 的 Jev 模型,包含完整代码、训练与评估流程,并在 typed-decisions 基准上与 Jev 对比,属于深入研究/复现项目。