Dati Jevals: benchmark indipendente per TypeSafe Jev
Dati di benchmark indipendenti che confrontano Jev (modello System One) di TypeSafe AI con vari LLM su punteggio di decisione, accuratezza, calibrazione, costo e latenza.
Questo repository è una riproduzione aperta del modello Jev di TypeSafe AI, che fornisce un motore decisionale tipizzato non autoregressivo con 150M parametri. Raggiunge un'accuratezza di 0,697 sul benchmark typed-decisions (Jev: 0,727), con migliore calibrazione, e può essere addestrato gratuitamente su Colab.
该仓库明确复现 TypeSafe AI 的 Jev 模型,包含完整代码、训练与评估流程,并在 typed-decisions 基准上与 Jev 对比,属于深入研究/复现项目。