Données Jevals : benchmark indépendant pour TypeSafe Jev
Données de référence indépendantes comparant Jev (modèle System One) de TypeSafe AI à plusieurs LLM sur le score de décision, la précision, la calibration, le coût et la latence.
Trois expériences mesurées sur l'hallucination en RAG : vérification des citations, Jev de TypeSafe et STAIR d'IBM. Plus de 850 questions notées, réponses brutes incluses.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。