Дані Jevals: незалежний бенчмарк для TypeSafe Jev
Незалежні бенчмарк-дані, що порівнюють Jev (модель System One) від TypeSafe AI з різними LLM за показниками рішення, точності, калібрування, вартості та затримки.
Три виміряні експерименти щодо галюцинацій у RAG: перевірка цитат, Jev від TypeSafe та STAIR від IBM. Понад 850 оцінених запитань, необроблені відповіді включено.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。