Данные Jevals: независимый бенчмарк для TypeSafe Jev
Независимые бенчмарк-данные, сравнивающие Jev (модель System One) от TypeSafe AI с несколькими LLM по показателям решения, точности, калибровке, стоимости и задержке.
Три измеренных эксперимента по галлюцинациям в RAG: проверка цитат, Jev от TypeSafe и STAIR от IBM. Более 850 оцененных вопросов, необработанные ответы включены.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。