Datos de Jevals: benchmark independiente para TypeSafe Jev
Datos de referencia independientes que comparan Jev (modelo System One) de TypeSafe AI con varios LLM en puntuación de decisión, precisión, calibración, costo y latencia.
Tres experimentos medidos sobre alucinación en RAG: verificación de citas, Jev de TypeSafe y STAIR de IBM. Más de 850 preguntas calificadas, respuestas crudas incluidas.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。