Jevals-Daten: unabhängiger Benchmark für TypeSafe Jev
Unabhängige Benchmark-Daten, die TypeSafe AIs Jev (System One Modell) mit mehreren LLMs in Entscheidungs-Score, Genauigkeit, Kalibrierung, Kosten und Latenz vergleichen.
Drei gemessene Experimente zur Halluzination in RAG: Zitatprüfung, TypeSafes Jev und IBMs STAIR. Über 850 bewertete Fragen, rohe Antworten enthalten.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。