Jevals データ: TypeSafe Jev の独立ベンチマーク
TypeSafe AI の Jev(System One モデル)と複数の LLM を、判定タスクにおける決定スコア、精度、キャリブレーション、コスト、遅延で比較する独立したベンチマークデータ。
100CC-BY-4.0
RAG幻覚に関する3つの測定実験:引用チェック、TypeSafeのJev、IBMのSTAIR。850以上のグレード付き質問と生の応答を含む。
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。