Dữ liệu Jevals: điểm chuẩn độc lập cho TypeSafe Jev
Dữ liệu benchmark độc lập so sánh Jev (mô hình System One) của TypeSafe AI với nhiều LLM về điểm quyết định, độ chính xác, hiệu chỉnh, chi phí và độ trễ.
Ba thí nghiệm đo lường về ảo giác RAG: kiểm tra trích dẫn, Jev của TypeSafe và STAIR của IBM. Hơn 850 câu hỏi được chấm điểm, phản hồi thô được bao gồm.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。