Jevals 데이터: TypeSafe Jev 독립 벤치마크
TypeSafe AI의 Jev(System One 모델)와 여러 LLM을 결정 점수, 정확도, 보정, 비용, 지연 시간 측면에서 비교하는 독립적인 벤치마크 데이터입니다.
100CC-BY-4.0
RAG 환각에 대한 세 가지 측정 실험: 인용 확인, TypeSafe의 Jev, IBM의 STAIR. 850개 이상의 등급별 질문과 원시 응답 포함.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。