Data Jevals: tolok ukur independen untuk TypeSafe Jev
Data benchmark independen yang membandingkan Jev (model System One) dari TypeSafe AI dengan berbagai LLM dalam skor keputusan, akurasi, kalibrasi, biaya, dan latensi.
Tiga eksperimen terukur tentang halusinasi RAG: pemeriksaan kutipan, Jev dari TypeSafe dan STAIR dari IBM. 850+ pertanyaan dinilai, respons mentah disertakan.
仓库包含对TypeSafe AI Jev模型在RAG场景中的多项实测评估(幻觉抑制、重排序、路由、重试决策),提供详细报告与可复现数据,属于实质性测试研究。