Jev 在邮件分类基准测试中不敌 Gemini,但仍考虑投产
作者在 1,565 封德语和英语工业供应商商务邮件的 10 类分类基准上测试了 Jev,发现其准确率不及 Gemini,但更关注错误出现的模式,并仍有意将其投入生产。
帖子指出 Jev 适合路由、分诊和护栏等快速有界决策,但仅靠校准概率无法满足企业可解释性,仍需上下文、证据、策略、血缘和审计轨迹。
Jev is compelling for fast, bounded decisions such as routing, triage and guardrails. But calibrated probabilities alone do not provide enterprise explainability; decisions still need context, evidence, policy, lineage and an audit trail. For the reference sake: This is where