Jev 在邮件分类基准测试中不敌 Gemini,但仍考虑投产
作者在 1,565 封德语和英语工业供应商商务邮件的 10 类分类基准上测试了 Jev,发现其准确率不及 Gemini,但更关注错误出现的模式,并仍有意将其投入生产。
Fatih Yildiz 表示 TypeSafe AI 的 Jev 在可观测性决策模型用例中很有前景,并提到在 edge_delta 使用前沿模型进行运营优先级评分、事件路由等决策时延迟累积,正在测试 Jev。
#Jev from @typesafeai looks very promising for Observability Decision Model use cases. At @edge_delta , we use frontier models for operational priority scoring, routing events, identifying recurring issues, and similar decisions. Latency adds up. I tested Jev on our