Jev、メール分類ベンチマークでGeminiに敗れるも実運用を検討
著者は、産業サプライヤーからのドイツ語・英語のビジネスメール1,565通を10カテゴリで分類するベンチマークでJevをテストし、Geminiより精度が低いものの、誤りの傾向に関心を持ち、実運用を検討している。
Fatih Yildiz氏は、TypeSafe AIのJevが可観測性意思決定モデルのユースケースで有望だと述べ、edge_deltaでフロンティアモデルを使った運用優先度スコアリングやイベントルーティングでは遅延が蓄積するため、Jevをテスト中と説明。
#Jev from @typesafeai looks very promising for Observability Decision Model use cases. At @edge_delta , we use frontier models for operational priority scoring, routing events, identifying recurring issues, and similar decisions. Latency adds up. I tested Jev on our