返回探索

Jev 安全问卷响应分类评估与调优

该帖讨论了Jev模型在安全问卷响应分类(已实施/不适用/未实施)中的表现,与Claude对比,指出Jev需要调优以获得更准确的结果。

#Jev security questionnaire response categorization (implemented, N/A, not implemented) given the question+response then a ground truth eval. - Claude initially performed better with little direction - Jev questions needed tuning to provide a more accurate response. Once tuned,

Jev 安全问卷响应分类评估与调优 1
· 0 次赞在 X 打开