Back to explore

การประเมินและการปรับแต่งการจัดหมวดหมู่การตอบแบบสอบถามความปลอดภัยของ Jev

โพสต์นี้กล่าวถึงประสิทธิภาพของ Jev ในการจัดหมวดหมู่การตอบแบบสอบถามความปลอดภัย (นำไปใช้แล้ว, N/A, ยังไม่ได้นำไปใช้) เทียบกับ Claude โดยสังเกตว่า Jev จำเป็นต้องปรับแต่งเพื่อให้ได้ผลลัพธ์ที่แม่นยำยิ่งขึ้น

#Jev security questionnaire response categorization (implemented, N/A, not implemented) given the question+response then a ground truth eval. - Claude initially performed better with little direction - Jev questions needed tuning to provide a more accurate response. Once tuned,

การประเมินและการปรับแต่งการจัดหมวดหมู่การตอบแบบสอบถามความปลอดภัยของ Jev 1
· 0 likesOpen on X