Jev能力迷宫测试补充
作者基于@karminski3的测试框架,补充测试了Jev在迷宫问题上的多组结果,并与随机游走和专业迷宫算法进行对照。
THE JEV GUIDE · CURATED EDITION
TypeSafe Jev 的发布、原理、演示与社区实践,按主题整理。每条内容都可回到 X 原帖核对。
人工精选 · 非全量收录 · 手动更新
01 / EXPLORE
0 表示待收录
作者基于@karminski3的测试框架,补充测试了Jev在迷宫问题上的多组结果,并与随机游走和专业迷宫算法进行对照。
作者在 Skills IL 中使用 TypeSafe 的新模型 Jev 构建了一个工具,用于检测通过短信、WhatsApp 或电子邮件收到的银行钓鱼消息。用户可以直接粘贴可疑消息内容进行验证。
有人构建了一个庞大的 Jev 相关目录,涵盖技能、代码仓库、X/Reddit 帖子、资源、网站等,并可按不同用例筛选。
作者建议,处理Jev的返回值时不应直接视为正确,而应关注confidence;对于Choice类型,应加入cannot_tell选项以避免误判。
作者认为Jev不适合用于AI生成内容检测,并提到所有AI检测工具都大同小异,除非准确率超过90%否则无意义,同时推荐了另一个API。 链接
作者尝试让Jev解数独,表示提示词有一定难度,但速度很快,并提到LLM解数独被认为困难。
帖主称 Jev 1.13 或许能在某些任务上取代大型语言模型。
作者rajeshsam提到,AI的势头似乎回到了传统数据科学,使用System 1分类器(如Jev)。他认为,通过类型化结构化响应和在Python中使用hooks进行确定性推理,胜过让模型猜测控制流,模糊性应保留在数据摄入边界。
社区多次复测显示,Jev在硬事实核查上与GPT-5.4基本持平(3.3个百分点差距,不显著),成本约为后者的五十分之一。 链接
开发者Tal Saiag分享了一种Jev使用模式:每次调用时故意留下少量状态,仅用于下一次Jev调用,并称之为“Jev carry state”。
用户分享使用 Jev 的实验发现:需要像 GPT-4 时代模型那样显式提示,成本非常低,并使用 Astra 进行了约8小时的调优。
Wildan 发推文称,是时候让 Claude 使用 TypeSafe AI 的 Jev 模型了。