stuntdouble:Jev 影子代理评测
一个零依赖 Node 代理,在转发请求到 TypeSafe Jev 的同时用本地模型(Kev、Laya)作影子决策,并生成是否可替换的评测报告。
OPEN SOURCE · CURATED REPOSITORIES
经过筛选的 Jev SDK、工具、演示、集成、评测与研究项目。仓库指标来自 GitHub,标题、摘要与分类由 Jev Guide 整理。
按 GitHub Stars 排名
按近期 Star 增量与更新活跃度排名
一个零依赖 Node 代理,在转发请求到 TypeSafe Jev 的同时用本地模型(Kev、Laya)作影子决策,并生成是否可替换的评测报告。
基于 CityFlow 的交通信号控制框架,通过同一仿真流程评估 TypeSafe Jev 和 OpenAI 兼容 LLM 控制器,并与规则和强化学习基线对比。
一个命令行工具,读取本地编码代理的会话日志,使用 TypeSafe AI 的 System One 模型 Jev 进行评分,并生成交互式 HTML 报告和终端仪表盘。
通过官方 SDK 调用 TypeSafe AI 的 Jev/System One 模型,对 24 个运营决策与 LLM 模拟基线进行实测对比,并提交可复现的运行结果与评估报告。
用于 TypeSafe Jev(System One)的 CLI/评估工具:在自有数据上测量阈值、校准置信度并检查漂移,可选 LLM 教师标签。内置无需密钥的演示模拟器,并集成 Jev API 实测。
对 TypeSafe AI 的 Jev 模型在西班牙语上的准确性、校准和 token 成本进行预注册审计,并提供 CLI 用于比较自己的标注数据。
TypeSafe Jev System One 模型的开源本地替代品,提供带校准置信度的类型化决策。包含与 Jev 及其他本地模型的跨系统基准测试。
关于RAG幻觉的三项实测实验:引用检查、TypeSafe的Jev和IBM的STAIR。包含850多个分级问题和原始响应。
Journey Evals 是一款评估工具,驱动真实浏览器或 LangGraph 智能体执行声明的用户旅程,并通过后端证据验证结果;其操作与元素选择使用 TypeSafe 的 Jev。
开源内容分析与 LLM 评判工具,使用 TypeSafe Jev / System One 的校准判断为帖子评分,并将其与实际互动数据对照检验。
Lunar Terminal 背后的代码与原始数据:Robocode Tank Royale 机器人、GapFlap、token 计量代理,以及针对 TypeSafe Jev 的 327 次随机决策试验。
用于 Claude Code、Codex 和 Cursor 的 agent 技能,可扫描代码库或想法,检查 Jev 的适用性与失败模式,估算成本/延迟,并通过 TypeSafe API 运行实时试点。