Back to GitHub projects

Jev-Test: Wstępnie zarejestrowany benchmark TypeSafe Jev jako modelu decyzyjnego

Wstępnie zarejestrowany benchmark sprawdzający, czy wyniki ufności TypeSafe Jev wiarygodnie decydują o wyszukiwaniu, dowodach i wsparciu cytatów dla lokalnego modelu 2B; zawiera harness, narzędzie audytowe i otwarte wyniki end-to-end.

仓库是预注册基准测试,明确使用 TypeSafe Jev 的 API 作为决策模型,包含 Jev 置信度评测、可运行 harness、审计工具和端到端结果,主题也包含 typesafe、jev、system-one。

· 1 starsOpen on GitHub