Dados Jevals: benchmark independente para TypeSafe Jev
Dados de benchmark independentes comparando o Jev (modelo System One) da TypeSafe AI com vários LLMs em pontuação de decisão, precisão, calibração, custo e latência.
AnyJev é uma biblioteca de pesquisa aberta que transforma qualquer LLM aberto em um modelo de decisão estilo Jev, com decisões tipadas, probabilidades calibradas, calibração L0/L1 sem treinamento e comparações de benchmark com Jev.
该仓库是一个实质性的研究项目,实现并评测了Jev风格的决策模型(AnyJev),将任意LLM转换为带类型化决策和可靠概率的模型,并与TypeSafe AI的Jev结果进行对比,属于深入研究Jev/System One思路的技术资源。