Dados Jevals: benchmark independente para TypeSafe Jev
Dados de benchmark independentes comparando o Jev (modelo System One) da TypeSafe AI com vários LLMs em pontuação de decisão, precisão, calibração, custo e latência.
Código e dados brutos por trás do Lunar Terminal: bots de Robocode Tank Royale, GapFlap, um proxy de medição de tokens e um ensaio randomizado de 327 decisões do TypeSafe Jev.
仓库包含 JevTank、GapFlap、llm-meter 及 327 次随机决策试验,对 TypeSafe Jev 进行实测评估并提供原始日志。