Dati Jevals: benchmark indipendente per TypeSafe Jev
Dati di benchmark indipendenti che confrontano Jev (modello System One) di TypeSafe AI con vari LLM su punteggio di decisione, accuratezza, calibrazione, costo e latenza.
Codice e dati grezzi dietro Lunar Terminal: bot Robocode Tank Royale, GapFlap, un proxy di misurazione dei token e uno studio randomizzato di 327 decisioni su TypeSafe Jev.
仓库包含 JevTank、GapFlap、llm-meter 及 327 次随机决策试验,对 TypeSafe Jev 进行实测评估并提供原始日志。