Jev проти моделей генерації тексту
Jev не генерує довільний текст. Порівняльне відео показує різницю між паралельним ухваленням рішень і генерацією тексту токен за токеном.

Taro L. Saito зазначає, що, як і Jev, локальний LLM-рушій досягає висновку за 40 мс, відмовившись від генерації тексту/JSON і спеціалізуючись на судженні, працюючи на DGX Spark.
Just like Jev, to think that a Local LLM engine capable of inference in 40ms is realized simply by abandoning text/json generation and specializing solely in judgment. It's running on DGX Spark, but anyway, it's incredibly fast.