Jev kontra modele generujące tekst
Jev nie generuje swobodnego tekstu. Film porównuje równoległe decyzje z generowaniem tekstu token po tokenie.

Taro L. Saito zauważa, że podobnie jak Jev, lokalny silnik LLM osiąga wnioskowanie w 40 ms, rezygnując z generowania tekstu/JSON i specjalizując się w ocenie, działając na DGX Spark.
Just like Jev, to think that a Local LLM engine capable of inference in 40ms is realized simply by abandoning text/json generation and specializing solely in judgment. It's running on DGX Spark, but anyway, it's incredibly fast.