Back to explore

Lokale LLM-engine in Jev-stijl: oordeel-inferentie in 40 ms

Taro L. Saito merkt op dat, net als Jev, een lokale LLM-engine 40 ms inferentie bereikt door tekst-/JSON-generatie op te geven en zich op oordelen te richten, op DGX Spark.

Just like Jev, to think that a Local LLM engine capable of inference in 40ms is realized simply by abandoning text/json generation and specializing solely in judgment. It's running on DGX Spark, but anyway, it's incredibly fast.

· 1,3K likesOpen on X