Back to explore

Lokalny silnik LLM w stylu Jev: wnioskowanie w 40 ms tylko do oceny

Taro L. Saito zauważa, że podobnie jak Jev, lokalny silnik LLM osiąga wnioskowanie w 40 ms, rezygnując z generowania tekstu/JSON i specjalizując się w ocenie, działając na DGX Spark.

Just like Jev, to think that a Local LLM engine capable of inference in 40ms is realized simply by abandoning text/json generation and specializing solely in judgment. It's running on DGX Spark, but anyway, it's incredibly fast.

· 1,3 tys. likesOpen on X