Back to explore

Mesin LLM lokal gaya Jev: inferensi 40ms khusus penilaian

Taro L. Saito mencatat bahwa, seperti Jev, mesin LLM lokal mencapai inferensi 40ms dengan meninggalkan pembuatan teks/JSON dan mengkhususkan diri pada penilaian, berjalan di DGX Spark.

Just like Jev, to think that a Local LLM engine capable of inference in 40ms is realized simply by abandoning text/json generation and specializing solely in judgment. It's running on DGX Spark, but anyway, it's incredibly fast.

· 1,3 rb likesOpen on X