Back to explore

Jev가 음성 에이전트 턴을 약 100ms로 라우팅

개발자 공유: 4090에서 Qwen3를 실행하는 음성 에이전트는 매 턴 수 초를 기다렸지만, Jev로 선택/참거짓/점수 결정을 처리하자 각 턴을 약 100ms로 라우팅하고 추론이 정말 필요할 때만 GPU를 사용한다.

Our voice agent runs Qwen3 on a 4090. Every turn waits seconds. Jev can't talk. It only decides: choice, true/false, score. Now Jev routes each turn in ~100ms. The GPU only fires when reasoning is truly needed. We spent months making inference faster. The fix: infer less.

Jev가 음성 에이전트 턴을 약 100ms로 라우팅 1
· 0 likesOpen on X