Blog teknis Jev dan akses awal
Akhir thread peluncuran Diogo menautkan blog teknis resmi dan pintu masuk akses awal untuk bacaan lanjutan.
Prototipe JEV multimodal yang dilatih pada CUB-200-2011 dengan backbone Qwen2.5-VL, menjawab pertanyaan gambar dengan probabilitas opsi dan kotak pembatas sekitar 0,4 detik per gambar.
Built a multimodal JEV prototype that answers image questions with option probabilities and bounding boxes. Trained on CUB-200-2011 with Qwen2.5-VL backbone (0.4s/image) https://github.com/tin-xai/multimodal-jev-grounding…