Back to explore

Nguyên mẫu JEV đa phương thức: hỏi đáp hình ảnh với hộp giới hạn

Nguyên mẫu JEV đa phương thức được huấn luyện trên CUB-200-2011 với backbone Qwen2.5-VL, trả lời câu hỏi hình ảnh với xác suất lựa chọn và hộp giới hạn khoảng 0,4 giây mỗi ảnh.

Built a multimodal JEV prototype that answers image questions with option probabilities and bounding boxes. Trained on CUB-200-2011 with Qwen2.5-VL backbone (0.4s/image) https://github.com/tin-xai/multimodal-jev-grounding…

· 0 likesOpen on X