Back to explore

Мультимодальный прототип JEV: вопросы по изображениям с ограничивающими рамками

Мультимодальный прототип JEV, обученный на CUB-200-2011 с backbone Qwen2.5-VL, отвечает на вопросы по изображениям с вероятностями вариантов и ограничивающими рамками за ~0,4 с на изображение.

Built a multimodal JEV prototype that answers image questions with option probabilities and bounding boxes. Trained on CUB-200-2011 with Qwen2.5-VL backbone (0.4s/image) https://github.com/tin-xai/multimodal-jev-grounding…

· 0 likesOpen on X