Back to explore

Donner des yeux à Jev : OCR local d'abord, puis transmission

Discussion sur un modèle pour donner la vision à Jev dans la conception d'agents : au lieu d'intégrer la vision directement dans un modèle de décision, exécuter d'abord un OCR local pour extraire du texte structuré et des objets, puis les transmettre à Jev.

Keno's breakdown of giving Jev eyes is a small example of a much bigger pattern in agent design. Jev can't see images. So the fix isn't to bolt vision onto a decision model, it's to run local OCR first, pull structured text and objects out of the picture, and only then hand Jev

· 0 likesOpen on X