Have you tried open weights vision models such as Qwen VL, MiniCPM, PaliGemma...?
I'm also curious how usable are simpler vision models such as Florence in case you explored this direction.
I'm also curious how usable are simpler vision models such as Florence in case you explored this direction.