2604.09531v1
CC BY 4.0
VisionFoundry:用合成圖像教導視覺語言模型學習視覺感知
VisionFoundry Teaching VLMs Visual Perception with Synthetic Images
Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu
VLMSynthetic DataVisual PerceptionVQAText-to-Image資料生成
Teds Lin 許願