2503.19508v1
CC BY-NC-SA 4.0
Alibaba / Qwen Team
改進大型視覺語言模型中的模態對齊
Improved Alignment of Modalities in Large Vision Language Models
Kartik Jangra, Aman Kumar Singh, Yashwani Mann, Geetanjali Rathee
VLMVision-LanguageAttention MaskImage Captioning多模態訓練策略
kerg kerg 許願