2605.13831v1
arXiv License
Alibaba / Qwen Team
訓練長上下文視覺語言模型:以 128K 之外的泛化能力為目標的有效訓練方案
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yu...
VLMLong ContextMultimodalContinued Pre-trainingData RecipeDocument VQAQwen2.5-VL
Teds Lin 許願