Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
長上下文建模 (Long-context Modeling) 正逐步成為現代大型視覺語言模型 (Large Vision-Language Model, LVLM) 的核心能力,能在長文件理解、影片分析、以及代理工作流 (Agentic Workflow) 中的多輪工具使用裡持續維護上下文。然而,實務上的訓練配方 (Training Recipe) 仍未被充分探索,特別是長上下文資料混合的設計與平衡。 本文系統性地研究 LVLM 的長上下文持續預訓練 (Long-context Continued Pre-training),將一個 7B 模型的上下文視窗從 32K 擴展到 128K,並在長文件資料上進行廣泛的消融實驗 (Ablation Study)。我們首先證明,長文件 VQA (Long-document VQA) 比 OCR 轉寫 (OCR Transcription) 的效果顯著更好。在此基礎上,消融實驗再得出三項關鍵發現: 1. 序列長度分佈 (Sequence-length Distribution):平衡分佈 (Balanced Distribution) 優於以目標長度(如 128K)為主的分佈,這表明長上下文能力需要在不同長度與位置上具備可泛化的關鍵資訊檢索能力; 2. 檢索仍是主要瓶頸:偏重檢索的混合,配上適量推理資料以維持任務多樣性,效果最佳; 3. 純長文件 VQA 大幅保留短上下文能力,這意味著指令化的長資料降低了混入短資料的必要性。 基於這些發現,我們提出 MMProLong,僅以 5B token 的預算從 Qwen2.5-VL-7B 進行長上下文持續預訓練得到。MMProLong 將長文件 VQA 分數提升了 7.1%,並在訓練視窗 128K 之外於 256K 與 512K 上下文長度仍維持強勁表現,無需任何額外訓練。它還能泛化到網頁式多模態大海撈針 (Webpage-based Multimodal Needle Retrieval)、長上下文視覺-文字壓縮 (Vision-text Compression)、與長影片理解等任務,且無需任務專屬監督訊號。總體而言,本研究確立了一套實務性的 LongPT 配方,並為發展長上下文視覺語言模型提供了實證基礎。
原文連結:arXiv