VisionFoundry:用合成圖像教導視覺語言模型學習視覺感知
原始論文:VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images 作者:Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu arXiv ID:2604.09531v1 日期:2026-04-10 標籤:VLM Synthetic Data Visual Perception VQA Text-to-Image 資料生成
目錄
摘要
視覺語言模型 (Vision-Language Models, VLMs) 在空間理解和視角辨識等視覺感知任務上仍然表現不佳。一個合理的原因是自然圖像資料集對低層級視覺技能提供的監督有限。這引出了一個實際問題:僅從任務關鍵字(如「深度順序 (Depth Order)」)生成的針對性合成監督,能否解決這些弱點?
為探究此問題,我們引入 VisionFoundry,一個任務感知的合成資料生成管線 (Pipeline),僅需任務名稱作為輸入,使用大型語言模型 (LLM) 生成問題、答案和文字轉圖像 (Text-to-Image, T2I) 提示詞,然後用 T2I 模型合成圖像,並透過專有 VLM 驗證一致性,全程不需要參考圖像或人工標註。
使用 VisionFoundry,我們構建了 VisionFoundry-10K,一個包含 10k 張圖像-問題-答案三元組的合成視覺問答 (VQA) 資料集,橫跨 10 個任務。在 VisionFoundry-10K 上訓練的模型在視覺感知基準上取得了顯著改善:MMVP 提高 +7%、CV-Bench-3D 提高 +10%,同時保持更廣泛的能力,且隨資料量增加展現出良好的擴展行為。我們的結果表明,有限的任務針對性監督是感知瓶頸的重要成因,而合成監督是邁向更系統化 VLM 訓練的一條有前景的路徑。
1 引言
視覺語言模型已快速演進為能處理和推理交錯文字與圖像的通用系統。它們現在支援從視覺問答到多模態推理、圖形使用者介面 (GUI) 定位以及數學問題求解等廣泛應用。儘管如此,VLMs 仍然在視覺感知方面存在持久的弱點,近期的診斷性基準(如 MMVP、CV-Bench 和 RealWorldQA)已經凸顯了這一點。Tong 等人構建的基準將視覺感知與純語言先驗脫鉤,而 RealWorldQA 則對幾何和空間推理進行壓力測試。
造成這一感知瓶頸的一個合理因素是:自然圖像資料集對這些低層級視覺技能提供的監督有限。自然圖像-文字語料庫雖然龐大,但可能無法系統性地涵蓋穩健視覺感知所需的組合式變異範圍。這引出了一個實際問題:我們能否合成針對性的監督來解決這些弱點,而不依賴參考圖像或昂貴的人工標註?
我們建構了 VisionFoundry,一個端對端的合成資料生成管線,僅需任務名稱即可作為輸入。VisionFoundry 將三個組件組合成一個閉環系統(見圖 2):(1) 大型語言模型生成問題-答案對及詳細的 T2I 提示詞,條件化在目標任務上;(2) 現代 T2I 模型根據這些提示詞合成圖像;(3) 強大的多模態判斷器驗證生成圖像與答案決定性視覺陳述之間的對齊,過濾掉不一致的樣本。
[Figure 1: 用合成圖像訓練 VLMs。VisionFoundry 使用僅任務關鍵字的管線,不需要參考文字或圖像。它生成任務感知的 T2I 提示詞和問答對,合成圖像,並使用結果監督來改善 VLM 的視覺感知能力。與傳統網路圖像收集管線相比,此方法提供更可控且針對任務的監督,且雜訊更少。]
[Figure 2: VisionFoundry 概覽。使用僅任務關鍵字,LLM 建構自適應概念池 (Adaptive Concept Pool);組合取樣形成用於生成 T2I 提示詞的實體;T2I 模型生成圖像,並由前沿 VLM 驗證,產出高品質的 VQA 資料集。]
2 VisionFoundry
VisionFoundry 是一個任務感知的合成資料生成管線,為 VLMs 產出高品質的 VQA 監督。它僅使用任務規格來建構資料,不需要參考圖像、人工撰寫的 QA 標註或真實圖像-標題對。
VisionFoundry 以三個方法論原則為指導:可控性 (Controllability)、視覺確定性 (Visual Determinism) 和驗證 (Verification)。
- 可控性使用明確的任務配置和實體池 (Entity Pool),系統性地覆蓋目標能力。
- 視覺確定性將答案決定性事實編碼到提示詞中,使問題僅能從圖像回答。
- 驗證使用強大的專有多模態判斷器來過濾微妙的提示詞與圖像不對齊。
2.1 VQA 三元組生成
VisionFoundry 的第一階段構造由問題、答案和對應 T2I 提示詞組成的三元組。此階段由 GPT-5.2 驅動。
任務感知生成。 VisionFoundry 以明確的任務配置 (Task Configuration) 為條件進行生成。每個任務指定目標能力(如空間關係、顏色辨別)、涉及的物體數量、以及可選的屬性或關係約束。為支持系統性覆蓋,我們構建一個實體池,包含物體類別、屬性、場景、風格和任務特定的自訂維度。實體從這些維度的笛卡爾積 (Cartesian Product) 中取樣,產生結構化的視覺配置。
給定一個取樣的實體,LLM 被提示生成:(i) 一個答案完全由可見內容決定的問題;(ii) 簡明確定性的答案;(iii) 一個明確編碼答案決定性視覺事實的高度詳細 T2I 提示詞。為避免歧義,LLM 被指示僅依賴視覺上可驗證的屬性,避免任何隱藏或常識性假設。
設計原理。 此設計在生成時強制語言監督與視覺內容之間的緊密耦合。透過將正確答案直接嵌入 T2I 提示詞,我們降低了產出與問題無關或不充分指定圖像的風險。
2.2 圖像合成
第二階段是 VisionFoundry 根據 T2I 提示詞合成圖像。我們使用現代 T2I 模型 Gemini-2.5-Flash-Image,其提供強大的真實感和提示詞遵從性。VisionFoundry 將 T2I 模型視為黑盒子,方法不依賴任何模型特定的內部機制,使管線與未來的生成器相容。
提示詞條件化生成。 每張圖像直接從前一階段的 T2I 提示詞生成。T2I 提示詞通常指定主要物體、屬性、空間排列、場景背景和視覺風格,確保結果圖像包含回答相關問題所需的所有資訊。
選擇性迭代精修。 為提高產出率,VisionFoundry 允許有限的圖像迭代精修。如果初始生成的圖像在下游驗證中失敗,系統可以請求局部編輯,使圖像最小程度地修改以更好地滿足預期的視覺陳述。
2.3 對齊驗證與過濾
第三階段驗證每張生成圖像是否與對應的問題和答案一致。此階段對於在更大的生成預算下維持資料集品質至關重要,同時保持管線完全自動化。
基於陳述的驗證。 給定一個問題及其候選答案,我們將其轉換為捕捉答案決定性事實的簡短宣告式視覺陳述(例如「紅色立方體在藍色球體的左邊」)。然後,強大的專有多模態模型 Gemini-3-Pro 作為判斷器,讀取生成的圖像與陳述,返回接受/拒絕的決定。我們忽略次要的風格差異,聚焦於答案決定性視覺事實的正確性。
二元過濾準則。 僅保留判斷器確認對齊的樣本。如果圖像在有限的精修嘗試後仍然未通過驗證,整個樣本被丟棄並重新取樣。
為什麼驗證很重要。 沒有明確的驗證,合成資料集容易出現缺失物體、不正確的空間關係或視覺模糊的場景等微妙的不對齊。我們觀察到像 Gemini 這樣的前沿模型已經足夠強大,使這種自動化在實踐中有效。
管線的輸出是完全合成的圖像-問題-答案三元組集合,格式化為標準 VLM 指令微調格式。
3 VisionFoundry-10K 資料集
使用 VisionFoundry,我們構建了 VisionFoundry-10K,一個針對視覺感知的合成 VQA 資料集。VisionFoundry-10K 包含橫跨 10 個精選任務的 10k 張圖像-問題-答案三元組,每個任務 1k 個案例。所有圖像由 T2I 模型生成並經過自動多模態對齊驗證過濾。
任務選擇。 選擇的任務強調當前 VLMs 已知具有挑戰性且與純語言能力弱相關的基本視覺感知技能。10 個任務為:
- 方向與方位 (Orientation and Direction)
- 視角與透視 (Viewpoint and Perspective)
- 位置與關係脈絡 (Positional and Relational Context)
- 空間關係 (Spatial Relationship)
- 狀態與條件 (State and Condition)
- 結構與物理特徵 (Structural and Physical Characteristics)
- 顏色與外觀 (Color and Appearance)
- 深度順序 (Depth Order)
- 相對距離 (Relative Distance)
- 真實世界空間理解 (Real-World Spatial Understanding)
這些任務涵蓋左/右和前/後判斷、近/遠判斷、深度排序、視角相關的外觀和相對屬性比較。
[Figure 3: VisionFoundry-10K 範例。隨機選取的定性範例,涵蓋所有 10 個任務。任務名稱標註在頂部,作為管線的唯一有效輸入。每個面板顯示一張生成圖像、對應問題和正確答案。]
資料集構建與統計。 對每個任務,我們定義一個任務特定的配置,約束物體數量、允許的屬性和關係謂詞。實體配置從底層實體池中系統性地取樣,確保物體類別、屬性、場景和視覺風格的多樣性。每個取樣的配置生成一個確定性答案的問題、一個對應的 T2I 提示詞。經過圖像合成和對齊驗證後,每個任務恰好保留 1k 個通過驗證的樣本,形成平衡的 10k 資料集。所有問題簡短明確,答案簡潔(如二元、類別或短語)。
與現有資料集的定位。 與大規模自然圖像 VQA 資料集不同,VisionFoundry-10K 不追求最大化語義覆蓋或語言多樣性。相反,它優先考慮精確的視覺基礎 (Visual Grounding) 和受控的難度,使其適合診斷和改善 VLMs 的核心感知弱點。
4 實驗
我們評估 VisionFoundry 生成的合成資料對改善 VLMs 視覺感知的效果,回答四個問題:(i) 合成資料是否改善視覺感知基準的性能?(ii) 這些改善是否跨不同 VLM 骨幹和模型規模泛化?(iii) 能否在不明顯影響通用任務性能的情況下獲得收益?(iv) 性能如何隨資料量和訓練輪次變化?
4.1 實驗設定
模型。 在三個具代表性的開源 VLMs 上進行實驗,涵蓋不同規模:Qwen2.5-VL-3B-Instruct、Llama-3.2-11B-Vision-Instruct 和 MiMo-VL-7B-SFT。所有模型從官方檢查點初始化。使用 non-LoRA 微調:對 Qwen2.5-VL-3B-Instruct 和 MiMo-VL-7B-SFT,聯合更新 ViT、適配器和 LLM 骨幹;對 Llama-3.2-11B-Vision-Instruct,凍結 LLM 骨幹,僅解凍 ViT 和適配器。
訓練資料。 VisionFoundry-10K 的 10k 張圖像-問題-答案三元組,均勻分佈在 10 個視覺感知任務上。僅在 VisionFoundry-10K 上訓練一個 epoch。
基準測試。 在 13 個廣泛使用的基準上評估,分三類:
- 視覺感知基準: MMVP、CV-Bench、RealWorldQA
- 通用理解與推理基準: BLINK、MMMU-Val、MMBench、MMStar、MathVista-Mini
- 應用特定基準: ScreenSpot-Pro、OCRBench、MMSI-Bench、3DSRBench、LEGO
表 2:主實驗超參數。 所有模型使用 1 epoch、批次大小 128。
| 模型 | Epochs | Batch | $\eta_{\text{ViT}}$ | $\eta_{\text{adapter}}$ | $\eta_{\text{LLM}}$ | LLM 更新 |
|---|---|---|---|---|---|---|
| Qwen2.5-VL-3B-Instruct | 1 | 128 | $5 \times 10^{-7}$ | $5 \times 10^{-6}$ | $5 \times 10^{-6}$ | 解凍 |
| MiMo-VL-7B-SFT | 1 | 128 | $5 \times 10^{-7}$ | $2.5 \times 10^{-6}$ | $2.5 \times 10^{-6}$ | 解凍 |
| Llama-3.2-11B-Vision-Instruct | 1 | 128 | $5 \times 10^{-7}$ | $5 \times 10^{-6}$ | N/A | 凍結 |
4.2 主要結果
表 1:主要基準結果。 在 13 個基準、15 個報告指標、三個 VLMs 上的結果。我們報告四次獨立運行的平均分數。視覺感知基準以粗體標示在頂部。
| 基準 | Qwen2.5-VL-3B Baseline | Synth | MiMo-VL-7B Baseline | Synth | Llama-3.2-11B Baseline | Synth |
|---|---|---|---|---|---|---|
| 視覺感知基準 | ||||||
| MMVP_pair | 35.3 | 42.0 | 43.3 | 57.3 | 42.7 | 46.7 |
| MMVP_single | 64.3 | 68.3 | 66.7 | 77.7 | 70.3 | 71.7 |
| CV-Bench-2D | 67.3 | 72.4 | 74.3 | 79.0 | 70.4 | 71.7 |
| CV-Bench-3D | 66.0 | 76.5 | 72.3 | 83.7 | 74.4 | 75.3 |
| RealWorldQA | 65.0 | 66.9 | 65.9 | 67.5 | 63.0 | 64.6 |
| 通用理解與推理基準 | ||||||
| BLINK | 48.1 | 47.9 | 58.9 | 58.7 | 34.3 | 35.5 |
| MMMU-Val | 48.0 | 47.1 | 49.4 | 52.3 | 40.1 | 40.7 |
| MMBench_EN_v1.1 | 75.8 | 76.1 | 50.5 | 81.6 | 66.6 | 73.8 |
| MMStar | 55.7 | 54.5 | 53.7 | 62.7 | 49.0 | 50.0 |
| MathVista-Mini | 62.3 | 62.9 | 39.1 | 52.4 | 47.0 | 48.3 |
| 應用特定基準 | ||||||
| ScreenSpot-Pro | 19.4 | 20.2 | 3.4 | 5.8 | 0.0 | 6.4 |
| OCRBench | 82.7 | 82.4 | 83.3 | 82.9 | 75.4 | 75.2 |
| MMSI-Bench | 9.2 | 9.9 | 8.4 | 11.5 | 3.0 | 8.9 |
| 3DSRBench | 35.2 | 36.8 | 32.0 | 40.0 | 27.5 | 39.2 |
| LEGO | 15.8 | 14.4 | 24.0 | 28.8 | 5.3 | 6.2 |
整體性能。 對所有三個 VLMs,在 VisionFoundry 合成資料上訓練持續改善視覺感知基準的性能,而通用基準顯示混合的、與基準相關的變化,既有明確的增益也有輕微的波動。
視覺感知增益。 最大的改善出現在 MMVP、CV-Bench 和 RealWorldQA 上,這些基準明確測試空間推理、深度排序、屬性辨識和其他低層級視覺感知技能。這些增益驗證了 VisionFoundry 有效針對先前工作中識別的核心視覺弱點。
通用任務。 在通用和應用特定基準上,不同模型和基準間的結果是異質的。特別值得注意的是 MiMo 在 MMBench 上異常大的增益(50.5 → 81.6),我們推測這是因為 VisionFoundry 的改善視覺感知大幅補償了 MiMo 在非思考模式下相對較弱的邏輯能力。
4.3 資料量敏感度
我們分析性能如何隨合成資料量變化。在 0.5k、1k、2k、5k 的子集以及完整 10k 資料集上訓練。子集透過固定種子(42)的隨機取樣獲得。
[Figure 4: 合成監督的資料量效果。隨著 VisionFoundry 合成 VQA 監督量的增加,我們報告性能趨勢。整體而言,視覺感知基準隨合成資料增加呈上升趨勢。]
結果與結論。 在完整 10k 設定下,關鍵診斷指標上觀察到顯著增益:MMVP-pair 從 35.3 提高到 42.0(+6.7),MMVP-single 從 64.3 到 68.3(+4.0),CV-Bench-2D 從 67.3 到 72.4(+5.1),CV-Bench-3D 從 66.0 到 76.5(+10.5)。RealWorldQA 也從 65.0 提高到 66.9(+1.9)。少數曲線呈現輕微的非單調性(如由於子集取樣變異),但整體趨勢穩健:更多經驗證過濾的合成監督持續轉化為更好的低層級感知性能。最大增益出現在 3D/空間診斷上(如 CV-Bench-3D),表明 VisionFoundry 在幾何和關係密集的視覺技能上特別有效。
4.4 進一步分析
合成與自然資料混合。 我們比較在等量合成與自然資料混合上的訓練:(i) 2k VisionFoundry-10K 樣本和 2k 隨機取樣的 LLaVA-Instruct-80K 樣本(共 4k);(ii) 4k 純自然資料。
[Figure 5: 等量混合 vs. 純自然資料。混合設定在視覺感知基準上持續產出更高準確率,同時在通用基準上保持可比性能。]
結果顯示,混合資料集在視覺感知基準上持續優於純自然資料,在其他基準上達到可比的性能。這表明合成資料提供了互補的視覺監督,難以從小規模自然子集中單獨獲得。
訓練輪次。 使用單任務 1k 子集時,性能通常在約 8 個 epoch 時提高然後飽和;使用完整 10 任務集時,用更少的訓練 epoch 就能達到收斂。
任務別分析。 我們對 10 個任務特定的 1k 子集分別訓練模型。大多數視覺感知基準在不同任務間展現一致的改善。例如,深度順序 (Depth Order) 在空間基礎基準上提供強增益,但在 ScreenSpot-Pro(2D GUI 定位設定)上產出有限或負面遷移。
[Figure 7: 任務別增益和跨基準分歧。(a) 五個任務特定 1k 子集在基準上的增益熱力圖。(b) 跨基準的性能包絡線和任務敏感度。]
5 相關工作
VLMs 的合成資料。 近期工作越來越多地使用合成多模態資料來擴展視覺-語言學習和指令微調。在標題生成方面,ShareGPT4V 產出 1.2M 標題,ALLaVA 合成 3.4M 標題和推理 QA 對,SynthVLM 精修標題品質,VILA² 啟用自我重標題。在指令微調方面,SVIT 擴展到 4.2M 指令,ProVision 生成 10M+ 以視覺為中心的指令,MMEvol 演化 447K 指令,LOVA3 教導 VQA 生成,Img-Diff 創建對比對。領域特定方法包括用於 3D 推理的 SpatialVLM、用於數學推理的 Math-LLaVA、以及圖表 QA 管線。
T2I 生成的訓練資料。 T2I 生成的訓練資料已從表示學習演進到監督式辨識。StableRep 使用擴散圖像進行對比學習,Synth² 使用 T2I 嵌入進行 VLM 訓練,擴展法則研究 CLIP 預訓練行為。
VLM 訓練與評估。 早期管線包括 LLaVA、InstructBLIP、MiniGPT-4 和 Qwen-VL,證明將圖像-文字語料轉換為指令遵從格式的資料能對齊 VLMs 的感知和生成。視覺感知基準重新利用 CV 資源:CV-Bench 使用 ADE20K、COCO,RealWorldQA 針對真實場景空間理解。互補基準涵蓋視覺陷阱(MMVP)、感知限制(BLINK)和整合能力(MME、MM-Vet)。
VisionFoundry 與先前工作的不同在於它是一個完全自動化的管線,僅從任務關鍵字生成資料集。
6 結論與討論
我們提出了 VisionFoundry,一個任務感知的合成資料生成管線,使用大型語言模型產出問題、答案和 T2I 提示詞,用現代 T2I 模型合成圖像,並應用自動多模態對齊驗證,全程不需要參考圖像或人工標註。使用 VisionFoundry,我們構建了 VisionFoundry-10K,包含橫跨 10 個視覺感知任務的 10k 張圖像-問題-答案三元組。
跨多個 VLMs 的實驗表明,在 VisionFoundry-10K 上訓練在視覺感知基準上產出顯著改善(如 MMVP +7%、CV-Bench +10%),同時保持更廣泛的能力,且隨資料量增加展現良好的擴展行為。
整體而言,我們的結果表明 VLMs 的感知瓶頸部分是一個資料問題,而精心設計的合成資料可以作為強化核心視覺感知的實用互補監督來源。更廣泛地說,我們的發現指出多模態系統的進步可能不僅取決於擴展模型規模或自然資料量,還取決於刻意為當前模型學習不足的特定感知區分建構監督。展望未來,合成監督可能成為未來 VLMs 更系統化多模態訓練的有前景的基礎。
局限性與未來工作。 VisionFoundry-10K 聚焦於視覺感知任務。一個重要的開放問題是這種合成資料管線能否類似地惠及需要更長推理鏈和更強組合推理的更複雜視覺推理任務。
附錄
A 實施細節
A.1 優化與超參數。 對 MiMo-VL-7B-SFT,在訓練和評估中均使用非思考設定(在答案前加上 <think></think> 作為佔位符)。對 Llama-3.2-11B-Vision-Instruct,凍結 LLM 骨幹並僅解凍 ViT 和適配器,以緩解激進的全 LLM 更新造成的災難性遺忘。
A.2 評估協議。 所有評估使用開源 VLMEvalKit 框架及預設設定。MMVP 報告官方配對準確率和常用的單圖像準確率。MMMU 在 val 分割上評估。ScreenSpot-Pro 報告所有子任務的平均分數。LEGO 和 MMSI-Bench 使用循環評估模式。3DSRBench 使用最具挑戰性的循環模式 FlipEval。
B 精確管線提示詞
B.1 提示詞集 A
A1. 自訂屬性擴展。 系統提示 LLM 為給定任務描述生成多樣化的屬性選項(如空間關係、難度標籤),輸出為 JSON 字串陣列。
A2. 單圖像 QA + T2I 案例構建。 主要樣本構建模板,聯合產出圖像提示詞、問題和答案。條件區塊(如空間/顏色焦點和物體數量約束)根據任務需求調整指令,明確規則強制視覺基礎和確定性。
B.2 提示詞集 B
B1. 問答轉宣告式驗證陳述。 將每個 QA 對標準化為可直接對照視覺證據檢查的單一宣告式陳述。
B2. 圖像一致性驗證(二元判斷器)。 判斷生成圖像是否在整體語義層面支持目標陳述,忽略次要細節,以嚴格的 YES/NO 格式回應。
B3. 失敗驗證後的可選編輯式重新生成。 定義驗證失敗案例的回退校正階段。
C 驗證器案例研究
我們提供定性案例研究,沿兩個維度分類:(i) 生成是否正確;(ii) 驗證器判斷是否正確。
- 真陽性 (True Positive):生成正確且驗證器接受(例如:雪地光澤判斷、相對深度比較、高視角辨識)
- 假陰性 (False Negative):生成正確但驗證器拒絕(例如:堆高機朝向正確但被誤判)
- 假陽性 (False Positive):生成錯誤但驗證器接受(例如:帆船船頭朝右但陳述說朝左)
- 真陰性 (True Negative):生成錯誤且驗證器正確拒絕(例如:購物車方向不正確被正確拒絕)
D 資料品質分析
驗證器性能(在審計樣本集上):準確率 92.1%、精確率 99.0%、召回率 90.8%、F1 94.7%。
管線品質指標:最終有效比例 70.7%、接受率 71.4%、拒絕率 28.6%、假接受率 3.2%、假拒絕率 9.2%、人機一致性 (Cohen's κ) 0.794。
E 任務別結果
10 個任務特定模型在所有基準上的完整逐任務結果,顯示不同任務的訓練如何差異化地遷移到不同的評估維度。
F 驗證必要性消融實驗
在匹配的 1k 資料預算下比較基線、帶驗證的微調和不帶驗證的微調。帶驗證的管線在視覺感知基準上持續表現更好,支持驗證是 VisionFoundry 的必要組件。
G 合成過程消融實驗
比較「自然圖像 + 合成 QA」vs.「合成圖像 + 合成 QA」。在匹配的 QA 監督下,合成圖像分支整體表現更好,特別是在視覺感知評估上(尤其是 CV-Bench-3D),進一步支持 caption 條件化 T2I 重建步驟提供了超越 caption 衍生合成 QA 之外的額外訓練價值。
參考文獻
- Dai, W., et al. (2023). InstructBLIP: Towards general-purpose vision-language models with visual instruction tuning. NeurIPS.
- Zhu, D., et al. (2024). MiniGPT-4: Enhancing vision-language understanding with advanced large language models. ICLR.
- Team, Q. (2023). Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.
- Liu, H., et al. (2023). Visual instruction tuning. NeurIPS. (LLaVA)
- Tong, S., et al. (2024a). Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs. NeurIPS.
- Tong, S., et al. (2024b). Eyes wide shut? Exploring the visual shortcomings of multimodal LLMs. CVPR. (MMVP)
- xAI. (2024). RealWorldQA dataset.
- Chen, B., et al. (2024d). ShareGPT4V: Improving large multi-modal models with better captions. ECCV.
- Chen, G.H., et al. (2024b). ALLaVA: Harnessing GPT4V-synthesized data for lite vision-language models.
- Liu, Z., et al. (2025). SynthVLM: Towards high-quality and efficient synthesis of image-caption datasets for vision-language models. ACMMM.
- Fang, Y., et al. (2024). VILA²: VILA augmented VILA.
- Zhao, B., et al. (2023). SVIT: Scaling up visual instruction tuning.
- Zhang, J., et al. (2025). ProVision: Programmatically scaling vision-centric instruction data for multimodal language models. ICLR.
- Luo, R., et al. (2025). MMEvol: Empowering multimodal large language models with evol-instruct. ACL Findings.
- Zhao, H.Y., et al. (2024). LOVA3: Learning to visual question answering, asking and assessment. NeurIPS.
- Jiao, Q., et al. (2025). Img-Diff: Contrastive data synthesis for multimodal large language models. CVPR.
- Chen, B., et al. (2024a). SpatialVLM: Endowing vision-language models with spatial reasoning capabilities. CVPR.
- Shi, W., et al. (2024). Math-LLaVA: Bootstrapping mathematical reasoning for multimodal large language models. EMNLP Findings.
- Google Cloud. (2025a). Gemini 2.5 Flash Image model documentation.
- Google Cloud. (2025b). Gemini 3 Pro model documentation.
- OpenAI. (2025). Introducing GPT-5.2.
- Bai, S., et al. (2025). Qwen2.5-VL technical report.
- Meta AI. (2024). Llama 3.2 vision: Multimodal large language models.
- Yue, Z., et al. (2025). MiMo-VL technical report.
- Duan, H., et al. (2024). VLMEvalKit: An open-source toolkit for evaluating large multi-modality models. ACMMM.
- Fu, X., et al. (2024). BLINK: Multimodal large language models can see but not perceive. ECCV.
- Yue, X., et al. (2024). MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI. CVPR.
- Liu, Y., et al. (2024a). MMBench: Is your multi-modal model an all-around player? ECCV.
- Chen, L., et al. (2024e). Are we on the right way for evaluating large vision-language models? NeurIPS. (MMStar)
- Lu, P., et al. (2024). MathVista: Evaluating mathematical reasoning of foundation models in visual contexts. ICLR.
- Li, K., et al. (2025). ScreenSpot-Pro: GUI grounding for professional high-resolution computer use. ACMMM.
- Liu, Y., et al. (2024b). OCRBench: On the hidden mystery of OCR in large multimodal models.
- Yang, S., et al. (2026). MMSI-Bench: A benchmark for multi-image spatial intelligence. ICLR.
- Ma, W., et al. (2025). 3DSRBench: A comprehensive 3D spatial reasoning benchmark. ICCV.
- Tang, K., et al. (2025). LEGO-Puzzles: How good are MLLMs at multi-step spatial reasoning?
術語對照表
| 英文 | 中文 |
|---|---|
| Vision-Language Model (VLM) | 視覺語言模型 |
| Visual Perception | 視覺感知 |
| Synthetic Data | 合成資料 |
| Visual Question Answering (VQA) | 視覺問答 |
| Text-to-Image (T2I) | 文字轉圖像 |
| Task-aware | 任務感知 |
| Pipeline | 管線 |
| Controllability | 可控性 |
| Visual Determinism | 視覺確定性 |
| Verification | 驗證 |
| Entity Pool | 實體池 |
| Task Configuration | 任務配置 |
| Cartesian Product | 笛卡爾積 |
| Adaptive Concept Pool | 自適應概念池 |
| Visual Grounding | 視覺基礎 |
| Alignment Verification | 對齊驗證 |
| Binary Filtering Criterion | 二元過濾準則 |
| Prompt-conditioned Generation | 提示詞條件化生成 |
| Selective Iterative Refinement | 選擇性迭代精修 |
| Statement-based Verification | 基於陳述的驗證 |
| Depth Order | 深度順序 |
| Spatial Relationship | 空間關係 |
| Viewpoint and Perspective | 視角與透視 |
| Orientation and Direction | 方向與方位 |
| True Positive / False Negative | 真陽性 / 假陰性 |
| False Positive / True Negative | 假陽性 / 真陰性 |
| Cohen's κ | Cohen's κ(人機一致性) |
| Catastrophic Forgetting | 災難性遺忘 |
| Non-LoRA Finetuning | 非 LoRA 微調 |
| Instruction Tuning | 指令微調 |
| Compositional Reasoning | 組合推理 |