讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: VLM 6 篇 × 清除
2605.13831v1 arXiv License Alibaba / Qwen Team

訓練長上下文視覺語言模型:以 128K 之外的泛化能力為目標的有效訓練方案

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yu...

VLMLong ContextMultimodalContinued Pre-trainingData RecipeDocument VQAQwen2.5-VL
Teds Lin 許願
2604.04771v2 arXiv License Alibaba / Qwen Team

MinerU2.5-Pro:推動資料中心文件解析的規模極限

MinerU2.5-Pro Pushing the Limits of Data-Centric Document Parsing at Scale

Bin Wang, Tianyao He, Linke Ouyang, Fan Wu, Zhiyuan Zhao, et al.(上海 AI Lab、北京大學、上海交大、商湯科技)

Document ParsingVLMOCRData-Centric AIBenchmark文件解析
鄭子凡 許願
2503.19508v1 CC BY-NC-SA 4.0 Alibaba / Qwen Team

改進大型視覺語言模型中的模態對齊

Improved Alignment of Modalities in Large Vision Language Models

Kartik Jangra, Aman Kumar Singh, Yashwani Mann, Geetanjali Rathee

VLMVision-LanguageAttention MaskImage Captioning多模態訓練策略
kerg kerg 許願
2604.09531v1 CC BY 4.0

VisionFoundry:用合成圖像教導視覺語言模型學習視覺感知

VisionFoundry Teaching VLMs Visual Perception with Synthetic Images

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

VLMSynthetic DataVisual PerceptionVQAText-to-Image資料生成
Teds Lin 許願
2512.02498v4 arXiv License MIT

dots.ocr:用單一視覺語言模型完成多語文件版面解析

dots.ocr Multilingual Document Layout Parsing in a Single Vision-Language Model

Yumeng Li, Guang Yang, Hao Liu, Bowen Wang, Colin Zhang (hi lab, Xiaohongshu Inc / 小紅書)

VLMOCRDocument ParsingMultilingualLayout DetectionXiaohongshu開源模型OmniDocBench
鄭子凡 許願
2604.08545v1 arXiv License ¹Accio Team, Alibaba Group;²華中科技大學 (Huazhong University of Science and Technology)

智慧行動:在代理人式多模態模型中培養後設認知的工具使用

Act Wisely Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

Shilin Yan¹*†‡、Jintao Tong¹,²*、Hongwei Xue¹†、Xiaojun Tang¹、Yangyang Wang¹、Kunyu Shi¹、Guannan Zhang¹、...

MultimodalAgentTool UseRLHFGRPOHDPOMeta-CognitionVLM
Teds Lin 許願