dots.ocr Multilingual Document Layout Parsing in a Single Vision-Language Model
文件版面解析 (Document Layout Parsing) 是人工智慧 (Artificial Intelligence, AI) 進入全球龐大結構化知識庫的關鍵入口。這項工作涵蓋版面偵測 (Layout Detection)、文字辨識 (Text Recognition) 與關聯理解 (Relational Understanding),對於驅動下一代視覺語言模型 (Vision-Language Model, VLM) 尤其重要。然而,現有方法多半依賴碎片化的多階段流水線 (Multi-stage Pipeline),受困於錯誤傳遞 (Error Propagation),也無法享有聯合訓練 (Joint Training) 帶來的協同效益。 本文介紹 dots.ocr,一個單一的視覺語言模型;它首次展示出:在統一、端對端 (End-to-end) 的框架中聯合學習三個核心任務是可行且優越的。支撐這一切的是一個高度可擴展的資料引擎 (Data Engine),它合成一套龐大的多語料庫,使模型能在多樣的語言、版面與領域上交出穩健的表現。 我們在綜合性的 OmniDocBench 上達到當前最佳 (SOTA) 效能,驗證了統一範式的有效性。為了推動全球文件智慧的研究,我們再提出 XDocParse — 一個涵蓋 126 種語言的具挑戰性新基準。在此基準上,dots.ocr 取得 SOTA,相對改善約 10%,展現出強大的多語能力。
原文連結:arXiv