2512.02498v4
arXiv License
MIT
dots.ocr:用單一視覺語言模型完成多語文件版面解析
dots.ocr Multilingual Document Layout Parsing in a Single Vision-Language Model
Yumeng Li, Guang Yang, Hao Liu, Bowen Wang, Colin Zhang (hi lab, Xiaohongshu Inc / 小紅書)
VLMOCRDocument ParsingMultilingualLayout DetectionXiaohongshu開源模型OmniDocBench
鄭子凡 許願