Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
MinerU2.5-Pro Pushing the Limits of Data-Centric Document Parsing at Scale
Improved Alignment of Modalities in Large Vision Language Models
VisionFoundry Teaching VLMs Visual Perception with Synthetic Images
dots.ocr Multilingual Document Layout Parsing in a Single Vision-Language Model
Act Wisely Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models