讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: GRPO 5 篇 × 清除
2609.03181v1 CC BY-NC-SA 4.0 Alibaba / Qwen Team

Jina-OCR-v1:以推測式解碼與稠密可驗證獎勵做高效文件解析

Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

Alejandro Barón García, Feng Wang, Emilia Garcia Casademont, Han Xiao

OCR文件解析推測式解碼MTPGRPORLVRMoE
鄭子凡 許願
2512.07783v1 arXiv License Carnegie Mellon University

論預訓練、中期訓練與強化學習在推理語言模型上的交互作用

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

Charlie Zhang、Graham Neubig、Xiang Yue(Carnegie Mellon University, Language Technologies Institute)

LLMReinforcement LearningReasoningPre-trainingMid-trainingGRPOProcess Reward
kerg kerg 許願
2606.25996v2 arXiv License Meta

Autodata:以代理人扮演資料科學家來生成高品質合成資料

Autodata: An agentic data scientist to create high quality synthetic data

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yua...

合成資料AgentSelf-InstructGRPOLLM-as-a-Judge推理Meta-Optimization
kerg kerg 許願
2604.14922v1 CC BY 4.0 Alibaba / Qwen Team

LongAct:利用內在激活模式實現長上下文強化學習

LongAct Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

LLMLong ContextReinforcement LearningActivationSparse UpdateGRPO
Teds Lin 許願
2604.08545v1 arXiv License ¹Accio Team, Alibaba Group;²華中科技大學 (Huazhong University of Science and Technology)

智慧行動:在代理人式多模態模型中培養後設認知的工具使用

Act Wisely Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

Shilin Yan¹*†‡、Jintao Tong¹,²*、Hongwei Xue¹†、Xiaojun Tang¹、Yangyang Wang¹、Kunyu Shi¹、Guannan Zhang¹、...

MultimodalAgentTool UseRLHFGRPOHDPOMeta-CognitionVLM
Teds Lin 許願