讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Reasoning 14 篇 × 清除
2603.24621v2 arXiv License MIT

ARC-AGI-3:前沿代理式智慧的全新挑戰

ARC-AGI-3 A New Challenge for Frontier Agentic Intelligence

ARC Prize Foundation

ARC-AGIAGIBenchmarkAgentReasoning互動式環境評測
Liang-Hsun Huang 許願
2512.07783v1 arXiv License Carnegie Mellon University

論預訓練、中期訓練與強化學習在推理語言模型上的交互作用

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

Charlie Zhang、Graham Neubig、Xiang Yue(Carnegie Mellon University, Language Technologies Institute)

LLMReinforcement LearningReasoningPre-trainingMid-trainingGRPOProcess Reward
kerg kerg 許願
2605.13301v1 CC BY 4.0

透過簡單且統一的擴展實現金牌級奧林匹亞推理

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wan...

LLMReasoningRLVRSFTTest-time Scaling數學推理Olympiad
Teds Lin 許願
2509.20186v4 CC BY 4.0

思考增強預訓練 (Thinking Augmented Pre-training)

Thinking Augmented Pre-training

Liang Wang, Nan Yang, Shaohan Huang, Li Dong, Furu Wei

LLMPre-trainingReasoningSynthetic DataData AugmentationMid-training
Teds Lin 許願
2604.27083v1 CC BY 4.0

共同演化策略蒸餾

Co-Evolving Policy Distillation

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Du...

LLMRLVRDistillationOn-Policy DistillationMulti-CapabilityReasoningMultimodal
Teds Lin 許願
2506.04178v2 CC BY 4.0 Alibaba / Qwen Team

OpenThoughts:推理模型的資料配方

OpenThoughts Data Recipes for Reasoning Models

Etash Guha, et al.

LLMReasoningData RecipeSFTOpen DatasetDistillationBenchmark
Thomas Liang 許願
2604.03128v2 CC BY 4.0 Alibaba / Qwen Team

Self-Distilled RLVR:以自我蒸餾改進可驗證獎勵的強化學習

Self-Distilled RLVR

Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, J...

LLMRLVRSelf-DistillationReasoningRLMultimodalCredit Assignment
Teds Lin 許願
2604.20244v1 CC BY 4.0

大型語言模型的混合策略蒸餾

Hybrid Policy Distillation for LLMs

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

LLMDistillationRLPolicy DistillationReasoningKL DivergenceOn-policy
Teds Lin 許願
2604.14164v1 CC BY 4.0 Alibaba / Qwen Team

如何微調推理模型?師生合作框架合成學生一致的 SFT 資料

How to Fine-Tune a Reasoning Model A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

LLMReasoningSFTKnowledge DistillationCatastrophic Forgetting資料合成
Teds Lin 許願
2510.03223v1 CC BY 4.0

Self-Anchor:透過逐步注意力對齊改進 LLM 推理

Self-Anchor LLM Reasoning via Step-by-step Attention Alignment

Hongxiang Zhang, Yuan Tian, Tianyi Zhang

LLMReasoningAttentionChain-of-ThoughtPrompt Engineering推理對齊
kerg kerg 許願
2604.13010v1 CC BY 4.0 Alibaba / Qwen Team

Lightning OPD:利用離線同策略蒸餾實現大型推理模型的高效後訓練

Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Yecheng Wu, Song Han, Han Cai

LLMKnowledge DistillationPost-TrainingOn-PolicyReasoning訓練效率
Teds Lin 許願
2602.21371v1 CC BY 4.0

交錯頭注意力機制

Interleaved Head Attention

Sai Surya Duvvuri, Chanakya Ekbote, Rachit Bansal, Rishabh Tiwari, Devvrit Khatri, David Brandfonbre...

LLMAttention MechanismTransformerMulti-Head AttentionReasoning長上下文架構設計
Teds Lin 許願
2604.06628v1 CC BY 4.0 Shanghai Artificial Intelligence Laboratory;Shanghai Jiao Tong University;University of Science and Technology of China

重新思考推理 SFT 中的泛化:對最佳化、資料與模型能力的條件式分析

Rethinking Generalization in Reasoning SFT

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, ...

SFTReasoningLong CoTGeneralizationPost-trainingLLMOptimization Dynamics
Teds Lin 許願
2210.03629v3 CC BY 4.0 ¹普林斯頓大學 (Princeton University) 計算機科學系;²Google Research, Brain team

ReAct:在語言模型中協同推理與行動

ReAct Synergizing Reasoning and Acting in Language Models

Shunyu Yao¹*、Jeffrey Zhao²、Dian Yu²、Nan Du²、Izhak Shafran²、Karthik Narasimhan¹、Yuan Cao²

LLMAgentReasoningTool UsePromptingCoTICLR2023
Thomas Liang 許願