讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: RLVR 6 篇 × 清除
2609.03181v1 CC BY-NC-SA 4.0 Alibaba / Qwen Team

Jina-OCR-v1:以推測式解碼與稠密可驗證獎勵做高效文件解析

Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

Alejandro Barón García, Feng Wang, Emilia Garcia Casademont, Han Xiao

OCR文件解析推測式解碼MTPGRPORLVRMoE
鄭子凡 許願
2608.24571v1 CC BY 4.0 Appier AI Research、National Taiwan University

大型語言模型代理人的工具創建與工具使用聯合最佳化

Joint Optimization of Tool Creation and Use for Large Language Model Agents

Zhi Rui Tam、Chieh-Yen Lin、Yun-Nung Chen、Shao-Hua Sun、Hung-yi Lee

LLMAgentTool UseRLVRDAPOReward Design工具創建
Liang-Hsun Huang 許願
2605.13301v1 CC BY 4.0

透過簡單且統一的擴展實現金牌級奧林匹亞推理

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wan...

LLMReasoningRLVRSFTTest-time Scaling數學推理Olympiad
Teds Lin 許願
2604.27083v1 CC BY 4.0

共同演化策略蒸餾

Co-Evolving Policy Distillation

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Du...

LLMRLVRDistillationOn-Policy DistillationMulti-CapabilityReasoningMultimodal
Teds Lin 許願
2604.03128v2 CC BY 4.0 Alibaba / Qwen Team

Self-Distilled RLVR:以自我蒸餾改進可驗證獎勵的強化學習

Self-Distilled RLVR

Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, J...

LLMRLVRSelf-DistillationReasoningRLMultimodalCredit Assignment
Teds Lin 許願
2501.00656v3 CC BY 4.0 MIT

2 OLMo 2 Furious:完全開放的下一代語言模型家族

2 OLMo 2 Furious

OLMo Team(Pete Walsh, Luca Soldaini, Dirk Groeneveld, Kyle Lo, Shane Arora, Akshita Bhagia, ... Ali ...

LLMOLMo開源模型預訓練Mid-trainingRLVRTüluAllen AI
林伯燊 許願