讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: RLHF 4 篇 × 清除
2512.20848v1 CC BY 4.0 Alibaba / Qwen Team

Nemotron 3 Nano:開放高效的 MoE 混合 Mamba-Transformer 智能體推理模型

Nemotron 3 Nano Open Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA(300+ 位貢獻者)

LLMMoEMambaHybrid ArchitectureAgenticRLHF開源模型
林伯燊 許願
2604.12374v1 CC BY 4.0 Alibaba / Qwen Team

Nemotron 3 Super:開源高效混合專家 Mamba-Transformer 模型,面向智能體推理

Nemotron 3 Super Open Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA(數百位貢獻者)

LLMMoEMambaAgenticRLHFQuantization開源模型
Teds Lin 許願
2604.07941v1 arXiv License

大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...

LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願
2604.08545v1 arXiv License ¹Accio Team, Alibaba Group;²華中科技大學 (Huazhong University of Science and Technology)

智慧行動:在代理人式多模態模型中培養後設認知的工具使用

Act Wisely Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

Shilin Yan¹*†‡、Jintao Tong¹,²*、Hongwei Xue¹†、Xiaojun Tang¹、Yangyang Wang¹、Kunyu Shi¹、Guannan Zhang¹、...

MultimodalAgentTool UseRLHFGRPOHDPOMeta-CognitionVLM
Teds Lin 許願