讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: 強化學習 2 篇 × 清除
2609.07925v1 CC BY 4.0 Alibaba / Qwen Team

FrogNano:以線上任務合成訓練 4B 程式碼代理

FrogNano: Training a 4B Coding Agent via Online Task Synthesis

Minseon Kim, Zhengyan Shi, Emiliano Penaloza, Christopher Cui, Roger Creus Castanyer, Maryam Hashemz...

FrogNano程式碼代理強化學習合成任務小模型SWE-benchQwen3.5
Liang-Hsun Huang 許願
2601.21343v1 arXiv License Meta FAIR

自我改進式預訓練:利用後訓練模型來預訓練更好的模型

Self-Improving Pretraining using post-trained models to pretrain better models

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, ...

預訓練強化學習安全性事實性推理中期訓練LLM
Liang-Hsun Huang 許願