讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Long Context 7 篇 × 清除
hf-XiaomiMiMo-MiMo-V2.6-Flash-RL MIT License MIT

MiMo-V2.6:將強化學習擴展至自我改進

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

LLM-Core Xiaomi

Reinforcement LearningSelf-ImprovementMoELong ContextMixed-Task Agentic RLReward Hacking Defense
Liang-Hsun Huang 許願
2506.13585v1 arXiv License Alibaba / Qwen Team

MiniMax-M1:以閃電注意力高效地擴展測試時運算

MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention

MiniMax(通訊:[email protected];共 128 位貢獻者,完整名單見原論文附錄 A)

Reasoning ModelLightning AttentionReinforcement LearningCISPOMoELong Context開源模型
Liang-Hsun Huang 許願
2404.06395v3 CC BY 4.0

MiniCPM:以可擴展的訓練策略揭示小型語言模型的潛力

MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Shengding Hu、Yuge Tu、Xu Han、Chaoqun He、Ganqu Cui、Xiang Long、Zhi Zheng、Yewei Fang、Yuxiang Huang 等(清華大...

Small Language ModelWSD SchedulerScaling LawPre-trainingMoELong Context開源模型
Liang-Hsun Huang 許願
2605.13831v1 arXiv License Alibaba / Qwen Team

訓練長上下文視覺語言模型:以 128K 之外的泛化能力為目標的有效訓練方案

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yu...

VLMLong ContextMultimodalContinued Pre-trainingData RecipeDocument VQAQwen2.5-VL
Teds Lin 許願
2604.14922v1 CC BY 4.0 Alibaba / Qwen Team

LongAct:利用內在激活模式實現長上下文強化學習

LongAct Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

LLMLong ContextReinforcement LearningActivationSparse UpdateGRPO
Teds Lin 許願
2411.01783v2 CC BY 4.0

上下文並行:可擴展的百萬 Token 推理

Context Parallelism for Scalable Million-Token Inference

Amy Yang, Jingyi Yang, Aya Ibrahim, Xinfeng Xie, Bangsheng Tang, Grigory Sizov, Jeremy Reizenstein, ...

LLMInferenceLong ContextParallelismRing Attention系統優化
kerg kerg 許願
2604.06169v1 arXiv License Alibaba / Qwen Team

就地測試時訓練

In-Place Test-Time Training

Guhao Feng, Shengjie Luo, Kai Hua, Ge Zhang, Di He, Wenhao Huang, Tianle Cai

LLMTest-Time TrainingLong ContextMLPContinual LearningByteDanceQwen3RULER
Teds Lin 許願