讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: LLM 58 篇 × 清除
2610.01674v1 CC BY 4.0 Google

發明一個資料集:以零種子測量資料集生成能力

Invent a Dataset: Measuring dataset generation abilities with zero seed

Singh, Shivalika、Djurisic, Andrija、Onilude, Gbemileke、Roy, Sudip、Hooker, Sara

LLM開源模型合成資料數據生成數據增強數據集生成零樣本
Liang-Hsun Huang 許願
2609.24974v1 arXiv License Google

Harness-Zero:透過代理人即Harness進行Harness蒸餾

Harness-Zero: Harness Distillation via Agent-as-Harness

Ye, Haoran、Lu, Yuxing、Dong, Haonan、Su, Zhaochen、Song, Guojie

LLMKnowledge DistillationAgentHarnessLLM-as-JudgeSynthetic DataSelf-Evolution
Liang-Hsun Huang 許願
2305.16264v5 arXiv License Hugging Face、Harvard University、University of Turku、Cornell University

資料受限下的語言模型 Scaling

Scaling Data-Constrained Language Models

Niklas Muennighoff、Alexander M. Rush、Boaz Barak、Teven Le Scao、Aleksandra Piktus、Nouamane Tazi、Sampo ...

LLMScaling LawPre-trainingDataChinchillaRepeated DataNeurIPS
Liang-Hsun Huang 許願
gh-MoonshotAI-Moonlight MIT License Moonshot AI、UCLA

Muon 可以擴展到 LLM 訓練

Muon is Scalable for LLM Training

Jingyuan Liu、Jianlin Su、Xingcheng Yao、Zhejun Jiang、Guokun Lai、Yulun Du、Yidao Qin、Weixin Xu、Enzhe Lu、...

LLMMuonOptimizerMoEScaling Law開源模型
Liang-Hsun Huang 許願
gh-MoonshotAI-Kimi-K3 Kimi K3 License Moonshot AI

Kimi K3:開放的前沿智慧

Kimi K3: Open Frontier Intelligence

Kimi Team

LLMMoEKimiAgentLinear AttentionRL開源模型
Liang-Hsun Huang 許願
gh-QwenLM-Qwen3.8-Flash-Next 未標明授權 Qwen Team, Alibaba Group

論 Qwen3.8-Next 架構設計:評測、效率與訓練穩定性

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen Team(核心貢獻者:Zihan Qiu、Zekun Wang、Xiao Li、Yanpeng Li、Yang Xu、Yixuan Wang、Huaqing Zhang、Rui Men、Bo...

LLMMoEQwenLinear AttentionSparse AttentionMuon技術報告
Liang-Hsun Huang 許願
2608.24571v1 CC BY 4.0 Appier AI Research、National Taiwan University

大型語言模型代理人的工具創建與工具使用聯合最佳化

Joint Optimization of Tool Creation and Use for Large Language Model Agents

Zhi Rui Tam、Chieh-Yen Lin、Yun-Nung Chen、Shao-Hua Sun、Hung-yi Lee

LLMAgentTool UseRLVRDAPOReward Design工具創建
Liang-Hsun Huang 許願
2503.05029v2 CC BY-NC-SA 4.0 Université de Montréal、Mila – Quebec AI Institute、Capital One、University of Chicago、Concordia University

MoE 的持續預訓練:你的路由器有多穩健?

Continual Pre-training of MoEs: How robust is your router?

Benjamin Thérien、Charles-Étienne Joseph、Zain Sarwar、Ashwinee Panda、Anirban Das、Shi-Xiong Zhang、Steph...

MoELLM持續預訓練RoutingLoad BalancingCatastrophic ForgettingReplay
Liang-Hsun Huang 許願
2602.10388v4 arXiv License Alibaba / Qwen Team

少即足夠:用稀疏自編碼器在 LLM 特徵空間中合成多樣化資料

Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders

Zhongzhi Li, Xuansheng Wu(University of Georgia)、Yijiang Li(UC San Diego)、Lijie Hu(MBZUAI)、Ninghao L...

LLMSparse Autoencoder合成資料Post-training資料多樣性可解釋性SFT
Liang-Hsun Huang 許願
2607.15232v1 CC BY 4.0 MIT

預訓練 LLM 的原地詞元化器擴充

In-Place Tokenizer Expansion for Pre-trained LLMs

Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyd...

LLMTokenizer詞彙擴充多語言持續預訓練On-deviceMoE
Liang-Hsun Huang 許願
2512.07783v1 arXiv License Carnegie Mellon University

論預訓練、中期訓練與強化學習在推理語言模型上的交互作用

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

Charlie Zhang、Graham Neubig、Xiang Yue(Carnegie Mellon University, Language Technologies Institute)

LLMReinforcement LearningReasoningPre-trainingMid-trainingGRPOProcess Reward
kerg kerg 許願
2501.02086v3 arXiv License Meta

指令遵循式剪枝:面向大型語言模型

Instruction-Following Pruning for Large Language Models

Bairu Hou, Qibin Chen, Jianyu Wang, Guoli Yin, Chong Wang, Nan Du, Ruoming Pang, Shiyu Chang, Tao Le...

LLM結構化剪枝動態剪枝推論加速指令遵循端側部署MoE
林伯燊 許願
2508.12631v2 arXiv License

超越 GPT-5:透過效能—效率最佳化路由讓 LLM 更便宜也更好

Beyond GPT-5: Making LLMs Cheaper and Better via Performance-Efficiency Optimized Routing

Yiqun Zhang, Hao Li, Jianhao Chen, Hangfan Zhang, Peng Ye, Lei Bai, Shuyue Hu(Shanghai Artificial In...

LLMModel Routing成本效益Multi-objective OptimizationGPT-5Pareto Frontier
林伯燊 許願
2601.07206v1 CC BY 4.0 OpenAI

LLMRouterBench:一個大規模基準與用於 LLM 路由的統一框架

LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing

Hao Li, Yiqun Zhang, Zhaoyan Guo, Chenxu Wang, Shengji Tang, Qiaosheng Zhang, Yang Chen, Biqing Qi, ...

LLM RoutingBenchmarkLLMModel EnsemblePerformance-Cost開源模型
林伯燊 許願
2605.13301v1 CC BY 4.0

透過簡單且統一的擴展實現金牌級奧林匹亞推理

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wan...

LLMReasoningRLVRSFTTest-time Scaling數學推理Olympiad
Teds Lin 許願
2605.14038v2 CC BY 4.0 Meta

模型自適應的工具必要性揭示了 LLM 工具使用中的「知行落差」

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

Yize Cheng, Chenrui Fan, Mahdi JafariRaviz, Keivan Rezaei, Soheil Feizi(University of Maryland, Coll...

LLMTool UseAgentProbingMeta-cognitionInterpretability知行落差
Teds Lin 許願
2605.14589v2 CC BY 4.0

EndPrompt:透過終端錨定 (Terminal Anchoring) 達成高效長上下文擴展

EndPrompt: Efficient Long-Context Extension via Terminal Anchoring

Han Tian, Luxuan Chen, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Jinman Zhao, Yuchen Li, Jiashu...

LLMLong-ContextRoPEPosition InterpolationContext ExtensionLLaMA高效訓練
Teds Lin 許願
2605.15156v2 CC BY 4.0

MeMo:記憶即模型

MeMo: Memory as a Model

Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bry...

LLMKnowledge IntegrationMemoryRAGModel Merging知識整合黑盒模型
Teds Lin 許願
2606.14150v2 arXiv License Carnegie Mellon University

小型大型語言模型:剪枝 vs. 從頭訓練

Small LLMs: Pruning vs. Training from Scratch

Yufeng Xu, Taiming Lu, Kunjun Li, Jiachen Zhu, Mingjie Sun, Zhuang Liu(Princeton University, New Yor...

LLMPruning剪枝Sparse初始化Llama小型模型
kerg kerg 許願
2606.18699v1 CC BY 4.0

TW-LegalBench:衡量台灣法律理解能力

TW-LegalBench: Measuring Taiwanese Legal Understanding

Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick...

LLMBenchmark法律 NLP繁體中文台灣法律LLM-as-Judge判決預測
鄭子凡 許願
2509.20186v4 CC BY 4.0

思考增強預訓練 (Thinking Augmented Pre-training)

Thinking Augmented Pre-training

Liang Wang, Nan Yang, Shaohan Huang, Li Dong, Furu Wei

LLMPre-trainingReasoningSynthetic DataData AugmentationMid-training
Teds Lin 許願
2604.27083v1 CC BY 4.0

共同演化策略蒸餾

Co-Evolving Policy Distillation

Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Du...

LLMRLVRDistillationOn-Policy DistillationMulti-CapabilityReasoningMultimodal
Teds Lin 許願
2005.14165v4 arXiv License OpenAI

語言模型是少樣本學習者(GPT-3)

Language Models are Few-Shot Learners

Tom B. Brown, Benjamin Mann, et al. (OpenAI)

GPT-3LLMFew-Shot LearningIn-Context LearningOpenAI語言模型Scaling
Thomas Liang 許願
2406.11794v4 CC BY 4.0

DataComp-LM:探索下一代語言模型訓練集

DataComp-LM In search of the next generation of training sets for language models

Jeffrey Li, Alex Fang, et al.

LLMPretraining DataBenchmarkOpen DatasetData CurationCommon Crawl
Thomas Liang 許願
2506.04178v2 CC BY 4.0 Alibaba / Qwen Team

OpenThoughts:推理模型的資料配方

OpenThoughts Data Recipes for Reasoning Models

Etash Guha, et al.

LLMReasoningData RecipeSFTOpen DatasetDistillationBenchmark
Thomas Liang 許願
2604.03128v2 CC BY 4.0 Alibaba / Qwen Team

Self-Distilled RLVR:以自我蒸餾改進可驗證獎勵的強化學習

Self-Distilled RLVR

Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, J...

LLMRLVRSelf-DistillationReasoningRLMultimodalCredit Assignment
Teds Lin 許願
2604.14191v1 CC BY 4.0

Attention to Mamba:跨架構蒸餾的配方

Attention to Mamba A Recipe for Cross-Architecture Distillation

Abhinav Moudgil, Ningyuan Huang, Eeshan Gunesh Dhekane, Pau Rodríguez, Luca Zappella, Federico Danie...

MambaKnowledge DistillationCross-ArchitectureLinear AttentionHedgehogSSMLLM
Teds Lin 許願
2604.15034v2 CC BY 4.0 Google

Autogenesis:自我演化的智能體協定

Autogenesis A Self-Evolving Agent Protocol

Wentao Zhang, Zhe Zhao, Haibin Wen, Yingcheng Wu, Ming Yin, Bo An, Mengdi Wang

AgentSelf-EvolutionProtocolLLMMulti-AgentTool UseMCP
Teds Lin 許願
2604.15597v1 arXiv License

當你委派工作時,LLMs 會污染你的文件

LLMs Corrupt Your Documents When You Delegate

Philippe Laban, Tobias Schnabel, Jennifer Neville

LLMDocument EditingHallucinationAgentBenchmarkLong-Horizon EvaluationDelegated Work
Liang-Hsun Huang 許願
2604.20244v1 CC BY 4.0

大型語言模型的混合策略蒸餾

Hybrid Policy Distillation for LLMs

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

LLMDistillationRLPolicy DistillationReasoningKL DivergenceOn-policy
Teds Lin 許願
2604.26951v1 CC BY 4.0

翻轉 TIDE:擴散大型語言模型的跨架構蒸餾

Turning the TIDE Cross-Architecture Distillation for Diffusion Large Language Models

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

Diffusion LLMKnowledge DistillationCross-ArchitectureCross-TokenizerLLMCode Generation
Liang-Hsun Huang 許願
2604.15039v1 arXiv License Alibaba / Qwen Team

Prefill-as-a-Service:下一代模型的 KVCache 可跨資料中心傳輸

Prefill-as-a-Service KVCache of Next-Generation Models Could Go Cross-Datacenter

Ruoyu Qin, Weiran He, Yaoyu Wang, Zheming Li, Xinran Xu, Yongwei Wu, Weimin Zheng, Mingxing Zhang

LLMInferenceKV CacheDisaggregationHybrid Attention系統優化
Teds Lin 許願
2604.18131v1 CC BY 4.0

訓練 LLM 智能體透過世界知識探索實現自發、無獎勵的自我演化

Training LLM Agents for Spontaneous Reward-Free Self-Evolution via World Knowledge Exploration

Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang

LLMAgentSelf-EvolutionReinforcement LearningWeb Agent世界知識
Teds Lin 許願
2512.20848v1 CC BY 4.0 Alibaba / Qwen Team

Nemotron 3 Nano:開放高效的 MoE 混合 Mamba-Transformer 智能體推理模型

Nemotron 3 Nano Open Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA(300+ 位貢獻者)

LLMMoEMambaHybrid ArchitectureAgenticRLHF開源模型
林伯燊 許願
2604.14164v1 CC BY 4.0 Alibaba / Qwen Team

如何微調推理模型?師生合作框架合成學生一致的 SFT 資料

How to Fine-Tune a Reasoning Model A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

LLMReasoningSFTKnowledge DistillationCatastrophic Forgetting資料合成
Teds Lin 許願
2604.14922v1 CC BY 4.0 Alibaba / Qwen Team

LongAct:利用內在激活模式實現長上下文強化學習

LongAct Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

LLMLong ContextReinforcement LearningActivationSparse UpdateGRPO
Teds Lin 許願
2604.14116v1 CC BY 4.0

TREX:以智能體驅動的樹狀探索自動化 LLM 微調

TREX Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen...

LLMFine-tuningMulti-AgentMCTSAutoMLAI Scientist
Teds Lin 許願
2602.06036v1 CC BY 4.0 Alibaba / Qwen Team

DFlash:用區塊擴散模型實現閃電推測解碼

DFlash Block Diffusion for Flash Speculative Decoding

Jian Chen, Yesheng Liang, Zhijian Liu

LLMSpeculative DecodingDiffusion ModelInference加速推測解碼
林伯燊 許願
2510.03223v1 CC BY 4.0

Self-Anchor:透過逐步注意力對齊改進 LLM 推理

Self-Anchor LLM Reasoning via Step-by-step Attention Alignment

Hongxiang Zhang, Yuan Tian, Tianyi Zhang

LLMReasoningAttentionChain-of-ThoughtPrompt Engineering推理對齊
kerg kerg 許願
2411.01783v2 CC BY 4.0

上下文並行:可擴展的百萬 Token 推理

Context Parallelism for Scalable Million-Token Inference

Amy Yang, Jingyi Yang, Aya Ibrahim, Xinfeng Xie, Bangsheng Tang, Grigory Sizov, Jeremy Reizenstein, ...

LLMInferenceLong ContextParallelismRing Attention系統優化
kerg kerg 許願
2601.20789v1 CC BY 4.0 Alibaba / Qwen Team

SERA:軟驗證的高效程式碼倉庫智能體

SERA Soft-Verified Efficient Repository Agents

Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers

LLMCode AgentSWE-benchSynthetic DataSoftware Engineering開源模型
kerg kerg 許願
2601.19897v1 CC BY 4.0

自蒸餾實現持續學習

Self-Distillation Enables Continual Learning

Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal

LLMContinual LearningKnowledge DistillationOn-Policy LearningInverse RL災難性遺忘
kerg kerg 許願
2604.13010v1 CC BY 4.0 Alibaba / Qwen Team

Lightning OPD:利用離線同策略蒸餾實現大型推理模型的高效後訓練

Lightning OPD Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Yecheng Wu, Song Han, Han Cai

LLMKnowledge DistillationPost-TrainingOn-PolicyReasoning訓練效率
Teds Lin 許願
2604.12374v1 CC BY 4.0 Alibaba / Qwen Team

Nemotron 3 Super:開源高效混合專家 Mamba-Transformer 模型,面向智能體推理

Nemotron 3 Super Open Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA(數百位貢獻者)

LLMMoEMambaAgenticRLHFQuantization開源模型
Teds Lin 許願
2604.07941v1 arXiv License

大型語言模型後訓練:離策略與在策略學習的統一視角

Large Language Model Post-Training A Unified View of Off-Policy and On-Policy Learning

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia...

LLMPost-TrainingRLHFSFTPreference OptimizationDistillation綜述
Teds Lin 許願
2604.07569v1 CC BY 4.0

學習即遺忘:LLM 訓練作為有損壓縮

Learning is Forgetting LLM Training As Lossy Compression

Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Ma...

LLMInformation TheoryRepresentation LearningInformation BottleneckCompression可解釋性預訓練動態
Teds Lin 許願
2305.10429v4 arXiv License

DoReMi:最佳化資料混合比例加速語言模型預訓練

DoReMi Optimizing Data Mixtures Speeds Up Language Model Pretraining

Sang Michael Xie, Hieu Pham, Xuanyi Dong, Nan Du, Hanxiao Liu, Yifeng Lu, Percy Liang, Quoc V. Le, T...

LLMData MixingPretrainingDomain ReweightingDistributionally Robust Optimization資料選擇語言模型
Liang-Hsun Huang 許願
2602.21371v1 CC BY 4.0

交錯頭注意力機制

Interleaved Head Attention

Sai Surya Duvvuri, Chanakya Ekbote, Rachit Bansal, Rishabh Tiwari, Devvrit Khatri, David Brandfonbre...

LLMAttention MechanismTransformerMulti-Head AttentionReasoning長上下文架構設計
Teds Lin 許願
2604.06628v1 CC BY 4.0 Shanghai Artificial Intelligence Laboratory;Shanghai Jiao Tong University;University of Science and Technology of China

重新思考推理 SFT 中的泛化:對最佳化、資料與模型能力的條件式分析

Rethinking Generalization in Reasoning SFT

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, ...

SFTReasoningLong CoTGeneralizationPost-trainingLLMOptimization Dynamics
Teds Lin 許願
2510.25741v4 CC BY-SA 4.0 ByteDance Seed, UC Santa Cruz, Princeton University, Mila - Quebec AI Institute, University of Montreal, Peking University, CMU, University of Pennsylvania, Conscium, University of Manchester, M-A-P

透過循環語言模型擴展潛在推理 / Ouro

Scaling Latent Reasoning via Looped Language Models

Rui-Jie Zhu, Zixuan Wang, Kai Hua, Tianyu Zhang, Ziniu Li, Haoran Que, Boyi Wei, Zixin Wen, Fan Yin,...

LoopLMLatent ReasoningParameter EfficiencyPre-trainingAdaptive ComputationUniversal TransformerLLM開源模型
Teds Lin 許願
2603.04972v1 arXiv License Alibaba / Qwen Team

基於 Fisher–Rao 流形的功能導向 LLM 合併

Functionality-Oriented LLM Merging on the Fisher-Rao Manifold

Jiayu Wang, Zuojun Ye, Wenpeng Yin

LLMModel MergingFisher-RaoRiemannian GeometryKarcher MeanSLERPMergeKitQwen2.5
葉鴻 許願
2210.03629v3 CC BY 4.0 ¹普林斯頓大學 (Princeton University) 計算機科學系;²Google Research, Brain team

ReAct:在語言模型中協同推理與行動

ReAct Synergizing Reasoning and Acting in Language Models

Shunyu Yao¹*、Jeffrey Zhao²、Dian Yu²、Nan Du²、Izhak Shafran²、Karthik Narasimhan¹、Yuan Cao²

LLMAgentReasoningTool UsePromptingCoTICLR2023
Thomas Liang 許願
2404.19737v1 CC BY 4.0 ¹FAIR at Meta;²CERMICS, École des Ponts ParisTech;³LISN, Université Paris-Saclay

透過多 token 預測打造更好、更快的大型語言模型

Better and Faster Large Language Models via Multi-token Prediction

Fabian Gloeckle*¹,²、Badr Youbi Idrissi*¹,³、Baptiste Rozière¹、David Lopez-Paz⁺¹、Gabriel Synnaeve⁺¹

LLMPretrainingMulti-token PredictionSpeculative DecodingCode GenerationMetaLlama
林伯燊 許願
2604.06169v1 arXiv License Alibaba / Qwen Team

就地測試時訓練

In-Place Test-Time Training

Guhao Feng, Shengjie Luo, Kai Hua, Ge Zhang, Di He, Wenhao Huang, Tianle Cai

LLMTest-Time TrainingLong ContextMLPContinual LearningByteDanceQwen3RULER
Teds Lin 許願
2604.06231v1 CC BY 4.0

使用大型語言模型自動化資料庫原生函式程式碼合成

Automating Database-Native Function Code Synthesis with LLMs

Wei Zhou (上海交通大學)、Xuanhe Zhou* (上海交通大學,通訊作者)、Qikang He (上海交通大學)、Guoliang Li (清華大學)、Bingsheng He (新加坡...

LLMCode SynthesisDatabaseSQLUDFTool UseSIGMOD
Teds Lin 許願
2501.00656v3 CC BY 4.0 MIT

2 OLMo 2 Furious:完全開放的下一代語言模型家族

2 OLMo 2 Furious

OLMo Team(Pete Walsh, Luca Soldaini, Dirk Groeneveld, Kyle Lo, Shane Arora, Akshita Bhagia, ... Ali ...

LLMOLMo開源模型預訓練Mid-trainingRLVRTüluAllen AI
林伯燊 許願
2601.21343v1 arXiv License Meta FAIR

自我改進式預訓練:利用後訓練模型來預訓練更好的模型

Self-Improving Pretraining using post-trained models to pretrain better models

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, ...

預訓練強化學習安全性事實性推理中期訓練LLM
Liang-Hsun Huang 許願
2505.09388v1 arXiv License Alibaba / Qwen Team

Qwen3 技術報告

Qwen3 Technical Report

Qwen Team

LLMMoEQwen開源模型推理模型多語言
Liang-Hsun Huang 許願