TREX:以智能體驅動的樹狀探索自動化 LLM 微調

原始論文:TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration 作者:Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li arXiv ID:2604.14116v1 日期:2026-04-15 標籤:LLM Fine-tuning Multi-Agent MCTS AutoML AI Scientist

目錄

1. 引言

LLM 已為 AI 研究智能體 (research agent) 在孤立任務上賦予了強大能力,但自動化複雜的工作流程——尤其是 LLM 訓練——仍然是一個挑戰。LLM 訓練方案的設計是開放式的,涉及多個相互作用的因素(資料、演算法、超參數);訓練資料的龐大規模讓直接納入 context 變得不可行;巨大的計算開銷也讓快速驗證變得困難。

Figure 1: TREX 在分子生成任務上的研究進展示意圖,展示任務定義輸入、效能改善軌跡、關鍵步驟,以及與人類專家微調模型的比較

本文提出 TREX,一個自動化完整 LLM 訓練生命週期的多智能體系統。它協調兩個核心模組的合作:

  • Researcher(研究員):進行文獻研究、策略規劃
  • Executor(執行者):實作訓練與評估

TREX 將實驗過程建模為一棵搜尋樹,用 Monte Carlo Tree Search (MCTS) 引導擴展,兼顧高效能解的利用 (exploitation) 和新穎方法的探索 (exploration)。系統還配備學術搜尋、實驗追蹤,以及自家的 AIDP (AI Data Processing) 函式庫來組合資料管線。

同時提出 FT-Bench,一個包含 10 個真實任務的 benchmark,涵蓋從基礎能力優化到特定領域適配的範疇。實驗證明,TREX 可在所有任務上穩定提升基礎模型效能,在多個任務上甚至匹配或超越人類專家設計的微調管線。

2. 相關工作

2.1 AI 增強的研究

LLM 協助文獻搜尋(DeepResearch、RAG 系統)、學術寫作、想法生成與實作(Dolphin、InternAgent、AI-Scientist)。從輔助工具到協作夥伴的演進是關鍵趨勢。

2.2 自主研究智能體

端到端 AI 研究員(AI Scientist v1 & v2、AI Researcher)和演化式搜尋智能體(結合演化演算法、樹搜尋)。現有 benchmark(MLE-bench、RE-bench、IdeaBench)缺乏專門針對 LLM 訓練的系統性評估資料集。

2.3 自動化模型訓練

AutoML 方法仍受限於預定義的搜尋空間。AI 在資料建構(合成、精煉、過濾)上的應用越來越多,但 TREX 提出了更全面、完全自動化的範式——將資料準備整合進自主迴圈中。

3. TREX 框架

3.1 概覽

系統採用雙迴圈 (dual-loop) 工作流程:

內迴圈 (Inner Loop):Researcher 與 Executor 針對單一實驗輪次合作。Researcher 根據任務目標和歷史制定計畫;Executor 在 GPU 叢集上實作並回傳結果供分析。

外迴圈 (Outer Loop):多輪實驗建模為一棵樹,由 MCTS 引導擴展,平衡高效能解的利用與新穎方法的探索。

Figure 2: TREX 框架架構,展示多智能體設計、雙迴圈工作流程、MCTS 引導擴展、Researcher-Executor 協作,以及外部知識存取的工具集

3.2 智能體框架

Researcher Agent:採用 coarse-to-fine 方法。先決定高層策略(資料增強、演算法探索),再細化為 3-5 個並行訓練配置的具體計畫。可存取學術搜尋引擎和 Hugging Face 資料集。

Executor Agent:基於 OpenHands 框架實作,將叢集任務排程 API 整合為工具。具備沙盒化環境隔離。

AIDP Library:模組化工具包,提供高效能、決定性的 LLM 資料管線運算子。建立在 HuggingFace Datasets 上,提供語義清晰的模組化組合,便於智能體編排。

實驗診斷 (Experiment Diagnostics):全面分析策略,檢視驗證集失敗案例、歸因分析、比較性 benchmark 分析、跨實驗綜合分析,最大化每輪迭代的資訊量。

3.3 訓練方案的迭代探索

MCTS 實作:從 root 節點的基線實驗出發,後續迭代選擇 Upper Confidence Bound for Trees (UCT) 分數最高的節點:

$$\text{UCT}(v) = \frac{Q_v}{N_v} + c \sqrt{\frac{\ln N_{P(v)}}{N_v}}$$

其中 $N_v$ 為訪問次數,$Q_v$ 為累積獎勵,$N_{P(v)}$ 為父節點訪問次數。

記憶 context 管理:歷史資訊從三個來源濃縮:

  • 從 root 到當前節點的軌跡(血緣,lineage)
  • 兄弟節點(避免重複)
  • 關鍵節點(重大收益或失敗,全域洞察)

4. FT-Bench Benchmark

4.1 Benchmark 建構

FT-Bench 包含 10 個源自真實情境的任務,具可控的計算開銷:

  1. ACI-Bench:對話臨床筆記生成
  2. TOMG-Bench:基於文字的分子生成
  3. oMeBench:化學反應機理推理
  4. HoC:癌症特徵分類
  5. CS-Bench:電腦科學能力評估
  6. OpenFinData:金融問答
  7. SST-2:情感分類
  8. EconlogicQA:經濟邏輯順序推理
  9. GTA:智能體工具使用
  10. LawBench:法律知識評估

4.2 與現有 Benchmark 比較

FT-Bench 是首個專門針對端到端 LLM 微調的 benchmark,要求自主導航完整管線。現有 benchmark 聚焦孤立子任務(MLAgentBench、ScienceAgentBench)或傳統 ML 範式(MLEBench),錯失了現代 LLM 訓練的挑戰。

5. 實驗

5.1 實驗設定

  • 基礎模型:Qwen3-1.7B,每次實驗最多 50,000 個訓練樣本
  • Researcher 後端:Qwen3-Next-80B-Thinking 和 Gemini 3 Pro 兩個版本
  • Executor 後端:Claude 4.5 Sonnet
  • 評估指標:標準化相對效能增益:

$$G_T = \frac{\mathcal{E}_T(M_{FT}) - \mathcal{E}_T(M_{Base})}{\mathcal{E}_T(M_{Ref}) - \mathcal{E}_T(M_{Base})}$$

其中 Qwen3-235B-2507 為參考模型。

5.2 主要結果

TREX 在所有任務上穩定提升基礎模型效能。Gemini 3 Pro 後端在多數任務上優於 Qwen3-Next-80B-Thinking,說明底層 LLM 的推理能力直接影響系統效能。

Figure 3: TOMG-Bench 與 OpenFinData 任務上使用不同 LLM 引擎的分數進展與比較分析

Figure 4: TOMG-Bench 與 OpenFinData 任務效能軌跡(續)

關鍵發現:

  • 提供初始訓練集的任務(ACI-Bench、TOMG-Bench)更容易建立基線、有效率迭代
  • 需要從零建構資料集的任務(CS-Bench、GTA)需要更多研究和迭代

與人類微調比較:

  • TOMG-Bench:TREX 達 0.498 效能增益,優於人類專家 OpenMolIns-Large 的 0.189-0.139
  • OpenFinData:TREX 達 0.205 增益,接近人類專家 FEVO 方法的 0.025-0.207

節點擴展策略:TREX 在資料處理和訓練方法上探索多樣化的優化方向。Gemini 3 Pro 展現更好的策略多樣性和執行成功率。

5.3 消融研究

樹搜尋策略比較:

Figure 5: 在 oMeBench 任務上 MCTS 與 GBFS 和 SES 的效能比較

Figure 6: 在 GTA 任務上 MCTS 與 GBFS 和 SES 的效能比較

MCTS 相比 Greedy Best-First Search (GBFS) 和 Sequential Expansion Search (SES) 展現更高的穩定性:波動更小、效能提升更一致。

AIDP Library 影響:

Figure 7: 在 oMeBench 上使用 vs. 不使用 AIDP 工具的效能差異

Figure 8: 在 GTA 上使用 vs. 不使用 AIDP 工具的效能差異

沒有 AIDP 工具的系統效能提升顯著較低,且更容易在資料處理步驟中中斷。

Bad-case 分析:

Figure 9: 在 oMeBench 上有 vs. 沒有 bad case 存取的效能比較

Figure 10: 在 GTA 上有 vs. 沒有 bad case 存取的效能比較

在實驗診斷中納入失敗案例分析能實現更有效的迭代,產生更高的最終效能分數。

6. 結論

TREX 是一個多智能體框架,透過協調的規劃、執行和迭代精煉自動化完整的 LLM 微調生命週期。將訓練優化表述為基於 MCTS 的樹搜尋,系統能在計算限制下高效探索訓練策略空間。TREX 穩定提升模型效能,在多個案例中匹配或超越專家設計的管線,展示了智能體系統作為自動化 AI 研究可擴展範式的潛力。


參考文獻

Lewis, P., et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 2020.

Karpukhin, V., et al. Dense Passage Retrieval for Open-Domain Question Answering. EMNLP, 2020.

Lu, C., et al. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery, 2024.

Yamada, K., et al. The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search, 2025.

Wang, X., et al. OpenHands: An Open Platform for AI Software Developers as Generalist Agents. ICLR, 2025.

Coulom, R. Efficient Selectivity and Backup Operators in Monte-Carlo Tree Search. Computers and Games, 2006.

Le, Q.V. and Zoph, B. Neural Architecture Search with Reinforcement Learning. ICLR, 2017.

Erickson, N., et al. AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data, 2020.

Yang, Z., et al. Qwen3 Technical Report, 2025.

Anthropic. Claude 4.5 Sonnet, 2025.

Google DeepMind. Gemini 3 Pro Technical Report, 2026.

AI-MO. MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering, 2024.

Chan, J.S., et al. MLE-Bench, 2024.

METR. RE-bench: Evaluating Frontier AI R&D Capabilities, 2024.

Ruan, J., et al. IdeaBench: Benchmarking Large Language Models for Research Idea Generation, 2024.

Yuan, Y., et al. ACI-Bench: A Novel Ambient Clinical Intelligence Dataset, 2023.

Li, J., et al. TOMG-Bench: Evaluating LLMs on Text-based Open Molecule Generation, 2024.

Liu, Y., et al. oMeBench: Benchmarking LLMs for Organic Mechanism Reasoning, 2025.

Baker, S., et al. HoC: The Hallmarks of Cancer Corpus, 2016.

Zhou, G., et al. CS-Bench: Computer Science Benchmark, 2024.

OpenCompass Team. OpenFinData: A Financial Data Benchmark, 2024.

Socher, R., et al. SST-2: Stanford Sentiment Treebank, 2013.

Quan, S., et al. EconlogicQA: Economic Sequential Reasoning, 2024.

Wang, J., et al. GTA: A Benchmark for General Tool Agents, 2024.

Fei, Z., et al. LawBench: Benchmarking Legal Knowledge of Large Language Models, 2023.

HuggingFace. Datasets: A Community Library for Natural Language Processing, 2021.


術語對照表

英文 中文
Fine-tuning 微調
Multi-Agent System 多智能體系統
Research Agent 研究智能體
Monte Carlo Tree Search (MCTS) 蒙地卡羅樹搜尋
Upper Confidence Bound for Trees (UCT) 樹上信賴區間上界
Tree-based Exploration 樹狀探索
Dual-loop Workflow 雙迴圈工作流程
Inner Loop / Outer Loop 內迴圈 / 外迴圈
Researcher Agent 研究員智能體
Executor Agent 執行者智能體
AIDP (AI Data Processing) AI 資料處理函式庫
Experiment Diagnostics 實驗診斷
Bad-case Analysis 失敗案例分析
Greedy Best-First Search (GBFS) 貪婪最佳優先搜尋
Sequential Expansion Search (SES) 順序擴展搜尋
Exploitation / Exploration 利用 / 探索
AutoML 自動化機器學習
Data Pipeline 資料管線
FT-Bench 微調基準測試
Data Augmentation 資料增強
Hyperparameter 超參數
Lineage 血緣
← 回到列表
已複製連結