Beyond GPT-5: Making LLMs Cheaper and Better via Performance-Efficiency Optimized Routing
在大型語言模型 (Large Language Model, LLM) 的發展中,平衡效能 (performance) 與效率 (efficiency) 是一項核心挑戰。GPT-5 透過測試時路由 (test-time routing) 來應對這個問題:在推論 (inference) 過程中,動態地將查詢 (query) 分派給高效率模型或高能力模型其中之一。在本研究中,我們提出 Avengers-Pro,一個將不同能力與效率的 LLM 進行集成 (ensemble) 的測試時路由框架,為所有效能—效率權衡 (performance-efficiency tradeoff) 提供統一的解決方案。 Avengers-Pro 會將進來的查詢嵌入 (embed) 並分群 (cluster),接著依據一個效能—效率分數 (performance-efficiency score) 將每個查詢路由到最合適的模型。在 6 個具挑戰性的基準測試 (benchmark) 與 8 個領先模型(包括 GPT-5-medium、Gemini-2.5-pro 與 Claude-opus-4.1)上,Avengers-Pro 取得了最先進 (state-of-the-art) 的結果:透過調整一個效能—效率權衡參數,它在平均準確率上能比最強的單一模型(GPT-5-medium)高出 +7%。此外,它能以低 27% 的成本達到與最強單一模型相同的平均準確率,並以低 63% 的成本達到該效能的約 90%。最後同樣重要的是,它達到了一條柏拉圖前緣 (Pareto frontier):在所有單一模型之中,對任何給定成本它都能持續產生最高準確率,對任何給定準確率它都能產生最低成本。 程式碼公開於 https://github.com/ZhangYiqun018/AvengersPro 。 > 【譯註:原文標註 Equal contribution(同等貢獻)、Corresponding author(通訊作者)、Project lead(專案主持人)等資訊,作者群為 Shanghai Artificial Intelligence Laboratory(上海人工智慧實驗室)。】 關鍵詞:Large Language Models、Model Routing、Cost-effective、Multi-objective Optimization 圖 1. Avengers-Pro 最佳化效能(準確率)與效率(成本)之間的權衡。 (A) 透過調整權衡參數 \alpha,Avengers-Pro 建立了一條柏拉圖前緣。相較於所有單一模型,它在任何給定成本下都達到最高準確率,並在任何給定準確率下都達到最低成本。(B) 在成本相當的情況下,Avengers-Pro 比最強的單一模型 GPT-5-medium 高出 7.1%。在效能相當的情況下,Avengers-Pro 相較於 GPT-5-medium 達成了 26.9% 的成本降低。
原文連結:arXiv