深度天花板:大型語言模型在發現潛在規劃中的極限

The Depth Ceiling On the Limits of Large Language Models in Discovering Latent Planning

摘要

思維鏈 (Chain-of-Thought, CoT) 監控的可行性取決於模型是否無法在其潛在表示 (Latent Representations) 中有效推理。然而,關於 LLM 中這種潛在推理 (Latent Reasoning) 的極限,我們所知甚少。我們透過研究模型是否能在沒有中間步驟監督的情況下發現多步驟規劃策略,並在單次前向傳遞 (Forward Pass) 中潛在地執行這些策略,來測試這些極限。 使用能精確控制所需潛在規劃步驟數的圖路徑搜尋任務,我們揭示了一個即使大規模擴展也無法解決的顯著限制:從頭訓練的小型 Transformer 能發現需要最多三個潛在步驟的策略,微調後的 GPT-4o 和 Qwen3-32B 達到五步,而 GPT-5.4 在少樣本提示下達到七步。雖然模型在訓練期間能學習的最大潛在規劃深度為五步,但所發現的策略在測試時能泛化到最多八個潛在步驟。這揭示了在僅有最終答案監督下發現潛在策略的能力與一旦發現後執行該策略的能力之間的分離。如果類似的限制更廣泛地成立,那麼需要多個協調的潛在規劃步驟的策略可能需要被明確教導或外化,這為思維鏈監控提供了支持。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv