LLMs Corrupt Your Documents When You Delegate
大型語言模型 (Large Language Models, LLMs) 越來越常被應用於「委派工作 (delegated work)」場景中,使用者依賴 AI 來編輯文件而不直接審視每一次變動。本研究提出 DELEGATE-52 ——一個橫跨 52 個專業領域、模擬長時程工作流程 (long workflows) 的基準測試。我們以「往返中繼 (round-trip relay)」的方式對 19 個 LLMs 進行評估,得到令人擔憂的發現:即使是前沿模型 (frontier models),在 20 次互動後也會將文件品質降低約 25%;其他模型則表現得明顯更糟。提供工具 (tool use) 並未帶來改善,且文件污染 (corruption) 會隨著文件大小、互動長度、以及干擾文件 (distractor documents) 的存在而呈倍數累積。 圖 1:跨領域文件污染的代表性示例。即使是頂尖模型,在多次往返互動後也會在重抄、編輯、轉換等任務中引入錯誤。
原文連結:arXiv