ReAct: Synergizing Reasoning and Acting in Language Models
ReAct:在語言模型中協同推理與行動
原始論文:ReAct: Synergizing Reasoning and Acting in Language Models 作者:Shunyu Yao¹*、Jeffrey Zhao²、Dian Yu²、Nan Du²、Izhak Shafran²、Karthik Narasimhan¹、Yuan Cao² 機構:¹普林斯頓大學 (Princeton University) 計算機科學系;²Google Research, Brain team arXiv ID:2210.03629v3 日期:2023-03-10(v3;ICLR 2023) 專案頁面:react-lm.github.io 標籤:LLM Agent Reasoning Tool Use Prompting CoT ICLR2023
摘要
雖然大型語言模型 (Large Language Models, LLMs) 已在語言理解與互動式決策任務上展現驚人的表現,它們在推理 (Reasoning)(例如思維鏈提示 (Chain-of-Thought Prompting, CoT))與行動 (Acting)(例如行動計畫生成)兩種能力上,過去主要被視為彼此獨立的研究主題。本文探討如何讓 LLM 以交錯方式同時生成推理軌跡 (reasoning trace) 與任務專屬行動 (task-specific action),使兩者產生更強的協同效應:推理軌跡幫助模型推導、追蹤、更新行動計畫並處理例外狀況;而行動則讓模型能夠連接外部環境(如知識庫或互動環境)以蒐集額外資訊。
我們將此方法命名為 ReAct,並在多個語言與決策任務上展示其相對於 SOTA 基線的有效性,並同時提升人類可解釋性與信賴度。具體而言,在問答 (HotpotQA) 與事實查證 (Fever) 任務中,ReAct 透過與簡單的 Wikipedia API 互動,克服了思維鏈推理普遍存在的幻覺 (hallucination) 與錯誤傳遞 (error propagation) 問題,並產生比無推理軌跡基線更具人性化、更可解釋的解題軌跡。在兩個互動決策基準 (ALFWorld 與 WebShop) 上,ReAct 僅以一到兩個 in-context 範例就能在絕對成功率上分別超越模仿學習與強化學習方法 34% 與 10%。
一、引言
人類智慧的一項獨特特徵,是能夠無縫地將任務導向行動與口語推理(或稱「內語 (inner speech)」(Alderson-Day & Fernyhough, 2015))結合在一起。這種能力被認為在人類認知中扮演關鍵角色,可達成自我調節、策略規劃 (Vygotsky, 1987; Luria, 1965; Fernyhough, 2010),以及維持工作記憶 (working memory) (Baddeley, 1992)。
以「在廚房做菜」為例:在任意兩個具體動作之間,我們可能會用語言進行推理,以追蹤進度(「東西都切好了,我該把水煮開」)、處理例外或調整計畫(「沒有鹽,那我用醬油加胡椒代替」)、以及察覺需要外部資訊(「麵團要怎麼做?來上網查一下」)。我們也會做出行動(翻食譜、開冰箱、檢查食材)來支持推理並回答問題(「現在能做什麼菜?」)。這種「行動」與「推理」之間的緊密協同,讓人類得以快速學習新任務,並在面對未知情境或資訊不確定時,仍能進行穩健的決策與推理。
近期的研究結果暗示,將口語推理與互動決策結合在自主系統中是可行的。一方面,經過妥善提示的 LLM 已展現出湧現能力 (emergent capability),可執行多步推理軌跡以解決算術、常識與符號推理任務 (Wei et al., 2022)。然而,這種「思維鏈」推理是一個靜態黑盒:模型只用自身的內部表徵生成思緒,與外在世界缺乏「接地 (grounding)」,因而無法做出反應式推理或更新知識,導致事實幻覺與錯誤在推理過程中傳遞累積(圖 1(1b))。
另一方面,近期工作探索使用預訓練語言模型於互動環境中進行規劃與行動 (Ahn et al., 2022; Nakano et al., 2021; Yao et al., 2020; Huang et al., 2022a),重點放在以語言先驗預測動作。這類方法通常將多模態觀測 (multi-modal observation) 轉為文字,以語言模型生成領域專屬動作或計畫,再用一個控制器來選擇或執行。然而,它們並不利用語言模型對高階目標進行抽象推理,也不維持工作記憶來支援行動。除了 Huang et al. (2022b) 進行了有限度的口語推理(重述當前狀態的空間事實)之外,目前尚未有研究系統性地探討「推理」與「行動」如何在通用任務求解中協同運作,以及這種結合是否能帶來相對於單獨推理或單獨行動的系統性效益。
本文提出 ReAct,一種將推理與行動結合的通用範式 (paradigm),用以解決多元的語言推理與決策任務(圖 1)。ReAct 提示 LLM 以交錯方式產生口語推理軌跡與任務相關行動,使模型既能進行動態推理以建立、維護、調整行動計畫(reason to act),也能與外部環境(例如 Wikipedia)互動,把額外資訊納入推理(act to reason)。
我們在四個多元基準上對 ReAct 與 SOTA 基線進行實證評估:問答 (HotpotQA, Yang et al., 2018)、事實查證 (Fever, Thorne et al., 2018)、文本遊戲 (ALFWorld, Shridhar et al., 2020b)、網頁導覽 (WebShop, Yao et al., 2022)。結果發現:
- 在 HotpotQA 與 Fever 上,配合 Wikipedia API,ReAct 優於原生 (vanilla) 行動生成模型,並與 CoT 不相上下。整體最佳方法是 ReAct 與 CoT 的結合,能同時運用模型內部知識與外部資訊。
- 在 ALFWorld 與 WebShop 上,ReAct 僅以一兩個範例的提示,就能擊敗以 10³~10⁵ 個任務實例訓練的模仿與強化學習方法,絕對成功率分別提升 34% 與 10%。
- 我們進一步透過控制實驗,證明稀疏 (sparse) 而靈活的推理在決策中的價值,以及推理與行動結合能改善可解釋性、信賴度與可診斷性。
主要貢獻:
- 提出 ReAct,以提示為基礎的新範式,協同 LLM 中的推理與行動以解決通用任務。
- 在多個基準上進行 few-shot 學習實驗,證明 ReAct 相較於單獨推理或單獨行動的優勢。
- 系統性消融與分析,理解行動對推理任務的重要性,與推理對互動任務的重要性。
- 分析 ReAct 在提示設定下的限制(例如推理與行動行為支援有限),並進行初步微調實驗,展示 ReAct 在加入訓練資料後的潛力。
[Figure 1: 四種提示方法的比較示意圖。(1) HotpotQA 任務上 (a) 標準提示、(b) CoT (Reason Only)、(c) Act-only、(d) ReAct (Reason+Act) 的解題軌跡對比;(2) ALFWorld 文字遊戲中 (a) Act-only 與 (b) ReAct 的對比。CoT 出現幻覺(誤答 iPod、iPhone、iPad),Act-only 則陷入錯誤搜尋的迴圈,而 ReAct 透過交錯思緒與行動成功找到正確答案 "keyboard function keys";在 ALFWorld 上 ReAct 透過 Think 行動列出常見位置、規劃次目標,順利完成任務。]
二、ReAct:協同推理與行動
考慮一個代理人 (agent) 與環境互動以求解任務的通用設定。在時間步 $t$,代理人從環境接收觀測 $o_t \in \mathcal{O}$,並依據某策略 $\pi(a_t \mid c_t)$ 採取行動 $a_t \in \mathcal{A}$,其中 $c_t = (o_1, a_1, \cdots, o_{t-1}, a_{t-1}, o_t)$ 是給代理人的上下文。當映射 $c_t \mapsto a_t$ 高度隱含且需要大量計算時,學習一個策略相當困難。例如在圖 1(1c) 中,代理人因為無法在 (Question, Act 1-3, Obs 1-3) 的軌跡上進行複雜推理,而無法產生正確的最終行動 (Act 4)。同樣地,圖 1(2a) 中的代理人由於無法從上下文理解 sinkbasin 1 並無 peppershaker 1,便不斷產生幻覺式的行動。
ReAct 的想法很簡單:我們將代理人的行動空間擴張為 $\hat{\mathcal{A}} = \mathcal{A} \cup \mathcal{L}$,其中 $\mathcal{L}$ 是語言空間。語言空間中的行動 $\hat{a}_t \in \mathcal{L}$,我們稱為思緒 (thought) 或推理軌跡 (reasoning trace),它不影響外在環境,因此沒有觀測回饋。相反地,思緒 $\hat{a}_t$ 的目的是透過對當前上下文 $c_t$ 進行推理,來組合有用資訊,並更新上下文 $c_{t+1} = (c_t, \hat{a}_t)$ 以支援未來的推理或行動。
如圖 1 所示,思緒可有多種有用形式:
- 分解任務目標、建立行動計畫(2b 的 Act 1;1d 的 Thought 1)
- 注入解題所需的常識知識(2b 的 Act 1)
- 從觀測中萃取重要資訊(1d 的 Thought 2、4)
- 追蹤進度並切換行動計畫(2b 的 Act 8)
- 處理例外與調整行動計畫(1d 的 Thought 3)
然而,由於語言空間 $\mathcal{L}$ 是無限的,在這個擴張的行動空間中學習相當困難,且需要強大的語言先驗。本文主要聚焦於凍結 (frozen) 大型語言模型 (PaLM-540B, Chowdhery et al., 2022) 的設定,以 few-shot in-context 範例提示模型,使其同時生成領域專屬行動與自由形式的語言思緒。每個 in-context 範例都是一條由人類書寫的「行動 + 思緒 + 環境觀測」軌跡(詳見附錄 C)。
對於以推理為主的任務(圖 1(1)),我們交替生成思緒與行動,使解題軌跡由多個「思緒-行動-觀測」步驟組成。對於可能涉及大量行動的決策任務(圖 1(2)),思緒只需要在最關鍵位置稀疏出現,因此我們讓語言模型自行決定思緒與行動的非同步出現時機。
ReAct 的幾項獨特特性:
- A) 直觀且易於設計:撰寫 ReAct 提示十分直接,人類標註者只需在自己的行動之上把思緒寫成語言即可,本論文未使用任何特殊格式選擇、思緒設計或範例挑選技巧。
- B) 通用且彈性:由於思緒空間靈活、思緒-行動的出現格式自由,ReAct 能適用於行動空間與推理需求差異甚大的多元任務(QA、事實查證、文字遊戲、網頁導覽等)。
- C) 表現良好且穩健:ReAct 對新任務實例的泛化能力強,僅以 1~6 個 in-context 範例學習,便在各領域上一致地優於僅有推理或僅有行動的基線;微調後表現更佳,且對提示選擇穩健。
- D) 與人類對齊且可控:ReAct 提供可解釋的序列決策與推理過程,人類能輕易檢視推理與事實正確性;亦可透過編輯思緒,即時修正代理人的行為。
三、知識密集型推理任務
我們從多跳問答 (multi-hop QA) 與事實查證等知識密集型推理任務開始。如圖 1(1d) 所示,透過與 Wikipedia API 互動,ReAct 能擷取資訊以支援推理,並用推理來決定下一步要查什麼,展示推理與行動的協同。
3.1 設定
任務領域 我們考慮兩個對知識擷取與推理具挑戰性的資料集:
- HotpotQA (Yang et al., 2018):需在兩段以上 Wikipedia 段落上進行推理的多跳問答基準。
- FEVER (Thorne et al., 2018):事實查證基準,每個聲明被標註為 SUPPORTS / REFUTES / NOT ENOUGH INFO,依據是否存在能驗證該聲明的 Wikipedia 段落。
兩個任務皆採「僅有問題」的設定:模型只接收問題或聲明作為輸入,無法直接讀取支持段落,必須依靠內部知識,或透過與外部環境互動來擷取知識。
行動空間 我們設計了一個簡單的 Wikipedia Web API,提供三種互動式資訊擷取行動:
search[entity]:若實體頁存在,回傳其 wiki 頁面前 5 句;否則建議前 5 名相似實體。lookup[string]:回傳當前頁面下一句包含string的文本,模擬瀏覽器 Ctrl+F。finish[answer]:以answer結束當前任務。
此行動空間刻意設計得比 SOTA 詞彙或神經檢索器弱很多,目的是模擬人類如何與 Wikipedia 互動,並迫使模型透過明確的語言推理來檢索資訊。
3.2 方法
ReAct 提示 針對 HotpotQA 與 Fever,我們從訓練集中隨機挑選 6 與 3 個案例,手動撰寫 ReAct 格式的軌跡作為 few-shot 範例。每條軌跡由多個「思緒-行動-觀測」步驟組成(dense thought),自由形式的思緒涵蓋多種用途:分解問題、從 Wikipedia 觀測中萃取資訊、進行常識或算術推理、引導重新搜尋、合成最終答案。
基線 我們系統性地對 ReAct 軌跡做消融,建立多個基線:
- (a) Standard 提示:移除 ReAct 軌跡中所有思緒、行動與觀測。
- (b) CoT 提示 (Wei et al., 2022):移除行動與觀測,作為純推理基線。我們也建立 CoT-SC 基線 (Wang et al., 2022a;b),於推論時以溫度 0.7 取樣 21 條 CoT 軌跡並採多數答案,已知能持續優於 CoT。
- (c) Act-only 提示:移除 ReAct 軌跡中的所有思緒,鬆散地對應 WebGPT 與網路互動的方式。
結合內部與外部知識 我們提出將 ReAct 與 CoT-SC 結合,由模型依以下啟發式決定何時切換方法:
- A) ReAct → CoT-SC:當 ReAct 在給定步數內無法回答時,退回 CoT-SC。HotpotQA 與 Fever 分別設定 7 與 5 步,因為更多步並不會提升 ReAct 表現。
- B) CoT-SC → ReAct:當 $n$ 個 CoT-SC 樣本中多數答案的出現次數少於 $n/2$(即內部知識可能不足以自信地完成任務)時,退回 ReAct。
微調 由於人工標註推理軌跡與行動的成本極高,我們採用類似 Zelikman et al. (2022) 的自舉 (bootstrapping) 方法:用 ReAct 等方法生成 3,000 條正解軌跡,微調較小的 PaLM-8B/62B 模型,使其能在輸入問題或聲明的條件下解碼出整條軌跡。
3.3 結果與觀察
ReAct 一致地優於 Act Table 1 顯示在 PaLM-540B 上,ReAct 在兩個任務上都優於 Act,證明推理對於「引導行動」(特別是合成最終答案)的價值。微調結果亦支持此結論。
Table 1:PaLM-540B 在 HotpotQA 與 Fever 上的提示結果
| 提示方法 | HotpotQA (EM) | Fever (Acc) |
|---|---|---|
| Standard | 28.7 | 57.1 |
| CoT (Wei et al., 2022) | 29.4 | 56.3 |
| CoT-SC (Wang et al., 2022a) | 33.4 | 60.4 |
| Act | 25.7 | 58.9 |
| ReAct | 27.4 | 60.9 |
| CoT-SC → ReAct | 34.2 | 64.6 |
| ReAct → CoT-SC | 35.1 | 62.0 |
| Supervised SoTA | 67.5 | 89.5 |
ReAct vs. CoT ReAct 在 Fever 上勝出 (60.9 vs. 56.3),但在 HotpotQA 上略落後 (27.4 vs. 29.4)。我們從 ReAct 與 CoT 各隨機抽 50 個正答與 50 個錯答,總共 200 例進行人工分析,得到下列關鍵觀察:
Table 2:ReAct 與 CoT 在 HotpotQA 上的成功與失敗模式類型
| 類型 | 定義 | ReAct | CoT | |
|---|---|---|---|---|
| 成功 | 真陽性 | 推理軌跡與事實皆正確 | 94% | 86% |
| 偽陽性 | 推理軌跡或事實出現幻覺 | 6% | 14% | |
| 失敗 | 推理錯誤 | 推理軌跡錯誤(含無法跳出重複步驟) | 47% | 16% |
| 搜尋結果錯誤 | 搜尋回傳空結果或無有用資訊 | 23% | - | |
| 幻覺 | 推理軌跡或事實幻覺 | 0% | 56% | |
| 標籤模糊 | 預測正確但與標籤不完全一致 | 29% | 28% |
(A) 幻覺對 CoT 是嚴重問題:CoT 的偽陽性率明顯高於 ReAct (14% vs. 6%),且幻覺占其失敗的 56%;ReAct 的解題軌跡因可存取外部知識庫而更具事實性與信賴度。
(B) 推理-行動-觀測的結構約束:雖提升 ReAct 的接地性與信賴度,卻也犧牲了推理步驟的彈性,導致 ReAct 的推理錯誤率高於 CoT。其中常見的特定錯誤模式是「重複生成先前的思緒與行動」並陷入迴圈。
(C) 對 ReAct 而言,成功透過 search 擷取有資訊的知識至關重要:無資訊搜尋占錯誤案例的 23%,會使模型脫軌、難以恢復與重新組織思緒。這是事實性與彈性的權衡,也是我們提出兩種方法結合策略的動機。
ReAct + CoT-SC 提示 LLM 的最佳組合 Table 1 顯示在 HotpotQA 與 Fever 上,最佳提示方法分別是 ReAct → CoT-SC 與 CoT-SC → ReAct。圖 2 進一步顯示在不同 CoT-SC 樣本數下,兩種 ReAct + CoT-SC 方法都能持續顯著超越純 CoT-SC,甚至只用 3-5 個樣本就能達到 21 樣本 CoT-SC 的水準。這證明了妥善結合內部與外部知識對推理任務的價值。
ReAct 是微調的最佳方法 圖 3 顯示在 HotpotQA 上,PaLM-8B/62B 提示時 ReAct 因為要同時學推理與行動而表現最差;然而僅以 3,000 例微調後,ReAct 變成四種方法中最佳,PaLM-8B 微調後的 ReAct 即超越 PaLM-62B 的所有提示方法,PaLM-62B 微調後的 ReAct 則超越 PaLM-540B 所有提示方法。微調 Standard 或 CoT 顯著差於微調 ReAct 或 Act,因為前者本質上是教模型記憶(可能是幻覺的)知識事實,後者則是教模型如何(推理並)行動以從 Wikipedia 取得資訊,後者是更可泛化的知識推理技能。
[Figure 3: 在 HotpotQA 上,prompting 與 finetuning 兩種學習設定下,PaLM-8B / 62B / 540B 對四種方法 (Standard、CoT、Act、ReAct) 的 EM 表現。Prompting 時 ReAct 在小模型上劣於其他方法;finetuning 時 ReAct 反而成為最佳。]
四、決策任務
我們也在兩個語言式互動決策任務上測試 ReAct:ALFWorld 與 WebShop,兩者皆有複雜環境,需要代理人在長時序與稀疏獎勵下行動,正適合需要推理來行動與探索的情境。
ALFWorld (Shridhar et al., 2020b)(圖 1(2))是一個合成文字遊戲,與具身 ALFRED 基準對齊。它包含 6 種任務(如「在桌燈下檢查一張紙」),代理人需在以文字行動模擬的家庭場景中導覽並互動(如 go to coffeetable 1、take paper 2、use desklamp 1)。一個任務實例可有 50 個以上位置,專家策略也需 50 步以上才能解出,這挑戰代理人的計畫、子目標追蹤與系統性探索能力(例如逐一檢查所有桌子尋找桌燈)。ALFWorld 的另一挑戰是需判斷常見家居物品的可能位置(桌燈通常在桌、架、櫃上),這正適合 LLM 發揮預訓練常識知識。
我們對每種任務隨機挑選 3 條訓練軌跡進行人工標註,加入稀疏思緒以:(1) 分解目標,(2) 追蹤子目標完成度,(3) 決定下個子目標,(4) 用常識推理物品位置與用途。我們以 134 個 unseen 評估遊戲做評估,並從 3 條標註軌跡中對每種任務排列出 6 種提示組合。基線是 BUTLER (Shridhar et al., 2020b),這是一個用每種任務 10⁵ 條專家軌跡訓練的模仿學習代理人。
WebShop (Yao et al., 2022) 是最近提出的線上購物網站環境,包含 1.18M 真實商品與 12k 人類指令。與 ALFWorld 不同,WebShop 含有大量結構化與非結構化文字(商品標題、描述、選項皆爬自 Amazon),代理人需依使用者指令(如「我要找有抽屜的床頭櫃,鎳金屬飾面,價格低於 140 美元」)透過網頁互動完成購買(搜尋、選擇商品、選擇選項、購買)。評估指標為平均分數(所選商品涵蓋的需求屬性比例)與成功率(完全滿足所有需求的比例)。我們以 Act 提示包含 search、choose product、choose options 與 buy 等行動,ReAct 提示則額外加入推理以決定何時探索、何時購買、哪些選項相關。
Table 3:ALFWorld 任務的成功率 (%)
| 方法 | Pick | Clean | Heat | Cool | Look | Pick 2 | All |
|---|---|---|---|---|---|---|---|
| Act (best of 6) | 88 | 42 | 74 | 67 | 72 | 41 | 45 |
| ReAct (avg) | 65 | 39 | 83 | 76 | 55 | 24 | 57 |
| ReAct (best of 6) | 92 | 58 | 96 | 86 | 78 | 41 | 71 |
| ReAct-IM (avg) | 55 | 59 | 60 | 55 | 23 | 24 | 48 |
| ReAct-IM (best of 6) | 62 | 68 | 87 | 57 | 39 | 33 | 53 |
| BUTLERg (best of 8) | 33 | 26 | 70 | 76 | 17 | 12 | 22 |
| BUTLER (best of 8) | 46 | 39 | 74 | 100 | 22 | 24 | 37 |
Table 4:WebShop 上的分數與成功率
| 方法 | Score | SR |
|---|---|---|
| Act | 62.3 | 30.1 |
| ReAct | 66.6 | 40.0 |
| IL | 59.9 | 29.1 |
| IL+RL | 62.4 | 28.7 |
| Human Expert | 82.1 | 59.6 |
結果 ReAct 在 ALFWorld 與 WebShop 上皆優於 Act。在 ALFWorld 上,最佳 ReAct 試驗達 71% 平均成功率,顯著超越最佳 Act (45%) 與 BUTLER (37%);甚至最差的 ReAct 試驗 (48%) 也勝過兩者的最佳試驗。ReAct 對 Act 的優勢在六次受控試驗中一致,相對提升從 33% 到 90%,平均 62%。質性觀察上,沒有任何思緒的 Act 經常無法將目標分解為較小的子目標,或會忘掉當前環境狀態。
在 WebShop 上,one-shot Act 提示已能與 IL 與 IL+RL 不相上下;加入稀疏推理後,ReAct 達到絕對 10% 的成功率提升。ReAct 較能透過推理橋接觀測與行動的落差,識別與指令相關的商品與選項(例如「對於『客廳省空間的腳凳』,這個商品有 39x18x18 吋與藍色選項,看起來很適合購買」)。但目前的方法仍遠不及人類專家——後者進行更多商品探索與查詢重組,仍是提示式方法難以做到的。
內部推理 vs. 外部回饋的價值 據我們所知,ReAct 是首次將推理與行動結合於 LLM、應用於互動環境內、形成閉迴路系統的展示。最相近的先前工作是 Inner Monologue (IM) (Huang et al., 2022b),其代理人的行動由「內部獨白」驅動。然而 IM 的「內部獨白」僅限於對環境狀態的觀測與目標完成度的描述;相對地,ReAct 中的推理軌跡具靈活性與稀疏性,可針對不同任務誘導出多種推理類型。
我們進行 ReAct-IM 消融實驗(用 IM 風格的密集外部回饋取代 ReAct 思緒),結果在 ALFWorld 上 ReAct (71) 顯著優於 ReAct-IM (53),且在 6 種任務的 5 種上都有一致優勢。質性上,ReAct-IM 經常無法判斷何時子目標已完成、下個子目標是什麼(缺乏高階目標分解),且難以判斷物品的可能位置(缺乏常識推理)。
五、相關工作
語言模型用於推理 最知名的工作是思維鏈 (CoT) (Wei et al., 2022),揭示 LLM 能自行構造「思考過程」來解題。後續工作包括 least-to-most prompting (Zhou et al., 2022)、zero-shot-CoT (Kojima et al., 2022)、self-consistency (Wang et al., 2022a) 等。Madaan & Yazdanbakhsh (2022) 系統性研究 CoT 的形式與結構,發現符號、模式與文字的存在對 CoT 有效性至關重要。其他工作則延伸到更複雜的推理架構:Selection-Inference (Creswell et al., 2022) 將推理分為「選擇」與「推論」兩步;STaR (Zelikman et al., 2022) 用模型自身產生的正確推理過程做自舉微調;Faithful reasoning (Creswell & Shanahan, 2022) 將多步推理拆為三步、各由專屬語言模型執行;Scratchpad (Nye et al., 2021) 在中間運算步驟上微調語言模型。與這些方法不同,ReAct 不僅執行孤立、固定的推理,還將模型行動及對應觀測整合為連貫的輸入流,讓模型能更精準地推理並處理推理之外的任務(如互動決策)。
語言模型用於決策 LLM 強大能力讓人開始將其作為決策的策略模型,特別在互動環境中。WebGPT (Nakano et al., 2021) 用 LM 與瀏覽器互動,回答 ELI5 (Fan et al., 2019) 的複雜問題;相較於 ReAct,WebGPT 並未明確建模思考過程,且依賴昂貴的人類回饋做強化學習。對話建模(BlenderBot (Shuster et al., 2022b)、Sparrow (Glaese et al., 2022))與任務導向對話系統(SimpleTOD (Hosseini-Asl et al., 2020))亦訓練 LM 決策 API 呼叫,但都未明確考慮推理過程,且依賴昂貴的資料與人工回饋。ReAct 學習策略的成本則低得多,因為決策過程僅需以語言描述推理過程。
LLM 也越來越常被用於互動式具身環境中的規劃與決策。最相關的是 SayCan (Ahn et al., 2022) 與 Inner Monologue (Huang et al., 2022b):SayCan 用 LLM 預測機器人可採取的行動,再由視覺接地的可供性模型重排;Inner Monologue 進一步加入「內部獨白」(即從環境注入回饋),據我們所知是首個展示閉迴路系統的工作,ReAct 即建立於此之上。然而我們主張 IM 並不真正含有「內在思緒」(詳見第 4 節)。
六、結論
我們提出 ReAct——一種簡單卻有效的方法,用以協同 LLM 中的推理與行動。透過在多跳問答、事實查證、互動決策上的多元實驗,我們證明 ReAct 帶來更佳表現與可解釋的決策軌跡。
儘管方法簡單,具有大行動空間的複雜任務需要更多範例以學得好,這常超出 in-context 學習的輸入長度限制。我們在 HotpotQA 上以微調方式取得初步成果,但要進一步提升表現,仍需從更多高品質人類標註中學習。將 ReAct 擴大到多任務訓練、並結合互補範式(如強化學習),可望產生更強大的代理人,進一步釋放 LLM 在更多應用上的潛力。
倫理聲明 ReAct 提示 LLM 產生比過去方法更具人類可解釋性、可診斷性、可控性的解題軌跡。然而,將 LLM 與外在環境(網路、實體環境)的行動空間掛鉤,存在潛在風險:例如查詢不當或私人資訊、在環境中採取有害行動。本文實驗將互動限制於 Wikipedia 與 WebShop 等不含私人資訊的特定網站,且行動空間設計上不含危險動作(模型不能真的買 WebShop 的商品或編輯 Wikipedia)。研究人員設計更廣泛實驗時應留意這些風險。
參考文獻
完整參考文獻請見原始論文 PDF。下列為文中提及的關鍵工作:
- Yang, Z., Qi, P., Zhang, S., Bengio, Y., Cohen, W., Salakhutdinov, R., & Manning, C. D. (2018). HotpotQA: A dataset for diverse, explainable multi-hop question answering. EMNLP.
- Thorne, J., Vlachos, A., Christodoulopoulos, C., & Mittal, A. (2018). FEVER: a large-scale dataset for fact extraction and verification. NAACL.
- Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q. V., & Zhou, D. (2022). Chain-of-thought prompting elicits reasoning in large language models. NeurIPS.
- Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S., Chowdhery, A., & Zhou, D. (2022). Self-consistency improves chain of thought reasoning in language models.
- Shridhar, M., Yuan, X., Côté, M.-A., Bisk, Y., Trischler, A., & Hausknecht, M. (2020). ALFWorld: Aligning text and embodied environments for interactive learning. ICLR.
- Yao, S., Chen, H., Yang, J., & Narasimhan, K. (2022). WebShop: Towards scalable real-world web interaction with grounded language agents. NeurIPS.
- Huang, W., Xia, F., Xiao, T., Chan, H., Liang, J., Florence, P., Zeng, A., Tompson, J., Mordatch, I., Chebotar, Y., Sermanet, P., Brown, N., Jackson, T., Luu, L., Levine, S., Hausman, K., & Ichter, B. (2022b). Inner monologue: Embodied reasoning through planning with language models.
- Ahn, M., Brohan, A., Brown, N., et al. (2022). Do as I can, not as I say: Grounding language in robotic affordances.
- Nakano, R., Hilton, J., Balaji, S., et al. (2021). WebGPT: Browser-assisted question-answering with human feedback.
- Chowdhery, A., Narang, S., Devlin, J., et al. (2022). PaLM: Scaling language modeling with pathways.
- Zelikman, E., Wu, Y., Mu, J., & Goodman, N. D. (2022). STaR: Bootstrapping reasoning with reasoning.
- Kojima, T., Gu, S. S., Reid, M., Matsuo, Y., & Iwasawa, Y. (2022). Large language models are zero-shot reasoners.
- Brown, T., Mann, B., Ryder, N., et al. (2020). Language models are few-shot learners.
術語對照表
| English | 繁體中文 |
|---|---|
| Reasoning | 推理 |
| Acting | 行動 |
| Reasoning trace | 推理軌跡 |
| Thought | 思緒 |
| Synergy | 協同 |
| Chain-of-Thought (CoT) | 思維鏈 |
| Self-Consistency (SC) | 自洽性 |
| Few-shot prompting | 少樣本提示 |
| In-context learning | 上下文學習 |
| Hallucination | 幻覺 |
| Error propagation | 錯誤傳遞 |
| Grounded / Grounding | 接地 / 接地化 |
| Working memory | 工作記憶 |
| Inner speech / Inner monologue | 內語 / 內部獨白 |
| Multi-hop QA | 多跳問答 |
| Fact verification | 事實查證 |
| Action space | 行動空間 |
| Observation | 觀測 |
| Policy | 策略 |
| Agent | 代理人 |
| Environment | 環境 |
| Trajectory | 軌跡 |
| Subgoal | 子目標 |
| Decomposition | 分解 |
| Closed-loop system | 閉迴路系統 |
| Embodied agent | 具身代理人 |
| Imitation learning | 模仿學習 |
| Reinforcement learning | 強化學習 |
| Bootstrapping | 自舉 |
| Finetuning | 微調 |
| Frozen model | 凍結模型 |
| Emergent capability | 湧現能力 |
| Task-oriented dialogue | 任務導向對話 |
| Affordance model | 可供性模型 |
| Interpretability | 可解釋性 |
| Trustworthiness | 信賴度 |
| Diagnosability | 可診斷性 |
| Exact Match (EM) | 精確匹配 |
| Success Rate (SR) | 成功率 |
| Imitation + RL (IL+RL) | 模仿學習加強化學習 |
| Multi-modal observation | 多模態觀測 |
| Wikipedia API | 維基百科 API |
| Sparse reward | 稀疏獎勵 |
| Long horizon | 長時序 |
| Decision making | 決策 |