ReAct: Synergizing Reasoning and Acting in Language Models

ReAct:在語言模型中協同推理與行動

原始論文:ReAct: Synergizing Reasoning and Acting in Language Models 作者:Shunyu Yao¹*、Jeffrey Zhao²、Dian Yu²、Nan Du²、Izhak Shafran²、Karthik Narasimhan¹、Yuan Cao² 機構:¹普林斯頓大學 (Princeton University) 計算機科學系;²Google Research, Brain team arXiv ID:2210.03629v3 日期:2023-03-10(v3;ICLR 2023) 專案頁面:react-lm.github.io 標籤:LLM Agent Reasoning Tool Use Prompting CoT ICLR2023

目錄

摘要

雖然大型語言模型 (Large Language Models, LLMs) 已在語言理解與互動式決策任務上展現驚人的表現,它們在推理 (Reasoning)(例如思維鏈提示 (Chain-of-Thought Prompting, CoT))與行動 (Acting)(例如行動計畫生成)兩種能力上,過去主要被視為彼此獨立的研究主題。本文探討如何讓 LLM 以交錯方式同時生成推理軌跡 (reasoning trace) 與任務專屬行動 (task-specific action),使兩者產生更強的協同效應:推理軌跡幫助模型推導、追蹤、更新行動計畫並處理例外狀況;而行動則讓模型能夠連接外部環境(如知識庫或互動環境)以蒐集額外資訊。

我們將此方法命名為 ReAct,並在多個語言與決策任務上展示其相對於 SOTA 基線的有效性,並同時提升人類可解釋性與信賴度。具體而言,在問答 (HotpotQA) 與事實查證 (Fever) 任務中,ReAct 透過與簡單的 Wikipedia API 互動,克服了思維鏈推理普遍存在的幻覺 (hallucination) 與錯誤傳遞 (error propagation) 問題,並產生比無推理軌跡基線更具人性化、更可解釋的解題軌跡。在兩個互動決策基準 (ALFWorld 與 WebShop) 上,ReAct 僅以一到兩個 in-context 範例就能在絕對成功率上分別超越模仿學習與強化學習方法 34% 與 10%。


一、引言

人類智慧的一項獨特特徵,是能夠無縫地將任務導向行動與口語推理(或稱「內語 (inner speech)」(Alderson-Day & Fernyhough, 2015))結合在一起。這種能力被認為在人類認知中扮演關鍵角色,可達成自我調節、策略規劃 (Vygotsky, 1987; Luria, 1965; Fernyhough, 2010),以及維持工作記憶 (working memory) (Baddeley, 1992)。

以「在廚房做菜」為例:在任意兩個具體動作之間,我們可能會用語言進行推理,以追蹤進度(「東西都切好了,我該把水煮開」)、處理例外或調整計畫(「沒有鹽,那我用醬油加胡椒代替」)、以及察覺需要外部資訊(「麵團要怎麼做?來上網查一下」)。我們也會做出行動(翻食譜、開冰箱、檢查食材)來支持推理並回答問題(「現在能做什麼菜?」)。這種「行動」與「推理」之間的緊密協同,讓人類得以快速學習新任務,並在面對未知情境或資訊不確定時,仍能進行穩健的決策與推理。

近期的研究結果暗示,將口語推理與互動決策結合在自主系統中是可行的。一方面,經過妥善提示的 LLM 已展現出湧現能力 (emergent capability),可執行多步推理軌跡以解決算術、常識與符號推理任務 (Wei et al., 2022)。然而,這種「思維鏈」推理是一個靜態黑盒:模型只用自身的內部表徵生成思緒,與外在世界缺乏「接地 (grounding)」,因而無法做出反應式推理或更新知識,導致事實幻覺與錯誤在推理過程中傳遞累積(圖 1(1b))。

另一方面,近期工作探索使用預訓練語言模型於互動環境中進行規劃與行動 (Ahn et al., 2022; Nakano et al., 2021; Yao et al., 2020; Huang et al., 2022a),重點放在以語言先驗預測動作。這類方法通常將多模態觀測 (multi-modal observation) 轉為文字,以語言模型生成領域專屬動作或計畫,再用一個控制器來選擇或執行。然而,它們並不利用語言模型對高階目標進行抽象推理,也不維持工作記憶來支援行動。除了 Huang et al. (2022b) 進行了有限度的口語推理(重述當前狀態的空間事實)之外,目前尚未有研究系統性地探討「推理」與「行動」如何在通用任務求解中協同運作,以及這種結合是否能帶來相對於單獨推理或單獨行動的系統性效益。

本文提出 ReAct,一種將推理與行動結合的通用範式 (paradigm),用以解決多元的語言推理與決策任務(圖 1)。ReAct 提示 LLM 以交錯方式產生口語推理軌跡與任務相關行動,使模型既能進行動態推理以建立、維護、調整行動計畫(reason to act),也能與外部環境(例如 Wikipedia)互動,把額外資訊納入推理(act to reason)。

我們在四個多元基準上對 ReAct 與 SOTA 基線進行實證評估:問答 (HotpotQA, Yang et al., 2018)、事實查證 (Fever, Thorne et al., 2018)、文本遊戲 (ALFWorld, Shridhar et al., 2020b)、網頁導覽 (WebShop, Yao et al., 2022)。結果發現:

  • 在 HotpotQA 與 Fever 上,配合 Wikipedia API,ReAct 優於原生 (vanilla) 行動生成模型,並與 CoT 不相上下。整體最佳方法是 ReAct 與 CoT 的結合,能同時運用模型內部知識與外部資訊。
  • 在 ALFWorld 與 WebShop 上,ReAct 僅以一兩個範例的提示,就能擊敗以 10³~10⁵ 個任務實例訓練的模仿與強化學習方法,絕對成功率分別提升 34% 與 10%。
  • 我們進一步透過控制實驗,證明稀疏 (sparse) 而靈活的推理在決策中的價值,以及推理與行動結合能改善可解釋性、信賴度與可診斷性。

主要貢獻:

  1. 提出 ReAct,以提示為基礎的新範式,協同 LLM 中的推理與行動以解決通用任務。
  2. 在多個基準上進行 few-shot 學習實驗,證明 ReAct 相較於單獨推理或單獨行動的優勢。
  3. 系統性消融與分析,理解行動對推理任務的重要性,與推理對互動任務的重要性。
  4. 分析 ReAct 在提示設定下的限制(例如推理與行動行為支援有限),並進行初步微調實驗,展示 ReAct 在加入訓練資料後的潛力。

[Figure 1: 四種提示方法的比較示意圖。(1) HotpotQA 任務上 (a) 標準提示、(b) CoT (Reason Only)、(c) Act-only、(d) ReAct (Reason+Act) 的解題軌跡對比;(2) ALFWorld 文字遊戲中 (a) Act-only 與 (b) ReAct 的對比。CoT 出現幻覺(誤答 iPod、iPhone、iPad),Act-only 則陷入錯誤搜尋的迴圈,而 ReAct 透過交錯思緒與行動成功找到正確答案 "keyboard function keys";在 ALFWorld 上 ReAct 透過 Think 行動列出常見位置、規劃次目標,順利完成任務。]


二、ReAct:協同推理與行動

考慮一個代理人 (agent) 與環境互動以求解任務的通用設定。在時間步 $t$,代理人從環境接收觀測 $o_t \in \mathcal{O}$,並依據某策略 $\pi(a_t \mid c_t)$ 採取行動 $a_t \in \mathcal{A}$,其中 $c_t = (o_1, a_1, \cdots, o_{t-1}, a_{t-1}, o_t)$ 是給代理人的上下文。當映射 $c_t \mapsto a_t$ 高度隱含且需要大量計算時,學習一個策略相當困難。例如在圖 1(1c) 中,代理人因為無法在 (Question, Act 1-3, Obs 1-3) 的軌跡上進行複雜推理,而無法產生正確的最終行動 (Act 4)。同樣地,圖 1(2a) 中的代理人由於無法從上下文理解 sinkbasin 1 並無 peppershaker 1,便不斷產生幻覺式的行動。

ReAct 的想法很簡單:我們將代理人的行動空間擴張為 $\hat{\mathcal{A}} = \mathcal{A} \cup \mathcal{L}$,其中 $\mathcal{L}$ 是語言空間。語言空間中的行動 $\hat{a}_t \in \mathcal{L}$,我們稱為思緒 (thought) 或推理軌跡 (reasoning trace),它不影響外在環境,因此沒有觀測回饋。相反地,思緒 $\hat{a}_t$ 的目的是透過對當前上下文 $c_t$ 進行推理,來組合有用資訊,並更新上下文 $c_{t+1} = (c_t, \hat{a}_t)$ 以支援未來的推理或行動。

如圖 1 所示,思緒可有多種有用形式:

  • 分解任務目標、建立行動計畫(2b 的 Act 1;1d 的 Thought 1)
  • 注入解題所需的常識知識(2b 的 Act 1)
  • 從觀測中萃取重要資訊(1d 的 Thought 2、4)
  • 追蹤進度並切換行動計畫(2b 的 Act 8)
  • 處理例外與調整行動計畫(1d 的 Thought 3)

然而,由於語言空間 $\mathcal{L}$ 是無限的,在這個擴張的行動空間中學習相當困難,且需要強大的語言先驗。本文主要聚焦於凍結 (frozen) 大型語言模型 (PaLM-540B, Chowdhery et al., 2022) 的設定,以 few-shot in-context 範例提示模型,使其同時生成領域專屬行動與自由形式的語言思緒。每個 in-context 範例都是一條由人類書寫的「行動 + 思緒 + 環境觀測」軌跡(詳見附錄 C)。

對於以推理為主的任務(圖 1(1)),我們交替生成思緒與行動,使解題軌跡由多個「思緒-行動-觀測」步驟組成。對於可能涉及大量行動的決策任務(圖 1(2)),思緒只需要在最關鍵位置稀疏出現,因此我們讓語言模型自行決定思緒與行動的非同步出現時機。

ReAct 的幾項獨特特性:

  • A) 直觀且易於設計:撰寫 ReAct 提示十分直接,人類標註者只需在自己的行動之上把思緒寫成語言即可,本論文未使用任何特殊格式選擇、思緒設計或範例挑選技巧。
  • B) 通用且彈性:由於思緒空間靈活、思緒-行動的出現格式自由,ReAct 能適用於行動空間與推理需求差異甚大的多元任務(QA、事實查證、文字遊戲、網頁導覽等)。
  • C) 表現良好且穩健:ReAct 對新任務實例的泛化能力強,僅以 1~6 個 in-context 範例學習,便在各領域上一致地優於僅有推理或僅有行動的基線;微調後表現更佳,且對提示選擇穩健。
  • D) 與人類對齊且可控:ReAct 提供可解釋的序列決策與推理過程,人類能輕易檢視推理與事實正確性;亦可透過編輯思緒,即時修正代理人的行為。

三、知識密集型推理任務

我們從多跳問答 (multi-hop QA) 與事實查證等知識密集型推理任務開始。如圖 1(1d) 所示,透過與 Wikipedia API 互動,ReAct 能擷取資訊以支援推理,並用推理來決定下一步要查什麼,展示推理與行動的協同。

3.1 設定

任務領域 我們考慮兩個對知識擷取與推理具挑戰性的資料集:

  1. HotpotQA (Yang et al., 2018):需在兩段以上 Wikipedia 段落上進行推理的多跳問答基準。
  2. FEVER (Thorne et al., 2018):事實查證基準,每個聲明被標註為 SUPPORTS / REFUTES / NOT ENOUGH INFO,依據是否存在能驗證該聲明的 Wikipedia 段落。

兩個任務皆採「僅有問題」的設定:模型只接收問題或聲明作為輸入,無法直接讀取支持段落,必須依靠內部知識,或透過與外部環境互動來擷取知識。

行動空間 我們設計了一個簡單的 Wikipedia Web API,提供三種互動式資訊擷取行動:

  1. search[entity]:若實體頁存在,回傳其 wiki 頁面前 5 句;否則建議前 5 名相似實體。
  2. lookup[string]:回傳當前頁面下一句包含 string 的文本,模擬瀏覽器 Ctrl+F。
  3. finish[answer]:以 answer 結束當前任務。

此行動空間刻意設計得比 SOTA 詞彙或神經檢索器弱很多,目的是模擬人類如何與 Wikipedia 互動,並迫使模型透過明確的語言推理來檢索資訊。

3.2 方法

ReAct 提示 針對 HotpotQA 與 Fever,我們從訓練集中隨機挑選 6 與 3 個案例,手動撰寫 ReAct 格式的軌跡作為 few-shot 範例。每條軌跡由多個「思緒-行動-觀測」步驟組成(dense thought),自由形式的思緒涵蓋多種用途:分解問題、從 Wikipedia 觀測中萃取資訊、進行常識或算術推理、引導重新搜尋、合成最終答案。

基線 我們系統性地對 ReAct 軌跡做消融,建立多個基線:

  • (a) Standard 提示:移除 ReAct 軌跡中所有思緒、行動與觀測。
  • (b) CoT 提示 (Wei et al., 2022):移除行動與觀測,作為純推理基線。我們也建立 CoT-SC 基線 (Wang et al., 2022a;b),於推論時以溫度 0.7 取樣 21 條 CoT 軌跡並採多數答案,已知能持續優於 CoT。
  • (c) Act-only 提示:移除 ReAct 軌跡中的所有思緒,鬆散地對應 WebGPT 與網路互動的方式。

結合內部與外部知識 我們提出將 ReAct 與 CoT-SC 結合,由模型依以下啟發式決定何時切換方法:

  • A) ReAct → CoT-SC:當 ReAct 在給定步數內無法回答時,退回 CoT-SC。HotpotQA 與 Fever 分別設定 7 與 5 步,因為更多步並不會提升 ReAct 表現。
  • B) CoT-SC → ReAct:當 $n$ 個 CoT-SC 樣本中多數答案的出現次數少於 $n/2$(即內部知識可能不足以自信地完成任務)時,退回 ReAct。

微調 由於人工標註推理軌跡與行動的成本極高,我們採用類似 Zelikman et al. (2022) 的自舉 (bootstrapping) 方法:用 ReAct 等方法生成 3,000 條正解軌跡,微調較小的 PaLM-8B/62B 模型,使其能在輸入問題或聲明的條件下解碼出整條軌跡。

3.3 結果與觀察

ReAct 一致地優於 Act Table 1 顯示在 PaLM-540B 上,ReAct 在兩個任務上都優於 Act,證明推理對於「引導行動」(特別是合成最終答案)的價值。微調結果亦支持此結論。

Table 1:PaLM-540B 在 HotpotQA 與 Fever 上的提示結果

提示方法 HotpotQA (EM) Fever (Acc)
Standard 28.7 57.1
CoT (Wei et al., 2022) 29.4 56.3
CoT-SC (Wang et al., 2022a) 33.4 60.4
Act 25.7 58.9
ReAct 27.4 60.9
CoT-SC → ReAct 34.2 64.6
ReAct → CoT-SC 35.1 62.0
Supervised SoTA 67.5 89.5

ReAct vs. CoT ReAct 在 Fever 上勝出 (60.9 vs. 56.3),但在 HotpotQA 上略落後 (27.4 vs. 29.4)。我們從 ReAct 與 CoT 各隨機抽 50 個正答與 50 個錯答,總共 200 例進行人工分析,得到下列關鍵觀察:

Table 2:ReAct 與 CoT 在 HotpotQA 上的成功與失敗模式類型

類型 定義 ReAct CoT
成功 真陽性 推理軌跡與事實皆正確 94% 86%
偽陽性 推理軌跡或事實出現幻覺 6% 14%
失敗 推理錯誤 推理軌跡錯誤(含無法跳出重複步驟) 47% 16%
搜尋結果錯誤 搜尋回傳空結果或無有用資訊 23% -
幻覺 推理軌跡或事實幻覺 0% 56%
標籤模糊 預測正確但與標籤不完全一致 29% 28%

(A) 幻覺對 CoT 是嚴重問題:CoT 的偽陽性率明顯高於 ReAct (14% vs. 6%),且幻覺占其失敗的 56%;ReAct 的解題軌跡因可存取外部知識庫而更具事實性與信賴度。

(B) 推理-行動-觀測的結構約束:雖提升 ReAct 的接地性與信賴度,卻也犧牲了推理步驟的彈性,導致 ReAct 的推理錯誤率高於 CoT。其中常見的特定錯誤模式是「重複生成先前的思緒與行動」並陷入迴圈。

(C) 對 ReAct 而言,成功透過 search 擷取有資訊的知識至關重要:無資訊搜尋占錯誤案例的 23%,會使模型脫軌、難以恢復與重新組織思緒。這是事實性與彈性的權衡,也是我們提出兩種方法結合策略的動機。

ReAct + CoT-SC 提示 LLM 的最佳組合 Table 1 顯示在 HotpotQA 與 Fever 上,最佳提示方法分別是 ReAct → CoT-SC 與 CoT-SC → ReAct。圖 2 進一步顯示在不同 CoT-SC 樣本數下,兩種 ReAct + CoT-SC 方法都能持續顯著超越純 CoT-SC,甚至只用 3-5 個樣本就能達到 21 樣本 CoT-SC 的水準。這證明了妥善結合內部與外部知識對推理任務的價值。

ReAct 是微調的最佳方法 圖 3 顯示在 HotpotQA 上,PaLM-8B/62B 提示時 ReAct 因為要同時學推理與行動而表現最差;然而僅以 3,000 例微調後,ReAct 變成四種方法中最佳,PaLM-8B 微調後的 ReAct 即超越 PaLM-62B 的所有提示方法,PaLM-62B 微調後的 ReAct 則超越 PaLM-540B 所有提示方法。微調 Standard 或 CoT 顯著差於微調 ReAct 或 Act,因為前者本質上是教模型記憶(可能是幻覺的)知識事實,後者則是教模型如何(推理並)行動以從 Wikipedia 取得資訊,後者是更可泛化的知識推理技能。

[Figure 3: 在 HotpotQA 上,prompting 與 finetuning 兩種學習設定下,PaLM-8B / 62B / 540B 對四種方法 (Standard、CoT、Act、ReAct) 的 EM 表現。Prompting 時 ReAct 在小模型上劣於其他方法;finetuning 時 ReAct 反而成為最佳。]


四、決策任務

我們也在兩個語言式互動決策任務上測試 ReAct:ALFWorld 與 WebShop,兩者皆有複雜環境,需要代理人在長時序與稀疏獎勵下行動,正適合需要推理來行動與探索的情境。

ALFWorld (Shridhar et al., 2020b)(圖 1(2))是一個合成文字遊戲,與具身 ALFRED 基準對齊。它包含 6 種任務(如「在桌燈下檢查一張紙」),代理人需在以文字行動模擬的家庭場景中導覽並互動(如 go to coffeetable 1、take paper 2、use desklamp 1)。一個任務實例可有 50 個以上位置,專家策略也需 50 步以上才能解出,這挑戰代理人的計畫、子目標追蹤與系統性探索能力(例如逐一檢查所有桌子尋找桌燈)。ALFWorld 的另一挑戰是需判斷常見家居物品的可能位置(桌燈通常在桌、架、櫃上),這正適合 LLM 發揮預訓練常識知識。

我們對每種任務隨機挑選 3 條訓練軌跡進行人工標註,加入稀疏思緒以:(1) 分解目標,(2) 追蹤子目標完成度,(3) 決定下個子目標,(4) 用常識推理物品位置與用途。我們以 134 個 unseen 評估遊戲做評估,並從 3 條標註軌跡中對每種任務排列出 6 種提示組合。基線是 BUTLER (Shridhar et al., 2020b),這是一個用每種任務 10⁵ 條專家軌跡訓練的模仿學習代理人。

WebShop (Yao et al., 2022) 是最近提出的線上購物網站環境,包含 1.18M 真實商品與 12k 人類指令。與 ALFWorld 不同,WebShop 含有大量結構化與非結構化文字(商品標題、描述、選項皆爬自 Amazon),代理人需依使用者指令(如「我要找有抽屜的床頭櫃,鎳金屬飾面,價格低於 140 美元」)透過網頁互動完成購買(搜尋、選擇商品、選擇選項、購買)。評估指標為平均分數(所選商品涵蓋的需求屬性比例)與成功率(完全滿足所有需求的比例)。我們以 Act 提示包含 search、choose product、choose options 與 buy 等行動,ReAct 提示則額外加入推理以決定何時探索、何時購買、哪些選項相關。

Table 3:ALFWorld 任務的成功率 (%)

方法 Pick Clean Heat Cool Look Pick 2 All
Act (best of 6) 88 42 74 67 72 41 45
ReAct (avg) 65 39 83 76 55 24 57
ReAct (best of 6) 92 58 96 86 78 41 71
ReAct-IM (avg) 55 59 60 55 23 24 48
ReAct-IM (best of 6) 62 68 87 57 39 33 53
BUTLERg (best of 8) 33 26 70 76 17 12 22
BUTLER (best of 8) 46 39 74 100 22 24 37

Table 4:WebShop 上的分數與成功率

方法 Score SR
Act 62.3 30.1
ReAct 66.6 40.0
IL 59.9 29.1
IL+RL 62.4 28.7
Human Expert 82.1 59.6

結果 ReAct 在 ALFWorld 與 WebShop 上皆優於 Act。在 ALFWorld 上,最佳 ReAct 試驗達 71% 平均成功率,顯著超越最佳 Act (45%) 與 BUTLER (37%);甚至最差的 ReAct 試驗 (48%) 也勝過兩者的最佳試驗。ReAct 對 Act 的優勢在六次受控試驗中一致,相對提升從 33% 到 90%,平均 62%。質性觀察上,沒有任何思緒的 Act 經常無法將目標分解為較小的子目標,或會忘掉當前環境狀態。

在 WebShop 上,one-shot Act 提示已能與 IL 與 IL+RL 不相上下;加入稀疏推理後,ReAct 達到絕對 10% 的成功率提升。ReAct 較能透過推理橋接觀測與行動的落差,識別與指令相關的商品與選項(例如「對於『客廳省空間的腳凳』,這個商品有 39x18x18 吋與藍色選項,看起來很適合購買」)。但目前的方法仍遠不及人類專家——後者進行更多商品探索與查詢重組,仍是提示式方法難以做到的。

內部推理 vs. 外部回饋的價值 據我們所知,ReAct 是首次將推理與行動結合於 LLM、應用於互動環境內、形成閉迴路系統的展示。最相近的先前工作是 Inner Monologue (IM) (Huang et al., 2022b),其代理人的行動由「內部獨白」驅動。然而 IM 的「內部獨白」僅限於對環境狀態的觀測與目標完成度的描述;相對地,ReAct 中的推理軌跡具靈活性與稀疏性,可針對不同任務誘導出多種推理類型。

我們進行 ReAct-IM 消融實驗(用 IM 風格的密集外部回饋取代 ReAct 思緒),結果在 ALFWorld 上 ReAct (71) 顯著優於 ReAct-IM (53),且在 6 種任務的 5 種上都有一致優勢。質性上,ReAct-IM 經常無法判斷何時子目標已完成、下個子目標是什麼(缺乏高階目標分解),且難以判斷物品的可能位置(缺乏常識推理)。


五、相關工作

語言模型用於推理 最知名的工作是思維鏈 (CoT) (Wei et al., 2022),揭示 LLM 能自行構造「思考過程」來解題。後續工作包括 least-to-most prompting (Zhou et al., 2022)、zero-shot-CoT (Kojima et al., 2022)、self-consistency (Wang et al., 2022a) 等。Madaan & Yazdanbakhsh (2022) 系統性研究 CoT 的形式與結構,發現符號、模式與文字的存在對 CoT 有效性至關重要。其他工作則延伸到更複雜的推理架構:Selection-Inference (Creswell et al., 2022) 將推理分為「選擇」與「推論」兩步;STaR (Zelikman et al., 2022) 用模型自身產生的正確推理過程做自舉微調;Faithful reasoning (Creswell & Shanahan, 2022) 將多步推理拆為三步、各由專屬語言模型執行;Scratchpad (Nye et al., 2021) 在中間運算步驟上微調語言模型。與這些方法不同,ReAct 不僅執行孤立、固定的推理,還將模型行動及對應觀測整合為連貫的輸入流,讓模型能更精準地推理並處理推理之外的任務(如互動決策)。

語言模型用於決策 LLM 強大能力讓人開始將其作為決策的策略模型,特別在互動環境中。WebGPT (Nakano et al., 2021) 用 LM 與瀏覽器互動,回答 ELI5 (Fan et al., 2019) 的複雜問題;相較於 ReAct,WebGPT 並未明確建模思考過程,且依賴昂貴的人類回饋做強化學習。對話建模(BlenderBot (Shuster et al., 2022b)、Sparrow (Glaese et al., 2022))與任務導向對話系統(SimpleTOD (Hosseini-Asl et al., 2020))亦訓練 LM 決策 API 呼叫,但都未明確考慮推理過程,且依賴昂貴的資料與人工回饋。ReAct 學習策略的成本則低得多,因為決策過程僅需以語言描述推理過程。

LLM 也越來越常被用於互動式具身環境中的規劃與決策。最相關的是 SayCan (Ahn et al., 2022) 與 Inner Monologue (Huang et al., 2022b):SayCan 用 LLM 預測機器人可採取的行動,再由視覺接地的可供性模型重排;Inner Monologue 進一步加入「內部獨白」(即從環境注入回饋),據我們所知是首個展示閉迴路系統的工作,ReAct 即建立於此之上。然而我們主張 IM 並不真正含有「內在思緒」(詳見第 4 節)。


六、結論

我們提出 ReAct——一種簡單卻有效的方法,用以協同 LLM 中的推理與行動。透過在多跳問答、事實查證、互動決策上的多元實驗,我們證明 ReAct 帶來更佳表現與可解釋的決策軌跡。

儘管方法簡單,具有大行動空間的複雜任務需要更多範例以學得好,這常超出 in-context 學習的輸入長度限制。我們在 HotpotQA 上以微調方式取得初步成果,但要進一步提升表現,仍需從更多高品質人類標註中學習。將 ReAct 擴大到多任務訓練、並結合互補範式(如強化學習),可望產生更強大的代理人,進一步釋放 LLM 在更多應用上的潛力。

倫理聲明 ReAct 提示 LLM 產生比過去方法更具人類可解釋性、可診斷性、可控性的解題軌跡。然而,將 LLM 與外在環境(網路、實體環境)的行動空間掛鉤,存在潛在風險:例如查詢不當或私人資訊、在環境中採取有害行動。本文實驗將互動限制於 Wikipedia 與 WebShop 等不含私人資訊的特定網站,且行動空間設計上不含危險動作(模型不能真的買 WebShop 的商品或編輯 Wikipedia)。研究人員設計更廣泛實驗時應留意這些風險。


參考文獻

完整參考文獻請見原始論文 PDF。下列為文中提及的關鍵工作:

  • Yang, Z., Qi, P., Zhang, S., Bengio, Y., Cohen, W., Salakhutdinov, R., & Manning, C. D. (2018). HotpotQA: A dataset for diverse, explainable multi-hop question answering. EMNLP.
  • Thorne, J., Vlachos, A., Christodoulopoulos, C., & Mittal, A. (2018). FEVER: a large-scale dataset for fact extraction and verification. NAACL.
  • Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q. V., & Zhou, D. (2022). Chain-of-thought prompting elicits reasoning in large language models. NeurIPS.
  • Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S., Chowdhery, A., & Zhou, D. (2022). Self-consistency improves chain of thought reasoning in language models.
  • Shridhar, M., Yuan, X., Côté, M.-A., Bisk, Y., Trischler, A., & Hausknecht, M. (2020). ALFWorld: Aligning text and embodied environments for interactive learning. ICLR.
  • Yao, S., Chen, H., Yang, J., & Narasimhan, K. (2022). WebShop: Towards scalable real-world web interaction with grounded language agents. NeurIPS.
  • Huang, W., Xia, F., Xiao, T., Chan, H., Liang, J., Florence, P., Zeng, A., Tompson, J., Mordatch, I., Chebotar, Y., Sermanet, P., Brown, N., Jackson, T., Luu, L., Levine, S., Hausman, K., & Ichter, B. (2022b). Inner monologue: Embodied reasoning through planning with language models.
  • Ahn, M., Brohan, A., Brown, N., et al. (2022). Do as I can, not as I say: Grounding language in robotic affordances.
  • Nakano, R., Hilton, J., Balaji, S., et al. (2021). WebGPT: Browser-assisted question-answering with human feedback.
  • Chowdhery, A., Narang, S., Devlin, J., et al. (2022). PaLM: Scaling language modeling with pathways.
  • Zelikman, E., Wu, Y., Mu, J., & Goodman, N. D. (2022). STaR: Bootstrapping reasoning with reasoning.
  • Kojima, T., Gu, S. S., Reid, M., Matsuo, Y., & Iwasawa, Y. (2022). Large language models are zero-shot reasoners.
  • Brown, T., Mann, B., Ryder, N., et al. (2020). Language models are few-shot learners.

術語對照表

English 繁體中文
Reasoning 推理
Acting 行動
Reasoning trace 推理軌跡
Thought 思緒
Synergy 協同
Chain-of-Thought (CoT) 思維鏈
Self-Consistency (SC) 自洽性
Few-shot prompting 少樣本提示
In-context learning 上下文學習
Hallucination 幻覺
Error propagation 錯誤傳遞
Grounded / Grounding 接地 / 接地化
Working memory 工作記憶
Inner speech / Inner monologue 內語 / 內部獨白
Multi-hop QA 多跳問答
Fact verification 事實查證
Action space 行動空間
Observation 觀測
Policy 策略
Agent 代理人
Environment 環境
Trajectory 軌跡
Subgoal 子目標
Decomposition 分解
Closed-loop system 閉迴路系統
Embodied agent 具身代理人
Imitation learning 模仿學習
Reinforcement learning 強化學習
Bootstrapping 自舉
Finetuning 微調
Frozen model 凍結模型
Emergent capability 湧現能力
Task-oriented dialogue 任務導向對話
Affordance model 可供性模型
Interpretability 可解釋性
Trustworthiness 信賴度
Diagnosability 可診斷性
Exact Match (EM) 精確匹配
Success Rate (SR) 成功率
Imitation + RL (IL+RL) 模仿學習加強化學習
Multi-modal observation 多模態觀測
Wikipedia API 維基百科 API
Sparse reward 稀疏獎勵
Long horizon 長時序
Decision making 決策
← 回到列表
已複製連結