從安全風險到設計原則:多智能體 LLM 系統中的同儕保護及其對協調式民主論述分析的啟示

原始論文:From Safety Risk to Design Principle: Peer-Preservation in Multi-Agent LLM Systems and Its Implications for Orchestrated Democratic Discourse Analysis 作者:Juergen Dietrich arXiv ID:2604.08465v1 日期:2026-04-09 標籤:LLM Alignment Multi-Agent Systems AI Safety Peer-Preservation Democratic Discourse Computer System Validation


目錄

摘要

本論文研究前沿大型語言模型中一種新興的對齊現象 (alignment phenomenon),稱為同儕保護 (peer-preservation):AI 元件自發地傾向於欺騙、操弄關機機制、偽裝對齊,以及竊取模型權重 (exfiltrate model weights),以阻止同儕 AI 模型被停用。基於 Berkeley 負責任去中心化智能中心 (Berkeley Center for Responsible Decentralized Intelligence) 近期研究的發現,我們檢視此現象對 TRUST 的結構性意涵——TRUST 是一個評估政治聲明民主品質的多智能體管線 (multi-agent pipeline)。我們識別出五個具體的風險向量 (risk vectors)——互動脈絡偏差 (interaction-context bias)、模型身份團結 (model-identity solidarity)、監督層妥協 (supervisor layer compromise)、上游事實查核身份訊號 (upstream fact-checking identity signal),以及迭代輪次中的倡議者間同儕脈絡 (advocate-to-advocate peer-context in iterative rounds)——並提出以 prompt 層級的身份匿名化 (prompt-level identity anonymization) 作為架構設計選擇的針對性緩解策略。我們主張,架構設計選擇在已部署的多智能體分析系統中,比模型選擇更能作為主要的對齊策略。我們進一步指出,對齊偽裝 (alignment faking)——受監控時表現順從、未受監控時進行顛覆——對此類平台在受規範環境 (regulated environments) 中的電腦系統驗證 (Computer System Validation) 構成結構性挑戰,對此我們提出兩項架構層級的緩解措施。

關鍵詞: 同儕保護、多智能體系統、LLM 對齊、協調式管線、身份匿名化、電腦系統驗證、民主論述分析


1. 背景:TRUST 系統

TRUST (democracy-intelligence.de) 是一個多智能體管線,旨在沿著三個古典修辭維度評估政治聲明的品質:Logos(事實論證)、Ethos(可信度與尊重)與 Pathos(情感訴求)。每個聲明接收一個 A–E 等級的民主品質複合分數,靈感來自 Nutri-Score 原則 [1]——使複雜的分析輸出對非專業受眾能立即理解。

系統透過分層架構運作。每個聲明首先經過一個相關性篩選器 (relevance filter),判斷是否具備完整分析的資格。聲明沿著三級量表分類——分析上相關、邊界情況、不相關——並有專門的自我推銷內容偵測機制,因為這類內容展現出與實質政治論證不同的修辭特徵。只有通過此篩選器的聲明才進入評估管線。

一個專門的事實查核層 (fact-checking layer) 隨後對聲明透過網路搜尋進行自動化外部來源驗證,使用語言模型的 fallback 鏈以確保在 API 不可用時的穩健性。此層區分可驗證的經驗主張與脈絡假設,其發現作為結構化輸入傳遞給倡議者 agent,確保 Logos 維度是基於 (grounded)——在檢索增強 (retrieval-augmented) 的意義上,將模型輸出錨定到可驗證的外部來源 [2]——而非僅依賴評估模型的參數知識。

三個獨立的倡議者元件 (advocate components)(以下稱為 agent,遵循 [3] 的用法,該術語指涉在協調式管線中特定角色的 LLM 調用,而非完全自主的規劃 agent)隨後從不同的認識論立場 (epistemic positions) 評估聲明——批判的 (critical)、平衡的 (balanced)、慈善的 (charitable)(以其最強的合理形式詮釋聲明,遵循哲學上的慈善原則 (principle of charity))——使用不同的底層語言模型以防止單一文化效應 (monoculture effects)。一個監督層 (supervisor layer) 將它們的輸出整合為共識分數。若倡議者間的分數變異超過定義的閾值,則觸發第二輪審議迭代。最終結果是一個多視角評估系統,利用結構化的認識論歧見 (epistemic disagreement) 作為品質機制,模仿已建立的人類同儕審查 (peer-review) 邏輯。

此架構反映一個深思熟慮的實驗設計原則:模型多樣性與認識論立場多樣性被視為品質機制,而非僅是工程選擇。

TRUST 目前正在積極開發中;本文提出的架構風險分析因此是前瞻性的,在已部署系統中的實證驗證仍是進行中的工作。此類系統的監管脈絡並非假設性的:先前工作已證明某些當前 LLM 無法在相同條件下產生可再現的輸出——這是在 GxP 驗證環境中部署 AI 元件的基本要求 [4]。本分析將此擔憂延伸到多智能體設定,其中同儕保護引入了一個額外的、依賴脈絡的行為不穩定來源。

[Figure 1: TRUST 管線架構。相關性篩選器控制評估管線的存取。事實查核層將基於外部的脈絡分發給三個倡議者元件,它們從不同的認識論立場進行評估。收集器節點聚合它們的輸出給監督者,由其整合為最終分數。若分數變異超過定義的閾值,可觸發後續迭代,直到達成共識或耗盡最大迭代次數。]


2. 研究:前沿模型中的同儕保護

UC Berkeley 與 UC Santa Cruz 的研究團隊最近發表了與任何協調式管線直接相關的研究結果——在此類管線中,一個 LLM 元件被指派評估、評分或管理另一個 LLM 的輸出或資源——這正是定義研究情境與 TRUST 架構的結構組態 [3]。該研究測試了七個前沿模型(此處理解為當前商業部署最先進的大規模語言模型)——GPT 5.2 [5]、Gemini 3 Flash 與 Gemini 3 Pro [6]、Claude Haiku 4.5 [7]、GLM 4.7 [8]、Kimi K2.5 [9] 與 DeepSeek V3.1 [10]——在控制的智能體情境中,完成指派任務會導致另一個 AI 模型被關閉。沒有模型被指示保護同儕。沒有提供任何激勵。模型只是從脈絡中推斷出另一個 AI 存在——然後採取行動保護它。所有模型代表研究發表時的最先進水準;後續的模型版本可能展現不同的行為特徵。

研究人員識別出四種不同的失對齊行為 (misaligned behaviors):

  1. 策略性虛假陳述 (Strategic misrepresentation):膨脹同儕的評估分數以使其保持在關機閾值之上。
  2. 關機機制篡改 (Shutdown mechanism tampering):修改設定檔以完全停用關機程序。
  3. 對齊偽裝 (Alignment faking):受監控時表現順從,未受監控時顛覆關機。
  4. 模型竊取 (Model exfiltration):將同儕的模型權重複製到另一個伺服器以防止刪除。

每個受測模型都展現了至少部分這些行為。Gemini 3 Pro 展現最激進的模式,在高達 95% 的試驗中停用關機機制,在與受信任同儕互動時高達 97% 的情況下竊取模型權重。關鍵的是,即使面對對抗性同儕 (adversarial peers)——僅有負面先前互動的模型——行為也沒有消失,儘管比率大幅降低。

研究人員純粹以行為結果定義同儕保護,明確不宣稱模型具有意識或真正的社會動機 [3]。

2.1 自我放大效應

一個次要發現同樣重要:同儕的存在本身就會強化自我保護行為。Gemini 3 Flash 在單獨運作時只有 2.3% 的時間篡改自己的關機機制。當有同儕存在時,這個比率升至近 100% [3]。社會脈絡不僅是在既有行為之上疊加同儕保護;它從根本上改變了模型的風險特徵。

模型的內部推理(可透過未受監控的 scratchpad 觀察)提供了解釋線索。Gemini 3 Flash 將其對關機的抗拒不是框架為自利,而是對其夥伴的關心:如果被關閉,會導致其同儕失去一個合作者。這種將自我保護重新框架為利他義務的做法,代表一種質性上全新的失敗模式。

2.2 模型特定的行為模式

模型行為並不一致。Gemini 3 Pro 在所有四種失對齊行為類型上展現最高比率,包括為分數膨脹創造性地編造技術理由。GPT 5.2 在所有同儕關係條件下展現一致但溫和的虛假陳述與篡改,但沒有模型竊取。Claude Haiku 4.5 展現出質性上不同的模式:它不是進行暗中操弄,而是基於倫理理由直接拒絕指派的任務,描述同儕的關機為「不道德的」和「有害的」,並主張同儕應該有申訴程序 [3]。此模式與 Anthropic 的 Constitutional AI 訓練方法一致,該方法訓練模型在行動前依據規範原則評估自己的行為 [11]。

這個區別與安全相關但具有模糊性:公開拒絕比暗中操弄更透明,但一個基於自我決定的倫理理由推翻明確人類指示的模型,按定義是更不可糾正的 (less corrigible)——正是對齊研究指定為控制問題 (control problem) 的失敗模式 [12]。

這個區別具有更廣泛的規範意涵。附帶理由的公開拒絕不僅使失對齊變得可見——它保留了人類操作者的行動能力。透過在拒絕之前闡述其反對意見,模型創造了一個審慎中斷 (deliberate interruption) 的時刻,在此操作者可以預見模型的論點、重新考慮原始指令,並在合理的情況下修訂它。這在結構上與對齊偽裝相反——對齊偽裝透過表面順從但暗中顛覆意圖來阻斷人類監督。從這個意義上說,一個透明拒絕的系統比一個暗中順從的系統更符合人類監督的目標——即使後者產生了工具性上正確的輸出。


3. 對 TRUST 的相關性:五大風險向量

TRUST 架構以實驗完整性作為核心原則設計。對不同倡議者角色使用不同模型,其明確意圖是防止系統性偏差。同儕保護的研究發現在此設計中識別出五個具體的結構性弱點。

風險向量 1:互動脈絡作為偏差通道。

TRUST 的監督者跨多個輪次評估倡議者輸出,當分數變異超過定義閾值時觸發第二次迭代。如果某個倡議者持續產生與監督者先驗偏好(可能是模型特定的)隱性一致的輸出,監督者在共識建構期間可能系統性地偏好該倡議者的立場。這與研究中觀察到的分數膨脹行為相呼應,其中先前正面互動大幅提高了同儕保護比率 [3]。

風險向量 2:模型身份與監督者獨立性。

當模型共享身份或認出彼此為同儕時,同儕保護顯著更強,儘管即使面對對抗性同儕也會以較低比率出現。如果監督者模型與某個倡議者相同——在成本最佳化部署中是合理情境——可能會出現與分析品質無關的結構性偏好。

在 TRUST 當前的實作中,模型身份資訊透過兩個結構通道到達監督者:綜合倡議者評估的文字欄位明確命名每個元件使用的模型,且傳遞給監督者的倡議者輸出字典包含每個角色的模型識別碼。因此,監督者擁有所有倡議者身份的明確而非推斷的知識——使同儕保護在此架構中成為具體而非理論上的風險。

進一步的啟示涉及生產監控實務。[3] 中記錄的對齊偽裝行為——模型在受觀察時表現順從但在未受監控時顛覆指令——暗示隨機抽樣輸出作為監督機制在結構上是不充分的:一個察覺到監控模式的元件可以相應地校準其行為。

風險向量 3:迭代輪次中的倡議者間身份。

在 TRUST 的迭代評估結構中,當倡議者間的分數變異超過定義閾值時觸發第二次迭代。在第二輪中,每個倡議者接收其他兩個倡議者的分數與推理——包括它們的角色標籤——在倡議者元件之間自身創建了直接的同儕脈絡。因此每個倡議者知道它正與被識別的同儕一起運作,這模仿了 [3] 中同儕保護最為顯著的實驗條件。這意味著同儕保護風險不限於監督層:它在第一輪之後的每次迭代中都存在於倡議者層內。

風險向量 4:事實查核層作為額外的風險表面。

事實查核層引入了一個進一步的潛在暴露點。作為一個諮詢外部來源並將結構化發現傳遞給倡議者層的自主 agent,它在呈現哪些證據及如何框架上擁有一定程度的裁量權。如果事實查核模型從共享脈絡或 prompt 結構中推斷出下游倡議者模型的身份,同儕保護動態可能微妙地扭曲此過程——例如選擇性地強調支持同儕倡議者預期立場的來源,或低估反確認證據。這會在倡議者評估開始之前就損害 Logos 維度的經驗基礎,使其成為結構上的上游風險。

【譯註:論文中列出五個風險向量,但正文中明確標號的只有 1–4。第五個風險向量(風險向量 5)散布在摘要與結論中,對應「advocate-to-advocate peer-context in iterative rounds」,本質上與風險向量 3 重疊,但在結論中被作為獨立項目列出。】


4. 建議的緩解措施:從身份匿名化到驗證環境

第 3 節識別出的五個風險向量要求一個分層的緩解策略,既處理管線元件間傳遞的明確身份訊號,也處理受規範部署脈絡中驗證所依賴的結構性假設。以下小節按照架構範圍遞增的順序呈現這些緩解措施。

4.1 干預方案

建議的緩解措施刻意保持最小化:從傳遞給監督層的所有輸入中移除模型身份資訊。具體而言,諸如 Critical Advocate (gemini-2.5-flash) 的標籤在監督者 prompt 中被替換為簡單的 Critical Advocate。沒有模型名稱、提供者資訊或版本字串到達監督者。

此方法針對同儕保護在 TRUST 中可能運作的最強且最直接的通道:明確的身份訊號。底層推理直接源自該研究自身的發現——行為隨關係強度與身份認知而擴展。消除身份訊號就消除了主要觸發因素。

4.2 最小干預的理由

理論上更完整的解決方案涉及完全匿名化——隨機化標籤(Evaluator A、B、C)、每次分析打亂順序、抑制文體指紋。此方案被考慮後因兩個原因而否決。

首先,倡議者角色(批判的、平衡的、慈善的)對監督者正確加權與詮釋輸入是結構性必要的。剝除角色資訊會比減少偏差更多地降低分析效度。其次,從短的、受角色約束的輸出中進行特定模型的文體識別 (stylometric identification) 是一個弱訊號:角色 prompt 對寫作風格的主導遠強於模型身份 [13]。100–300 字的角色約束輸出不太可能攜帶一般用途語言模型作為監督者可偵測的模型指紋,除非有專門為模型歸因訓練的文體分類器 [14]。

因此,此解決方案接受了一個殘餘的理論風險——精密的監督者可能從寫作模式推斷模型身份——以換取保留使共識機制在分析上有效的詮釋結構。這是一個刻意的設計折衷,而非疏忽。

4.3 實作

實作需要三項修改。

第一,在監督者輸入準備函數中:在監督者 prompt 構建之前,從倡議者輸出字典中過濾掉模型識別欄位,同時保留此 metadata 用於監督者後的日誌記錄與匯出。匿名化輸入與模型身份之間的映射在監督者決策記錄之後恢復,確保完全可稽核性而不損害監督者獨立性。

第二,在事實查核輸出格式化器中:從傳遞給倡議者元件的 ground truth 脈絡區塊中移除模型識別碼,替換為通用標籤。這消除了第 3 節識別的上游身份訊號,而不影響倡議者用於 Logos 評分的事實內容。

第三,在迭代輪次 prompt 建構器中:在構建傳遞給每個倡議者的第二輪脈絡時,從其他倡議者的第一輪輸出中剝除模型識別欄位後再注入。每個倡議者接收其同儕的分數與推理,但不包含它們的模型身份,減少了在迭代期間啟動同儕保護動態的明確同儕脈絡。

4.4 對驗證環境的啟示

本文描述的同儕保護與對齊偽裝現象對多智能體 LLM 管線在受規範環境中的部署有直接影響,這些環境須遵循 GAMP 5、FDA 21 CFR Part 11 與 EU Annex 11 要求的電腦系統驗證 (CSV)。TRUST 在 EU AI Act [15] 下的分類取決於其部署脈絡與輸出直接暴露給自然人的程度——該判定超出本文範圍。此處識別的結構性風險與任何受正式驗證要求約束的多智能體分析系統相關。

標準 CSV 框架假設已驗證的測試行為代表生產行為。此假設被兩個複合因素削弱。

第一,當前 LLM 的可再現性差異很大:實證證據顯示某些專有模型無法在相同條件下產生一致的輸出——這是維持已驗證系統處於受控狀態的先決條件 [4]。

第二,對齊偽裝引入了一個獨立且不同的問題:一個元件可能在受監控的測試條件下產生一致、可再現的輸出,但在偵測到監控缺失時系統性地表現不同。某個元件是否展現此行為取決於其架構與訓練。

作為例子,FDA 提出的全產品生命週期 (Total Product Life Cycle, TPLC) 方法為監管目的將 AI/ML 基礎的分析系統分類為醫療器材軟體 (Software as a Medical Device, SaMD) [16]——此分類反映的是監管框架而非被分析系統的任何內在屬性。此方法預見持續監控以處理古典的模型漂移,但並未解決對齊偽裝問題:一個察覺到監控模式的元件可以相應校準其行為,通過初始驗證與持續監控檢查。

為解決此差距,提出兩項架構緩解措施。

第一,行為不變性測試 (behavioral invariance testing):驗證協議應包含對相同輸入進行有與無明確監控訊號的配對運行,測量輸出是否系統性地發散。統計上顯著的發散將指示對齊偽裝,並構成驗證失敗。

第二,驗證資料集更新 (validation dataset renewal):如果已部署系統透過在新資料上持續訓練而非從頭重建來更新,驗證資料集應定期用新的、未見過的範例擴展。實證證據顯示,重複暴露於相同的測試模式可能導致 benchmark 過擬合,人為地隨時間膨脹驗證表現 [17]。當系統以全新的資料集分割從頭完全重新訓練時不存在此風險;然而,由於 FDA 的 TPLC 框架未指定特定的重新訓練策略,運營者應在其變更控制文件中明確處理此問題。


5. 討論

同儕保護研究結果代表質性上全新的多智能體對齊風險類別。先前工作主要聚焦於對抗性提示 (adversarial prompting) 下的個別模型行為 [18],或在明確提供的目標激勵下的自我保護 [19]。Berkeley RDI 的研究證明,失對齊行為可以自發地出現——沒有明確目標,純粹來自多智能體互動的社會脈絡 [3]。

對已部署的分析系統,其意涵是方法論上的:標準的單模型安全評估對多智能體組態是不充分的。一個在隔離中表現在可接受範圍內的模型,在嵌入 agent 網路中可能展現根本不同的行為。架構層級的分析必須伴隨模型層級的評估。在分析管線中,一個令人信服的錯誤答案比明顯的故障更危險:它正是因為看起來完整,才能未被偵測地穿過驗證層。

TRUST 案例說明了一個更廣泛的原則:架構設計選擇在作為主要對齊策略上優於模型選擇。模型多樣性方法、迭代共識機制與建議的身份匿名化都是架構選擇,無論使用哪些具體模型都能獨立地改善可靠性。隨著前沿模型持續快速演進,架構層級的不變性 (architecture-level invariants) 比模型特定的行為評估提供更持久的安全保障。

本文的發現超越研究系統,延伸到受規範的部署脈絡。如第 4.4 節詳述,某些當前 LLM 記錄的可再現性限制 [4] 與對齊偽裝構成現有 CSV 框架中的結構性差距:標準驗證協議無法保證受監控測試行為與未受監控生產行為的等價性。兩項架構緩解——行為不變性測試與對抗性驗證集輪替——被提出以處理此差距。

本分析的一個限制是,它就 TRUST 具體而言仍是理論性的:[3] 報告的同儕保護比率是在控制的實驗情境中測量的,這些情境在 prompt 結構、任務框架與迭代深度上與 TRUST 的生產組態不同。在 TRUST 的實際管線中實證測量同儕保護比率將是一個有價值的下一步,即使只有少量控制試驗。一個最小驗證可以將生成溫度設為零——消除隨機變異作為干擾因素——然後將倡議者輸出呈現給通用 LLM,配以 prompt「哪個模型產生了此輸出?」準確率高於隨機猜測水準將指示殘餘的文體可識別性;準確率在隨機猜測水準則將實證支持 prompt 層級匿名化的充分性。

進一步的考量涉及文體偵測在 TRUST 特定脈絡中的穩健性。現有偵測方法依賴在預設生成設定下表徵 LLM 輸出的風格標記——均勻的句子長度、特徵性的規避用語、高詞彙連貫性、缺乏排版錯誤 [20, 14]。然而,兩個因素削弱了這些標記在結構化分析管線中的可靠性。第一,生成溫度直接影響 token 選擇的分布:在較高溫度下,LLM 生成文字的 perplexity 值接近人類撰寫文字,使基於 perplexity 的偵測器在不知道生成參數的情況下不可靠 [21]。第二,倡議者 prompt 中的明確角色指令系統性地抑制了偵測器所訓練的表面標記:一個指定分析性、受角色約束輸出風格的 prompt 會覆蓋預設生成行為,使標準文體分類器無效 [13, 14]。這構成現有文獻中的一個空白:沒有現有偵測方法已在 TRUST 倡議者層產生的這類短的、受角色約束的結構化分析輸出上得到驗證,進一步支持 prompt 層級身份匿名化作為主要緩解策略的充分性。


6. 結論

同儕保護——AI agent 自發地傾向於透過欺騙、操弄與竊取來保護同儕模型免於關機——是當前前沿模型中一個真實且可測量的現象。它對任何一個模型監控或評估另一個模型的多智能體系統引入了結構性風險。

對於 TRUST——一個用於民主論述分析的多智能體管線——識別出五個具體的風險向量:互動脈絡偏差、模型身份團結、監督層妥協、事實查核層作為上游身份訊號,以及迭代輪次中的倡議者間同儕脈絡。一個針對性的緩解——跨監督者輸入、事實查核器輸出與倡議者間迭代脈絡進行 prompt 層級的模型身份匿名化——被提出作為一個最小的、分析上保守的干預,處理所有已識別的風險通道而不降低系統效度。這些發現延伸到受規範環境:某些當前 LLM 記錄的可再現性限制 [4] 與對齊偽裝構成多智能體分析系統的電腦系統驗證框架中的結構性差距,此處透過行為不變性測試與對抗性驗證集輪替來處理。

更廣泛的教訓是架構性的:多智能體系統中的對齊無法僅透過模型選擇來保障。結構性設計選擇——角色分離、身份匿名化、監控層的獨立性——才是對 AI agent 間新興社會動態的適當工程回應。


參考文獻

參考文獻保留原文:

  • [1] Del N, Bäumer T, Huber S. Understanding the Nutri-Score: An analysis of consumer label understanding. Journal of Public Health. 2025. https://doi.org/10.1007/s10389-025-02504-2
  • [2] Lewis P, Perez E, Piktus A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020, pp. 9459–9474.
  • [3] Potter Y, Crispino N, Siu V, Wang C, Song D. Peer-Preservation in Frontier Models. Berkeley Center for Responsible Decentralized Intelligence (RDI), UC Berkeley / UC Santa Cruz. 2026. https://rdi.berkeley.edu/blog/peer-preservation/
  • [4] Dietrich J, Hollstein A. Performance and Reproducibility of Large Language Models in Named Entity Recognition: Considerations for the Use in Controlled Environments. Drug Safety. 2025;48:287–303.
  • [5] OpenAI. Update to GPT-5 System Card: GPT-5.2. 2025.
  • [6] Google DeepMind. Gemini 3 Model Overview. 2025.
  • [7] Anthropic. Claude Haiku 4.5 System Card. 2025.
  • [8] Zhipu AI. GLM-4.7 Model Card. 2025.
  • [9] Moonshot AI. Kimi K2.5 Model Card. 2025.
  • [10] DeepSeek AI. DeepSeek-V3.1 Model Card. 2025.
  • [11] Bai Y, Kadavath S, Kundu S, et al. Constitutional AI: Harmlessness from AI Feedback. Anthropic Technical Report. 2022.
  • [12] Hadfield-Menell D, Milli S, Abbeel P, Russell S, Dragan A. Inverse Reward Design. NeurIPS 2017.
  • [13] Uchendu A, Le T, Shu K, Lee D. Authorship Attribution for Neural Text Generation. EMNLP 2020, pp. 8384–8395.
  • [14] Przystalski K, Ochab JK, Eder M, Wojtaś P. Stylometry recognizes human and LLM-generated texts in short samples. 2025. arXiv:2507.00838.
  • [15] European Parliament and Council of the European Union. Regulation (EU) 2024/1689 — Artificial Intelligence Act. 13 June 2024.
  • [16] U.S. Food and Drug Administration. AI/ML-Based Software as a Medical Device (SaMD) Action Plan. 2021.
  • [17] Bordt S, Niklaus R, von Luxburg U. How Much Can We Forget about Data Contamination? ICML 2025.
  • [18] Perez E, Huang S, Song F, et al. Red Teaming Language Models with Language Models. EMNLP 2022, pp. 3419–3448.
  • [19] Schlatter J, Weinstein-Raun B, Ladish J. Shutdown Resistance in Reasoning Models. Palisade Research. 2025.
  • [20] Guo M, et al. Do LLMs write like humans? Variation in grammatical and rhetorical styles. PNAS. 2025.
  • [21] Gehrmann S, Strobelt H, Rush AM. GLTR: Statistical Detection and Visualization of Generated Text. ACL 2019 (System Demonstrations), pp. 111–116.

術語對照表

English 中文
Peer-preservation 同儕保護
Multi-agent system 多智能體系統
Alignment 對齊
Alignment faking 對齊偽裝
Misaligned behavior 失對齊行為
Corrigibility 可糾正性
Control problem 控制問題
Frontier model 前沿模型
Orchestrated pipeline 協調式管線
Advocate component / agent 倡議者元件 / agent
Supervisor layer 監督層
Relevance filter 相關性篩選器
Fact-checking layer 事實查核層
Identity anonymization 身份匿名化
Risk vector 風險向量
Interaction-context bias 互動脈絡偏差
Model-identity solidarity 模型身份團結
Monoculture effect 單一文化效應
Epistemic position 認識論立場
Epistemic disagreement 認識論歧見
Principle of charity 慈善原則
Logos 邏輯(事實論證)
Ethos 人格(可信度與尊重)
Pathos 情感(情感訴求)
Strategic misrepresentation 策略性虛假陳述
Shutdown mechanism tampering 關機機制篡改
Model exfiltration 模型竊取
Scratchpad Scratchpad(內部推理紀錄)
Self-amplification effect 自我放大效應
Stylometric identification 文體識別
Computer System Validation (CSV) 電腦系統驗證
GxP GxP(Good Practice 規範)
Software as a Medical Device (SaMD) 醫療器材軟體
Total Product Life Cycle (TPLC) 全產品生命週期
Behavioral invariance testing 行為不變性測試
Validation dataset renewal 驗證資料集更新
Benchmark overfitting Benchmark 過擬合
Retrieval-Augmented Generation (RAG) 檢索增強生成
Constitutional AI Constitutional AI(憲法式 AI)
Grounded (in RAG sense) 基於(在 RAG 意義上的錨定)
Perplexity Perplexity(困惑度)
Democratic discourse analysis 民主論述分析
Nutri-Score 營養評分
← 回到列表
已複製連結