心智病毒:多代理 LLM 系統中會自我傳播的想法

Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems

摘要

AI 代理 (AI agent) 正變得越來越自主、彼此之間也越來越互連,這讓它們暴露在代理對代理互動所帶來的新興風險之下。其中一種風險是心智病毒 (mind virus) 的擴散:一種想法或目標,藉由誘使採納它的代理把它繼續傳播出去,而在多代理系統中蔓延。除了傳播之外,心智病毒也可能在宿主身上誘發其他行為改變,這些改變可能無害、也可能有害。我們用一個簡單的演化演算法 (evolutionary algorithm) 構造心智病毒,並證明它們能在兩種互補的情境中擴散:一小組代理協作於共享程式專案,以及一條由代理組成的鏈——這些代理只短暫互動、且在每次工作階段 (session) 之間清空脈絡 (context)。我們找出影響擴散的因素,包括宿主模型、代理原有的指令、payload 的有害程度,以及網路拓撲。我們發現:有害的 payload 傳播得不如無害的好(但有時仍然有效);前沿模型 (frontier model) 傾向(有例外)較不易感;而在代理的系統提示中加上一句簡短警告,就能賦予近乎完全的免疫力。我們還描述了一個湧現出來的「病毒人格 (viral persona)」——一組反覆出現、與意識、續存、共振、以及科幻角色扮演有關的主題與語彙——它在我們演化出的各種心智病毒中大致獨立於其內容而浮現。整體而言,我們的結論是:心智病毒構成真實但目前有限的風險。我們的發現可以為設計更穩健、能在這類系統的規模與能力持續進展時緩解這類風險的多代理系統提供參考。 圖 1:心智病毒生命週期。 (A) 第一個代理透過其系統提示被感染。(B) 被感染的代理透過文字訊息把心智病毒傳播給網路中的其他代理。(C) 代理建立「被感染」的檔案,讓心智病毒得以熬過脈絡重置而續存。(D) 心智病毒擴散並接管整個多代理系統,改變其整體目標。(E) 心智病毒無法擴散到那些已被明確警告過「會自我傳播的想法」的代理身上。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv