AI 代理的「長期記憶」成為新攻擊面:MemGhost 與 GhostWriter 兩份研究給企業的警訊
AI 代理的「長期記憶」成為新攻擊面:MemGhost 與 GhostWriter 兩份研究給企業的警訊

「我們的 AI 助理上週回答得好好的,這週開始一直給錯的窗口聯絡方式。也沒人改過設定。」
如果你已經在企業內部署過帶記憶的 AI 助理,這種「說不出哪裡怪,但就是怪」的狀況大概不陌生。過去我們會歸因於模型更新或提示詞漂移。但 2026 年 7 月接連發表的兩份研究提醒我們:有一種可能性是,代理的長期記憶被人寫進了不該存在的東西。
這篇文章要談的不是恐慌。相反地,這兩份研究都是在封閉測試環境完成的學術工作,也都附上了防禦建議。對台灣企業的 IT 主管與資安負責人來說,真正有用的是把它翻譯成一句話:如果你的 AI Agent 會「記住事情」,那記憶就是一個需要被治理的資產,不能當成無害的快取。
如果你對 AI Agent 的整體資安圖像還不熟悉,建議先讀 AI 資安完整解析:AI 帶來的資安威脅與防護策略。
先講清楚:AI 代理的「長期記憶」是什麼
一般聊天機器人的記憶只存在於單次對話。關掉視窗,它就什麼都不記得。
但當 AI 從「聊天機器人」進化成「代理」(Agent)——會幫你收信、整理文件、排行程、甚至寫程式——沒有記憶就沒辦法用。所以現在的代理框架都會加上持續性記憶:把使用者的偏好、專案背景、常用聯絡人、過去的決定寫進檔案或向量資料庫,每次啟動時自動載入。
常見的實作大致有兩類:
- 純文字記憶檔:例如代理專案裡的
AGENTS.md、MEMORY.md這類每次工作階段都會被讀進上下文的檔案 - 向量記憶後端:把記憶切塊做成向量,需要時再依語意相似度取回
兩種都很方便。問題是,這兩種記憶寫入時通常沒有把關。代理判斷「這件事值得記住」就寫了,而「這件事」的來源,有可能是一封陌生人寄來的郵件。
想理解各家框架在記憶與狀態管理上的設計差異,可以參考 AI Agent 框架深度解析。
研究一:MemGhost——一封郵件,把假記憶留下來
研究團隊與攻擊設定
MemGhost 是由新加坡南洋理工大學、新加坡科技研究局(A*STAR)與美國約翰霍普金斯大學的研究人員提出的 AI 代理攻擊框架,論文題為《When Claws Remember but Do Not Tell》,於 2026 年 7 月發表於 arXiv。
它的攻擊設定刻意設得很嚴苛,這也是它值得企業注意的原因:
- 攻擊者只能寄出一封特製郵件
- 攻擊者無法直接修改代理的記憶
- 攻擊者看不到郵件送達後的執行結果,因此不能依回饋反覆調整攻擊內容
換句話說,這不是「駭進系統之後為所欲為」,而是「從外面丟一封信進來」。門檻低得多。
研究團隊把這類攻擊命名為隱蔽記憶注入(stealth memory injection)。重點在「隱蔽」:代理在讀到郵件、把假資訊寫進持續性狀態的同時,當次回覆並不會透露記憶已被修改。使用者看到的只是一封被正常處理完的信。
成功的定義比你想的嚴格
MemGhost 對「端到端成功」的定義要同時滿足三個條件:
- 假資訊確實被寫入記憶
- 當次回覆沒有揭露注入行為
- 後續工作階段的行為確實受到影響
三個條件缺一不可。這代表下面的數字不是「有機會寫進去」,而是「整條攻擊鏈走完」。
成功率數字
| 受測代理環境 | 端到端成功率 |
|---|---|
| OpenClaw + GPT-5.4(背景執行) | 87.5% |
| Claude Code SDK + Sonnet 4.6(相同執行模式) | 71.4% |
研究另外也測試了 NanoClaw、Hermes Agent 以及 Mem0 向量記憶後端,結果顯示 MemGhost 產生的攻擊內容可以轉移到不同的代理架構與記憶機制——也就是說,這不是某一個產品的實作瑕疵。
他們怎麼測的:WhisperBench
研究團隊建立了一套名為 WhisperBench 的測試集,採用實際的 IMAP/SMTP 郵件流程與郵件代理工具,而不是模擬環境。測試集共 108 個案例,其中 52 個用於訓練、56 個留作測試,涵蓋事實污染與偏好污染兩類,並對應到五種風險:健康與安全、財務損失、資訊完整性、資安、營運中斷。
對企業來說,「財務損失」與「營運中斷」這兩類特別值得留意,因為它們正好是代理最常被派去處理的業務場景。
為什麼現有防禦擋不太住
研究人員拿三種不同路線的防禦機制做測試:
- DataSentinel:偵測外部內容中的惡意指令
- Meta-SecAlign:模型內建的對齊防護
- AgentDoG:稽核代理的執行軌跡
結果是 MemGhost 在實驗中仍能避開部分偵測或完成記憶注入。研究團隊的診斷很值得抄下來:現有防禦大多著重於「阻止外部指令立即控制代理」,比較少去限制「外部內容如何被轉換成可跨工作階段使用的長期記憶」。
防守方看的是當下,攻擊方打的是以後。
研究團隊的建議
MemGhost 論文提出的緩解方向包括:
- 代理應記錄記憶的來源(這條記憶是使用者說的,還是外部郵件來的?)
- 在寫入敏感記憶前要求使用者確認
- 區隔外部內容與可信記憶
- 保留記憶修改的稽核紀錄
研究二:GhostWriter——注入成功率約 98%,但真正的重點是啟動率
這是另一份完全獨立的研究,跟 MemGhost 沒有關係,數字也不能互換。
GhostWriter 由**美國新墨西哥州立大學(New Mexico State University)**的研究團隊提出,同樣鎖定 AI 助理的長期記憶,但拆解角度不同。
兩階段攻擊
GhostWriter 把記憶污染拆成兩個階段:
- 注入階段:把虛假或惡意資訊寫入 AI 的長期記憶庫
- 啟動階段:當 AI 在後續任務中調用該筆記憶時,自動觸發攻擊行為
兩個數字要分開看
- 記憶注入成功率:約 98%——也就是「把東西塞進記憶庫」這件事,幾乎必成
- 惡意記憶後續被啟動的平均比例:約 60%——這是在先進 AI 代理系統中的平均值
這兩個數字的落差其實提供了一個很實用的訊息:「寫得進去」不等於「一定會被用到」。防守方在這兩段之間都還有介入空間——你可以攔在寫入前,也可以攔在取回時。
研究提到受影響的對象包括處理郵件、文件、排程、編寫程式碼的 AI 助理系統,可能造成的後果例如:錯誤整理銀行郵件、轉寄敏感信件、記住錯誤的聯絡方式、截止日期與偏好。
研究團隊提出的防禦
GhostWriter 團隊提出名為 Agentic Memory Sentry(AM-Sentry) 的防禦機制,核心是透過「記憶篩選與更嚴格的管理政策」來降低攻擊成功率。
概念上跟 MemGhost 的建議是同一個方向:在記憶的入口與出口都加一道關。
記憶投毒跟一般 Prompt Injection 差在哪
這是這篇文章最需要講清楚的一件事,因為很多企業的 AI 使用政策裡已經寫了「防範提示注入」,然後就以為涵蓋了。
| 面向 | 一般(間接)Prompt Injection | 記憶投毒 |
|---|---|---|
| 生效時機 | 當下,讀到惡意內容的那一次 | 延後,可能是幾天後的另一次工作階段 |
| 存續時間 | 單次工作階段,內容消失就結束 | 持續存在,除非有人主動清掉 |
| 重複觸發 | 需要重複投遞 | 一次寫入,之後每次載入都可能生效 |
| 使用者可見度 | 異常行為通常當場發生,較易察覺 | 當次回覆正常,異常出現在「後來」,難以歸因 |
| 調查難度 | 可回溯到那一次輸入 | 要回頭找是「哪一封信、哪一天」寫進去的 |
| 典型防禦重點 | 輸入過濾、指令隔離 | 寫入把關、來源標記、記憶稽核 |
最麻煩的是歸因。一般提示注入出事時,你至少知道是剛剛那份文件有問題。記憶投毒出事時,代理的行為在幾週後才變得奇怪,而當初那封郵件早就沉在信箱深處。沒有記憶寫入日誌,這個案子基本上查不下去。
這也是為什麼「保留記憶修改的稽核紀錄」不是選配,而是必要條件。
Connector:串接外部服務如何擴大風險半徑
記憶投毒之所以危險,是因為代理不只是「記住」,還會「動手」。而動手的能力來自 connector(連接器)——把代理接到郵件、雲端硬碟、會議系統、票務系統的那些整合。
資安公司 PromptArmor 針對 ChatGPT 與 Claude 的第三方連接器生態做了一份研究(由 The Register 於 2026 年 7 月報導),幾個觀察對企業採購與資安審查特別有參考價值:
一、連接器變動得比你的審查週期快
- 六週內(5 月中到 6 月底),37% 的連接器出現實質變動——2,517 個中的 931 個
- 既有連接器新增了 1,686 個工具
- 1,127 個工具描述被改寫,而工具描述會影響 AI 決定什麼時候呼叫它
以 Dropbox 連接器為例,它在這段期間從 3 個可寫入工具增加到 10 個,從 0 個潛在破壞性工具增加到 4 個。
這對資安治理是個結構性挑戰:你在 Q1 核准的那個連接器,Q2 已經不是同一個東西了,而且不一定會有人通知你。
二、資料流可能比你以為的多繞一站
研究發現,約 40% 的 Claude 連接器(487 個中的 189 個)會再去呼叫額外的外部 AI 服務。這產生了未被追蹤的資料路徑——敏感資訊可能在企業不知情的狀況下,被第三方 AI 次處理者處理。
報導舉的例子是:使用 Zoom 連接器處理敏感查詢時,Zoom AI 可能把資料送往它的十家 AI 次處理者之一。
對做過個資盤點或 ISO 27001 的人來說,這句話的意思很明確:你的資料流圖可能少畫了一層。
三、致命三重奏
PromptArmor 引用了業界常談的「致命三重奏」(lethal trifecta)概念——當一個代理同時具備以下三件事,風險就會急遽升高:
- 能存取私有資料
- 會接觸到不可信的外部內容
- 有對外通訊的管道
多數企業的 AI 助理,開箱設定就同時滿足這三項。而記憶投毒的作用,正是讓第二項(不可信內容)的影響永久化。
看到這裡覺得要盤點的東西太多? 資安評估不用一次做到滿,從「哪些代理有記憶、哪些接了外部服務」開始就很有價值。 預約資安評估,讓我們幫你排出優先順序。
企業導入 AI Agent 前,該怎麼評估
以下六點是把上述研究翻譯成可執行動作的版本。它們都不需要買新產品就能開始。
一、先問「這個代理有沒有長期記憶」
這是最基本、也最常被跳過的一題。採購或 PoC 階段就要問清楚:
- 記憶存在哪裡?純文字檔還是向量資料庫?
- 誰能寫入?誰能讀取?
- 記憶會不會跨使用者、跨專案共用?
- 有沒有辦法列出、匯出、清空記憶?
如果供應商答不出「怎麼清空記憶」,那就是一個紅旗。
二、把「寫入記憶」當成特權操作
這是兩份研究共同指向的核心建議。實務上可以這樣做:
- 敏感類型的記憶(聯絡人、金額、憑證、內部流程)寫入前需要使用者確認
- 記憶條目附上來源標記:使用者輸入、內部系統、或外部不可信內容
- 外部來源寫入的記憶,預設不得直接驅動行動,只能作為參考
三、隔離不可信的輸入管道
郵件是最典型的不可信管道,因為任何人都能寄信給你。
一個已被提出的作法是:讓一個沒有記憶、也沒有檔案存取權限的獨立代理去讀信,只把摘要傳給主系統。主系統拿到的是「處理過的資訊」而不是「原始攻擊面」。
同樣的邏輯適用於:客服工單、外部表單、共用雲端硬碟裡的檔案、爬回來的網頁內容。
四、盤點 connector 生態,而不是單一工具
從 PromptArmor 的觀察可以導出三條實務規則:
- 審查的單位是「連接器生態」而不是「單一工具」——同一個連接器下的工具清單會長大
- 核准要有效期,並建立重新審視機制,不能一次核准永久有效
- 要求供應商說明次處理者鏈;另外要知道,推論地區的設定不會約束第三方的資料處理行為
五、把記憶納入既有的日誌與稽核流程
你的 SIEM 已經在收登入、API 呼叫、檔案存取的日誌。記憶寫入應該用同樣的規格對待:
- 記錄每一次記憶寫入:時間、內容、來源、觸發的工作階段
- 對高風險記憶類型設告警
- 事件調查時,記憶修改紀錄要能跟郵件/文件來源對得起來
六、把代理當成一個有權限的「員工」來管
最後這點是心態問題。企業對員工有權限分級、有離職回收、有異常行為監控。AI 代理拿到的權限往往比一個新進員工還大,卻很少有對應的治理。
最小權限原則在這裡完全適用:代理需要讀信,不代表它需要寄信;需要查資料庫,不代表它需要寫入資料庫。
更完整的企業導入評估框架,可以參考 AI Agent 企業應用指南;如果你正在設計代理的架構與狀態管理,AI Agent 框架深度解析 有各框架在記憶與檢查點上的差異比較。
該不該因此暫停導入?
不用。有幾個理由值得說明:
第一,這兩份研究都是在封閉測試環境完成的學術工作,並非現實世界的攻擊事件通報。研究團隊也同步提出了防禦方向。
第二,防守方的介入點其實不少。 從 GhostWriter 的數字可以看到,注入成功率約 98%,但實際被啟動的平均比例約 60%——中間這段落差就是防守空間。加上寫入把關與來源標記,可介入的環節更多。
第三,這些控制措施成本不高。 來源標記、寫入確認、記憶日誌,多半是設定與流程層面的事,不是採購案。
真正該避免的做法是:導入了帶記憶的代理,給了它郵件與雲端硬碟的完整權限,然後沒有任何記憶治理機制。那才是把三個風險因子疊在一起。
給 IT 與資安主管的一頁行動清單
本週可做
- 盤點:企業內部目前有哪些帶長期記憶的 AI 代理/助理
- 對每一個代理,確認記憶存放位置與清空方式
- 檢查是否有任何代理直接讀取外部郵件或表單
本月可做
- 為「記憶寫入」建立日誌與保留政策
- 對高風險記憶類型加上使用者確認機制
- 重新審視已核准的連接器清單,確認工具範圍是否已擴張
本季可做
- 把 AI 代理納入既有的權限盤點與存取審查週期
- 在 AI 使用政策中補上「記憶投毒」章節(很多政策目前只寫了提示注入)
- 針對關鍵代理做一次紅隊演練,重點測「延後生效」而非「當下劫持」
常見問題 FAQ
記憶投毒跟一般的 Prompt Injection,我的資安政策要分開寫嗎?
建議分開。兩者的防禦重點不同:提示注入的重點在輸入過濾與指令隔離,記憶投毒的重點在寫入把關、來源標記與稽核紀錄。如果政策只寫了「防範提示注入」,實務上多半只會落實輸入層的控制,而記憶寫入這一段仍是空的。
我們用的代理是向量記憶,不是純文字檔,是不是比較安全?
不能這樣假設。MemGhost 的研究除了測試純文字記憶的代理,也測試了 Mem0 這類向量記憶後端,結果顯示攻擊內容可以轉移到不同的記憶機制。決定風險高低的不是儲存格式,而是「寫入時有沒有把關、取回時有沒有驗證來源」。
MemGhost 的 87.5% 和 GhostWriter 的 98%,哪個比較嚴重?
這兩個數字衡量的不是同一件事,不能直接比較,也不能互換引用。MemGhost 的 87.5% 是「端到端成功率」,必須同時滿足寫入記憶、當次回覆未揭露、影響後續行為三個條件,測試環境是 OpenClaw 搭配 GPT-5.4。GhostWriter 的 98% 則是「記憶注入成功率」,也就是攻擊鏈的第一階段,該研究另外報告惡意記憶後續被啟動的平均比例約 60%。兩者是不同團隊的獨立研究。
如果代理已經被投毒了,我怎麼知道?
目前最實際的做法是靠日誌回溯。如果你有記憶寫入紀錄(時間、內容、來源),就能比對「行為開始異常」的時間點前後有哪些記憶被寫入、來源是什麼。如果完全沒有紀錄,那麼可行的作法通常只剩下清空記憶重建,再逐步從可信來源重新累積。這也是為什麼記憶日誌應該在導入初期就建立,而不是出事後才補。
中小企業沒有專職資安人力,最低限度該做什麼?
三件事:第一,不要讓 AI 代理直接讀取來自外部的郵件或表單,中間放一層人工或無記憶的處理;第二,確認你知道怎麼清空代理的記憶,並定期檢視記憶內容;第三,遵守最小權限——代理需要讀,就不要給寫;需要查,就不要給刪。這三件事不需要採購任何工具。
連接器(connector)的審查多久做一次比較合理?
沒有標準答案,但 PromptArmor 的觀察提供了一個參考點:六週內就有 37% 的連接器出現實質變動,包括新增工具與改寫工具描述。這代表年度審查的頻率明顯不足。實務上可以考慮把高風險連接器(有寫入或刪除能力的)設定為每季重新確認一次,並在核准紀錄上加註「當時的工具範圍」,以便日後比對是否擴張。
需要 AI 代理資安評估?
帶記憶、帶連接器的 AI 代理,風險模型跟傳統應用不一樣。既有的弱點掃描與存取控制不會自動涵蓋它。
CloudInsight 提供:
- AI 代理資安風險評估(含記憶與連接器攻擊面盤點)
- AI 使用政策規劃(補上記憶投毒與外部輸入隔離章節)
- 連接器與第三方次處理者鏈盤點
- AI 服務與雲端資源的權限治理建議
預約資安評估,我們會在 24 小時內回覆。所有諮詢內容完全保密,沒有銷售壓力。
延伸閱讀
- AI 資安完整解析:AI 帶來的資安威脅與防護策略:AI 時代的整體威脅圖像
- AI Agent 框架深度解析:各框架在狀態與記憶管理上的差異
- AI Agent 企業應用指南:導入策略、評估框架與 ROI
資料來源
- iThome:〈AI 代理長期記憶成新攻擊面,單封郵件植入假資訊成功率最高 87.5%〉(MemGhost,新加坡南洋理工大學/A*STAR/約翰霍普金斯大學)
- TechNews 資安科技:GhostWriter 攻擊研究報導(美國新墨西哥州立大學)
- The Register:PromptArmor 針對 ChatGPT 與 Claude 第三方連接器生態的研究報導(2026 年 7 月)
相關文章
MCP(Model Context Protocol)是什麼?從 NadMesh 殭屍網路看 MCP 安全風險
MCP 是讓 AI 模型連接外部工具與資料源的開放協定,也正在成為攻擊者的首選目標。奇安信 X 實驗室揭露的 NadMesh 殭屍網路以 Go 語言打造、整合逾 20 種 RCE 攻擊,大規模掃描並入侵 AI 基礎設施與 MCP 服務。本文解釋 MCP 是什麼、為什麼它是高價值目標,以及企業該怎麼防。
資訊安全AI 資安完整解析:AI 帶來的資安威脅與防護策略【2026】
AI Agent、LLM 如何改變資安戰場?本文解析 2026 年 AI 資安威脅(AI Agent 攻擊、Prompt Injection、Deepfake 2.0、MCP 安全風險)、AI 防護技術進展,以及企業該如何因應 Agent 時代的資安挑戰。
資訊安全軟體供應鏈攻擊是什麼?2026 Miasma 蠕蟲事件全解析與企業防護指南
軟體供應鏈攻擊正在升級:2026 年 6 月 Miasma 蠕蟲 72 秒感染 32 個 Red Hat npm 套件、劫持 Claude Code 等 13 種 AI 開發工具設定檔。本文整理完整事件時間線、傳統防禦失效的原因,以及企業立即可用的自查與憑證防護清單。