返回首頁資訊安全

AI 代理的「長期記憶」成為新攻擊面:MemGhost 與 GhostWriter 兩份研究給企業的警訊

29 min 分鐘閱讀
#AI Agent#資安#記憶投毒#Prompt Injection#MemGhost#GhostWriter#Agent Security#企業導入#connector

AI 代理的「長期記憶」成為新攻擊面:MemGhost 與 GhostWriter 兩份研究給企業的警訊

示意 AI 代理的長期記憶遭投毒後污染持續留存、並在後續互動被啟動

「我們的 AI 助理上週回答得好好的,這週開始一直給錯的窗口聯絡方式。也沒人改過設定。」

如果你已經在企業內部署過帶記憶的 AI 助理,這種「說不出哪裡怪,但就是怪」的狀況大概不陌生。過去我們會歸因於模型更新或提示詞漂移。但 2026 年 7 月接連發表的兩份研究提醒我們:有一種可能性是,代理的長期記憶被人寫進了不該存在的東西

這篇文章要談的不是恐慌。相反地,這兩份研究都是在封閉測試環境完成的學術工作,也都附上了防禦建議。對台灣企業的 IT 主管與資安負責人來說,真正有用的是把它翻譯成一句話:如果你的 AI Agent 會「記住事情」,那記憶就是一個需要被治理的資產,不能當成無害的快取。

如果你對 AI Agent 的整體資安圖像還不熟悉,建議先讀 AI 資安完整解析:AI 帶來的資安威脅與防護策略

先講清楚:AI 代理的「長期記憶」是什麼

一般聊天機器人的記憶只存在於單次對話。關掉視窗,它就什麼都不記得。

但當 AI 從「聊天機器人」進化成「代理」(Agent)——會幫你收信、整理文件、排行程、甚至寫程式——沒有記憶就沒辦法用。所以現在的代理框架都會加上持續性記憶:把使用者的偏好、專案背景、常用聯絡人、過去的決定寫進檔案或向量資料庫,每次啟動時自動載入。

常見的實作大致有兩類:

  • 純文字記憶檔:例如代理專案裡的 AGENTS.mdMEMORY.md 這類每次工作階段都會被讀進上下文的檔案
  • 向量記憶後端:把記憶切塊做成向量,需要時再依語意相似度取回

兩種都很方便。問題是,這兩種記憶寫入時通常沒有把關。代理判斷「這件事值得記住」就寫了,而「這件事」的來源,有可能是一封陌生人寄來的郵件。

想理解各家框架在記憶與狀態管理上的設計差異,可以參考 AI Agent 框架深度解析

研究一:MemGhost——一封郵件,把假記憶留下來

研究團隊與攻擊設定

MemGhost 是由新加坡南洋理工大學、新加坡科技研究局(A*STAR)與美國約翰霍普金斯大學的研究人員提出的 AI 代理攻擊框架,論文題為《When Claws Remember but Do Not Tell》,於 2026 年 7 月發表於 arXiv。

它的攻擊設定刻意設得很嚴苛,這也是它值得企業注意的原因:

  1. 攻擊者只能寄出一封特製郵件
  2. 攻擊者無法直接修改代理的記憶
  3. 攻擊者看不到郵件送達後的執行結果,因此不能依回饋反覆調整攻擊內容

換句話說,這不是「駭進系統之後為所欲為」,而是「從外面丟一封信進來」。門檻低得多。

研究團隊把這類攻擊命名為隱蔽記憶注入(stealth memory injection)。重點在「隱蔽」:代理在讀到郵件、把假資訊寫進持續性狀態的同時,當次回覆並不會透露記憶已被修改。使用者看到的只是一封被正常處理完的信。

成功的定義比你想的嚴格

MemGhost 對「端到端成功」的定義要同時滿足三個條件:

  1. 假資訊確實被寫入記憶
  2. 當次回覆沒有揭露注入行為
  3. 後續工作階段的行為確實受到影響

三個條件缺一不可。這代表下面的數字不是「有機會寫進去」,而是「整條攻擊鏈走完」。

成功率數字

受測代理環境端到端成功率
OpenClaw + GPT-5.4(背景執行)87.5%
Claude Code SDK + Sonnet 4.6(相同執行模式)71.4%

研究另外也測試了 NanoClaw、Hermes Agent 以及 Mem0 向量記憶後端,結果顯示 MemGhost 產生的攻擊內容可以轉移到不同的代理架構與記憶機制——也就是說,這不是某一個產品的實作瑕疵。

他們怎麼測的:WhisperBench

研究團隊建立了一套名為 WhisperBench 的測試集,採用實際的 IMAP/SMTP 郵件流程與郵件代理工具,而不是模擬環境。測試集共 108 個案例,其中 52 個用於訓練、56 個留作測試,涵蓋事實污染與偏好污染兩類,並對應到五種風險:健康與安全、財務損失、資訊完整性、資安、營運中斷。

對企業來說,「財務損失」與「營運中斷」這兩類特別值得留意,因為它們正好是代理最常被派去處理的業務場景。

為什麼現有防禦擋不太住

研究人員拿三種不同路線的防禦機制做測試:

  • DataSentinel:偵測外部內容中的惡意指令
  • Meta-SecAlign:模型內建的對齊防護
  • AgentDoG:稽核代理的執行軌跡

結果是 MemGhost 在實驗中仍能避開部分偵測或完成記憶注入。研究團隊的診斷很值得抄下來:現有防禦大多著重於「阻止外部指令立即控制代理」,比較少去限制「外部內容如何被轉換成可跨工作階段使用的長期記憶」。

防守方看的是當下,攻擊方打的是以後。

研究團隊的建議

MemGhost 論文提出的緩解方向包括:

  • 代理應記錄記憶的來源(這條記憶是使用者說的,還是外部郵件來的?)
  • 寫入敏感記憶前要求使用者確認
  • 區隔外部內容與可信記憶
  • 保留記憶修改的稽核紀錄

研究二:GhostWriter——注入成功率約 98%,但真正的重點是啟動率

這是另一份完全獨立的研究,跟 MemGhost 沒有關係,數字也不能互換。

GhostWriter 由**美國新墨西哥州立大學(New Mexico State University)**的研究團隊提出,同樣鎖定 AI 助理的長期記憶,但拆解角度不同。

兩階段攻擊

GhostWriter 把記憶污染拆成兩個階段:

  1. 注入階段:把虛假或惡意資訊寫入 AI 的長期記憶庫
  2. 啟動階段:當 AI 在後續任務中調用該筆記憶時,自動觸發攻擊行為

兩個數字要分開看

  • 記憶注入成功率:約 98%——也就是「把東西塞進記憶庫」這件事,幾乎必成
  • 惡意記憶後續被啟動的平均比例:約 60%——這是在先進 AI 代理系統中的平均值

這兩個數字的落差其實提供了一個很實用的訊息:「寫得進去」不等於「一定會被用到」。防守方在這兩段之間都還有介入空間——你可以攔在寫入前,也可以攔在取回時。

研究提到受影響的對象包括處理郵件、文件、排程、編寫程式碼的 AI 助理系統,可能造成的後果例如:錯誤整理銀行郵件、轉寄敏感信件、記住錯誤的聯絡方式、截止日期與偏好。

研究團隊提出的防禦

GhostWriter 團隊提出名為 Agentic Memory Sentry(AM-Sentry) 的防禦機制,核心是透過「記憶篩選與更嚴格的管理政策」來降低攻擊成功率。

概念上跟 MemGhost 的建議是同一個方向:在記憶的入口與出口都加一道關。

記憶投毒跟一般 Prompt Injection 差在哪

這是這篇文章最需要講清楚的一件事,因為很多企業的 AI 使用政策裡已經寫了「防範提示注入」,然後就以為涵蓋了。

面向一般(間接)Prompt Injection記憶投毒
生效時機當下,讀到惡意內容的那一次延後,可能是幾天後的另一次工作階段
存續時間單次工作階段,內容消失就結束持續存在,除非有人主動清掉
重複觸發需要重複投遞一次寫入,之後每次載入都可能生效
使用者可見度異常行為通常當場發生,較易察覺當次回覆正常,異常出現在「後來」,難以歸因
調查難度可回溯到那一次輸入要回頭找是「哪一封信、哪一天」寫進去的
典型防禦重點輸入過濾、指令隔離寫入把關、來源標記、記憶稽核

最麻煩的是歸因。一般提示注入出事時,你至少知道是剛剛那份文件有問題。記憶投毒出事時,代理的行為在幾週後才變得奇怪,而當初那封郵件早就沉在信箱深處。沒有記憶寫入日誌,這個案子基本上查不下去。

這也是為什麼「保留記憶修改的稽核紀錄」不是選配,而是必要條件。

Connector:串接外部服務如何擴大風險半徑

記憶投毒之所以危險,是因為代理不只是「記住」,還會「動手」。而動手的能力來自 connector(連接器)——把代理接到郵件、雲端硬碟、會議系統、票務系統的那些整合。

資安公司 PromptArmor 針對 ChatGPT 與 Claude 的第三方連接器生態做了一份研究(由 The Register 於 2026 年 7 月報導),幾個觀察對企業採購與資安審查特別有參考價值:

一、連接器變動得比你的審查週期快

  • 六週內(5 月中到 6 月底),37% 的連接器出現實質變動——2,517 個中的 931 個
  • 既有連接器新增了 1,686 個工具
  • 1,127 個工具描述被改寫,而工具描述會影響 AI 決定什麼時候呼叫它

以 Dropbox 連接器為例,它在這段期間從 3 個可寫入工具增加到 10 個,從 0 個潛在破壞性工具增加到 4 個

這對資安治理是個結構性挑戰:你在 Q1 核准的那個連接器,Q2 已經不是同一個東西了,而且不一定會有人通知你。

二、資料流可能比你以為的多繞一站

研究發現,約 40% 的 Claude 連接器(487 個中的 189 個)會再去呼叫額外的外部 AI 服務。這產生了未被追蹤的資料路徑——敏感資訊可能在企業不知情的狀況下,被第三方 AI 次處理者處理。

報導舉的例子是:使用 Zoom 連接器處理敏感查詢時,Zoom AI 可能把資料送往它的十家 AI 次處理者之一。

對做過個資盤點或 ISO 27001 的人來說,這句話的意思很明確:你的資料流圖可能少畫了一層。

三、致命三重奏

PromptArmor 引用了業界常談的「致命三重奏」(lethal trifecta)概念——當一個代理同時具備以下三件事,風險就會急遽升高:

  1. 能存取私有資料
  2. 會接觸到不可信的外部內容
  3. 有對外通訊的管道

多數企業的 AI 助理,開箱設定就同時滿足這三項。而記憶投毒的作用,正是讓第二項(不可信內容)的影響永久化


看到這裡覺得要盤點的東西太多? 資安評估不用一次做到滿,從「哪些代理有記憶、哪些接了外部服務」開始就很有價值。 預約資安評估,讓我們幫你排出優先順序。


企業導入 AI Agent 前,該怎麼評估

以下六點是把上述研究翻譯成可執行動作的版本。它們都不需要買新產品就能開始。

一、先問「這個代理有沒有長期記憶」

這是最基本、也最常被跳過的一題。採購或 PoC 階段就要問清楚:

  • 記憶存在哪裡?純文字檔還是向量資料庫?
  • 誰能寫入?誰能讀取?
  • 記憶會不會跨使用者、跨專案共用?
  • 有沒有辦法列出、匯出、清空記憶?

如果供應商答不出「怎麼清空記憶」,那就是一個紅旗。

二、把「寫入記憶」當成特權操作

這是兩份研究共同指向的核心建議。實務上可以這樣做:

  • 敏感類型的記憶(聯絡人、金額、憑證、內部流程)寫入前需要使用者確認
  • 記憶條目附上來源標記:使用者輸入、內部系統、或外部不可信內容
  • 外部來源寫入的記憶,預設不得直接驅動行動,只能作為參考

三、隔離不可信的輸入管道

郵件是最典型的不可信管道,因為任何人都能寄信給你。

一個已被提出的作法是:讓一個沒有記憶、也沒有檔案存取權限的獨立代理去讀信,只把摘要傳給主系統。主系統拿到的是「處理過的資訊」而不是「原始攻擊面」。

同樣的邏輯適用於:客服工單、外部表單、共用雲端硬碟裡的檔案、爬回來的網頁內容。

四、盤點 connector 生態,而不是單一工具

從 PromptArmor 的觀察可以導出三條實務規則:

  • 審查的單位是「連接器生態」而不是「單一工具」——同一個連接器下的工具清單會長大
  • 核准要有效期,並建立重新審視機制,不能一次核准永久有效
  • 要求供應商說明次處理者鏈;另外要知道,推論地區的設定不會約束第三方的資料處理行為

五、把記憶納入既有的日誌與稽核流程

你的 SIEM 已經在收登入、API 呼叫、檔案存取的日誌。記憶寫入應該用同樣的規格對待:

  • 記錄每一次記憶寫入:時間、內容、來源、觸發的工作階段
  • 對高風險記憶類型設告警
  • 事件調查時,記憶修改紀錄要能跟郵件/文件來源對得起來

六、把代理當成一個有權限的「員工」來管

最後這點是心態問題。企業對員工有權限分級、有離職回收、有異常行為監控。AI 代理拿到的權限往往比一個新進員工還大,卻很少有對應的治理。

最小權限原則在這裡完全適用:代理需要讀信,不代表它需要寄信;需要查資料庫,不代表它需要寫入資料庫。

更完整的企業導入評估框架,可以參考 AI Agent 企業應用指南;如果你正在設計代理的架構與狀態管理,AI Agent 框架深度解析 有各框架在記憶與檢查點上的差異比較。

該不該因此暫停導入?

不用。有幾個理由值得說明:

第一,這兩份研究都是在封閉測試環境完成的學術工作,並非現實世界的攻擊事件通報。研究團隊也同步提出了防禦方向。

第二,防守方的介入點其實不少。 從 GhostWriter 的數字可以看到,注入成功率約 98%,但實際被啟動的平均比例約 60%——中間這段落差就是防守空間。加上寫入把關與來源標記,可介入的環節更多。

第三,這些控制措施成本不高。 來源標記、寫入確認、記憶日誌,多半是設定與流程層面的事,不是採購案。

真正該避免的做法是:導入了帶記憶的代理,給了它郵件與雲端硬碟的完整權限,然後沒有任何記憶治理機制。那才是把三個風險因子疊在一起。

給 IT 與資安主管的一頁行動清單

本週可做

  1. 盤點:企業內部目前有哪些帶長期記憶的 AI 代理/助理
  2. 對每一個代理,確認記憶存放位置與清空方式
  3. 檢查是否有任何代理直接讀取外部郵件或表單

本月可做

  1. 為「記憶寫入」建立日誌與保留政策
  2. 對高風險記憶類型加上使用者確認機制
  3. 重新審視已核准的連接器清單,確認工具範圍是否已擴張

本季可做

  1. 把 AI 代理納入既有的權限盤點與存取審查週期
  2. 在 AI 使用政策中補上「記憶投毒」章節(很多政策目前只寫了提示注入)
  3. 針對關鍵代理做一次紅隊演練,重點測「延後生效」而非「當下劫持」

常見問題 FAQ

記憶投毒跟一般的 Prompt Injection,我的資安政策要分開寫嗎?

建議分開。兩者的防禦重點不同:提示注入的重點在輸入過濾與指令隔離,記憶投毒的重點在寫入把關、來源標記與稽核紀錄。如果政策只寫了「防範提示注入」,實務上多半只會落實輸入層的控制,而記憶寫入這一段仍是空的。

我們用的代理是向量記憶,不是純文字檔,是不是比較安全?

不能這樣假設。MemGhost 的研究除了測試純文字記憶的代理,也測試了 Mem0 這類向量記憶後端,結果顯示攻擊內容可以轉移到不同的記憶機制。決定風險高低的不是儲存格式,而是「寫入時有沒有把關、取回時有沒有驗證來源」。

MemGhost 的 87.5% 和 GhostWriter 的 98%,哪個比較嚴重?

這兩個數字衡量的不是同一件事,不能直接比較,也不能互換引用。MemGhost 的 87.5% 是「端到端成功率」,必須同時滿足寫入記憶、當次回覆未揭露、影響後續行為三個條件,測試環境是 OpenClaw 搭配 GPT-5.4。GhostWriter 的 98% 則是「記憶注入成功率」,也就是攻擊鏈的第一階段,該研究另外報告惡意記憶後續被啟動的平均比例約 60%。兩者是不同團隊的獨立研究。

如果代理已經被投毒了,我怎麼知道?

目前最實際的做法是靠日誌回溯。如果你有記憶寫入紀錄(時間、內容、來源),就能比對「行為開始異常」的時間點前後有哪些記憶被寫入、來源是什麼。如果完全沒有紀錄,那麼可行的作法通常只剩下清空記憶重建,再逐步從可信來源重新累積。這也是為什麼記憶日誌應該在導入初期就建立,而不是出事後才補。

中小企業沒有專職資安人力,最低限度該做什麼?

三件事:第一,不要讓 AI 代理直接讀取來自外部的郵件或表單,中間放一層人工或無記憶的處理;第二,確認你知道怎麼清空代理的記憶,並定期檢視記憶內容;第三,遵守最小權限——代理需要讀,就不要給寫;需要查,就不要給刪。這三件事不需要採購任何工具。

連接器(connector)的審查多久做一次比較合理?

沒有標準答案,但 PromptArmor 的觀察提供了一個參考點:六週內就有 37% 的連接器出現實質變動,包括新增工具與改寫工具描述。這代表年度審查的頻率明顯不足。實務上可以考慮把高風險連接器(有寫入或刪除能力的)設定為每季重新確認一次,並在核准紀錄上加註「當時的工具範圍」,以便日後比對是否擴張。


需要 AI 代理資安評估?

帶記憶、帶連接器的 AI 代理,風險模型跟傳統應用不一樣。既有的弱點掃描與存取控制不會自動涵蓋它。

CloudInsight 提供:

  • AI 代理資安風險評估(含記憶與連接器攻擊面盤點)
  • AI 使用政策規劃(補上記憶投毒與外部輸入隔離章節)
  • 連接器與第三方次處理者鏈盤點
  • AI 服務與雲端資源的權限治理建議

預約資安評估,我們會在 24 小時內回覆。所有諮詢內容完全保密,沒有銷售壓力。


延伸閱讀

資料來源

  • iThome:〈AI 代理長期記憶成新攻擊面,單封郵件植入假資訊成功率最高 87.5%〉(MemGhost,新加坡南洋理工大學/A*STAR/約翰霍普金斯大學)
  • TechNews 資安科技:GhostWriter 攻擊研究報導(美國新墨西哥州立大學)
  • The Register:PromptArmor 針對 ChatGPT 與 Claude 第三方連接器生態的研究報導(2026 年 7 月)

需要專業的雲端建議?

無論您正在評估雲平台、優化現有架構,或尋找節費方案,我們都能提供協助

預約免費諮詢

相關文章