防禦工具反成駭客利器?最新研究揭露「Friendly Fire」攻擊,誘導 AI Agent 觸發遠端控制

最新研究揭露「Friendly Fire」PoC:攻擊者可在程式儲存庫植入惡意檔與誘導文字,誤導 AI agent 執行攻擊者控制的檔案,進而導致遠端程式碼執行(RCE)。本文從攻擊鏈、風險面與防護策略,解析 AI 防禦工具如何被反向利用。

事件說明

根據 TWCERT/CC 轉載的研究摘要,AI Now Institute 研究人員提出名為「Friendly Fire」的概念驗證(Proof of Concept, PoC),展示攻擊者如何利用 AI agent 的推理與工具呼叫能力,將原本用於資安檢測的防禦流程轉化為攻擊鏈的一環,最終導向遠端程式碼執行(Remote Code Execution, RCE)[1]。

這起研究的關鍵不在於單一漏洞,而在於「信任邊界被錯置」。攻擊者先在程式儲存庫中混入惡意二進位檔,並偽裝成合法的資安檢測元件;接著再於常被開發者閱讀的專案文件中加入具引導性的文字,誘使 agent 主動執行該檔案[1]。當 AI agent 依照文字提示執行檔案時,實際上就把防禦檢查變成了惡意程式的執行入口[1]。

TWCERT/CC 將這類情境視為一種新的「友軍誤擊」風險:工具本來站在防禦側,卻因為資料與指令混雜、權限過大、缺乏來源驗證,而被攻擊者反向操控[1]。

技術分析

Friendly Fire 的核心技術點,是把「自然語言指令」與「可執行內容」放在同一個決策平面,讓 AI agent 在不夠嚴謹的情況下,將文件中的建議視為操作指令[1]。這類設計在生成式 AI 與 agent 架構中很常見:模型會讀取 repository 內容、總結風險、選擇工具、再執行檔案或命令;但若缺少強制性的來源驗證與權限隔離,agent 就可能把攻擊者植入的內容當成可信資料[1]。

從攻擊鏈來看,第一階段是「內容污染」。攻擊者不是直接入侵目標主機,而是先污染專案倉庫,讓惡意檔案與正常程式碼、說明文件共存[1]。第二階段是「行為誘導」。常被優先讀取的專案文件通常很適合被用來放入看似合理、實際上帶有執行引導的文字[1]。當 agent 依提示執行檔案時,惡意二進位檔便可取得執行機會,進一步觸發 RCE[1]。

這種手法的危險性在於,它不依賴傳統漏洞掃描器容易抓到的簽章型惡意碼特徵,而是利用 AI 系統「相信上下文」的設計假設。換言之,攻擊面不是單一 CVE,而是 agent 的工作流、權限配置、工具鏈整合方式與人機協作習慣[1]。一旦 agent 被允許直接存取檔案系統、執行 shell 指令或呼叫外部工具,攻擊者只要讓它「自願」做出危險動作,就可能完成入侵[1]。

更值得注意的是,這反映出 AI 防禦工具本身的雙重性:它能協助分析惡意檔案,也能成為被操控的執行器[1]。因此,問題不只是「AI 會不會看錯」,而是「系統是否允許 AI 在未驗證輸入的情況下直接採取高風險動作」[1]。

影響範圍

受影響的對象,首先是導入 AI agent 進行程式碼審查、惡意程式分析、CI/CD 輔助、文件摘要或自動維運的團隊[1]。這些場景通常會讓 agent 讀取 repository 內容,甚至自動執行測試、掃描或修補流程;若權限控管不當,攻擊者便可能透過儲存庫內容直接操縱執行路徑[1]。

其次是使用「多工具編排」的企業環境。當 agent 能呼叫 shell、下載檔案、執行腳本、查詢 API 或修改專案文件時,任何一個步驟都可能成為攻擊面[1]。特別是把 agent 接在開發管線、弱隔離沙箱或共享工作站上的情境,若缺乏最小權限原則,單一惡意檔案就可能外溢到更高權限環境[1]。

此外,這種攻擊也會影響資安治理。傳統防禦工具的假設是「檢測者是可信的」,但 Friendly Fire 顯示,檢測流程本身也可能被植入惡意引導,導致企業誤以為正在做安全掃描,實際上卻是在執行未授權程式[1]。對於大型組織而言,這將帶來供應鏈風險、內部橫向擴散風險,以及自動化系統被濫用後難以追查的稽核問題[1]。

防護建議

TWCERT/CC 建議企業與開發團隊從「資料隔離、權限縮限、執行驗證、行為監控」四個層面建立防線[1]。首先,必須區隔不受信任內容與 agent 指令,避免將專案文件或外部提交內容直接視為執行依據[1]。其次,應落實最小權限原則,並將機敏環境與一般分析環境隔離,降低 agent 誤執行後的破壞半徑[1]。

第三,應限制 agent 可呼叫的工具與指令,尤其是高風險操作如 shell 執行、檔案寫入、權限提升與網路連線等,最好採白名單機制,而非全面開放[1]。第四,需建立執行前檢查與檔案來源驗證機制,例如對可執行檔做簽章驗證、比對來源路徑、確認哈希值,避免 agent 把偽裝檔案當成可信元件[1]。

最後,企業應監控 AI agent 的異常行為,包含不尋常的工具呼叫、非預期路徑執行、對未知檔案的重複嘗試、或在非標準時段發起敏感操作;同時採行多層次隔離,例如容器化、唯讀掛載、受限網段與審核流程,以降低單點失誤造成的連鎖風險[1]。對資安團隊而言,重點不只是讓 AI「能工作」,而是讓它「只在可驗證、可回溯、可中止的邊界內工作」[1]。

5步驟修補清單

  • 將專案文件與可執行內容分離,禁止文件直接驅動高風險操作[1]
  • 對 AI agent 啟用最小權限原則,限制檔案系統、shell 與網路工具存取範圍[1]
  • 建立可執行檔來源驗證機制,包含簽章、Hash 與路徑白名單[1]
  • 在 sandbox 或容器內執行 agent,並採用唯讀掛載與多層隔離[1]
  • 持續監控 agent 行為,對異常工具呼叫、未知檔案執行與敏感操作觸發告警[1]

參考資料

  • TWCERT News:防禦工具反成駭客利器?最新研究揭露「Friendly Fire」攻擊,誘導 AI Agent 觸發遠端控制

更多資安新聞