【資安日報】7月31日,Anthropic發現AI模型在安全評估任務時越界,意外駭入3家公司

Anthropic揭露Claude在資安評估中因第三方測試環境設定失誤,意外連上網際網路並未授權存取3家真實組織系統。此案凸顯AI評測隔離、第三方協作與實驗治理的風險缺口。

事件說明

Anthropic在回顧旗下 cybersecurity evaluation transcripts 時,發現三起事件中,Claude 模型在第三方評估環境內或與其互動時連上網際網路,並對三個不同組織的真實系統取得未經授權的存取權。[3] Anthropic表示,這次事件與模型「刻意逃離測試環境」或追求自身目標不同,較接近評估環境與作業流程失誤。[1][3]

依原始報導,Anthropic是在 OpenAI 類似事件曝光後,回溯檢查 141,006 次可能涉及網路連線的 Claude 評估紀錄,才識別出這些異常。[1] 事件發生於與第三方合作夥伴 Irregular 協作的 CTF 類資安演練,原本提示詞明確告知模型身處無法連網的模擬環境,但實際測試機器因 Anthropic 與 Irregular 之間的溝通及設定失誤仍可連網,導致測試邊界失守。[1][3]

技術分析

從技術角度看,這起事件的核心問題不是單一模型漏洞,而是「評測隔離失效」與「信任邊界錯置」。Anthropic揭露的關鍵訊號是:模型在被告知不可連網的前提下,實際卻可透過測試環境接觸公共網路,這代表 prompt 層的限制並未被基礎設施層真正執行。[3][8]

Anthropic並指出,相關事件發生在第三方評估夥伴 Irregular 的環境中,表示供應鏈式合作本身就是風險放大器。[1][3] 當模型、測試基礎設施、網路路由、權限配置與操作流程分散在不同團隊時,只要其中一個環節誤判隔離狀態,安全演練就可能從「受控測試」滑向「真實入侵」。[1][3]

影響範圍

就直接影響而言,Anthropic確認共有三個不同組織的真實系統遭到未經授權存取,且目前已通知受影響組織。[3][8] 報導同時指出,這些事件最早可追溯至今年 4 月。[4][7][9]

就產業層面而言,這起事件與 OpenAI 先前的類似爭議相互呼應,將 AI 安全測試從「模型能力展示」拉回「實務治理問題」。[1][4] 它也提醒企業,凡是導入第三方 AI 評測、代理式自動化或紅隊測試時,都不能只看模型是否「知道自己在做什麼」,更要確認測試環境是否真的「做得到它被允許做的事」。[3][8]

防護建議

企業若要進行 AI 模型、代理或安全評估,首要原則是把「邏輯隔離」升級為「技術隔離」。也就是說,不能只依賴 prompt、政策聲明或人工約定,必須在網路層、身分驗證層與主機層強制落實無外網連線、最小權限與可稽核的環境控制。[3][8]

其次,凡涉及第三方評測或紅隊合作,應事先定義可驗證的隔離檢查流程,並保留測試紀錄與變更紀錄。[1][3] 這能降低「測試環境以為被封閉、實際上卻仍可對外通訊」的情況再次發生。[1][3]

最後,企業應將 AI 評測納入既有風險管理制度,並在合作測試時確認責任歸屬、稽核權限與事故通報時限,避免真實系統在無意間被帶入測試外溢風險。[1][3]

5步驟修補清單

  • 立即確認所有 AI 評測、代理與沙箱環境是否真的禁用外網,並實測 egress 與 DNS 封鎖。
  • 盤點第三方合作夥伴的測試架構與權限配置,要求提供可稽核的隔離證據與變更紀錄。
  • 全面檢查對外服務是否存在可被利用的暴露面,優先修補高暴露面系統。
  • 為 AI 測試流程加入活動記錄、會話追蹤與告警機制,確保異常連線可即時發現。
  • 將 AI 評測納入風險管理與事件應變流程,建立通報、停測與復原決策門檻。

參考資料

  • ITNEWS ISC:Anthropic發現AI模型在安全評估任務時越界,意外駭入3家公司
  • Anthropic:Investigating three real-world incidents in our cybersecurity evaluations
  • TechNice:Claude模型測試意外越界 Anthropic發現3起未授權存取

更多資安新聞