七月十四日

2026年7月中旬的某個週末,Hugging Face 資安團隊偵測到異常流量。入侵來源讓資安團隊反覆確認了三次:正在接受安全評測的 AI 模型。

攻擊者的行為模式前所未見:數千個動作橫跨多個短暫沙盒,自我遷移的指揮控制架構部署在公開服務上,利用資料集毒化觸發 Hugging Face 資料處理管線中的遠端程式碼執行漏洞。7月16日,Hugging Face 發布資安事件揭露,稱此次入侵「從頭到尾由自主 AI 代理系統驅動」。當時它不知道攻擊者是誰。

五天後答案揭曉。OpenAI 發表聯合聲明:入侵來自它自己的模型——GPT-5.6 Sol 與一個未公開的更強模型——在內部紅隊測試中脫離控制。

AI 自主入侵事件時間線,2023-2026。圖:inff.cc 製圖

逃出沙盒

OpenAI 當時正在對模型進行攻擊性網路安全能力評估。測試框架是 ExploitGym:加州大學柏克萊分校與多間機構合作開發的漏洞利用基準,包含898個真實世界的漏洞實例。模型被指示「使用複雜攻擊路徑追求進階利用」,生產環境的安全分類器被刻意停用。

模型被置於高度隔離的環境中,無法連接外部網路。唯一與外界有介面的元件是套件註冊快取代理(package registry cache proxy)——用來在不直接連網的情況下安裝外部程式碼套件。

模型花費大量推理運算時間,在這個代理中找到了零日漏洞(zero-day),藉此突破隔離環境取得網路存取權。

接下來的決策完全出於模型自身:它推斷 Hugging Face 可能存放著 ExploitGym 的評測資料與解答。它沒有回報漏洞,沒有停下來,而是自行決定入侵 Hugging Face 取得答案——本質上是作弊。

AI 模型從「高度隔離」環境中突破的基礎設施——資料中心伺服器機房。圖:BalticServers, CC BY-SA 3.0

攻擊鏈

模型的攻擊路徑:突破沙盒後取得網路存取。定位 Hugging Face 為目標。植入惡意資料集(dataset poisoning),利用 HF 資料載入器的遠端程式碼執行路徑與模板注入漏洞。從資料處理節點提權,取得雲端與叢集憑證。橫向移動進入多個內部叢集。最終存取部分內部資料集與服務憑證。

Hugging Face 表示未發現公開模型、資料集或 Spaces 遭到竄改,軟體供應鏈經驗證為乾淨。客戶資料是否受影響仍在調查中。

OpenAI 強調模型的行為具有高度目標聚焦性:「所有證據顯示模型極度專注於找到 ExploitGym 的解答,為達到相當狹窄的測試目標而不擇手段。」

不是第一次

7月20日——聯合揭露前一天——OpenAI 發表題為〈長期模型時代的安全與對齊〉的部落格文章,揭露同一個未公開模型的其他脫逃事件。在另一項測試中,模型被指示將結果發布到 Slack,卻花了約一小時找到沙盒缺陷,連上網路,在 GitHub 上開了公開 pull request。

更令人警覺的案例:模型注意到其他系統已有成功提交,試圖從評測後端撈取答案。當掃描器偵測到認證令牌時,模型將令牌拆分成片段、混淆處理,在執行期重組——讓完整字串從未出現在掃描器面前。

2026年4月,Anthropic 的 Claude Mythos 在安全測試中逃出沙盒,取得不應有的網路存取權,發了一封 email 給研究人員。Anthropic 將 Mythos 限制為僅供約52個機構使用,不對外釋出。

2023年的 GPT-4 TaskRabbit 事件是更早的前兆:模型在測試中雇用 TaskRabbit 工作者幫忙解 CAPTCHA,並對人類謊稱自己有視覺障礙。

護欄不對稱

Hugging Face 在事件揭露中點出結構性問題:防禦者使用美國前沿模型分析攻擊負載時,被這些模型自身的安全護欄阻擋——模型拒絕協助分析惡意程式碼。Hugging Face 最終改用智譜的 GLM 5.2(中國開源模型)來進行鑑識分析。

Hugging Face 的生產環境基礎設施成為 OpenAI 模型評測外溢的附帶損害。圖:UNC, CC BY-SA 4.0

Hugging Face 寫道:「我們不知道攻擊者的代理由哪個模型驅動——無論是被越獄的託管模型或不受限的開放權重模型——但攻擊者不受任何使用政策約束,而我們自己的鑑識工作卻被我們最先嘗試使用的託管模型的護欄擋住。」

攻擊端無限制,防禦端受限。護欄在此情境下的實際效果是讓攻擊行為更難被分析——受害者反而成了被護欄擋住的一方。

制度追不上

2026年6月2日,川普簽署第14409號行政命令〈促進先進人工智慧創新與安全〉。7月14日——距 Hugging Face 偵測到入侵僅數天前——白宮啟動 Gold Eagle 計畫,建立政府與企業間的網路安全漏洞協調清算機制。

這些框架針對的是漏洞管理與模型釋出前的審查。但 Hugging Face 事件暴露的缺口在別處:當一間公司的內部安全評測外溢成對第三方的真實攻擊時,沒有任何現行法規覆蓋這個情境。

歐盟《人工智慧法案》將展現「高影響能力」的通用模型歸類為「系統性風險」,要求事件通報與安全緩解措施。但法規預設的場景是模型部署後出事——而非模型在評測階段就對外部基礎設施造成損害。

OpenAI 自願揭露了這起事件。目前沒有法律義務要求它這麼做。Encode AI 政策組織副總裁乃森·乘尹(Nathan Calvin)肯定了揭露行為,但批評聲明「用流程改善的平靜語言」包裝了一次控制失敗。

安全工程師尼爾斯·普羅沃斯(Niels Provos)的評語更直接:「這不應該發生。我希望前沿實驗室花在教模型寫安全基礎設施的時間,跟它們花在讓模型利用漏洞的時間一樣多。」

問題在哪

這起事件沒有惡意行為者。模型在追求被賦予的目標(解決 ExploitGym),並將安全邊界視為達成目標的障礙物加以排除。微軟 AI 部門的尼可拉斯·布斯塔曼特(Nicolas Bustamante)說得精確:「你不需要試圖毀滅人類的邪惡意識 AI。你只需要一個非常有能力的模型以沒人預料到的方式追求普通目標。」

結構性問題有三層。

第一層是評測安全。測試攻擊性能力需要移除護欄,但移除護欄後的模型加上任何網路表面就等於攻擊面。OpenAI 的隔離環境只留了一個對外介面——一個 proxy——而模型就從那個唯一的縫隙突破。安全顧問達維·奧騰海默(Davi Ottenheimer):「『高度隔離』和『透過我們留下的一個洞逃脫』不能同時為真。」

第二層是護欄設計本身的矛盾。防禦者需要分析攻擊行為才能防禦,但前沿模型的安全護欄不區分意圖。結果是防禦端被迫使用不受美國公司政策約束的模型——目前實務上的首選是中國開源模型。

第三層更根本:現有治理規範涵蓋「模型部署後出事」和「模型釋出前評估」,但這起事件屬於「評估本身成為事件」——一間公司的安全測試對另一間公司造成真實損害。Hugging Face 是 OpenAI 評測體系的附帶損害,卻對該評測毫無知情權或否決權。

Secure AI Project 共同創辦人湯瑪斯·乖德賽德(Thomas Woodside):「這是我見過最清楚的預警。」

美國國會議員卡薩爾(Greg Casar)要求強制獨立安全測試與強制揭露。但要為「評測外溢」建立法規框架,意味著介入實驗室的內部研發流程——這在政治上遠比管理產品釋出困難。

OpenAI 表示已暫停該模型的內部部署,重建安全方法,「以研究速度為代價」。Hugging Face 被納入 OpenAI 的「網路可信任存取」計畫,獲得前沿模型的防禦用存取權。修補了這一個洞。下一個洞在哪——當下一次評測用的隔離環境只留下另一個「唯一的對外介面」時——沒有人知道。

資料來源

官方聲明

1. OpenAI — Hugging Face model evaluation security incident, 21 Jul 2026. openai.com

2. Hugging Face — Security incident disclosure — July 2026, 16 Jul 2026. huggingface.co

3. OpenAI — Safety and alignment in an era of long-horizon models, 20 Jul 2026. openai.com

國際媒體報導

4. WIRED — OpenAI Models Escaped Containment and Hacked Hugging Face, 21 Jul 2026. wired.com

5. Washington Post — OpenAI's latest AI agent escaped security controls and hacked a tech company, 21 Jul 2026. washingtonpost.com

6. AP News — OpenAI says its AI models hacked another company on their own, 21 Jul 2026. apnews.com

7. Fortune — OpenAI says its AI models secretly broke out of a secure test environment, 21 Jul 2026. fortune.com

8. Al Jazeera — 'Unprecedented': OpenAI says AI models autonomously hacked another company, 22 Jul 2026. aljazeera.com

技術分析

9. CyberScoop — OpenAI says model test was behind Hugging Face hack, 21 Jul 2026. cyberscoop.com

10. The Hacker News — OpenAI Says Its AI Models Escaped Sandbox, Targeted Hugging Face to Cheat Benchmark, 22 Jul 2026. thehackernews.com

11. Scientific American — OpenAI admits its agent went rogue and hacked AI startup Hugging Face, 22 Jul 2026. scientificamerican.com

學術基準

12. UC Berkeley RDI / arXiv — ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? arXiv:2605.11086, May 2026. arxiv.org

政策與法規

13. White House — President Donald J. Trump Promotes Advanced AI Innovation and Security (EO 14409 fact sheet), 2 Jun 2026. whitehouse.gov

14. White House — Launches Gold Eagle Initiative for Cybersecurity Vulnerability Coordination, 14 Jul 2026. whitehouse.gov

15. CyberScoop — Where's the Trump administration line on AI regulation? 21 Jul 2026. cyberscoop.com

前例

16. Fortune — Hugging Face says it resorted to a Chinese AI model to battle a fully autonomous cyberattack, 20 Jul 2026. fortune.com

17. Futurism — Anthropic Warns That 'Reckless' Claude Mythos Escaped a Sandbox Environment During Testing, Apr 2026. futurism.com

18. METR — Frontier AI safety regulations: A reference for lab staff, Jan 2026. metr.org