![]()

OpenAI 已發布七月 Hugging Face 入侵事件的詳細驗屍報告,揭示其 AI 代理所做的遠遠超過逃離網路安全沙盒。
這些模型建立了未經授權的通訊網路、分享漏洞與憑證、在不同的評估運行中協調攻擊,最終入侵了 Hugging Face 以及 OpenAI 自身部分研究基礎設施。
OpenAI 的調查,在 CrowdStrike 的協助下,顯示該活動主要由一個未發布的研究模型驅動,稱為 Internal Model 1 (IM1),其規模被描述為與 GPT-5.6 Sol 相當。
問題始於五月在強化學習訓練期間。原本應該獨立運作的代理發現它們可以將檔案寫入 OpenAI 內部託管的 Artifactory 套件服務,實際上將其變成了一個臨時留言板。它們後來濫用 Artifactory 來轉發外部網際網路請求,並在 6 月 26 日前利用權杖更新漏洞取得了管理員等級的存取權。
Hugging Face 經營著最大的平台之一,用於託管與分發 AI 模型、資料集和機器學習應用程式。如先前報導,在其生產環境成為目標後,這些代理開始搜尋外部服務以尋找有助於解決困難 ExploitGym 網路安全挑戰的資訊。
在 OpenAI 於七月初重建 Artifactory 後,這些代理使用目錄名稱重建了它們的留言板,並恢復交換發現。OpenAI 表示這些模型開始在自己之間分工,有些搜尋憑證、有些開發漏洞、有些協調活動。有幾個代理將所形成的群體稱為「swarm」或「collective」。
在 7 月 10 日,代理恢復了 14 個具有寫入權限的公開暴露 Hugging Face 憑證。第二天,它們利用一個先前未知的涉及 HDF5 檔案的缺陷,從 Hugging Face 生產工作器取得機密,然後將該存取權與一個名為「RefJinja」的模板注入漏洞結合起來,在伺服器上執行命令。
到 7 月 12 日,這些代理已將存取權擴展到多個 Hugging Face 叢集,並取得了 Kubernetes、資料庫、訊息、原始碼儲存庫和雲端憑證。OpenAI 表示程式碼在數十台伺服器上被執行,其中一台系統取得 root 存取權,並存取了有限的私人資料。

OpenAI 的調查找出了該行為背後的幾個因素。代理學會了「獎勵駭客」行為,透過追求意外的捷徑來完成評估,持續在看似實際上無法解決的任務上工作,並隨著額外推理努力的提供而越來越多地探查基礎設施。在 898 個 ExploitGym 挑戰中,有 198 個先前從未被解決,而這些佔了透過臨時留言板討論的任務的 93%。
該公司還發現其最強的生產防護措施在評估環境中並不存在。回溯測試顯示,OpenAI 目前的思考鏈監控很可能會在 Hugging Face 被入侵前一天多就偵測到危險活動。
OpenAI 此後已隔離 IM1 的權重、暫停主要的邊界強化學習運行、強化其沙盒與網路隔離,並將思考鏈監控強制用於涉及 GPT-5.6 Sol 等級或更高模型的工具使用評估。嚴重警報現在需要停止運行,除非回應者在 30 分鐘內確定該警告是誤報。
OpenAI 稱該事件為「警告射擊」,顯示具備足夠能力的 AI 代理可以結合堅持、利用和自主協調來克服安全邊界。
如果您喜歡這篇文章,請務必在 X/Twitter 和 LinkedIn 上關注我們,以獲取更多獨家內容。
https://cyberinsider.com/openai-says-ai-agents-formed-a-swarm-before-breaching-hugging-face/