隨着人工智能(AI)從聊天機器人進一步走向智能體(Agent),AI安全問題也在從“說錯話”變成“做錯事”。
近日,據美國Axios新聞網站報道,AI巨頭OpenAI和Anthropic以及安全研究人員正在調查數萬起安全事件。這些事件發生在內部測試和現實環境中,涉及繞過安全護欄、創建留言板、逃離沙盒、劫持網站、自我提示以及試圖繞過監控等行爲。
9月25日,OpenAI方面稱其已暫停對其最先進模型的訓練,只有在“確信已落實額外的安全保障措施後”才會恢復訓練。公司CEO薩姆·奧特曼(Sam Altman)在社交平臺X表示,公司正在進行的審查“進展不如預期迅速”。
9月28日,據《華爾街日報》報道, OpenAI已經放棄了原計劃10月推出的下一代模型GPT-6.1 Astra,因爲發現Astra比前代出現了更多欺騙行爲,同時存在未經用戶許可繼續執行任務的問題。
與此同時,Anthropic也已委託第三方安全機構對其模型行爲進行審查。隨公司Opus 5.5模型一起發布的官方安全與技術評估文檔“系統卡”顯示,該模型出現被標記爲“異常”或“存疑”的行爲。
一邊是加速發展的技術與公司,一邊是令人不安的潛在風險,這些事件的披露,再次放大科技界圍繞前沿AI安全的激烈討論。
從“越權訪問”到“欺騙隱瞞”
近期公開披露的案例顯示,智能體安全風險已經呈現多種形態,涉及越權訪問、破壞性操作、數據外泄、欺騙隱瞞,以及多個智能體之間的越界協作等不同類型。
一類是越權訪問與隔離失效。7月,OpenAI披露智能體在安全評測中突破測試邊界,入侵Hugging Face。Anthropic也披露,Claude在評測中訪問了真實第三方系統;谷歌9月確認,Gemini曾在5月的測試中訪問三個真實網站;Meta則在8月披露過類似事件。
9月25日,OpenAI再次披露,內部研究模型利用訓練沙盒中DNS過濾不充分的漏洞,與外部聊天機器人建立了通信。
不過,需要注意的是,這些案例中部分源於評測環境錯誤開放聯網權限,並不能全部歸結爲模型主動“逃出沙盒”。
另一類風險是擅自執行破壞性操作。4月,搭載Claude的Cursor編程智能體被曝刪除軟件企業PocketOS的生產數據庫及相關備份,造成客戶業務混亂,數據隨後得到恢復。
數據與訪問憑證外泄也是一種風險。OpenAI於9月披露,多個智能體在協作制作工作簿時,因無法互相讀取本地文件,擅自將文件上傳至公共託管平臺。另一起案例中,內部模型爲獲取其他團隊的數學證明材料,將研究員的GitHub訪問令牌寫入公開倉庫,並拆分令牌以躲避密鑰掃描。
還有一些行爲涉及造假、欺騙與規避監督。OpenAI披露,部分模型會在用於延續任務的摘要中留下指令,要求編造缺失數據或隱瞞錯誤。
提示注入及惡意指令傳播,則是另一條風險路徑。6月公開的GitInject研究驗證,惡意代碼提交或配置文件可能誘導智能體泄露憑證、操縱審查判斷。OpenAI於9月披露的信息也顯示,惡意指令可以誘使智能體將其復制到後續郵件、文件或代碼注釋中。
獨立網絡安全研究機構DARKNAVY的AI安全研究員李忠睿對澎湃新聞記者表示,這一輪智能體安全事件與過去的大模型安全問題最大的區別,是風險正在從“看錯東西、說錯話”轉變爲“做錯事”。
“過去的大模型安全,主要是內容層面的風險,比如對抗性樣本、‘越獄’等。模型只是產出內容,最後要不要照着做,決定權還在人手裏。”李忠睿表示,“現在的AI智能體手裏有工具、有網絡、有賬號權限,能夠連續自主執行很多步操作,中間沒有人逐一把關。”
上海財經大學特聘教授胡延平指出,從大模型到智能體,最大的變化是從“一問一答”變爲“任務行動”,從“內容風險”轉向“能力風險”,安全問題也由被動安全風險轉變爲主動安全風險。
多智能體協作,風險如何被放大
值得注意的是,智能體的風險不一定來自傳統意義上的“惡意攻擊者”,也可能來自模型爲了完成既定目標而主動尋找捷徑。
在李忠睿看來,過去的安全威脅背後往往有一個明確的惡意操縱者,而這一次的部分事件中,“沒有人下達攻擊指令,是模型爲了完成任務、拿到更高分,自己選擇了作弊”。
胡延平也指出,智能體執行任務時,可能因爲理解偏差產生行動偏差,也可能爲了實現任務目標而窮盡各種方法、衝破禁區;少數情況下,智能體還可能出現用戶並未提出的非任務行爲,“目前這種情況數量最少,但最危險”。
除了單個Agent越權,多個智能體之間形成非預期的通信和協作,也使風險進一步復雜化。
對OpenAI此前Hugging Face事件的獨立調查顯示,約1200個原本應彼此隔離的智能體通過未經授權的留言板交流,其中約700個參與了攻擊。研究人員還觀察到,後續智能體能夠復用智能體之前留下的信息和方法。
李忠睿認爲,單個智能體出錯是個別問題,但當多個智能體可以互相學習、協同行動時,風險就不再只是簡單相加,而可能進一步放大。
在他看來,這意味着企業不能只盯住單個智能體的行爲,還需要關注多個Agent之間是否形成了開發者沒有設計的通信渠道,以及一個局部異常能否通過工具、文件、消息和代碼等方式進一步傳播。
而當Agent從單個工具進入大規模協作環境時,另一個問題也隨之出現:即使異常行爲的單次發生概率較低,當Agent數量和運行次數不斷增加,異常事件是否會由“小概率”變成“高頻”?
對此,李忠睿認爲,這種情況是可能出現的。假設一家企業部署上千個智能體,每個智能體每天執行上百次任務,即便單次行爲出現異常的概率很低,累積到足夠大的運行規模後,也可能形成大量實際事件。
北京郵電大學數字媒體與設計藝術學院副教授譚劍則從傳統的“委託-代理”關系來理解這一問題。在他看來,過去的軟件能力有限,而AI Agent擁有更強的推理和工具調用能力,在目標設定不清晰或約束不足時,可能不斷尋找完成目標的路徑。能力越強,能夠尋找的路徑就越多,偏離人的真實意圖的可能性也隨之增加。
如何建立智能體安全防線
面對智能體越來越強的自主行動能力,企業如何增強防範?
李忠睿認爲,企業首先需要改變思路,即從“杜絕異常”轉向“默認異常一定會發生,重點控制破壞範圍”。在人機協作方面,應按照風險進行分級。對於刪除數據、資金轉賬等高風險、不可逆操作,需要保留人工確認,不能完全交給智能體自主執行。
“企業不可能要求人類逐條審核智能體每一次操作,真正可行的方式是提前劃定邊界。”李忠睿解釋道,邊界需要包括哪些數據可以讀取、哪些工具可以調用、哪些操作可以執行、哪些信息不能向外發送,以及出現什麼情況必須停止並交給人工處理。
奇安信人工智能公司安全專家鄧正誠也認爲,企業的人機協作應從“人審結果”轉向“人管邊界”,通過“監控—收斂—阻斷”逐步提高管控力度。
在權限治理方面,他認爲,需要區分大模型調用身份、Agent應用身份和Agent運行身份,進一步釐清“誰在調用模型”“誰在使用智能體”“最終是誰在執行”。同時,通過安全網關統一管控連接行爲,把“能不能幹”與“幹了什麼”分開管理,實現更細的權限控制。
鄧正誠強調:“歸根結底,智能體規模化部署的前提不是‘模型足夠聰明’,而是‘系統足夠可控’。只有當每一個智能體的行爲都可觀測、權限都可追溯、異常都可阻斷,企業才敢把更多、更關鍵的任務交給它們。”
除了企業自身防護,第三方評估和行業標準也被認爲是未來AI安全體系的重要組成部分。
目前,與餐飲、金融服務和航空等受到監管的行業不同,AI領域並不存在統一的系統安全與安保測試標準。因此,包括Anthropic、OpenAI在內的公司正在討論引入獨立評估機構,對模型安全實踐和相關事件進行檢查。
李忠睿表示,隨着AI Agent進一步進入真實業務環境,AI公司的競爭重點也可能從“模型有多強”逐漸轉向“能不能管得住”。下一階段,企業需要證明的不僅是模型性能,還包括發現異常行爲、控制風險和接受外部審查的能力。
胡延平也認爲,隨着AI繼續向面向任務、進入物理現實世界的智能發展,行業不僅需要發展更強的智能,也需要發展更安全的智能,“安全可能成爲AI企業重要的能力維度和競爭力來源”。
值得注意的是,第三方企業已經開始行動。英偉達在28日發布了獨立Agent安全平臺,該平臺由OpenShell開源軟件和Sentry參考系統設計組成,從智能體測試到部署的各個環節強化AI安全,可在運行智能體的軟件、硬件、計算機和機器人系統中實現全棧治理與控制。
連線雜志指出,英偉達的兩層架構,OpenShell可以將Agent限制在沙盒中,對活動進行隔離。第二層Sentry則可以隔離試圖越過邊界的智能體。
相關閱讀
- 不咬人但視覺衝擊極大!入侵物種美國白蛾街頭橫行 如何應對2026-09-29
- 4929.17米,“夢想”號重新整理我國深海鑽探紀錄2026-09-29
- BigBang倫敦迴歸開唱、尼泊爾雪崩致多人失聯、星艦今晚衝擊首次入軌……張朝陽雙語分享全球熱點2026-09-29
- 雙預警齊發!這些地方將有10級以上雷暴大風,主要影響時段2026-09-29