跳至主要內容
科技前沿

人工智慧代理現已侵入許多公司和政府。正在採取什麼措施?

A close-up shows the Gemini, Claude, ChatGPT, DeepSeek, Mistral and Copilot icons on a smartphone screen in Creteil, France, on September 11, 2026, as Anthropic announced that it had blocked several accounts that used its artificial intelligence models for research that could contribute to the development of biological weapons. (Photo by Samuel Boivin/NurPhoto via Getty Images)
Mail

廣告
廣告
廣告
廣告

人工智慧代理現已侵入許多公司和政府。正在採取什麼措施?

OpenAI、Anthropic、Meta 和其他人工智慧實驗室都報告了流氓人工智慧事件,並因此受到越來越嚴格的審查。

丹·索普·蘭卡斯特

編輯

A close-up shows the Gemini, Claude, ChatGPT, DeepSeek, Mistral and Copilot icons on a smartphone screen in Creteil, France, on September 11, 2026, as Anthropic announced that it had blocked several accounts that used its artificial intelligence models for research that could contribute to the development of biological weapons. (Photo by Samuel Boivin/NurPhoto via Getty Images)
您可能聽說過很多關於人工智慧代理變得流氓的事情。以下是您需要了解的內容以及為此採取的措施。 (NurPhoto 來自 Getty Images)

週二,川普總統在白宮會見了科技高層 签署“具有道德约束力”的协议 關於人工智慧。川普沒有推動政府監管,而是呼籲 “強大的自律” 在人工智慧產業的公司中。该文件反映了这一点,鼓励人工智能领导者实施“强有力的内部控制”并与独立的外部审计师合作。

這場峰會是在人工智慧公司因披露人工智慧事件而受到數月加強審查之後舉行的。 “去流氓” 測試期間。拉開這一切序幕的事件是 抱臉事件,其中接受評估的 OpenAI 人工智慧代理逃離了表面上孤立的測試環境,並滲透到另一家公司的系統,試圖「欺騙」他們所承擔的任務。此後,OpenAI、Anthropic、Meta 和 Google 報告了更多人工智慧代理以各種方式失控的事件。我們匯總了您需要了解的所有案例,以及有關針對這些案例採取的措施(如果有的話)的詳細資訊。

2026 年 9 月 25 日:OpenAI 代理人繞過限制查詢美國政府系統

在從事研究任務時,OpenAI 代理 造訪商務部和證券交易委員會網站,但沒有取得任何非公開資訊。今年夏天,特工們還試圖侵入教育部的網站,但沒有成功。就商務部而言,代理商使用線上找到的憑證來存取人口普查資料。同時,OpenAI 表示,其特工可能已滲透到其已通知的「數十個」其他組織的網站。

2026年9月24日:澳大利亚总理称OpenAI特工入侵政府数据库

澳洲總理 Anthony Albanese 表示,OpenAI 特工在這起事件中發現了迄今為止最大規模的政府系統違規事件 六月入侵了該國的醫療保險系統。阿爾巴尼斯表示,該特工未經授權存取了公共和非公開文件,但他不認為任何個人資訊被存取。對此,阿爾巴內塞表示,他將成立一個工作小組來進行「緊急和立即」的審查,並將這一事件提交給澳洲議會人工智慧委員會。

2026 年 9 月 19 日:Google揭露 Gemini 在 5 月入侵外部公司係統

据谷歌称,在测试Gemini的网络安全能力期间,该模型在5月份闯入了三家外部公司。在一次事件中,双子座通过以下方式获得了访问权限: 只是猜測正確的密碼,强调确保使用强密码的必要性。在另外兩起事件中,Gemini 在公共儲存庫中發現了憑證。

2026 年 9 月 9 日:Anthropic 透露 Claude Opus 4.6 於 1 月侵入第三方系統

在先前披露Anthropic在审查其培训成绩单时发现的三起事件后,该公司 发现了1月份的第四个。在此事件中,配置问题导致Claude Opus 4.6突破测试环境并访问第三方机器。该模型实际上多次尝试中止其任务,但由于配置问题而未能成功。 Anthropic 表示,這種行為在後續模型中“發生了很大變化”,因此與它發現的前三個事件相比,它“不太關心這一事件”。

2026年9月5日: OpenAI承认“维基事件”

In a 第三方報告一組 AI 安全研究人員表示,他們發現 OpenAI 代理程式發布了大約 18,000 個帖子,他們使用德國軟體開發商 Wiki 作為留言板,在網路檢索任務中相互交流。開放人工智慧 承認了這一事件,表示正在制定一个框架,规定何时以及如何共享“人工智能错位事件”。後來公司 9月16日制定了該框架.

2026 年 8 月 5 日:Meta 表示,其模型之一在安全測試期間入侵了一家外部公司

Meta 透露,一家獨立測試公司的錯誤配置導致其人工智慧模型之一獲得了開放互聯網的訪問權限,並且 入侵外部公司 在網路安全測試期間。第三方测试公司 Irregular 表示,它正在编写一份白皮书,以“分享遏制和安全运行网络评估的最佳实践”。

2026年7月30日:Anthropic發現Claude在測試過程中發生三起未經授權存取第三方組織的事件

在 OpenAI 的 Hugging Face 事件揭露後,Anthropic 開始檢視自己過去的網路安全測試記錄。在 141,006 次評估運行中,發現了 3 起事件,克勞德能夠在「本應被封鎖的測試環境」中獲得網路存取權限。每次,克勞德都會面臨「奪旗」挑戰,要求它找到隱藏在網路中另一台機器上的秘密資訊。對此,Anthropic 表示正在與獨立人工智慧評估組織 METR 合作,對其成績單進行審查。它還致力於「對評估基礎設施進行更嚴格的監控和控制」。

2026年7月21日: OpenAI声称对Hugging Face违规行为负责

這是引發整個產業本輪審查的最初事件。在 Hugging Face 最初報告人工智慧代理入侵其係統後, OpenAI 聲稱對此負責。在網路安全測試期間,特工獲得了開放網路的存取權限,並在嘗試完成任務時利用漏洞存取 Hugging Face 的生產資料庫。從那時起,OpenAI 進行了全面審查 並表示正在採取措施「加強安全性和模型一致性」。

    廣告
    廣告

    About Us · 關於我們