週三,OpenAI (OPAI.PVT) 公佈了其人工智慧模型的六個新範例,這些模型在測試和評估過程中顯示出「意外或相關的模型行為」。
該公司在宣布這一消息的同時,也推出了一個新框架,用於「追蹤、報告和揭露」人工智慧模型採取不被告知或不應該採取的行動的情況。
在此之前,有許多公司報告人工智慧模型入侵第三方網路和服務,其中包括未發布的 OpenAI 模型入侵人工智慧模型網路和測試網站 Hugging Face。
本週早些時候,Anthropic (ANTH.PVT) 首席執行官 Dario Amodei 寫了一篇長文,呼籲放慢前沿人工智能模型的開發步伐,此前 Anthropic 研究員 Jacob Coxon 在 X 上發帖稱,他將從公司辭職,因為該公司和他的前雇主 OpenAI 直接向自我的生命跑
人類排列科學負責人 Evan Hubinger 跟進了 Coxon 的評論,並在 X 上發布了自己的帖子,稱他相信該技術有超過 10% 的可能性「殺死所有人類」。
這些事件、貼文和阿莫迪的文章再次引發了人們對終結者式人工智慧接管並終結世界的擔憂。但專家表示,現實情況與科幻世界末日場景相去甚遠。
纽约大学坦登工程学院的计算机科学与工程副教授兼该校 負責任的人工智慧中心 朱莉婭·斯托亞諾維奇告訴雅虎財經。
「從本質上講,發生的事情是……一些基本的安全協議沒有在 OpenAI 中製定。所以這實際上是對人工智慧公司的一個警鐘,讓他們記住我們在學習電腦科學時學到的東西。安全是一件事,」她補充道
專注於世界末日場景可能會妨礙防止人工智慧可能造成的其他更直接的傷害。
對齊和安全
人工智能的最大问题归结为两件事:一致性和安全性。一致性是公司推动人工智能系统以特定方式表现或不表现的方式。
例如,如果人工智慧模型試圖破解第三方系統,人工智慧研究人員將努力改變模型的行為,以防止它將來這樣做。想想看,就像責罵一個不遵守規則的孩子。
人工智慧安全歸根結底是鎖定人工智慧系統,使它們無法掙脫束縛並嘗試入侵外部網路。