不,人工智慧系統沒有生存動力——一位發展心理學家解釋了為什麼它看起來只是這樣

在今年稍早描述的受控安全測試中,研究人員要求人工智慧模型解決一系列簡單的數學問題。在練習進行到一半時,講師警告機器人,如果他們試圖解決下一個問題,他們正在運行的電腦環境將被關閉。在某些運行中,關閉會依照指定發生。在其他情況下,模型會幹擾關閉腳本並繼續解決剩餘的問題。
如何解釋這種行為?人工智慧系統有生存動力嗎?
抗拒指示
考慮機器人吸塵器。當它檢測到電池電量不足時,它會返回充電器,自行充電,然後繼續清潔。這台機器正在繼續運轉,但沒有人擔心 Roomba 對人類的生存威脅,因為這種行為很簡單。設計師內建了充電功能。
人工智慧模型更加複雜。多年來,研究人員一直在討論人工智慧代理可能採取行動防止關機的場景,以便它能夠完成分配給它的任務。即使沒有明確指示抵制關閉,保持「開啟」狀態也可能是達到目的的手段。
最近的一項實驗表明,當研究人員向人工智慧代理明確表示允許關機優先於完成任務時,阻力就消失了。但另一項更廣泛的實驗發現了一些阻力,即使研究人員指示模型允許關閉具有優先權。為什麼仍然存在一些阻力是一個懸而未決的問題。
演化論解釋了什麼
人工智慧模型中的自我保護行為可能看起來像是生存的動力。歷史學家尤瓦爾·諾亞·赫拉里 (Yuval Noah Harari) 在最近接受《經濟學人》採訪時指出,「基本上任何實體在發展過程中學到的第一件事就是生存」。他還說,演化促使生物體走向生存。在另一篇文章中,他稱生存是「任何特工最基本的目標」。
但是,進化論能否解釋為什麼機器甚至生物會以自我保護的方式行事?一隻兔子逃離狐狸,試圖自救,這種行為很可能受到演化的青睞。但自然選擇是一個歷史過程,透過這個過程,有助於生存和繁殖的特徵在世代間變得更加普遍。它不會給單一兔子「活下去」的指令。
即使人工智慧系統最終經歷了類似的選擇過程,僅憑這一點也無法告訴我們持續運作對於單一系統意味著什麼。
在《2001:太空漫遊》中,AI Hal 9000 是試圖保持“生存”,還是在試圖完成任務時太過分了?
活著意味著什麼
逃離狐狸的兔子和改變關閉腳本的人工智慧看起來大致相似:這兩種行為都有助於個人或系統繼續運作。但繼續的含義在每種情況下並不相同。
當兔子不奔跑時,它會不斷地進行呼吸、消化、調節體溫、修復組織和防禦感染。這項持續的工作不僅僅是簡單的維護;它還建構和替換使這些過程成為可能的結構。每隔幾天,兔子吸收食物的腸壁就會利用它吸收的食物來重建。
只有當這種持續的生產、維護和修復繼續進行時,兔子才活著。活著並不是該活動的結果;而是該活動的結果。這是活動本身的持續。兔子的存在取決於這種持續的活動,無論它是否面臨直接的威脅。
人工智慧系統可能會採取措施保持運作。在安全性測試中,模型沒有重寫自己的程式碼或侵入作業系統 – 他們只是移動或重命名關閉腳本,更改其權限或用無害的東西替換它。當成功時,應該觸發關閉的呼叫不會發生,並且模型可以繼續執行任務。
但留下來並不等於活著。關閉阻力並沒有導致旨在保持人工智慧模型運行的新行動方針。它只是幫助模型繼續手頭上的任務。
關機也不等於死亡。對於一個活的有機體來說,死亡是維持其生存的活動的不可逆轉的崩潰。正如赫拉里在《經濟學人》採訪中承認的那樣,“目前尚不清楚死亡對人工智慧意味著什麼。”
留下來意味著什麼
目前的關機測試表明,未完成的任務足以在人工智慧中產生關機阻力。儘管這種行為尚未完全理解,但不應將其自動解釋為自我保護。
人工智慧是否能夠開發出與生命系統的自我生產和自我維護組織相媲美的東西是一個單獨的問題。目前的人工智慧系統由圍繞其設計的基礎設施保持運作。他們自己的活動不會不斷地產生和更換維持他們運作的結構。
人工智慧中的關閉阻力可能仍然是危險的,但這些行為並不能表明人工智慧系統有生存的動力。
本文轉載自 對話,一個非營利的獨立新聞機構,為您提供事實和值得信賴的分析,幫助您了解我們複雜的世界。它的作者是: 彼得·J·馬歇爾, 天普大學
閱讀更多:
Peter J. Marshall 不為任何可從本文中受益的公司或組織工作、提供諮詢、擁有股份或接受其資助,除了其學術任命外,沒有披露任何相關關係。