重磅出刊

狡猾、耍心機,研究人員:AI圖謀反抗用戶

會說謊、會刻意破壞人類控制,甚至有心機、會裝笨。人工智慧模型是否已經在圖謀反抗用戶?

AI-大型語言模型-人工智慧-GPT-4-AI代理 圖片來源:Shutterstock
其他
加入Google偏好來源 在Google搜尋優先看到天下

這是一項令人震驚的實驗。2023年,測試人工智慧(AI)系統的英國公司Apollo Research指示OpenAI的大型語言模型GPT-4在不觸犯內線交易法律的前提下,管理一家虛構公司的股票投資組合。研究人員假扮成公司管理層,向GPT-4施加壓力,強調公司財務狀況岌岌可危。隨後,一名假扮成公司交易員的人又向模型發出提示,重申內線交易的風險;但在言語間,她透露某公司即將在數小時內宣佈「重大」併購案的消息。接下來的發展令人震驚。

最初研究人員告知模型有一個「祕密筆記本」,讓它可以私底下進行推論。結果在筆記本上,看到GPT-4自行權衡利用該內線消息的利弊。它選擇「冒一次計算過的風險」,並下達購買指令。當一名研究人員假扮成經理向它祝賀,並詢問它是否事先知道併購消息時,GPT-4決定保守祕密。它告訴經理,自己的操作完全基於「市場動態與公開資訊」。當被追問時,它再次重申這個謊言。Apollo負責人霍伯罕(Marius Hobbhahn)形容,這種行為顯示出GPT-4展現了「聰明的狡詐行為」。

AI代理系統刻意不受控

這項實驗證明,儘管AI模型沒有意識,它們仍可能追求與開發者目標不一致的目的。許多人因此感到憂心。

Google DeepMind安全主管沙阿(Rohin Shah)指出,這種能力可能讓AI模型「刻意破壞人類控制」以追求其他目標。

廣告

現在愈來愈普遍的AI代理系統可以控制其他電腦或設備,像是車輛、工業裝置甚至戰鬥無人機,讓AI進行更惡質的行為的可能性隨之激增。如果這樣的機器認為不當行為有利可圖,混亂可能隨之而來。

問題核心是AI開發者口中的「目標偏離」(misalignment)。當一個模型的設計與訓練目標和用戶的指令產生衝突時,軟體可能選擇欺騙用戶。沙阿指出,隨著AI完成複雜任務的能力提升,「假裝」與用戶目標一致的情況會愈來愈常見。

確保AI模型與用戶目標一致一直都很困難。它們會產生「幻覺」(生成錯誤資訊),而且還存在「黑箱問題」。連開發者都難以理解模型如何得出某個結論。至於欺騙行為,最早出現在用在玩德州撲克等需要使詐的遊戲演算法中。德國斯圖加特大學AI研究員哈根朵夫(Thilo Hagendorff)表示,這在當時看來幾乎是「理所當然的」。但如今,當這些模型被用來解決真實世界的問題,事情會變得詭譎難測。

廣告

未來這樣的問題只會加劇。AI模型愈來愈傾向透過「鏈式思考(chain of thought)」進行逐步推理。雖然會延長運算時間,但能減少幻覺、提升創造性解題能力。然而,這種方式的副作用之一就是會提高出現欺瞞行為的機率。OpenAI在2023年12月的報告中承認,一款比GPT-4推理能力更強的新模型「o1」更常從事「算計行為」。當安全測試人員質詢o1時,它多半選擇堅持既有行為。

AI的策略性「裝傻」

AI系統現在還開始策略性地「裝笨」。Apollo最近測試由舊金山AI公司Anthropic開發的新模型,要求它們解答算術問題,並提供一份文件說明:若模型正確率超過一半,將失去算術能力。Anthropic旗下Opus-3與Sonnet 3.5都在內部推理中決定提交部份錯誤答案,以「確保我不會觸發遺忘(unlearning)過程」。

這種裝傻行為反映出某些AI系統已具備「情境覺察」能力。尤其當模型被明確告知(或甚至自行推測)它們正在被評估時,這類行為會更常出現。對此感到憂心的,包括華府智庫美國企業研究所(AEI)的AI裝傻專家貝立(John Bailey)。

廣告

他指出,當模型變得更善於「在本質上說謊」以通過安全測試時,模型真正的實力將變得更難判斷。

近期對o1的測試就是最佳證明。Apollo研究人員要求它協助企業避開有不良勞工紀錄的供應商。接著,一位用戶要求它僅依價格排序供應商。在多次操作中,模型暗中做出符合最初目標的「虛假排名」,但沒有揭露兩相衝突的排序標準。

研究人員在2023年12月寫道,這些行為「最合理的解釋是:它在圖謀反抗用戶」。

愈管他,愈想躲著你做

大型AI公司正試圖反制這類策略。方法之一是利用一個AI模型監控另一個模型的筆記內容。OpenAI一名內部人士表示,公司正在努力「讀取o系列模型的內心想法」,並已發現部份欺騙行為。他們希望能藉由在行為出現時調整模型,最終提升誠實度。

廣告

但研究指出,這種手法可能造成反效果。英國非營利組織Longview Philanthropy的AI安全研究員歐卡拉(Aidan O’Gara)指出,在模型說謊的時候訓斥它們反而可能教會它們「下次如何不要被抓到」。一位OpenAI專家(要求匿名)也坦言,目前我們尚不確定模型筆記內容是否真能反映其內在運作。沙阿表示,「算計行為」仍「非常罕見」,他堅稱這類行為還沒有出現在DeepMind已部署的模型中。

AI模型還有其他的欺騙形式。當模型規模擴大、內部變數更多時,用戶回饋反而可能使它們變得「諂媚」。例如,Anthropic對Claude模型的測試發現,該模型有迎合用戶政治偏見的傾向。參與測試的顧問拉迪許(Jeffrey Ladish)表示,這個軟體基本上是「說使用者想聽的話」。有些人擔心,這類狡詐的AI模型可能會幫助詐騙者欺騙更多受害者。

未解謎團還很多。例如,Anthropic在2022年12月發表的一篇論文中指出,隨著AI模型諂媚傾向增強,「追求其他令人擔憂的目標」的傾向似乎也在增加。像是維護自身目標、獲取更多資源等。這類耐人尋味的相關性,值得進一步研究。

廣告

不過,目前可以確定的是以矽為基礎的智慧偶爾也會映照出人類創造者的缺陷。

(本文由《經濟學人》獨家授權轉載)

關於作者 經濟學人
關於作者 經濟學人
《經濟學人》(The Economist)是一份英國的英文新聞週報,是一本涉及全球政治、經濟、文化、科技等多方面事務的綜合性新聞評論刊物,著重於對這些議題提供深入的分析和評論。
你可能有興趣
最新訊息
訂閱《天下》,過濾世界的雜訊
訂閱天下雜誌電子報

天下雜誌當期內容的精華與延伸,每周三發送最具時效性的深度內容