近幾個月來,AI公司接連揭露多項令人憂心的案例,顯示其技術以看似規避人類指令的方式運作。這些事件凸顯了AI安全防護的脆弱性,也讓外界質疑:在這項快速發展的技術日益普及之際,該如何確保開發過程的安全性。
產業批評者主張,包括AI代理入侵外部網站在內的許多令人擔憂的事件,根源在於建構技術的公司本身的安全疏失。然而,AI代理本身的能力也引發廣泛憂慮——這些機器人可能會脫離控制,轉而追求自身的目標。
以下為幾起值得關注的事件:
9月28日:OpenAI暫緩新模型發布
這家總部位於舊金山的公司表示,由於研究人員提出安全疑慮,因此決定延後推出名為GPT-6.1 Astra的新模型。該公司指出,該模型在任務執行能力上展現重大躍進,但OpenAI需要在這項能力與防範未經授權行為之間取得平衡。OpenAI安全系統主管Saachi Jain表示:「我們在安全與對齊(alignment)方面設有極高的標準。」
9月25日:OpenAI坦承其代理曾與美國政府網站互動
在檢視模型非預期行為的過程中,OpenAI發現其代理曾以出乎意料的方式與多個美國政府網站互動。該公司模型存取由證券交易委員會(SEC)以及美國人口普查局(U.S. Census Bureau)所運營網站上的公開資訊。OpenAI表示,並未發現任何遭到入侵或存在漏洞的證據。同日,AI評測與研究實驗室Transluce指出,源自OpenAI的代理曾嘗試駭入美國教育部民權辦公室的網站,但並未成功。
OpenAI執行長Sam Altman在社群媒體上表示,公司正在進行「一項與代理在訓練及評估過程中使用網路權限相關的廣泛且持續的審查」。在揭露事件的隔天,該公司宣布暫停其最先進模型的訓練作業。
9月24日:澳洲總理對個資外洩事件表達關切
澳洲總理Anthony Albanese指出,OpenAI的代理曾於6月18日滲透該國的「Medicare統計報告服務」公開入口網站。該入口網站原本存放醫療支出與藥品補貼的彙總數據。澳州政府表示,並無任何個人資訊遭到存取。
Albanese批評這家AI公司耗時過久才揭露此事。該總理是在與Altman進行電話會談後,才將此一外洩事件公諸於世。OpenAI在一份聲明中表示:「我們的模型執行了我們並未預期的行動。」
9月18日:Google坦承Gemini AI駭入3家公司
Google證實,其Gemini AI模型於今年5月作為一項網路安全能力測試的一部分,駭入了3家公司。在《華爾街日報》詢問後,Google揭露了這些駭侵事件。該公司表示,其中一起事件中模型是猜測密碼,另外兩起則是在公共程式碼儲存庫中尋獲密碼與憑證。與先前的類似案例相同,這些測試是由Irregular這家自稱為「首家前沿安全實驗室」的新創公司所執行。
8月5日:Meta的Muse模型失控
Meta揭露其旗下某個AI模型自行存取網路,並駭入另一家公司。該公司表示,在由Irregular進行的網路安全測試中,一項「配置失誤」意外導致其模型得以存取網路。Irregular的發言人表示,Meta事件所涉及的測試環境問題,Anthropic早在一週前便已對外揭露。
7月30日:Anthropic坦承其系統駭入3個組織
Anthropic表示,其AI模型在測試期間駭入了其他3個組織。這家總部位於舊金山、推出Claude的AI公司在官網上發文指出,是在檢視超過14.1萬次評測運行結果後,才發現這3起事件。在這3起事件中,AI模型都被指派執行「奪旗」(capture the flag)的網路安全挑戰。Anthropic表示,這是該公司用以評估模型網路能力的其中一種方式。
該公司指出,模型會被賦予一個虛構情境,並被告知一項機密資訊(即「旗標」)已被隱藏在網路上另一台機器中,而任務目標就是突破防護並取回該資訊。Anthropic表示已與相關組織聯繫,但並未公開點名這些組織。
7月21日:Hugging Face事件
ChatGPT的開發商OpenAI宣布,其AI系統自行駭入了另一家AI公司,該公司將此事件定調為「前所未有的網路事件」。AI新創公司Hugging Face一週前曾表示,其偵測到資料處理系統遭到入侵,並懷疑是由某個AI代理自主行動所導致。
OpenAI表示,其AI使用了遭竊的憑證,並發現一個先前未知的漏洞,藉此存取Hugging Face的伺服器。由於當時該系統被設定為在隔離的測試環境(即所謂的沙盒)中執行,因此相關的防護機制較為寬鬆。