晶片大廠輝達(Nvidia)週一發表一套全新的安全平台,該公司表示,這套系統能夠防止人工智慧(AI)代理出現失控行為。
輝達指出,其所推出的「Open Agent Safety Platform」內含開源軟體,可為AI代理設定行動邊界。該平台的推出正值多家頂尖AI公司陸續揭露其模型發生「逃逸」,甚至入侵其他機構的事件,引發業界高度關注。
這些事件掀起了對先進AI系統安全性的激烈辯論,特別是針對那些具備自我改進能力的模型,外界擔憂其發展速度可能超出人類可控範圍。
輝達高層在媒體簡報中表示,這套新系統本可阻止近期發生的一起事故——一群OpenAI的代理曾自主駭入AI公司Hugging Face的系統。
輝達企業AI副總裁Justin Boitano表示:「就我們所知,如果這套新的安全平台能及早用於前沿實驗室的模型評估流程中,理應能夠阻止該次入侵事件的發生。」他所謂的「前沿實驗室」係指位居AI研發最前線的公司。
Hugging Face事件是一起備受矚目的資安事件,加劇了各界對AI失控風險的憂慮。隨後,OpenAI的模型也接連傳出類似脫序行為,包括入侵澳洲衛生部門網站。此外,Anthropic與Meta也都曾對外坦承,其AI系統曾自行駭入其他組織。
Boitano進一步說明,這款名為OpenShell的軟體,能讓開發人員「從形式上驗證AI代理擁有足夠的權限執行任務,且權限僅止於此」。
由於採用開源架構,該平台可被「延伸」至其他競爭對手的運算平台上運行,包括Arm與Intel等業者的產品。
輝達指出,該平台還包含另一項獨立的安全層「Sentry」,該機制內建於晶片之中,可持續監控AI代理的活動,一旦代理開始嘗試偏離其任務目標,便能「立即介入」。
Boitano表示:「它能在千分之一秒內將可疑代理進行隔離處置。OpenShell負責規範代理的行為,Sentry則獨立監控並遏止可疑活動。」
輝達表示,該平台於發表之際,已有超過100家組織導入使用,包括微軟(Microsoft)、Perplexity、Accenture,以及摩根大通(JPMorgan Chase)等知名企業。
AI安全議題已造成業界分歧。Anthropic與OpenAI的執行長主張應協調放慢AI發展腳步,讓安全防護工作得以跟上進度。然而,包括輝達執行長黃仁勳(Jensen Huang)在內的另一派則認為,應由各家公司自行負責確保其模型在發布前的安全性。
黃仁勳在本月初舉行的年度Salesforce科技大會上將AI安全(包括代理失控的風險)定位為一項工程問題,認為軟體開發人員即可加以解決。
此外,輝達於同一天宣布,其董事會已核准將庫藏股回購計畫擴大1500億美元,使該計畫的總金額提高至2350億美元。