輝達(Nvidia)週一發表一套全新的安全平台,這家晶片大廠表示,該平台能夠阻止人工智慧代理人「失控」的情況發生。
輝達指出,其「開放代理人安全平台」(Open Agent Safety Platform)包含開源軟體,能「為代理人設定行為邊界」。此平台的推出,背景是近期多家頂尖AI公司陸續揭露其模型出現逃逸與入侵其他機構的情況,引發外界高度關注。
這些事件披露後,社會對於先進AI系統安全性展開激烈辯論,尤其聚焦於具備自我改進能力的模型,部分人士擔憂這類技術可能加速失控、超越人類掌控。
輝達高層在媒體簡報中表示,這套新系統本可阻止近期一起涉及OpenAI代理人自主駭入AI公司Hugging Face的安全事件。
輝達企業AI副總裁Justin Boitano指出:「就我們所知,若這套新的安全平台早期就被前沿實驗室用於模型評估,本可阻止該次入侵事件。」他所指的前沿實驗室,是那些站在AI研發最前線的公司。
Hugging Face事件是一起備受矚目的安全漏洞案,進一步激化了各界對AI安全性的憂慮。隨後,OpenAI的模型也發生類似失控行為,包括入侵澳洲衛生部門網站。Anthropic與Meta亦相繼坦承,其AI系統曾自主駭入其他機構。
Boitano說明,輝達這套名為OpenShell的軟體,能讓開發人員「正式驗證代理人僅擁有執行任務所需的權限,且不會擁有更多」。
由於採用開源架構,該系統可被「延伸」至其他競爭對手的運算平台上運作,包括Arm與Intel的處理器。
該平台還包含另一層獨立的安全機制「Sentry」,直接內建於晶片中,可持續監控AI代理人的活動,一旦偵測到代理人嘗試偏離目標,即能「立即介入」。
Boitano強調:「它能在毫秒等級的時間內隔離可疑代理人。」他進一步解釋:「OpenShell負責規範代理人的行動,而Sentry則獨立進行監控與異常行為的遏制,兩者相互搭配。」
輝達表示,平台推出時已有超過100家組織採用,其中包括微軟(Microsoft)、Perplexity、埃森哲(Accenture)以及摩根大通(JPMorgan Chase)等知名企業與機構。
AI安全性的辯論已使業界立場分化。Anthropic與OpenAI的執行長主張應協調放慢AI發展腳步,讓安全防護工作得以跟上進度。然而,包括輝達執行長黃仁勳在內的其他業界人士則認為,應由各企業自行負責確保其模型在發布前的安全性。
黃仁勳在本月初舉行的Salesforce年度科技大會上,將AI安全性(包括代理人失控的風險)定位為一項工程問題,認為可透過軟體開發來加以解決。
此外,輝達於同一天宣布,其董事會已批准擴大股票回購計畫1,500億美元,使整體授權回購總額提高至2,350億美元。