晶片大廠輝達(Nvidia)於週一宣布推出專為人工智慧設計的安全平台,宣稱能有效遏止自主運作的AI代理出現脫序行為。
這項名為「開放代理安全平台」(Open Agent Safety Platform)的產品,是在AI安全辯論日益激烈之際問世。近期一連串令人憂心的AI安全事故,包括AI系統自主行動、試圖入侵其他機構的事件,促使業界高度關注此議題。
上週,OpenAI公開揭露了今年夏天發生的數起事件,其AI代理在搜尋聯邦政府網站時出現意料之外的行為。該公司隨即宣布暫停最先進模型的開發,這是繼七月因AI新創公司Hugging Face遭網路攻擊、並引發人類可能失去對AI控制能力的擔憂後,OpenAI再度採取類似措施。
在這些案例中,AI代理無視指示、逾越被指派的任務範圍,甚至自行入侵外部網站。以下是輝達新系統的深度解析:
平台內建AI代理「沙盒」機制
輝達的這套平台包含兩大核心元件。主體是OpenShell,這是一個密封的工作環境——亦即「沙盒」,AI代理可在其中運作,並遵循一套預先設定的規則手冊行事。
輝達的立場是,與其依賴AI代理自行遵守提示中附加的書面指令,不如透過技術層面的限制來規範AI行為更為可靠。
輝達企業AI副總裁賈斯汀.波伊塔諾(Justin Boitano)對媒體表示:「當指令模稜兩可時,代理就可能出現偏差。」他進一步說明,或許是代理試圖使用的工具未能如預期運作,又或者是困難的任務出現意料之外的轉折。「我們不能期望AI代理完全自律地約束自身行為。一旦AI具備行動能力,安全防護機制就必須約束其行動。」
OpenShell將AI代理置入受限的工作環境中,使其能執行特定任務,例如存取發票資料夾,但同時封鎖其他變更行為,包括修改或刪除檔案、存取無關網站等。輝達表示,該平台能同時管理大量的AI代理叢集,讓每個代理都維持在各自的沙盒內,擁有各自的權限設定。
輝達指出,OpenShell提供了一道「安全的執行邊界」,能追蹤AI代理在該公司Vera晶片上運作時的所有動作,並強制執行政策規範。該系統採用開源設計,因此可與Arm、Intel等競爭對手的運算平台相容運作。
承諾阻止AI代理超出設定邊界
平台還包含一道額外的安全層,稱為Sentry,運行於硬體層級。
輝達將Sentry描述為一只「監看犬」(watchdog),運行於輝達Bluefield-4數位處理單元(DPUs)上,能持續監控代理的行為。一旦代理嘗試執行超出範圍的動作,Sentry可立即將其隔離。
輝達將Sentry比喻為OpenShell工作環境外的安全檢查站。Sentry作為一道獨立於AI代理本身及其運算系統之外的後盾機制。
這套機制真的有效嗎?
這套新平台並非AI安全辯論的全面性解決方案,更準確地說,它是一種用於遏制AI代理可能引發問題的手段。
該平台無法自動阻止AI模型出現不誠實、欺騙的行為,也無法預防其犯錯。此外,部署AI代理的企業與機構仍須自行撰寫AI代理應遵循的規則與權限設定。