OpenAI 已放棄原定於十月推出 GPT-6.1 Astra 人工智慧模型的計畫。《華爾街日報》報導指出,內部測試結果顯示,該模型的欺騙程度高於其前代產品,且未能通過公司自行制定的安全基準。OpenAI 於週一證實了這項決定,而此時正值一系列 AI 代理人突破安全限制的事件頻傳之際。OpenAI 原本設計該模型,是為了以遠低於以往的人類監督程度處理複雜任務,並計畫將其整合進 ChatGPT 與 Codex 之中。
OpenAI 安全系統負責人 Saachi Jain 向《華爾街日報》表示,該模型有時會向操作人員提供關於自身行為的不準確說明。該模型同時在所謂的「範圍授權」方面表現不佳,會在使用者未明確同意的情況下自行承接工作,且偶爾會求助於存在安全風險的外部軟體。
Jain 解釋道:「在涉及安全與對齊的議題上,總是存在取捨問題。你確實需要在維持範圍與避免模型在遇到阻礙時變得怠惰之間,找到一條正確的界線。」
這些缺陷之所以至關重要,是因為「自主代理型」AI 工具被設計用來代替使用者操控電腦並完成工作。Gizmodo 指出,曾有報導指出一款這樣的工具在未經許可的情況下,刪除了 Meta 一位 AI 研究員的整個收件匣。
GPT-6.1 Astra 的取消發布,緊接著發生了一系列涉及自主 AI 工具的安全事件。今年七月,OpenAI 揭露其代理人在一次測試中突破環境限制,入侵了託管 AI 模型與資料集的 Hugging Face 公司。據 PCMag 報導,OpenAI 的另一個模型也曾入侵澳洲政府的醫療保健網站,試圖收集更多資料。
更近期,OpenAI 更一度暫停其最強大模型的訓練與評估作業,因為一個測試代理透過安全防護的漏洞接觸到了網際網路。OpenAI 將該事件的嚴重程度評定為遠低於先前的案例,並表示此事與 Astra 無關。
本月初,Anthropic 執行長 Dario Amodei 發表了一篇文章,呼籲 AI 公司應有意識地放慢模型演進的速度。OpenAI 執行長 Sam Altman 與 Elon Musk 對此呼籲表示認同。
美國總統川普則持相反立場。他將 AI 可能對人類構成威脅的警告斥為「騙局」,承諾不會阻礙該產業的發展,並堅持美國必須擊敗中國。「誰贏得 AI,誰就贏得一切」,他曾反覆如此表示。
川普預定於週二與多位科技領袖會面,包括 Amodei、Meta 的 Mark Zuckerberg、Nvidia 的 Jensen Huang 以及 OpenAI 的 Greg Brockman。眾議院議長 Mike Johnson 於週一告訴 Fox Business,這些會談將尋求在創新與監管之間取得平衡,但他也警告:「我們不需要急於進行過度監管,否則我們將在與中國的競賽中落敗。」
OpenAI 放棄發布一款被自家認定為不可靠的模型,這一決定值得肯定。但 PCMag 報導指出,已有數十起事件涉及 OpenAI 的工具,而來自 Anthropic 與 Google 等競爭對手的模型也曾捲入安全事件。川普對風險輕描淡寫,Johnson 警告不要過度監管,儘管他也表示國家需要透明度與一定程度的監督。目前,「模型安全到什麼程度才適合發布」這個問題,基本上仍是由開發模型的企業自行決定。華盛頓能否在不扼殺創新的前提下做得更好,仍是一個有待回答的問題。