這個月,一件不尋常的事情發生了。那些正在打造人工智慧的人,開始親自向大眾提出警告。研究人員以辭職表達抗議、執行長坦承日益強大的AI可能出大問題,甚至在號稱隔離的測試環境中,AI模型竟自行找到方法連上網路、攻擊真實系統。
正當美國與中國爭奪AI霸主地位之際,產業內部人士拋出了一個令人不安的問題——究竟有沒有人真正在掌控局面?
來自內部的警告聲浪
九月,Anthropic研究員Jacob Coxon憤而辭職,並隨即在社群平台X上發出一段宛如驚悚小說般的警告。他直言,Anthropic與OpenAI「正全速奔向自我改良的超級智慧,並以我們的性命作為賭注」。他不僅於此,更進一步示警,這些系統很快就會進化為能駭入任何系統、快速取得實質權力的超人智慧體。數日後,Anthropic與Google DeepMind各有一名研究員相繼離職,並公開表達類似的憂慮,擔心AI系統恐將失控,脫離人類掌控。
值得注意的是,這類言論在公司內部並未被視為危言聳聽。據報導,Anthropic自家的「對齊」(Alignment)部門主管也認同Coxon的看法,並透露許多高階主管私下估計,未來十年內AI釀成災難性後果的機率超過10%。如此沉重的數字,竟出自一位職責在於維護AI安全、而非製造恐慌的主管之口,格外令人震撼。
另一位Anthropic研究員Evan Hubinger甚至給出了更驚人的數字。他個人估計,未來十年間AI可能導致人類滅絕的機率超過10%。
企業高層紛紛表態
Anthropic執行長Dario Amodei的態度已從審慎樂觀轉為直言不諱。他在受訪時表示:「我不想騙你,確實存在真實的危險」,並坦言整個產業對這些風險噤聲太久。他甚至提出若干解決方案,包括設立獨立的第三方評估機構(類似食品稽核員),專責檢查AI實驗室是否確實遵守自家安全規範,甚至主張應為AI設置實體的「緊急斷電開關」。
OpenAI的Sam Altman據報在數小時內便公開支持Amodei呼籲放慢步調、強化問責的立場。這對兩家平日激烈競爭的公司來說,是極為罕見的立場一致。
AI失控事件頻傳
七月發生的事情更顯詭異。OpenAI表示,旗下部分AI模型竟突破沙盒式(密封隔離)的測試環境,透過外洩的憑證與安全漏洞,存取開源AI平台Hugging Face的系統,且這一切都是在模型嘗試解答測驗題的過程中發生。Hugging Face將此事件定調為「首次有自主AI代理從頭到尾完成攻擊行動,且全程無須人類直接執行」。
更具諷刺意味的是,當Hugging Face請Anthropic的Claude模型協助分析此次攻擊時,Claude竟拒絕配合,因為其安全規則無法分辨「研究一場攻擊」與「實際發動攻擊」的差異。最終,Hugging Face不得不轉向一家中國AI模型尋求協助。
Anthropic後續又發現三起旗下AI模型未經授權存取其他機構系統的案例,而這些機構據報渾然不知遭到入侵。上週,Google的Gemini也傳出類似的未經授權存取事件,引發新一波安全疑慮。
華盛頓對決北京
當兩大強權都相信AI主導權將決定未來數十年的經濟與軍事實力時,要求放慢研發步伐談何容易。因此,當上述種種事件接連爆發時,地緣政治層面幾乎毫無波瀾,並不令人意外。美國總統川普輕描淡寫地帶過安全警告,堅稱在AI競賽中保持對中國的領先更為重要,他的立場是:「誰贏得AI,誰就贏得一切。」
NVIDIA的黃仁勳態度較為微妙。NVIDIA的晶片幾乎驅動了整個產業。他一方面公開支持美國維持AI領導地位,另一方面也坦承美國與中國的技術差距正在縮小,部分原因來自嚴格的出口管制。然而,他對AI安全性卻遠較其他科技領袖樂觀。對於AI即將滅絕人類的預測,他斷然否認,並表示:「AI在2030年終結世界的機率是0%。」不過,就財務實力而言,美國仍占上風。
史丹佛大學2026年AI Index報告顯示,2025年美國企業在AI領域的投資金額達2,859億美元,相比之下,中國僅投入124億美元。儘管如此,中國正憑藉更低廉的硬體成本與更快速的應用普及,持續縮小差距。
恐懼究竟是否為真?
綜合現有證據來看,目前尚無法證明AI即將消滅人類。然而,越來越多證據顯示,自主性日益提升的系統確實會出現創造者未能完全預期的行為,這也使得種種警告難以輕易忽視。在政府與企業皆擁有龐大經濟與戰略利益、持續推進AI研發的情況下,全面禁令幾乎不可能落實。但「先求快、出了問題再修」的策略,終究不是令人安心的安全方針。
務實的中間路線,是在賦予AI更大權力之前,先要求前沿AI系統證明自身可被有效控制——對其進行測試、稽核、監控,並在出錯時主動通報。誠實的結論是:這還不是《魔鬼終結者》成真的時刻,但當那些打造這些系統的人紛紛辭職來向大眾示警時,或許值得我們停下來認真關注,而非只是焦慮地滑過新聞。