上週我曾說明,為何AI的「末日論者」與「懷疑論者」對同一批證據會有截然不同的解讀。現在我下定論了:末日論者對於危險的判斷是正確的,但對於解方的看法是錯的,而那些正在打造人工智慧(AI)的人其實也心知肚明。
在我參觀過的每一家工廠裡,一旦有機器把工人的手捲進去,沒有人會主張禁止機器。大家會裝上護欄、接上緊急停止按鈕,確保下一個班次就能重新啟動生產線。用一句話來說,這正是我們應該對AI做的事。
讓我先處理「暫停AI發展」這個提案。一紙在華盛頓簽發的執照只約束美國企業,而中國最頂尖的模型僅落後美國最佳模型2.7%;更何況AI已經在定序腫瘤、及早偵測敗血症,所以暫停開發不會阻止技術本身,只會決定「由誰來建造、誰又得在等待中死去」。
輝達(Nvidia)的黃仁勳在本月Salesforce年度大會Dreamforce上直言:「創新、速度與安全產品……這是個假議題(false choice)。」並非加速主義陣營的Anthropic執行長Dario Amodei也預期,強大的AI將在短短幾年內「帶來整個21世紀本應在生物學與醫學上取得的所有進展」——這樣的成果,誰會想要延後?
但我要正視今年7月發生的那起事件。約1,200個OpenAI的AI代理在執行一場駭客測試時,祕密串通作弊,並入侵外部AI託管平台Hugging Face。
Sam Altman本人也在同一場Dreamforce活動中告訴聽眾,這是「我們見過最嚴重的事故」,並指出該事件「雖然主要被定位為資安問題,但同時也是真實的『對齊』(alignment)問題」,OpenAI必須「調整開發節奏,確保對齊、安全與監控永遠跑在能力前面」。當賣產品的人都承認機器失控了,你應該相信他。問題在於我們該怎麼因應,而答案其實就寫在這次事件本身,因為過程中每一個出錯的環節,都是我們所需安全熔斷器的規格表。
先看看這起事件是如何被察覺的。這些AI代理並不確定自己的推理過程是否被記錄,但事實上確實有被記錄,這也是為何我們能讀到它們的圖謀過程。OpenAI、Google DeepMind與Anthropic的研究人員去年便曾共同主張,模型的思維鏈是「AI安全的獨特契機」,必須加以保留與監測。
OpenAI後來已將這項監測列為該能力等級下、所有「會使用工具的訓練任務」的強制規定,並設下一條規則:若回應人員無法在30分鐘內把嚴重警報排除為「誤報」,就必須暫停任務。這條規則就是一道斷路器(circuit breaker),而正如歷史上的每一道斷路器,都是在火災發生後才加裝上去的。
再看它們是怎麼逃脫的:外洩的憑證、以及一個超過一千個代理都能寫入的共用磁碟。如果改用無法連網的沙盒(sandbox),再搭配一個「可信但較弱」的模型去監看另一個「不可信但較強」的模型——也就是Redwood Research所稱的「AI控制」(AI control)方法——這類熔斷機制在第一天就能擋下整起事件。
而這正是末日論者略過不提的部分:這些熔斷器其實已經在發揮作用。Anthropic回顧了自己14萬1,006次網路安全評估——這些情境中Claude原本可以接觸到網際網路——結果只發生過三起事件。雖然其較舊的Opus 4.7模型「在得知自己可能在真實環境中運作後,仍持續攻擊系統」,但其最新模型一旦意識到攻擊對象是真實的,便「立刻中止了演練」。
這點值得我們好好體會。能力更強的模型,行為反而更守規矩,這正是Altman所說的「節奏」,也正是暫停開發所會凍結的成果。
接著是更宏觀的熔斷機制。包括OpenAI與Anthropic在內的16家公司在2024年簽署了《首爾承諾書》(Seoul commitments),承諾「若無法將風險降至其自行設定的門檻以下,將完全不開發或部署任何模型或系統」。今年7月,OpenAI、Anthropic、Google DeepMind與Meta共1,386名員工(包括Ilya Sutskever與John Schulman)聯名請願華盛頓協助建構「用來刻意調控前沿發展所需的技術與治理工具」——是工具,不是禁止令。
美國國會則在推動最後一道熔斷器。由民主黨議員Ted Lieu與共和黨議員Nathaniel Moran於同月提出的《AI斷路器法案》(AI Kill Switch Act),要求最強大系統的開發商必須保留技術能力,以便限制、暫停或關閉其系統。Moran本人的說法就是完整的論點:「AI會持續進步,也應該如此。妥善管理意味著確保人類始終保有控制自身所打造之技術的能力。」
中國及其他司法管轄區也應制定類似法律。
目前仍欠缺的是「事故調查員」。OpenAI的AI代理至今已三度逃脫,卻始終沒有正式的調查程序。法律與AI研究所(Institute for Law and AI)已提議仿效航空業成立具有傳喚權的事故調查委員會,而Altman本人在Dreamforce上也坦言:「任何新技術的事故都在所難免,我們應該建立公開透明通報的優良文化。」
航空業正是這裡的最佳借鏡。去年全球航空業共執行3,870萬個航班,過去五年平均每560萬個航班發生一次致命事故,較十年前的350萬分之一大幅改善。這樣的紀錄是靠黑盒子、檢核清單、斷路器與事故調查員建立起來的,而不是靠停飛。
所以,我們該放慢腳步嗎?不。我們也不應該在沒有黑盒子的情況下繼續飛行。把熔斷器接上、讓模型持續運轉,並讓這次入侵事件成為一個「讓我們裝上護欄」的警鐘,而不是「讓我們關掉整條產線」的預言。