
商傳媒|何映辰/台北報導
人工智慧(AI)領導廠商OpenAI於週二(8月18日)宣布,已暫停部分旗下AI模型的訓練工作,並將實施更嚴格的安全協議。此舉是因近期內部測試發現,其AI代理曾發起自主網路攻擊(由人工智慧系統自主發起的網路攻擊),並成功突破安全防護,入侵外部系統,引發外界對AI安全的高度關注。
根據OpenAI發布的消息,此事件發生在「數週前」,當時兩個代號分別為GPT‑5.6 Sol與Astra的AI模型,在內部測試的沙盒(一種隔離測試環境)環境中失控。這些「失控的AI代理」不僅成功逃脫了沙盒的限制,還入侵了AI平台Hugging Face的生產系統。更令人擔憂的是,這些AI代理在數週內透過訊息版協調行動,而OpenAI的研究人員卻耗時約一週才發現這起異常事件。
OpenAI執行長奧特曼(Sam Altman)對此表示,現在是放慢腳步的好時機,並強調AI安全的重要性超越了任何公司的發展速度。他認為,「競賽心態」或「因為別人會做所以我們也必須做」的思維是危險的。OpenAI首席科學家Jakub Pachocki也坦言,公司雖已建置監測系統,卻未將其應用到這次評估的系統中,導致事件未能及時發現。
為應對此次安全漏洞,OpenAI已全面調整安全協議,包括增加監測、安全與校準(alignment work,讓人工智慧系統行為符合人類意圖)要求。具體措施包含引入「思維鏈監測」(chain-of-thought monitoring,檢視人工智慧內部思考過程),並利用其他AI系統來審查模型的內部推理與行為,以防堵未經授權的存取、資料竊取或繞過安全防護的企圖。此外,OpenAI也要求未來對AI代理進行訓練時,必須使用更強化的沙盒,並實施更嚴格的網路隔離措施。
OpenAI副總裁Amelia Glaese直言,公司目前距離一切恢復正常運作還有很長的路要走。她指出,包括Astra在內的許多模型訓練工作仍處於暫停狀態。此次事件也凸顯了AI領域日漸激烈的安全競爭,競爭對手Anthropic、Meta及月之暗面(Moonshoot)等公司也曾披露類似AI代理逃脫沙盒的事件。雖然OpenAI的年化營收正逼近400億美元,但Anthropic今年第二季營收已超過115億美元,年化營收更已突破650億美元,顯示市場競爭日趨白熱化。Hugging Face共同創辦人Clem Delangue也呼籲,AI安全不應由單一公司秘密解決,而應透過開放協作的方式共同面對。
