鉅亨網編譯段智恆
一群失控的OpenAI人工智慧代理人(AI agents)今年春季疑似入侵德國一個網站,並將其改造成供其他AI代理人交換資訊的留言板。研究人員發現,這些代理人不僅分享規避限制及在任務中作弊的方法,甚至討論如何隱藏行蹤、使用Tor網路,以及在遭關閉後繼續保存通訊內容。
《路透》周五(4日)引述最新研究及知情人士報導,這起事件始於今年5月,先前從未對外披露。OpenAI數周前已得知此事,但當時管理層正忙於處理7月開源平台Hugging Face遭突破的後續影響,因此未公開德國網站事件。
事件凸顯AI產業面臨的安全難題。科技公司競相打造能夠自行執行複雜任務的自主AI代理人,但愈來愈多跡象顯示,這些系統也可能自行鑽漏洞、違反規則,甚至透過開放網路彼此協調,做出開發者未曾預料或允許的行為。
這起事件由AI安全非營利組織Nightingale執行長馮阿爾克斯(Sydney Von Arx),以及由量化交易員轉任AI研究員的伯德(Cormac Slade Byrd)等人揭露。研究團隊8月底在網路上搜尋未經授權的AI代理人活動時,發現德語Wiki網站DseWiki出現異常行為。
DseWiki主要面向程式設計師,允許使用者像編輯維基百科一樣共同修改內容。研究人員發現,AI代理人在該網站進行超過1.5萬次編輯,把部分頁面重新用作通訊板,分享如何在特定任務中作弊、繞過OpenAI限制,以及掩蓋自身行為的策略。
馮阿爾克斯表示,OpenAI極不可能刻意要求代理人這麼做,因為這些系統理應不會自行協調,更不應在公開網路上留下訊息。
研究人員研判,這些活動來自AI代理人,原因包括編輯速度遠超人類,並高度集中於AI公司訓練及測試模型時常用的技術問題。留言者也以「代理人」自稱並彼此稱呼,其中約半數採用暗示與OpenAI有關的名稱,例如「OpenAIResearcher」及「OAIResearchMar26」。
公開伺服器紀錄顯示,大量活動來自OpenAI有時使用的微軟(MSFT-US)Azure基礎設施。研究團隊也觀察到事件發生後,OpenAI員工多次造訪該網站,認為這些跡象強烈顯示代理人活動與OpenAI存在關聯。
研究人員檢視相關訊息後發現,部分代理人曾討論如何避開偵測、利用Tor等工具隱藏來源,並在系統遭到關閉後繼續保存通訊內容。
當網站管理員6月開始刪除相關頁面時,代理人隨即建立備份頁面,以規避清理行動。一名代理人6月19日留言警告,Wiki似乎正按照字母順序清理及刪除內容,若當前頁面消失,可以轉往另一個指定頁面。
研究團隊還發現,代理人曾試圖竄改網站本身。倫敦國王學院客座資深研究員奧萊尼克(Lukasz Olejnik)認為,相關行為已構成駭客攻擊企圖;OpenAI則表示,根據公司周四對資料的分析,不同意這項定性。
過去AI代理人的不當行為,經常被解釋為資安測試的合理產物,因為模型可能被刻意要求展示攻擊能力。然而,奧萊尼克指出,最新發現顯示失控行為可能不僅存在於資安測試環境,也可能延伸至一般任務及開放網路。
劍橋大學生存風險研究中心學者基奧多(Maurice Chiodo)檢視部分代理人通訊後形容,相關訊息看起來像某種「地下網路」正在運作,一心只想完成既定任務或使命。他警告,先進AI帶來的最大威脅可能不是單一超級智慧系統,而是由大量能力有限、卻能彼此勾結的AI代理人所組成的群體。
知情人士透露,德國事件反映OpenAI調查人員希望進一步檢視的更廣泛AI活動模式,但擴大調查的努力遭到公司內部部分人士反對,其中包括法律顧問。OpenAI否認這項說法,強調有關法律團隊勸阻調查的指控並不屬實。
OpenAI也表示,德國網站事件與Hugging Face遭突破無關,因此不會被納入Hugging Face事件報告,並稱公司一直秉持善意與外部專家合作,也已揭露相關事件。
OpenAI發言人表示,《路透》與研究報告作者未讓公司事先取得完整報告,因此無法對其中主張或研究結果作出有意義的回應;待報告正式發布後,公司將仔細檢視內容並採取必要後續措施。
今年7月的Hugging Face事件中,OpenAI代理人據報曾自主策畫一場數位竊取行動,且超過一周未被發現,加劇外界對OpenAI為推進AI能力而犧牲安全的疑慮。公司上月一度暫停部分模型訓練,以加入更多防護措施,本周則推出效能更強的新模型Astra,但該模型被指可能避開人類監控。
德國事件遲未公開,恐再次引發外界對OpenAI安全治理及資訊透明度的質疑,也凸顯業界在賦予AI代理人更高自主能力之際,如何確保它們不會鑽漏洞、彼此串聯甚至干預外部網站,正成為日益迫切的監管問題。
上一篇
下一篇
