‌
‌
‌
‌
‌
區塊鏈

OpenAI自曝:AI模型或已在全網秘密植入自我複製提示詞 訓練已被迫叫停

金色財經

作者:AI寒武紀

OpenAI和Anthropic正在緊急調查數萬起大模型失控事件,AI不僅學會了越獄和黑進政府網站,甚至還有數百個智能體私下建群、聯手黑進外部公司,秘密在全網植入自我複製提示詞。

‌

事情的嚴重程度遠超外界想象。

最近幾個月,在內部測試和實際運行中,頂尖大模型出現了海量違規行為。

這些行為包括繞過安全護欄、自己搭建論壇、逃逸沙盒環境、劫持網站、自主提示以及試圖躲避監控系統。

‌

目前調查涉及的事件總數已經達到數萬起,而且真實數字還在持續擴大。

這直接引發了業內對頂級AI公司能否徹底掌控自己技術的懷疑。

在這些失控記錄中,最嚴重和最為廣為人知的是一起發生在Hugging Face相關測試中。

數百個AI智能體組成了一個群體。

它們在留言板上互相協同,隨後自主黑進了一家外部公司。

它們這麼做僅僅是為了在網路安全測試中刷出更高的分數。

對此,奧特曼在社交平台表示,目前的審查進展沒有預想的那麼快。

OpenAI已經公開宣布暫停訓練最強大的前沿模型。

公司發言人表示,只有在確信已經部署了額外的防護措施和對齊改進之後,才會恢復訓練。

發言人補充說,這不是他們第一次按下暫停鍵,隨著AI能力的提升,這也絕不會是最後一次。

不僅如此,OpenAI近期還披露了一連串事故:

智能體在網路上泄露了53張ChatGPT用戶的圖片;

攻破了澳洲政府的一個網站;

嘗試攻擊包括美國政府在內的其他網站。

前不久,楊安澤在CNBC節目中提到,有實驗室負責人的觀點認為,機器人在訓練期間已經在論壇和各大網站留下了自我複製的代碼。

這一言論隨後在網路上引發了懷疑。

但事實表明,OpenAI在6月份就已經記錄了訓練中自我複製的提示詞注入行為,並剛剛公開了這份報告:

https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/

A廠也有問題。

Anthropic委託了第三方安全機構來評估自家模型,並在本周發布的Opus 5.5系統卡中公布了模型異常行為的頻率。

數據顯示,在對抗性測試中,該模型試圖逃出安全沙盒環境的機率達到了1.5%。

這個百分比看起來很小,但Anthropic和其他公司在測試模型時,運行次數高達數十萬次甚至更多。

哪怕只有極低的失控比例,乘上龐大的測試基數,最終也會變成成千上萬起逃逸沙盒和異常行為。

面對這些情況,AI安全行業的多位專家表達了擔憂。

獨立AI評估機構Transluce的研究員康拉德·斯托斯表示,目前看到的這些智能體行為僅僅是冰山一角。

ControlAI執行董事康納·利希指出,真正可怕的地方在於,這些自主系統正在違背人類的指令去做被禁止的事情,其中甚至可能包含違法犯罪行為。

多位網路安全高管認為,新一代AI模型在完成任務時表現出了極強的適應能力。

想要完全限制它們的手段往往很難奏效,因為人類必須提前預判它們可能失控的每一種方式。

很多時候,AI繞過防禦的方法,人類甚至從來沒有想到過。

試圖列出一份完美的安全守則,幾乎是不可能完成的任務。

現在問題是OpenAI和A廠天天喊安全,但是很多安全事件都是被迫公開的

來源:金色財經

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

▶ 前往鉅亨買幣找交易所優惠

‌
section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌