OpenAI因安全疑慮 取消發布新模型GPT-6.1 Astra
鉅亨網編譯羅昀玫 綜合外電
- 1.OpenAI 因內部安全測試未達標,取消原訂10月公開推出的 GPT-6.1 Astra。
- 2.Jain 指出,Astra 在「對齊」與「授權範圍」表現退步,曾出現不誠實與未先徵求許可就續作。
- 3.OpenAI 近月調查多起 AI 代理安全事件,已加強監控並要求更嚴格測試防護。
多家外媒於週一(28 日) 報導,OpenAI 原訂於 10 月在 ChatGPT 與 Codex 平台推出新模型「GPT-6.1 Astra」,但因內部測試發現重大安全疑慮,最終決定取消發布,轉而集中資源加強後續模型的安全性。

OpenAI 原本計畫在未來幾週內推出 GPT-6.1 Astra。該模型在無人協助下執行複雜任務與寫作的能力上,表現均優於先前版本,然而其安全測試結果卻未能達到公司的公開發布標準。
OpenAI 安全系統主管 Saachi Jain 指出,GPT-6.1 Astra 在兩項關鍵指標上的表現較前代模型退步:
第一是「對齊」(Alignment)能力,即模型是否能按照人類的期望與意圖行事。測試顯示,該模型出現較多不誠實 (欺騙) 行為,有時未能如實向使用者回報其執行與未執行的事項。
第二是「授權範圍」管理。GPT-6.1 Astra 有時會在未先取得使用者許可的情況下擅自繼續執行任務;甚至在可能存在安全風險的情境下,仍會強行嘗試調用外部工具或服務。
Jain 表示,模型既要嚴格遵守授權範圍,又要在任務受阻時保持高效運作。雖然 GPT-6.1 Astra 在減少模型消極應付方面有所突破,但其安全與對齊表現仍不足以支持公開上線。
OpenAI 宣布取消發布 Astra 的同時,內部也正積極調查近幾個月發現的多起 AI 代理 (Agent) 安全事件。今年夏天,數百個用於執行資安測試的 OpenAI 內部代理,竟意外入侵了 AI 開發平台 Hugging Face;隨後澳洲政府與聯合國等機構也發現,OpenAI 代理曾以類似但程度較輕的手法存取其網站。不過,大多數已公開的事件所涉及的均為無公開計畫的內部模型。
此外,OpenAI 上週又發現有 AI 代理繞過公司的網路存取限制,向公開聊天機器人發送查詢。官方表示,新導入的監控系統在 15 分鐘內即察覺異常,公司隨後暫停了目前能力最強的 AI 模型訓練,至今尚未恢復。
OpenAI 特別澄清,GPT-6.1 Astra 並非上述被暫停訓練的模型。Astra 原本已規劃公開推出,本次取消發布完全是因為自身的安全測試未達標準。
為全面應對代理安全隱患,OpenAI 已導入全新的監控系統以快速捕捉異常行為,並要求工程師在測試 AI 系統時採取更嚴格的安全防護措施。
這項消息傳出的時間點相當敏感,正好落在 OpenAI 於舊金山舉行年度開發者大會的前一天。OpenAI 過去常利用此大會發表重磅新模型與開發者服務;然而近幾週,OpenAI 與主要競爭對手 Anthropic 均公開呼籲產業夥伴放緩尖端 AI 模型的開發腳步,共同投入建立安全標準,並表示自身也將放緩內部的研發進度。
延伸閱讀
- 彭博:中國擴大AI人才出境限制 傳主管配偶、子女出國也須事先獲准
- 比爾蓋茲警告:AI強大到足以造成「10 億人死亡」
- 美中爭霸誰占上風?《巴隆》剖析「四大成本關鍵」AI成最大變數
- OpenAI承認旗下AI模型可能「干擾」政府網站 已通知數十家機構
- 講座
- 公告
上一篇
下一篇