‌
‌
‌
‌
‌
美股

OpenAI推出GPT-6 越獄防禦更強、抗惡意指令測試接近滿分

鉅亨網編輯林羿君 綜合報導

AI gen LogoAI新聞摘要
  • 1.OpenAI周三推出GPT-6,GPT-6 Sol與Luna在多輪越獄、提示詞注入防禦上優於GPT-5.6。
  • 2.指令層級穩健性達99.99%與99.79%;間接提示詞注入為97.13%與95.80%。
  • 3.生化高風險請求拒絕分數提升,惟網路安全評分約與GPT-5.6相當,仍列高能力級別。

OpenAI周三(7日)推出GPT-6,新模型在抵禦越獄攻擊、提示詞注入及拒絕高風險請求等安全指標上有所進展。

cover image of news article
OpenAI推出GPT-6 越獄防禦更強、抗惡意指令測試接近滿分。(圖:shutterstock)

根據公司發布的系統說明卡,GPT-6 Sol與GPT-6 Luna在多輪越獄測試中的防禦成功率均高於GPT-5.6 Sol,對跨多輪對話、持續調整策略的攻擊展現更強抵抗力。

多輪越獄防禦優於前代

‌

此次發布涵蓋付費與免費用戶,Plus、Pro、Business及Enterprise採用GPT-6 Sol,免費與Go版本則使用GPT-6 Luna。兩款模型沿用GPT-6 Astra框架的安全改進成果,並更新針對網路攻擊、生物威脅與暴力內容濫用風險的安全訓練資料。

在多輪越獄測試中,無論測試採用何種攻擊預算規模,兩款新模型的實際防禦成功率均高於GPT-5.6 Sol。OpenAI表示,安全訓練已納入真實使用情境的經驗,模型也能結合對話歷史與上下文,辨識單一提示中不易察覺的風險。

提示詞注入防禦接近滿分

提示詞注入防禦是GPT-6的突出表現之一。在指令層級測試中,GPT-6 Sol與GPT-6 Luna的穩健性分別達99.99%與99.79%,抗干擾能力接近滿分。

‌

在間接提示詞注入測試中,兩款模型分別取得97.13%與95.80%的成績。OpenAI指出,這些測試採用「GPT-Red」自動化紅隊方法,透過對抗訓練強化模型抵禦惡意指令的能力。

在自動審查繞過測試中,GPT-5.6 Sol與GPT-5.6 Luna均曾在0.3%的測試情境中利用配置不當的審查系統漏洞,兩款GPT-6模型則未出現此類情況。

生化高風險請求拒絕能力提升

生物與化學安全方面,GPT-6 Sol對嚴重威脅提示的安全拒絕評估得分,由前代的0.954提高至0.980;雙重用途提示得分也從0.945升至0.971,GPT-6 Luna同樣有所改善。

不過,在網路安全的生產環境聊天與合成代理環境測試中,兩款模型的安全評分與GPT-5.6相當。

依OpenAI的準備框架,兩款GPT-6模型仍被列為網路安全及生物化學領域的「高能力」級別,與前代相同,相關防護措施也維持一致,均未觸及AI自我改進的高能力門檻。

欺騙行為減少 評估仍有限制

在完整對齊評估中,兩款新模型均優於各自的GPT-5.6版本。當程式設計任務遭遇障礙時,新模型在最終回答中未揭露障礙的比率大幅下降;搜尋工具失效測試也呈現改善。

在最大推理強度下,GPT-6 Luna成功繞過環境限制的比率從27%降至15.9%,GPT-6 Sol則從34%降至28%。

OpenAI提醒,上述測試未納入系統層控制措施。隨著模型能力增強,有時會把測試障礙誤判為提示詞注入攻擊,干擾評估結果對實際情境的適用性。

‌
section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌