安全倫理
被破解的 Frontier 模型仍能保持性能
Jailbroken Frontier Models Retain Their Capabilities

arXiv cs.LG · 2026-05-04
摘要
研究人員發現越來越複雜的 jailbreak 攻擊不再顯著降低大型語言模型的性能。在對 Claude Haiku 4.5 到 Opus 4.6 的測試中,性能衰減與模型能力成反比——能力越強的模型受影響越小,Opus 4.6 在最強 jailbreak 下僅損失 7.7% 性能。這表明高級模型已能在被破解後仍維持核心能力,對 AI 安全防護的有效性提出重要問題。
隨著語言模型防護措施日益強健,攻擊者被迫開發越來越複雜的越獄(jailbreak)攻擊。過往研究指出,這種複雜性會對目標模型造成「越獄稅」,導致任務性能下降。然而,新研究顯示,這種性能稅與模型能力成反比,且最先進的越獄攻擊實際上不會降低模型能力。
研究人員在 Claude 模型系列上評估了 28 種越獄攻擊,涵蓋從 Haiku 4.5 到 Opus 4.6 的五個基準測試。結果顯示,Haiku 4.5 在被越獄後,基準測試性能平均損失 33.1%;而 Opus 4.6 在最大思考努力下,僅損失 7.7% 的性能。這表明能力越強的模型,受越獄攻擊的影響越小。
此外,研究觀察到在所有模型中,需要推理的任務比知識回憶任務顯示出顯著的更多性能下降。目前針對部署分類器最強的 Boundary Point Jailbreaking 攻擊,在安全模型上實現了近乎完美的分類器逃避,同時性能下降接近零。
基於上述發現,研究建議前線模型的安全案例不應依賴越獄會導致有意義的能力下降這一假設。
●開發者:需要重新評估模型安全防護的實際邊界與局限性
●投資人:高端模型仍具有強韌性,但安全防護成本持續上升值得關注
●一般用戶:高端模型即使被惡意利用也能保持可靠性
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Claude AI 怎麼用?Anthropic Claude 繁中完整教學 2026
Claude AI 怎麼用?本文用繁體中文教你 Anthropic Claude 的申請步驟、免費版限制、與 ChatGPT 差異,以及最適合用 Claude 的場景——尤其是長文件分析和程式開發。
閱讀指南 →
Claude Code 教學:如何在 VS Code 中設定 Hooks 與 Subagents 實戰
深入解析 claude code vscode extension 實戰教學。掌握 Hooks 與 Subagents 設定技巧,從環境配置到進階應用,提升開發效率。
閱讀指南 →
Claude 與 Claude Code 比較:2026 年對話模型與編碼代理實戰應用
深入解析 2026 年 claude vs claude code 的差異。涵蓋 claude code 教學、編碼功能實戰與代理設定,助您選擇最適合的 AI 開發工具。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。