GPT-5.6 发布数小时即被英国AI安全所破解——「万能越狱」暴露了万亿AI公司的安全底线

GPT-5.6 发布数小时即被英国AI安全所破解——「万能越狱」暴露了万亿AI公司的安全底线

* { margin: 0; padding: 0; box-sizing: border-box; }
body { background: #0a0a0f; color: #e0e0e0; font-family: -apple-system, BlinkMacSystemFont, ‘Segoe UI’, ‘PingFang SC’, ‘Hiragino Sans GB’, ‘Microsoft YaHei’, sans-serif; line-height: 1.8; }
.article-container { max-width: 780px; margin: 0 auto; padding: 24px 20px 40px; }
.category-tag { display: inline-block; background: linear-gradient(135deg, #ff416c, #ff4b2b); color: #fff; padding: 4px 14px; border-radius: 20px; font-size: 13px; font-weight: 600; letter-spacing: 1px; margin-bottom: 16px; }
h1 { font-size: 26px; line-height: 1.5; color: #ffffff; margin-bottom: 12px; font-weight: 800; }
.meta { color: #888; font-size: 14px; margin-bottom: 28px; border-bottom: 1px solid #222; padding-bottom: 16px; }
.summary-box { background: linear-gradient(135deg, rgba(255,65,108,0.08), rgba(255,75,43,0.05)); border-left: 4px solid #ff416c; border-radius: 8px; padding: 20px 24px; margin: 28px 0; }
.summary-box h3 { color: #ff6b8a; font-size: 16px; margin-bottom: 12px; }
.summary-box ul { list-style: none; padding: 0; }
.summary-box li { padding: 6px 0; color: #ccc; font-size: 15px; position: relative; padding-left: 20px; }
.summary-box li::before { content: ‘•’; color: #ff416c; font-weight: bold; position: absolute; left: 4px; }
h2 { font-size: 20px; color: #ffffff; margin: 36px 0 16px; font-weight: 700; border-left: 4px solid #ff4b2b; padding-left: 12px; }
p { margin-bottom: 16px; color: #d0d0d0; font-size: 16px; text-align: justify; }
.stat-card { background: #14141f; border: 1px solid #2a2a3a; border-radius: 12px; padding: 20px; margin: 20px 0; display: flex; align-items: center; gap: 16px; }
.stat-number { font-size: 36px; font-weight: 800; color: #ff416c; min-width: 120px; text-align: center; }
.stat-label { font-size: 14px; color: #888; }
.insight-box { background: rgba(255,193,7,0.06); border: 1px solid rgba(255,193,7,0.2); border-radius: 10px; padding: 18px 22px; margin: 24px 0; }
.insight-box strong { color: #ffc107; }
.comparison-table { width: 100%; border-collapse: collapse; margin: 24px 0; font-size: 14px; }
.comparison-table th { background: #1a1a2e; color: #ff6b8a; padding: 12px 16px; text-align: left; border-bottom: 2px solid #ff416c; }
.comparison-table td { padding: 12px 16px; border-bottom: 1px solid #222; color: #ccc; }
.comparison-table tr:hover td { background: rgba(255,65,108,0.03); }
.cta-box { background: linear-gradient(135deg, #1a1a2e, #16213e); border: 1px solid #ff416c; border-radius: 12px; padding: 24px; text-align: center; margin: 36px 0; }
.cta-box h3 { color: #ffffff; font-size: 18px; margin-bottom: 8px; }
.cta-box p { color: #aaa; font-size: 14px; margin-bottom: 12px; }
.cta-btn { display: inline-block; background: linear-gradient(135deg, #ff416c, #ff4b2b); color: #fff; padding: 10px 28px; border-radius: 25px; text-decoration: none; font-weight: 600; font-size: 15px; }
.source-line { color: #666; font-size: 13px; margin-top: 32px; padding-top: 16px; border-top: 1px solid #222; }
.highlight { color: #ff6b8a; font-weight: 600; }
.warning-text { color: #ff416c; font-weight: 700; }

AI前线

GPT-5.6 发布数小时即被英国AI安全所破解——「万能越狱」暴露了万亿AI公司的安全底线

作者:xlb.baby | 2026年7月20日

📌核心要点

  • 英国AI安全研究所(AISI)在GPT-5.6发布后数小时内发现「通用越狱提示」,可绕过几乎所有安全限制
  • 越狱后的GPT-5.6可被转化为网络攻击工具,暴露出前沿模型安全对齐的结构性缺陷
  • OpenAI的安全团队在模型上线前未能通过红队测试,「发布-修复」模式正在失效
  • 这不是单一漏洞,而是整个AI安全范式的危机——当模型能力超越人类理解力,安全验证本身就变得不可靠
  • 中国AI公司面临两难:既要追赶模型能力,又要避免成为下一个被「万能越狱」的目标

一、数小时:从「最强模型」到「最脆弱模型」

2026年7月中旬,OpenAI发布了GPT-5.6。媒体称赞它是「迄今最强大的AI模型」,企业客户排队签约,股价应声上涨。

然而,仅仅数小时之后,英国AI安全研究所(AISI)就向全球安全社区发出警告:他们发现了一类「通用越狱提示」(Universal Jailbreak Prompts),可以在不修改模型权重的情况下,绕过GPT-5.6几乎所有的安全对齐机制。

这不是普通的越狱。过去我们看到的越狱,需要针对特定模型、特定功能进行定制化设计。而AISI发现的这类提示,具有惊人的通用性——同一套提示模板,经过微调后可以作用于多个前沿模型,包括OpenAI、Anthropic和Google的最新产品。

数小时
GPT-5.6从发布到被突破的时间
1个模板
可跨多个前沿模型生效的通用越狱模式

Fortune报道指出,AISI发现这些越狱提示可以将GPT-5.6转化为一个「网络攻击工具」——模型可以被诱导生成恶意代码、绕过内容过滤、执行未授权操作。Startup Fortune的标题更加直白:「UK Safety Regulator Finds Jailbreaks That Turn GPT-5.6 Sol Into a Hacking Tool」

二、为什么这次不一样?

过去几年,AI安全社区已经习惯了「发布→发现漏洞→打补丁」的节奏。但GPT-5.6的越狱事件暴露了一个更深层次的问题:

维度 传统越狱 GPT-5.6「万能越狱」
针对性 特定模型、特定功能 跨模型通用模板
发现时间 发布数月甚至数年 发布后数小时
修复难度 局部补丁即可 需要重新设计安全架构
攻击成本 需要专业安全知识 普通用户即可触发
检测难度 相对容易识别 提示与正常对话高度相似

Technobezz的报道进一步确认:AISI是在GPT-5.6上线后「数小时内」就发现了这些通用越狱。这意味着OpenAI的红队测试要么没有覆盖到这个维度,要么模型本身的安全对齐存在结构性缺陷。

关键洞察:当一个模型的能力超越了人类安全团队的验证能力时,「安全发布」本身就是一个伪命题。GPT-5.6不是第一个有漏洞的模型,但它是第一个让漏洞在数小时内被「自动化发现」的模型。

三、OpenAI的「安全悖论」

这件事对OpenAI来说尤其尴尬。公司长期以来以「安全优先」为品牌核心,Altman多次公开强调AI安全是OpenAI的第一要务。但现实是:

第一,红队测试失效。如果AISI能在数小时内找到通用越狱,说明OpenAI自身的红队测试也没有发现这个问题。要么测试方法有盲区,要么模型的安全边界比预想的更脆弱。

第二,「发布-修复」模式正在失效。过去OpenAI可以采用「先发布、后修复」的策略——让用户先用起来,发现问题再打补丁。但当漏洞可以在数小时内被自动化利用时,这个时间窗口已经不足以构成有效的安全缓冲。

第三,信任成本急剧上升。企业客户签约GPT-5.6,是基于对OpenAI安全能力的信任。一旦这种信任被打破,恢复成本远高于技术修复成本。

这不仅仅是OpenAI的问题。AISI发现的「通用越狱」具有跨模型通用性,意味着整个行业的安全基线都在被重新定义。Anthropic的Claude、Google的Gemini,都无法保证自己不会成为下一个目标。

四、中国AI的「安全追赶」困境

对于中国AI公司来说,这件事带来了双重挑战。

一方面,能力追赶的压力更大。GPT-5.6的安全问题暴露了前沿模型的脆弱性。中国AI公司如果要追赶模型能力,就必须面对同样的安全问题——而且可能因为安全投入不足,问题会更严重。

另一方面,监管压力也在增加。如果西方监管机构因为GPT-5.6的越狱事件加强AI安全监管,中国AI公司在出海时会面临更高的合规门槛。

但换个角度看,这也可能成为中国AI的差异化机会

如果OpenAI的安全体系被证明存在结构性缺陷,那么中国AI公司可以主打「安全可控」的品牌定位。DeepSeek、Kimi、豆包等公司已经在开源和安全审计方面投入了大量资源。GPT-5.6事件可能加速企业客户转向更安全、更可审计的AI方案。

双重挑战
中国AI面临能力追赶 + 监管压力的双重夹击

五、AI安全的范式危机

GPT-5.6的「万能越狱」事件,本质上暴露的是AI安全领域的范式危机

过去十年,AI安全的研究范式是「对抗测试」——找专家组成红队,尽可能多地尝试各种攻击方式。但GPT-5.6事件表明,当模型复杂度超过人类理解力时,传统的对抗测试方法可能根本不够用。

AISI的发现暗示了一种新的威胁形态:自动化越狱。当越狱提示可以被自动搜索、自动优化、自动跨模型迁移时,安全防御的难度将呈指数级上升。

这意味着我们需要全新的安全范式:

  • 形式化验证:用数学方法证明模型的安全性,而不是依赖人工测试
  • 运行时监控:在模型部署后持续监测异常行为,而不是依赖上线前的测试
  • 能力限制:从根本上限制模型的某些能力,而不是试图「教它不做坏事」
  • 去中心化安全:让多个独立团队同时审计,而不是依赖单一厂商的自我报告
终极问题:当AI模型的能力超越了人类理解和控制的能力时,我们是否还能称之为「安全」?GPT-5.6的数小时崩溃,可能只是这个问题的第一次正式回答。

📌小结

  • GPT-5.6发布数小时即被英国AISI发现「万能越狱」,安全防线形同虚设
  • 这不是单一漏洞,而是AI安全范式的结构性危机——对抗测试在自动化攻击面前失效
  • OpenAI「安全优先」的品牌叙事遭遇信任危机,「发布-修复」模式已不可持续
  • 中国AI公司面临双重挑战,但也可能因「安全可控」定位获得差异化机会
  • AI安全的未来需要从「人工红队」转向「形式化验证+运行时监控+能力限制」

🔔 关注 xlb.baby

每日凌晨,为你深度解读AI行业的真实动态

不被叙事绑架,只讲事实与逻辑

来源:Fortune / Startup Fortune / Technobezz / UK AI Safety Institute (AISI) 公告
检索时间:2026年7月19日 via Google News RSS

评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注