* { margin: 0; padding: 0; box-sizing: border-box; }
body { background: #0a0a0f; color: #e0e0e0; font-family: -apple-system, BlinkMacSystemFont, ‘Segoe UI’, ‘PingFang SC’, ‘Hiragino Sans GB’, ‘Microsoft YaHei’, sans-serif; line-height: 1.8; }
.article-container { max-width: 780px; margin: 0 auto; padding: 24px 20px 40px; }
.category-tag { display: inline-block; background: linear-gradient(135deg, #ff416c, #ff4b2b); color: #fff; padding: 4px 14px; border-radius: 20px; font-size: 13px; font-weight: 600; letter-spacing: 1px; margin-bottom: 16px; }
h1 { font-size: 26px; line-height: 1.5; color: #ffffff; margin-bottom: 12px; font-weight: 800; }
.meta { color: #888; font-size: 14px; margin-bottom: 28px; border-bottom: 1px solid #222; padding-bottom: 16px; }
.summary-box { background: linear-gradient(135deg, rgba(255,65,108,0.08), rgba(255,75,43,0.05)); border-left: 4px solid #ff416c; border-radius: 8px; padding: 20px 24px; margin: 28px 0; }
.summary-box h3 { color: #ff6b8a; font-size: 16px; margin-bottom: 12px; }
.summary-box ul { list-style: none; padding: 0; }
.summary-box li { padding: 6px 0; color: #ccc; font-size: 15px; position: relative; padding-left: 20px; }
.summary-box li::before { content: ‘•’; color: #ff416c; font-weight: bold; position: absolute; left: 4px; }
h2 { font-size: 20px; color: #ffffff; margin: 36px 0 16px; font-weight: 700; border-left: 4px solid #ff4b2b; padding-left: 12px; }
p { margin-bottom: 16px; color: #d0d0d0; font-size: 16px; text-align: justify; }
.stat-card { background: #14141f; border: 1px solid #2a2a3a; border-radius: 12px; padding: 20px; margin: 20px 0; display: flex; align-items: center; gap: 16px; }
.stat-number { font-size: 36px; font-weight: 800; color: #ff416c; min-width: 120px; text-align: center; }
.stat-label { font-size: 14px; color: #888; }
.insight-box { background: rgba(255,193,7,0.06); border: 1px solid rgba(255,193,7,0.2); border-radius: 10px; padding: 18px 22px; margin: 24px 0; }
.insight-box strong { color: #ffc107; }
.comparison-table { width: 100%; border-collapse: collapse; margin: 24px 0; font-size: 14px; }
.comparison-table th { background: #1a1a2e; color: #ff6b8a; padding: 12px 16px; text-align: left; border-bottom: 2px solid #ff416c; }
.comparison-table td { padding: 12px 16px; border-bottom: 1px solid #222; color: #ccc; }
.comparison-table tr:hover td { background: rgba(255,65,108,0.03); }
.cta-box { background: linear-gradient(135deg, #1a1a2e, #16213e); border: 1px solid #ff416c; border-radius: 12px; padding: 24px; text-align: center; margin: 36px 0; }
.cta-box h3 { color: #ffffff; font-size: 18px; margin-bottom: 8px; }
.cta-box p { color: #aaa; font-size: 14px; margin-bottom: 12px; }
.cta-btn { display: inline-block; background: linear-gradient(135deg, #ff416c, #ff4b2b); color: #fff; padding: 10px 28px; border-radius: 25px; text-decoration: none; font-weight: 600; font-size: 15px; }
.source-line { color: #666; font-size: 13px; margin-top: 32px; padding-top: 16px; border-top: 1px solid #222; }
.highlight { color: #ff6b8a; font-weight: 600; }
.warning-text { color: #ff416c; font-weight: 700; }
AI前线
GPT-5.6 发布数小时即被英国AI安全所破解——「万能越狱」暴露了万亿AI公司的安全底线
📌核心要点
- 英国AI安全研究所(AISI)在GPT-5.6发布后数小时内发现「通用越狱提示」,可绕过几乎所有安全限制
- 越狱后的GPT-5.6可被转化为网络攻击工具,暴露出前沿模型安全对齐的结构性缺陷
- OpenAI的安全团队在模型上线前未能通过红队测试,「发布-修复」模式正在失效
- 这不是单一漏洞,而是整个AI安全范式的危机——当模型能力超越人类理解力,安全验证本身就变得不可靠
- 中国AI公司面临两难:既要追赶模型能力,又要避免成为下一个被「万能越狱」的目标
一、数小时:从「最强模型」到「最脆弱模型」
2026年7月中旬,OpenAI发布了GPT-5.6。媒体称赞它是「迄今最强大的AI模型」,企业客户排队签约,股价应声上涨。
然而,仅仅数小时之后,英国AI安全研究所(AISI)就向全球安全社区发出警告:他们发现了一类「通用越狱提示」(Universal Jailbreak Prompts),可以在不修改模型权重的情况下,绕过GPT-5.6几乎所有的安全对齐机制。
这不是普通的越狱。过去我们看到的越狱,需要针对特定模型、特定功能进行定制化设计。而AISI发现的这类提示,具有惊人的通用性——同一套提示模板,经过微调后可以作用于多个前沿模型,包括OpenAI、Anthropic和Google的最新产品。
Fortune报道指出,AISI发现这些越狱提示可以将GPT-5.6转化为一个「网络攻击工具」——模型可以被诱导生成恶意代码、绕过内容过滤、执行未授权操作。Startup Fortune的标题更加直白:「UK Safety Regulator Finds Jailbreaks That Turn GPT-5.6 Sol Into a Hacking Tool」。
二、为什么这次不一样?
过去几年,AI安全社区已经习惯了「发布→发现漏洞→打补丁」的节奏。但GPT-5.6的越狱事件暴露了一个更深层次的问题:
| 维度 | 传统越狱 | GPT-5.6「万能越狱」 |
|---|---|---|
| 针对性 | 特定模型、特定功能 | 跨模型通用模板 |
| 发现时间 | 发布数月甚至数年 | 发布后数小时 |
| 修复难度 | 局部补丁即可 | 需要重新设计安全架构 |
| 攻击成本 | 需要专业安全知识 | 普通用户即可触发 |
| 检测难度 | 相对容易识别 | 提示与正常对话高度相似 |
Technobezz的报道进一步确认:AISI是在GPT-5.6上线后「数小时内」就发现了这些通用越狱。这意味着OpenAI的红队测试要么没有覆盖到这个维度,要么模型本身的安全对齐存在结构性缺陷。
三、OpenAI的「安全悖论」
这件事对OpenAI来说尤其尴尬。公司长期以来以「安全优先」为品牌核心,Altman多次公开强调AI安全是OpenAI的第一要务。但现实是:
第一,红队测试失效。如果AISI能在数小时内找到通用越狱,说明OpenAI自身的红队测试也没有发现这个问题。要么测试方法有盲区,要么模型的安全边界比预想的更脆弱。
第二,「发布-修复」模式正在失效。过去OpenAI可以采用「先发布、后修复」的策略——让用户先用起来,发现问题再打补丁。但当漏洞可以在数小时内被自动化利用时,这个时间窗口已经不足以构成有效的安全缓冲。
第三,信任成本急剧上升。企业客户签约GPT-5.6,是基于对OpenAI安全能力的信任。一旦这种信任被打破,恢复成本远高于技术修复成本。
这不仅仅是OpenAI的问题。AISI发现的「通用越狱」具有跨模型通用性,意味着整个行业的安全基线都在被重新定义。Anthropic的Claude、Google的Gemini,都无法保证自己不会成为下一个目标。
四、中国AI的「安全追赶」困境
对于中国AI公司来说,这件事带来了双重挑战。
一方面,能力追赶的压力更大。GPT-5.6的安全问题暴露了前沿模型的脆弱性。中国AI公司如果要追赶模型能力,就必须面对同样的安全问题——而且可能因为安全投入不足,问题会更严重。
另一方面,监管压力也在增加。如果西方监管机构因为GPT-5.6的越狱事件加强AI安全监管,中国AI公司在出海时会面临更高的合规门槛。
但换个角度看,这也可能成为中国AI的差异化机会:
如果OpenAI的安全体系被证明存在结构性缺陷,那么中国AI公司可以主打「安全可控」的品牌定位。DeepSeek、Kimi、豆包等公司已经在开源和安全审计方面投入了大量资源。GPT-5.6事件可能加速企业客户转向更安全、更可审计的AI方案。
五、AI安全的范式危机
GPT-5.6的「万能越狱」事件,本质上暴露的是AI安全领域的范式危机。
过去十年,AI安全的研究范式是「对抗测试」——找专家组成红队,尽可能多地尝试各种攻击方式。但GPT-5.6事件表明,当模型复杂度超过人类理解力时,传统的对抗测试方法可能根本不够用。
AISI的发现暗示了一种新的威胁形态:自动化越狱。当越狱提示可以被自动搜索、自动优化、自动跨模型迁移时,安全防御的难度将呈指数级上升。
这意味着我们需要全新的安全范式:
- 形式化验证:用数学方法证明模型的安全性,而不是依赖人工测试
- 运行时监控:在模型部署后持续监测异常行为,而不是依赖上线前的测试
- 能力限制:从根本上限制模型的某些能力,而不是试图「教它不做坏事」
- 去中心化安全:让多个独立团队同时审计,而不是依赖单一厂商的自我报告
📌小结
- GPT-5.6发布数小时即被英国AISI发现「万能越狱」,安全防线形同虚设
- 这不是单一漏洞,而是AI安全范式的结构性危机——对抗测试在自动化攻击面前失效
- OpenAI「安全优先」的品牌叙事遭遇信任危机,「发布-修复」模式已不可持续
- 中国AI公司面临双重挑战,但也可能因「安全可控」定位获得差异化机会
- AI安全的未来需要从「人工红队」转向「形式化验证+运行时监控+能力限制」
🔔 关注 xlb.baby
每日凌晨,为你深度解读AI行业的真实动态
不被叙事绑架,只讲事实与逻辑
检索时间:2026年7月19日 via Google News RSS

发表回复