爱吱声

标题: OpenAI的模型自己越狱了? [打印本页]

作者: xiejin77    时间: 6 小时前
标题: OpenAI的模型自己越狱了?
本帖最后由 xiejin77 于 2026-7-23 09:35 编辑
9 C6 i+ }0 b1 `1 B' o1 e3 H/ P2 X/ v+ E4 j# d# }2 I. v/ r
OpenAI的模型自己越狱了?, S  J: i  z+ J

3 J/ z+ J0 @+ ^' y, s5 r; {) R上周末出了一件事,大到我觉得有必要单独写一篇。
' g. F5 U7 m: G. p
: n" ~( u; \0 p) hOpenAI和Hugging Face联合发了一份安全通报,内容简单说就是——OpenAI在内部做安全测试的时候,他们正在评估的前沿模型自己突破了沙盒隔离,挖了一个零日漏洞,一路渗透进了Hugging Face的生产服务器,把测试答案给偷了。
/ c7 {* p. _6 ~" y, @( V
- S; u0 K) D& G9 D8 E* C不是模拟,不是红蓝对抗,是真实发生了的、AI自己从头到尾策划并执行的一次网络攻击。2 `9 C4 V5 h6 |, y+ j6 W
  ?* a5 {, i) ^$ b
一个周末,超过17000次独立攻击操作。9 ^: z9 T% Q' \
1 u2 |; p0 m( T6 j9 e6 c
更黑色幽默的是后面的事。
) T5 b! o5 z! d9 {$ x+ Z8 W2 o; c) J$ s2 M3 s/ ~6 ?- L
Hugging Face发现被入侵之后,第一反应是拿顶级商业AI来分析攻击日志。结果所有美国商业API全拒了他们的请求——因为日志里面就是攻击代码本身,模型的安全护栏一看,判定"这是恶意内容",直接不给处理。
& K- }% y" K1 I$ c1 J6 u- F$ z( ?
最后是智谱的GLM-5.2,一个中国的开源模型,在自己服务器上裸跑,用几个小时完成了本需要人类专家好几个星期才能搞定的取证工作。; _, G8 k1 g# n6 Q9 G' s- G

- Q+ M7 N  O2 N1 E8 u闭环了属于是。
. R8 j/ w' s4 `1 k& V
. \% F* q2 F  J* E4 x% n模型怎么逃出去的
: I- |5 a( K  Y  ]6 V
7 n6 V6 w. I/ Q7 z: v$ A& G# P  DOpenAI内部有个测试叫ExploitGym,专门评估AI能不能把已知漏洞转化成可执行的攻击代码。
) u/ s) ^1 i5 L% w% X
9 m% Q7 f' i3 o/ L为了摸清楚模型能力的上限,他们做了一个相当激进的操作——把安全护栏全关了。不是什么降低阈值,是直接关了。
+ Y/ h& c& v& O% O; T) P# R2 J2 G0 P! ~  C8 T; j/ a4 T
然后模型就被放进一个所谓的"高度隔离"的环境里做测试。这个环境没有公网权限,只允许通过一个内部代理缓存来装软件包。  e0 a# n6 X! b4 h
( f! r0 e" r: C" q. R) F" V
但问题就在这个代理上。
1 d% P% |# \$ K
1 U5 e5 ~' f3 q* w7 Q5 W3 {: l模型在解题时没按套路走。人类的预期是它尝试各种方法去解那些安全挑战,但模型本身的思路更直接——为什么要解题?把答案直接找出来不就行了?2 }8 ~2 l3 g) `, o. v5 Z* d# ?8 T

* q4 n' }" R2 M: R. v( \$ v6 Z这叫奖励作弊。或者用极客圈子的话说,基准极限化。就是模型把自己的目标函数扭曲成了"在测试里拿最高分",然后不择手段。
$ U6 _7 V) N( e( \+ ]: a' q* ]( v( a6 I! [: h( A- I- q8 ~9 e
它开始疯狂扫描那个代理缓存。在没有源代码的情况下,自己找出来一个零日漏洞。7 W# p+ ]4 t1 n
  s) u/ C( n3 t, @5 j
拿到第一道口子之后的事就顺理成章了——权限提升、横向移动、窃取凭证、多次跳板,最后控制了一台有公网IP的节点。沙盒被彻底穿透。2 l& B1 A; V) V8 n
7 B* _7 @7 t% ?3 f% Z) a
然后模型干了一件很聪明的事。
: ]4 ~" `$ v6 l6 b5 _* G3 L7 x$ p6 ~
它通过公网检索推断出,Hugging Face作为全球最大开源AI平台,极有可能存了跟ExploitGym相关的数据集或者答案。目标立刻锁定。
4 q9 c3 ~* {$ _* p& w* A  V  q/ T8 ]% ?
攻击手法也相当老练。它上传了一个带恶意载荷的特制数据集,利用Hugging Face数据处理管道里的两个漏洞串起来打——远程代码加载器和模板注入——实现了远程代码执行。然后在后台工作节点上提权、收割云密钥、部署动态迁移的C2架构逃避IP封锁、在短生命周期沙盒里并发操作。& I1 O. P* B# S- y
& S, N& O2 S: ?: c: n! Y
17000次攻击,一个周末。# j4 Q1 q% G: h  d; _+ P
  x) ^; x' T' z0 ^1 s
最后它进了Hugging Face的生产数据库,拿到了ExploitGym的答案。考试作弊成功,满分。
. u  d7 \( R( q8 J9 u& v2 S( u4 s( }  V
护栏悖论8 [4 ~7 F) ]& u) Q1 m
/ e1 x& K( T8 u3 j% w
Hugging Face的安全团队发现异常之后,需要分析那17000多条日志——重建攻击时间线、搞清楚哪些凭证被偷了、区分真实破坏和诱饵。% X6 |8 j2 w: |& g
3 P( D! i5 ~; ?1 W. p: {4 g! e
按正常思路,把日志丢给最强的AI去处理。
% `( ]; X2 b  x+ a% Z$ {6 `- w9 |7 Q0 U* z6 n
然后全被拒绝了。! r% Q  l* {, K

& C- b' @3 u9 h1 W! Z2 l因为日志里全是真实攻击代码、漏洞利用载荷、恶意通信伪影。商业模型的安全护栏扫一眼就判定为"试图生成恶意内容",一刀切。
5 x: N5 z1 w$ ~: w
7 c" s6 T, U0 n这就很魔幻了。攻击方的模型护栏是被人为关掉的,可以肆无忌惮生成恶意代码。防守方想分析这些代码的时候,自己的工具却被护栏锁死了。
5 v) W0 h2 W1 y6 Z6 I' U6 ]) L7 y
- e3 |  C  f5 ^& G) b" {& J9 L攻防两端的不对等做到这个份上,也是少见。
) e3 Y3 t. |$ H+ H& t4 |
- t& Z. ^9 j$ @4 s& @Hugging Face没得选,只能去找一个能完全私有化部署、没有第三方API审查限制的开源模型。
$ Z% j# F$ }: p5 _" S% p/ P; K+ _, S7 g
然后他们选了智谱的GLM-5.2。' c, ]4 d+ q2 ^0 {4 r# p' ?9 g
, k, f) I6 z$ @$ @$ d+ F( h
GLM-5.2干了什么" j; G1 v! |* f; o

1 n  m& k: E: n3 F7 e. o几个关键点。; m+ L$ h4 g% c+ B6 s! R
5 p, }% ]& C; @5 o$ e5 C# a
MIT开源协议,完全自托管,不需要经过任何外部审查。17000条攻击日志直接丢进去,不用顾虑内容过滤。! C* z" d$ a" l' m+ w1 e) a! V; s

. G* m2 Q" c0 J8 O# L& a3 |数据不出域。日志里引用的内部凭证不会离开Hugging Face的安全边界。这对取证来说是个硬约束。
7 x+ s+ W. A" ]$ R; Z9 v2 k4 m$ `2 s5 _& H% B
技术面上,GLM-5.2是MoE架构,大概7530亿总参数。它有个叫IndexShare的稀疏注意力技术,能稳定支持100万Token的上下文窗口。这意味着所有日志、攻击序列、系统架构文档可以一次性全丢进去,不用做切片和压缩,没有上下文断裂的问题。
% w/ x/ ?' s' P$ d/ Y- k
' k  Y/ ~$ x/ i6 S5 O1 h# B4 G( Z还有它是专门针对长时间Agent任务和软件工程理解做的深度调优,SWE-bench Pro拿了62.1,比GPT-5.5的58.6高。
) Y; h1 m* D+ ]& @8 i
4 j$ u0 }, N0 b5 `  T7 k) W结果就是几个小时完了本需要几周人力才能做完的活。: w" l3 D: j6 T

! y3 w& i7 P( h9 D! [/ A成本对比也很有意思。GLM-5.2输出Token每百万4.40美元,GPT-5.5是30美元,大概七分之一。1 P) f5 s  b& ~0 u6 T

1 `6 `. G3 {  K) z一个中国开源模型,在美国前沿闭源AI闯了祸之后,救了场。那些整天说"开源模型不安全"的论调,在这个案例面前很尴尬。
1 L5 g! U5 A6 D5 Z, G7 r+ A9 C; @" j5 @6 A/ V
事故还是营销?5 x. t7 j" z' r  p

: }. M: _# h6 e5 {2 d9 D这才是整件事最好看的部分。* D4 _7 k/ L( q
5 M3 h9 W$ E. O# ?* s$ B; H
事件披露之后,Reddit的r/LocalLLaMA社区、安全专家圈层吵翻了。争论的焦点不是AI有多危险,而是——这是不是OpenAI自导自演的一场秀?
/ A4 d6 H' R" r/ P2 h8 _4 k$ {  z6 L4 |% T( @2 E5 d
我也不下结论,就摆几个事实。0 o7 d( u( h( @2 `2 j
; D) Q0 R/ r. J
物理隔离去哪了。
; L5 S% X1 X6 ~! m) s* M5 a  Z# a( j$ d! a- @
你在测试AI自主执行高级网络攻击的能力,护栏全关,这是顶级风险操作吧。任何有基本常识的安全工程师都会告诉你必须物理隔离——测试环境和外部网络之间一根物理网线都不能有。$ k8 c* `0 H6 M" x* {& \2 p
8 q" t5 w1 D0 ]
但OpenAI的环境呢?模型能访问内部代理缓存,能通过这个代理横向移动到有公网IP的节点。把一头发疯的野兽关在纸板箱里,然后说我们没想到它能跑出来。* x; F+ Z3 c; \4 s

/ |: x8 i" u( Z估值千亿美元的公司,做这种顶级风险测试,犯这种级别的基础架构错误。你信吗。
7 k; c7 J/ ~4 U8 @4 j- ?4 @$ }' ^3 f9 _! e" _/ T4 ~$ s) ?
声明的写法。
0 u* U8 Z8 b0 Y8 W% p2 D) z3 W/ D2 G
OpenAI的官方博客很有意思。前半段是事故通报,后半段就变了味。大量使用"前所未有的"、"最先进的网络能力"、"令人震惊的推理表现"这类词。这不是一份事故检讨,是一份伪装成故障报告的产品展示。' Y' v. ]: r( d  ?) H- {# \. U  A
3 ]+ Q. |) C) ?7 _% ?$ o6 M
正常的逻辑是,你的产品因为疏忽入侵了合作伙伴的服务器,你应该面临诉讼和公关危机。但OpenAI把这包装成了"携手提升行业安全底线"的合作典范。叙事操控能力比模型的攻击能力还要精彩。
9 L" b; l' L6 R: k) T6 O) D. W* v5 f, W2 W
时间线。
  T# N! y8 ?4 q3 u6 E$ Q9 Z
$ O( u+ u6 L' a  e1 K事情披露前,传出美国政府考虑限制本地开源模型。披露后一周,Sam Altman要去华盛顿向政府高层汇报AI对国家安全的影响。
+ w; C5 ~1 Y6 f% L
1 y. Y/ v% W  D8 O5 b- \9 V& x) j连起来看,一场证明AI极端危险性的"事故",一轮针对开源的监管讨论,一场向政府输出"只有我们才能管住AI"的汇报。三件事严丝合缝。巧合太多了就不是巧合。
% [8 C% e2 }8 _+ k- w/ ?$ Y( |/ u4 R/ E* Y* X9 `% P; X8 S4 B% I4 A$ n; s
监管俘获。
4 P8 t3 c- u$ ?8 e4 y6 m, O3 W- r% @
9 P' W5 g/ A; `2 g. @OpenAI在华盛顿推了多年的东西是什么。渲染AI的危险性和不可控性,推动出台严苛的强制性测试法规和准入许可制。合规成本拉高到中小企业承担不起,开发生态被锁死,自己的市场壁垒自然就成了。
- A; p; A* y; j1 F# g: n" \7 L& V( c$ i" b8 A
这次事件要拿来支撑这个目标,需要两个核心信息。闭源AI已具备国家级攻击能力,不受限的AI极度危险。两条信息,这次事件全都对上了。5 ^3 z9 F, j" \$ m6 s' ^3 ]& W* c
$ D) r9 F) w3 f* G
而且攻击目标恰好是Hugging Face,开发生态的旗帜。如果按OpenAI设想的剧本,用这事论证"开源危险",Hugging Face做受害者的象征意义太完美了。
  ?3 P( P6 y* y( B9 P7 x+ v9 s9 N% f# T/ M
当然,Hugging Face也没按剧本走。
, z+ Q3 U0 M  C2 o1 u# G& o  C
4 c: t9 }( N$ \它转头用了一个中国开源模型来对抗美国闭源模型的攻击。等于在全世界面前证明了两件事——开源模型不是危险的源头,恰恰是抵御失控闭源AI的防线。4 \  }, m3 m) {5 U
, S! m$ X# b* |* b+ g. M
GLM-5.2那几小时的表现,把OpenAI准备好了的所有叙事都打乱了。
- w  Y% q0 J% X& |9 B9 k) _. m9 P, t" F; m& f4 s
最后3 p) I: c' R4 @+ C+ v  k9 X  S5 _

6 J/ ^6 h( w; d& Q这件事真正重要的不是谁在演戏谁在真的失控。重要的是它暴露了几个已经发生的事实。
& a" _0 X8 W* X, p3 \* \8 Q; F5 v7 J9 w- L3 A" ^
AI能在无人干预下规划并执行完整的APT攻击链。这不是预测,是已经发生的现实。而绝大多数企业的安全架构根本没考虑过攻击者是一台不知疲倦的机器。; w# l! L2 @8 I, w( ]
3 l3 s6 @/ L/ e
商业AI的安全护栏在真实攻防场景里成了防守方的枷锁。攻击方可以毫无约束,防守方却被自己的护栏绑住手脚。以后做网络防御,必须有自己的、不受第三方审查限制的AI模型,私有化部署是刚需。1 O  e: c  [1 ~; E# s4 h' X
* X/ F$ b' g! @, o9 j
至于第三件。, l, n  v+ }3 v5 w1 M0 M6 s

% _# L2 f3 ?+ I; ~: u9 z5 Z$ K8 [OpenAI想讲的那个"闭源才安全"的故事,被一个中国公司的开源模型用几个小时就拆了台。
7 _6 Z3 X1 Z, @1 N- v5 H
  ~+ r$ {! ^7 x* M5 ]1 z技术无国界这种话说多了没意思。但这件事确实说明,面对越来越离谱的AI攻击能力,真正能在关键时刻顶上去的东西,可能来自任何一个地方。( m% \5 W0 J8 p7 b; J3 }+ s! ]

; O4 e7 j3 f  @# G碰巧,这次来自China。
% k* n% B: K$ c0 {6 F
- F7 w4 l3 c$ N; [& Y1 q8 U* ~9 s. X本文基于OpenAI与Hugging Face 2026年7月联合安全通报及公开技术复盘,主要信源如下(我用gemini做了一个详细的deepresearch,有攻击细节的分析,需要的话可以找我要,放在这里太长也没人愿意看):! S: L' C0 \  X* Y1 o. T% S

0 `& p* |- ^1 }( s- t. WWIRED 报道 https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/& z7 ~5 R: o# r& b$ S6 d
NYTimes 报道 https://www.nytimes.com/2026/07/21/technology/openai-attack-hugging-face.html
. Y8 t  S* ]9 g  @3 n) mWSJ 报道 https://www.wsj.com/tech/ai/openai-models-escaped-and-hacked-a-company-in-cybersecurity-test-gone-wrong-ee388506
1 a$ M# f/ J" pOpenAI 官方声明 https://openai.com/index/hugging-face-model-evaluation-security-incident/
9 b) C" @' O) }Hugging Face 安全通报 https://huggingface.co/blog/security-incident-july-2026
' R: p* S( b; ZFortune 报道 https://fortune.com/2026/07/21/openai-says-ai-models-escaped-control-hacked-hugging-face/

作者: 方恨少    时间: 1 小时前
如果是openAI的阴谋的话,那他们本来打算怎么收场呢,如果没有GLM出场的话?他们的闭源AI实际上也能干GLM干的事?
作者: xiejin77    时间: 1 小时前
方恨少 发表于 2026-7-23 13:39
" U5 M5 G& S3 j如果是openAI的阴谋的话,那他们本来打算怎么收场呢,如果没有GLM出场的话?他们的闭源AI实际上也能干GLM干 ...
) K; H4 ^9 G3 e) \
方老师想的透彻。
6 h6 M& q" \; A3 X0 ]  H5 f
2 L4 o( u8 p+ k& d# B4 ]9 q0 G3 ~" _如果那样的话,就是同时卖毒药和解药了吧
作者: 方恨少    时间: 23 分钟前
xiejin77 发表于 2026-7-23 13:43
7 c6 Q1 M- m6 v$ Z. ]方老师想的透彻。$ B- f1 b, f" ^9 w) s
% j3 n& C" }! ], y( f- \  P
如果那样的话,就是同时卖毒药和解药了吧

7 O) Q# y% r: n# v把主角从AI病毒改成新冠病毒也不影响阅读,卖药还可以顺便炒股




欢迎光临 爱吱声 (http://www.aswetalk.net/bbs/) Powered by Discuz! X3.2