TA的每日心情 | 开心 2020-4-8 10:45 |
|---|
签到天数: 227 天 [LV.7]分神
|
玻璃之翼降临——Glasswing计划与Claude的Mythos Preview
* h" R8 V/ T0 b3 f% ^
3 T& z7 R7 N/ K" F% g# ]+ [) x5 {9 j2 ? j# A4 m8 Z
一个预览版的AI大模型刚刚挖出了一个尘封27年的漏洞,然后11家科技巨头都坐不住了……% C& M8 E! c6 d8 Y: H( }9 O; L
5 x1 k w/ E6 i+ X, ? ]; y故事是这样的。
% N9 ]# S/ Y8 |. J7 E, b) a- z/ f, [: c3 q0 [% ~
我今天看到这个新闻,看完之后愣了好几秒。7 j* e. [% [* E/ P- A3 D1 F
) I A6 p! L* D( g/ |
一家叫OpenBSD的公司——做操作系统的,算是安全领域的老前辈——他们有一个漏洞,在代码里躺了整整27年。1998年写进去的,没人发现。% k! k* P/ O7 X/ {. \
- |$ f6 d6 {/ V6 v8 H结果被一个AI模型给挖出来了。
. i: a7 m9 }7 y |: [
1 [: k1 }1 I( r6 p7 O这肯定不是那种"我们用AI扫了一下代码库发现了问题"的挖出来。而是那种"这个漏洞藏在最核心的地方,所有传统工具都扫过5百万次,一次都没报过警"的条件下挖出来。
6 s+ z2 O% n8 {, i7 S
8 k; k l n& Z" i然后,这个AI模型,顺手还把FFmpeg里一个16年的漏洞也给挖了。; R3 {# U& H& x5 C. V3 |/ Z- b
- t3 B* e! x! d+ S) HFFmpeg,音视频处理领域最最最核心的基础设施。全世界的视频播放器、浏览器、直播平台,有几个不是建立在FFmpeg之上的?这个漏洞在里面藏了16年。5百万次自动化测试,没一次报过警。
& `$ k/ u& B% M) x- \$ P# V/ a- e- R. G) w- G7 G8 M5 {% V M: c
然后呢?
! u$ w: D7 n) I0 T% t' H- n4 w5 ~4 i( b- n* y, @
然后,11家全球最大的科技公司——Google、Microsoft、Apple、NVIDIA、CrowdStrike、JPMorganChase、Google等等——坐下来,说了一句话:我们一起出钱,让这个AI模型,能被全世界的安全研究员用上。) a% T$ V4 }# \. S2 x y
: J) L4 H7 S g6 @
这个项目,叫Glasswing。
; o9 l: o. z1 \, `5 f4 i; J9 a" E/ j6 h P5 E2 }; m: ^8 A& `
glasswing
* ^" Z7 O! W/ h8 c7 w
& s* J7 D4 {- C
4 x0 f. y5 T6 C) s先说清楚Glasswing是什么。
: r2 }1 S: K% f+ O2 m! ?' M
1 }: ^% Z( k. B' E! D" o5 t; n简单说,它是一个AI安全联盟。发起方是Anthropic,加入方是一堆哪怕是不关注技术领域也叫得出名字的科技巨头。它的核心,是一个叫Claude Mythos Preview的模型——注意是Preview(预览版),就是还没正式发布的那个版本——专门训练来挖漏洞的。$ b. e9 n. e& a9 d2 ~
6 ~. K0 V: i9 }8 t1 b7 w有多强呢?* ]9 w$ c) T4 L, Q/ [
, D9 G& N/ y! [' i
CyberGym基准测试,83.1%。作为对比,Claude Opus 4.6,得分是66.6%。不是Claude Opus 4.5,是Claude Opus 4.6,Anthropic目前最强模型。# R' Q$ s. Y" G- m$ {: W$ }# M2 O
% _* I: U# V6 ~+ M6 z( x
SWE-bench Verified,93.9%。还是SWE-bench Verified,不是那个容易一点的版本。Claude Opus 4.6是80.8%。
+ v; M: T+ Q' ]: t/ l; K- H5 x `# K6 w
差了13个百分点。2 q5 \1 u4 V0 i( t3 s6 U
. ~' d4 X) m6 f你说这13个百分点意味着什么?3 Z( O1 ^+ g& a8 T1 Q& D) Q) F
: q5 h) D: P) [$ [% e8 I0 |. V' E意味着,传统扫描工具漏掉的那些最刁钻的漏洞——那些藏在层层调用关系里、藏在异常分支里、藏在并发边界条件里的漏洞——Mythos Preview能找到。
* U8 u4 h8 e8 @. ]. S/ y6 V9 }1 p
意味着,27年的OpenBSD,16年的FFmpeg,以后可能不会再有了。9 P" t. @! l9 d( o4 }9 w; o
8 E G. e: X2 c# R1 Y
或者说,这种级别的漏洞发现速度,会比以前快几个数量级。
( V" |0 n1 m* G, z8 f q \* {) I
/ Q) ~% a/ G9 M% d说到这个OpenBSD的漏洞,我必须展开讲一下,因为这个例子太有意思了。
7 G; j8 k+ B: J5 N6 L$ z3 N
- r# J; x3 @! r3 POpenBSD是个什么存在?. ^3 r' s f+ a2 O0 { i; `
' o" b( J2 I6 t
它是BSD操作系统的一个分支,最核心的设计哲学就是安全。代码审计之严格,在整个开源社区都是有名的。很多安全研究员的信仰级操作系统。
, W/ q7 P8 |2 i A( j, {) Y0 D$ _' ^% M% H3 Z3 c" w
这样的项目,代码审计了多少年了?二十多年。
C4 }/ K" U" R8 K. I2 g. T# R
4 O, [; ~2 S# M0 V然后,一个漏洞,在里面躺了27年。( P+ r2 X0 b+ H5 r8 ?. t
* Y) y) [2 ~' ?4 q" {这说明什么?
& c, i W. }* l6 U. i5 R+ h8 H: d6 P% u5 |7 _) ~
不是OpenBSD的人不行,是传统的审计方式有盲区。任何人工审计,只要时间足够长、人足够累、代码足够复杂,就一定会有漏洞漏过去。这是人性的边界,不是能力的边界。; \ Z# e+ L* o0 n/ [6 y6 o
/ l' S8 X! E1 a2 c8 \" B# L$ u4 M3 ?
但AI不一样。AI不会累。AI不会因为审了三个月之后注意力下降。AI可以在几个小时之内,把整个代码库的所有调用路径、所有边界条件全部穷举一遍。. x/ a3 M6 e& I5 S2 b: k& l& A; c0 _1 ^
0 Q" a/ X U* aMythos Preview发现的那个OpenBSD漏洞,是一个本地权限提升漏洞。攻击者如果已经拿到了一点点访问权限,可以利用这个漏洞进一步提升到root权限。
5 F6 ]% b! `- |* k! _% ]5 U# ^, u; P
这种漏洞可怕在哪?& y& \5 Z+ p2 j# ]$ G1 x
4 E+ k+ D7 t3 I: b它不显眼。它不是那种"输入框里填个单引号就弹shell"的漏洞。它需要你对系统有相当深的理解,才能构造出触发条件。' k9 y5 q0 A2 _9 V9 ~
& a9 y" S/ O' u$ T$ p; @( t
传统扫描工具扫不出来,是因为它的payload模式不在规则库里。AI不一样,AI学的是语义理解,它不是匹配特征,它是理解代码在"想什么"。
1 v$ k8 y# o& T
$ R+ _- ~ u4 nFFmpeg那个例子更让我震撼。 f5 N. [! E* _/ x( p! S2 `3 t/ H
! ]8 G# }0 n m2 [6 Y16年。
0 x/ E! C) Q" C& o0 v& M2 D! g8 U4 p* I+ q
FFmpeg上一次发现这种级别的漏洞是什么时候?2009年。3 f, T" A# i4 Q, q7 L7 a& O
, g& V# Q7 _# {9 i1 _4 t
16年都没有人发现。然后Mythos Preview扫了一下,找到了。* x, ^9 q; J: T, r: s
* P3 r9 U& b4 P5 s
注意这个"扫了一下"的背景。SWE-bench测试集里,有大量是真实世界里的bug修复历史。FFmpeg这个bug在历史上真实存在过,是某次修复的时候被记录下来的。这意味着,Mythos Preview不仅能做代码审计,它能做的是:从海量代码里,识别出"这个写法有问题,即使目前还没有人报告过"。: w3 L* x1 P2 L7 J8 b% x( G+ |& S
' I: z2 O) W: [) n5 X Y这是主动防御,不是被动响应。# ~/ ?5 [- l0 G9 c) ^% i$ _
5 k1 O2 ?- U3 d" N$ K9 X. r7 n
传统安全的方式是:出了事 → 分析样本 → 提取特征 → 更新规则库 → 下次能识别。
4 g+ U+ U6 c/ @- s3 o3 ]8 C% b# L% N( U) S" Y6 q8 ?
AI安全的方式是:不需要样本。直接读代码,告诉你这里有个洞。
. |( E% T4 p' V' q9 O
0 o% X% _& l" O5 A这两者之间的差距,大概就是"等贼来了再装防盗门"和"在盖楼的时候看着图纸就告诉你这堵墙扛不住地震"的差距。, \$ D+ z% I" p" \1 k
* E' U9 l: U9 Y1 N
现在说说大家最关心的问题:谁能用到,怎么用,花多少钱。
- l- C, Q& c4 N( M$ ? R" P' F. Z+ k5 s
Glasswing的AI能力,现在跑在三个平台上:Amazon Bedrock、Google Vertex AI、Microsoft Foundry。! k) J! D1 _6 r! s) o/ h
3 P! A+ m" D# g) A* w这三个平台,恰好是AWS、Google Cloud、Azure。全球三大云服务商。1 ^# Z5 O5 j! \6 g+ H/ }
2 f0 K; F! I# \) u3 k你在任何一个上面,都能调用Mythos Preview的漏洞检测能力。4 `6 G5 E8 ?) _- H) H. t
o* j, V- k9 m1 M- q# ~: \价格呢?过了初始的credits之后,每百万token输入25美元,每百万token输出125美元。
) C' Q/ a+ _" `2 w$ N: N) Y7 i, h& @3 z" c; S; l
这个价格贵不贵?
% v( Y7 C3 k E! C9 k! v6 w# B$ |! f |+ n# ~1 w% ^
对比一下就知道了。现在市面上做代码安全扫描的工具,像Snyk、Veracode这一类,商业扫描工具的报价大概是每个开发者每个月几十到几百美元不等。而且它们扫的是规则匹配,不是语义理解。# _3 k+ g" e( [1 `3 t
9 L4 l2 d0 E% G
Mythos Preview能发现那些工具发现不了的漏洞。
6 e% G0 \) K# Z C4 j! a: g2 _# ^' ?: g. ~( x
这不是贵不贵的问题了,这是"有没有意识到你以前省的那些钱其实在交更多的学费"的问题。2 i+ G3 _3 V5 s7 b, T& Q" h
/ U% O: A V; P$ h; ~8 Y
另外,Anthropic自己掏了1个亿美元的使用额度,分给联盟成员和开源社区。还额外捐了400万,250万给Alpha-Omega/OpenSSF,150万给Apache软件基金会。9 T( t) [" Y% q6 a# t3 z: b
$ F$ q3 R$ _6 ?
这些钱是用来干什么的?让那些没有商业利益驱动的开源项目,也能用上最好的漏洞检测能力。
2 O4 l. c( h" e; Y: ?; f! D* V" Q2 m2 [1 V: _2 a* w
FFmpeg就是开源的。OpenBSD也是开源的。这些项目没人给他们钱做安全审计,但他们的代码,运行在全球几十亿台设备上。
/ P- {% _/ H/ ^ l9 j6 e' Z; {. A. L6 f9 Q. g' o4 a
还有一个细节,我觉得特别有意思。/ v" {( n. \* g" n! s! t) {- T% |
0 \& _" ~0 S5 |/ t+ Z: \7 n' X
漏洞发现之后,公开披露的时间是90天。
& v8 m$ s& K$ J
( `& d) {0 O4 G7 c4 f/ w0 m, T' F90天是什么概念?
/ k5 ^4 E! d# f! L3 A1 S& T, W: l4 J" _. Q: T) v2 v
行业标准的漏洞披露窗口是90天。这个时间足够让厂商评估漏洞、制定修复方案、推送更新,但又不至于让漏洞在黑市上流通太久。 e* o: o) D3 ?2 \1 Z# E1 J
2 W6 p9 j* Q& P- I! K$ ^但这里有一个问题:90天是针对"有人发现了漏洞"这个前提来说的。+ b1 J" x* X+ n6 u. {( k+ i
. a9 F) O: `9 q- h% M+ a
Mythos Preview现在能以前所未有的速度挖出漏洞。它一天挖出来的漏洞,可能比以前整个安全社区一个月挖的还多。
8 l+ X- [9 P0 W1 f& v
- H) b9 }) r8 i# i这意味着,漏洞披露的节奏,整个就变了。' I: A r" F1 \7 J
4 W- v& K4 E7 W
以前是"挖到一个,披露一个"。现在是"AI在持续不断地挖,每90天披露一批"。
4 c5 B1 N) `3 `- j+ _# O+ |: F. W* X U- ^7 K. D* W" K* h
厂商的补丁开发速度,能不能跟上AI的发现速度?
4 ^! X$ s+ p: K7 X2 I2 H
3 y( L: |; K% W) [这个,我说实话,不知道。但我觉得,这是整个Glasswing项目最值得观察的地方之一。
r; ~! A; y& W! S% m
W( ]$ x6 [3 ]写到这儿,我突然想到了一个更大的问题。+ F! \0 t+ E$ P$ g
0 Y& I: T0 u r( Q8 H
Glasswing这个名字,本身就是一只蝴蝶的名字。玻璃翼蝴蝶。它的翅膀是透明的,像玻璃一样。
6 J) E% D e8 `9 y* U3 @- {8 P
^8 S4 k- ^/ v透明,意味着隐藏的东西变可见了。# `0 b9 a& E- o9 r
6 n1 ~( u- ]+ L! t
一只蝴蝶的翅膀是透明的,它就隐藏不了任何东西了。它在哪里,飞向哪里,所有捕食者都看得清清楚楚。# T; ~& @! e; J
$ q4 b4 E) Y7 a# K: g这个意象,放在漏洞挖掘上,太精准了。% S5 Q/ C# m' R$ D
) ] d$ ^! P% H( |8 F' D) `9 w
代码里那些隐藏了几十年都没人发现的漏洞,在AI的"眼睛"之下,突然就透明了。
8 ]% B9 u' n0 F0 C, `
7 l9 p c% O, G以前我们说"security through obscurity"——通过隐藏来保证安全。你的代码不公开,漏洞藏在暗处,攻击者找不到。
. S; E5 F' w, ~7 Q, {' \" {" a: Z; y5 Z
但现在,只要代码存在,AI就能读。Mythos Preview不需要你的代码是开源的,它只需要能接触到代码——不管是源码、还是编译后的二进制、还是运行时的行为轨迹。
6 W! `% G$ H# H5 A/ W
8 j- N4 P0 `: G* \代码越来越难藏了。或者说,代码里的漏洞越来越难藏了。
T! k8 M% G$ {6 z; C' e+ c/ n( z6 w; K" s" I/ C& k" [# J3 b
这是一件好事吗?8 m: K2 O( R% |8 J
0 W5 Z* w! J( ?# X) ?$ [
我觉得,短期内,这是一件非常非常好的事。
* K2 F0 ~& u7 U) J. i
* E5 z9 e" D: J全球互联网基础设施里,有多少代码是10年、20年、30年前写的?没人敢审计、没人敢动、出了问题就打补丁接着跑的,有多少?
* n* @1 S. G. y, l1 {
9 a2 x, e8 x' [3 p8 u0 w这些代码就像一颗颗定时炸弹,埋在整个数字世界的基础里。
0 \1 B0 ~; ?2 L& Z; c6 h
% a" }1 H' `% M, p' v N" WAI能做的是,帮我们把这些炸弹找出来,一颗一颗地拆除。
/ p: B: C6 p: `5 i B0 s5 {0 t+ e' A; U8 S" V6 [* S- S
但长期呢?
% f) V. _0 V; I* \
0 w! Z/ ^5 ?3 ^$ v% j7 e, ?* N当所有可见的漏洞都被AI清除干净之后,剩下的,是什么样的世界?$ l4 [; r6 C- _* X+ V: Z' H
3 ^. {* m4 Y% S是代码质量极高、安全性极强的一个世界?还是所有攻击者也在用同样的AI,攻击的速度和防守的速度同步提升的一个世界?6 l! w+ ]* A& k I. l
" [# A* _: A3 L1 Z$ X: I
我也不知道。3 A! _* E' H% }% ~# j! s: [
; s, f1 F6 e0 n8 e/ x7 f: d# e; k
但有一件事我特别想强调。1 `8 P6 r4 | K/ S2 ^' K
9 e* T2 i, u N8 T$ f o
这次Glasswing联盟里,有JPMorganChase,有CrowdStrike,有Palo Alto Networks。这些公司,是真正的安全重度用户。8 C1 b1 {- y i4 ?
6 w2 S/ l% y* D0 S# K9 b
他们自己有能力挖漏洞吗?当然有。JPMorganChase的安全团队在全球排前列。CrowdStrike就是做安全的。$ a0 t9 q" b, P
- U5 P% r# v! r( T) y他们为什么还要加入这个联盟,用别人的AI?
2 z+ }2 @% f+ y, @+ Z |& G. ~
% |6 [3 d2 E1 H7 G/ h我大胆猜测一下:因为挖漏洞这件事,规模太大了。6 _ q6 O, H: b: J* r
* `$ D- o( o1 T' x% M+ w7 v7 ]; V全球代码量太大了。每一家公司,即使安全团队再强,也只能覆盖自己的代码库。但外面的供应链、开源组件、合作伙伴的代码,你根本管不到。
' s# G l/ J' M5 s: A8 l
% N$ i( H! w) y! {' I# @0 G+ gMythos Preview的价值,不在于它比你的安全团队强。而在于它能同时扫所有地方。: `% k2 m$ A! T+ ]9 q
8 i0 m( J: ~9 n) o0 G% T/ p$ E
这是规模效应。! ]$ x' o5 D! a9 g' v( B2 ^ w K2 P
2 V# L9 M# C& V; k就像打补丁。手工打补丁,你只能打你知道的那些机器。自动化打补丁,你能打你所有的机器。AI扫漏洞,相当于在每一个代码提交的时候,就自动扫一遍。" `7 q2 S, c) n! ^; j% L$ Q
9 \2 }, x' v6 c" P这个规模,是人类团队根本无法覆盖的。
" B8 p {7 R4 [# J
; d; B: Y& w8 Z9 a: B$ B# L* IGlasswing这个项目,还有可能往一个方向发展——成为一个独立的第三方机构。
4 r( ?& X9 Y+ n5 `! m, m
- ~2 S `& T2 X7 S7 m什么意思?# X9 Q" m4 K1 a" K6 {: I
' a( f' k( r5 w) r% O ]* x( X2 |
现在它还是Anthropic牵头、11家公司参与的联盟。但未来,它可能变成一个真正独立于任何商业公司的安全机构。它的评估结果,有公信力;它的漏洞报告,有权威性;它给出的安全评级,整个行业认。
. B1 \8 E* n6 b e# R2 _6 D' p; f1 o* L! J
类似现在的ISO认证,但针对的是代码安全。( M; J0 m+ L' P s" S6 Q
7 N, _! b2 B) R# N
想想这个画面。未来的软件采购,合同里可能不只要写"符合SOC2",还要写"通过Glasswing认证,漏洞数为0"。
7 ]- G4 t% y# I! c& b' Y/ x N2 V% N7 r. l( q! y
这不是不可能的。
7 v# x9 v* z3 e, j/ t4 v% \5 I F7 i
当然,路还很长。现在还只是第一步。但方向是对的。0 N6 q' ]6 u6 e6 @
) E9 z( Q. k, ?+ k1 s好了,写了这么多,让我最后说几句掏心窝的话。5 c) K2 I5 y' w- P* L6 z3 [
5 |8 m2 M: F6 e我这次看到Glasswing的新闻,第一个反应是兴奋,第二个反应是有点怕。
4 H3 N- X0 j1 h* w2 w/ i
' t0 q# [7 r- `5 X兴奋是因为,我真的觉得,这是AI在安全领域做的最有价值的一件事。以前我们聊AI安全,大家想的都是"AI能不能被攻击"——对抗样本、数据投毒、模型劫持。这些很重要,但离普通开发者很远。
8 H' u, E$ m; J
3 H# j% V$ w, ]2 W, r这次不一样。这次是AI在帮我们发现自己的脆弱点。, u& S2 c7 J3 e' w1 C, t$ f3 o
( V& ^0 P. j1 x9 k0 L
这种脆弱点,我们以前不知道,或者知道但没有能力发现。AI把它们挖出来,摆在阳光下,告诉你这里需要修。+ t4 t+ ]3 k- F# f: l9 l
( W. _& k8 D. `) ~. l+ j# `) H这是AI在补人类的短板。不是在超越人类,是在帮助人类补上人类自己够不到的地方。
0 t$ F' Y& f- |0 Q9 L1 b% q. U! @) ~! b; q
我怕的是什么呢?
+ B, B/ T' p2 i% ~7 r
5 i; N# }# j- o. @; i1 W: o* d我怕的是,这个工具,只有大公司用得起。
; {+ T" E0 i& H# G7 {7 {) W! {9 p* ?' x/ L7 F
AWS、Google、Microsoft,Bedrock、Vertex AI、Foundry。这些平台,都是商业平台。Cloudflare这种中型公司,可能用起来没问题。但那些真正需要安全检测的——初创公司、开源项目、十几人的小团队——他们能用到吗?
4 w& v* |, v8 [4 k' W$ B( t- D' R4 @* C+ F
Anthropic捐的那1亿美元额度够用多久?分到全世界的开源项目上,每个项目能分到多少?
8 g$ a- K1 U3 U8 z8 X. X% Z
! e, y- q1 g( v2 u! k* N) E这些问题,现在还没有答案。7 R, r# D( u, @
+ q1 G4 P/ {1 @7 o但有一点我特别想强调。6 d) c( _/ |8 S9 E# o1 ]. U
* |1 P1 b, a+ }) W5 X$ r' P+ eGlasswing这个项目,让安全这件事,第一次真正有了一种"基础设施"的可能性。7 O, g% ]5 y) }& y! u
1 P4 o- X0 c1 p, m, s以前的安全,是奢侈品。你要么雇得起安全团队,要么买得起企业级扫描工具,要么你就裸奔。( P j c+ D3 ]8 a. z3 h' W
, T+ z# ?; {! G& ^" rAI改变了这个等式。Mythos Preview能发现那些企业级工具发现不了的漏洞,但它的调用成本,并没有比那些工具贵多少。' T( B- E' U6 b0 M8 b$ I
: T! z9 w0 c, `6 y7 [. ~
当漏洞挖掘的成本持续下降,当AI扫描变成每一个代码仓库的标配,我们或许真的会迎来一个更安全的互联网。& |( K! q+ F+ E# R) S
5 G4 _+ u4 B& i. a2 V" C这一天什么时候来?我不知道。可能5年,可能10年。) P; X1 |! F! [5 K0 G6 h
1 A# D! i7 G2 z9 t* C但Glasswing,让我第一次觉得,这件事不是痴人说梦了。) K: E9 Z. j# {; L" _
|
评分
-
查看全部评分
|