爱吱声

标题: 华为韬定律芯片是如何降低功耗的? [打印本页]

作者: 可梦之    时间: 11 小时前
标题: 华为韬定律芯片是如何降低功耗的?
本帖最后由 可梦之 于 2026-9-11 07:35 编辑
1 g1 H: i% o! e/ h8 ^' i
: E( I' l/ _( i2 b- S华为推出韬定律后,大家(包括我)最关心的一个疑问是:把两个芯片面对面放在一起,功耗和散热怎么办? 8 L5 \" \! c- a: @! `2 d" I5 z
% D$ j' F- o9 n( T& A9 {; I0 `$ v% M, k! z9 Z
最近,何庭波发表了第二版韬定律的论文回应了这个问题。经过麒麟2026(内部名称,对外是麒麟9050 Pro)芯片验证,韬定律芯片不仅仅没变热,还变冷了。( M4 ]! F! c  F- B7 [8 O2 L6 U

* j' G7 j$ A! r) `. T( L这个结论得到了广泛的媒体报道,但还是有点反直觉的。华为到底是怎么做到芯片功耗的1+1<1,抱着这样的疑问,我把论文原文拜读了一下(https://chinaxiv.org/abs/202609.00031)。5 }# }" E; f; \% z2 \4 v' z
  Y& V3 Z* F% v! Q. y* c
论文报告芯片密度提升了55%,与此同时功耗降低了66%。非常亮眼的数据。
7 O' T  ]( L+ S. k) L4 c8 F( B" ^5 H; v
主要的阐述逻辑是:功耗的大头不是计算,而是数据传输。韬定律,或者具体来说,逻辑折叠缩短了芯片连线,从而降低了功耗。
- G0 N$ p  B& G3 c
, s* z( o; D. e. [# @# F4 X这是讲得通的,但我还是有疑问,逻辑折叠能把连线缩短多少,单靠这个能降低66%的功耗?细看之下,逻辑折叠平均降低了20%的金属走线长度,关键路径下能降低70%,在时钟网络上效果更好,平均降低28%,而且将clock buffer降低了一多半。数据非常炸裂,但是貌似不足以降低这么多功耗吧。
' }& j- a& J+ G, g' V! [
# l1 H& b5 J0 C: D: ]" }7 c( n& I解开我困惑的是第四章,这里提出两个测试方法:等效性能模式(iso-performance)和满血模式(full throttle)。前者降低芯片电压,算力和前代的麒麟9030 Pro保持持平。而前文公式1可见功耗和电压的平方成正比。将电压降低一半,性能就能降低到四分之一。这个才应该是功耗降低的首席功臣。6 {8 e) A5 l( ~+ D* V6 m; j
! t. K* n0 |1 a! N# H7 c8 U6 E. F
文中图1信息量相当密集,让我们来仔细看一下。
" b* ~" j1 q* J! R( d# O& _# M/ b0 F" Z5 d
" o, D' R; D8 y$ W% R
/ X" C5 ~+ ?  u' Z1 b) q5 U) z% q
首先,66%的数据是NPU在等效模式下的数据,其它部分数据为:GPU 58%,CPU:41%和23%(不同测试集),DSP:25%(2026)。满血版数据则为:NPU:+37%,GPU:+20%,CPU:+11%/+14%。选择最好的数据放是写论文的基操。
  X6 {! U2 I1 S  l1 m6 x' v3 v5 l% C9 K; M% B) X, R* b
其次,看NPU是如何节省66%的。相比9030,芯片最高频率从1.2G降低到1.1G,满血电压从0.85降低到0.70,根据公式1,大致估算同样设计功耗降低到(0.7/0.85)^2*(1.1/1.2)=62%。等效模式下频率从1.2G降低到0.442G,电压从0.85降低到了0.55V,根据公式1估算功耗降低到(0.55/0.85)^2*(0.442/1.2)=15%。当然,公式1只是数据传输的功耗而非整体的功耗。但也可以看出电压对功耗的影响甚大。 , l. ]. v/ h% K9 P9 C& k" B5 w- S
# p. W, r9 T2 l- k
为什么等效模式下电压/频率能降低这么多?关键在于性能从29TOPS增加到70TOPS。在频率降低的情况下,这一性能提升基本是更多计算单元造成的。简单估算计算单元增加了70/29*1.2/1.1=2.63倍。如果工艺和晶体管密度类似,那么芯片面积也增加到2.63倍。逻辑折叠理想情况下能让面积减半(NPU中大量重复计算单元,还是比较容易均分到上下两个die的),这样面积增加到1.31倍。我们看图中数据,NPU的投影面积增加为1.27倍,这里应该是逻辑折叠起了作用,走线变短可以进一步提升密度,当然不排除工艺进步因素。* L) J: l% ^( U; y# o+ ~1 H
4 i2 i; K% N, s- {, g
在满血模式下,估算功耗是0.62*2.63=1.63,但实测数据是1.37,这个差距剔除模型误差因素,主要或部分应该是逻辑折叠带来的。在等效模型下,估算功耗是0.15*2.63=0.39,和文中0.34更接近些。
2 q, f: S# I3 k! W4 h+ m
8 c2 I) M6 W$ P+ m- l) F& e因为干活的多了,所以每个NPU计算单元可以算慢点。等效模式下可以慢1.2/0.442=2.71倍,和上面数据是吻合的。我猜另外一个降低频率的因素是时延,一般来说电压降低,时延会增加。时钟周期必须拉长,否则setup违例芯片就乱套了。但不好简单估算这个关系。
! s# [) V1 f' A
3 T5 x; P7 t* B4 F% K2 H1 m散热更多考虑功耗密度,因为NPU投影面积增大为1.27倍,功耗密度相比更好更漂亮。等效模式下降低到27%,满血模式只增加7%。
0 I7 _5 D# C0 \2 L! h6 V4 b2 u
8 d* A2 j: u, @! O: o2 j& g: f其它模块例如GPU、CPU可以类似分析。GPU性能从61提升到86.9,芯片面积降低到96%;CPU性能从1700/1854到2005/2084,面积降低到78%。CPU不好折叠,最差情况下功耗密度增加46%。DSP面积降低到60%,功耗密度增加24%,但麒麟2027会降低到97%。7 ?+ z- w& |. g/ m' q) P% r% T

, o" \! Q- S: S+ i8 R/ ]7 ^5 d芯片散热要考虑最差的满血模式。论文指出,这里功耗密度是上下两层die的数据,每一层的功耗密度会更低。而让芯片不工作的是晶体管的温度,所以问题不大。另外他们设计的时候特意将发热单元放在更容易散热的地方。另外逻辑折叠让走线变短,芯片面积减小,也腾出更多空间用于散热。下层的die可能会比上层的高个几度,但下面也更容易散热还好。9 O& q: O* V3 [# T
$ S6 j8 }7 s$ G% R5 R& j
至此,我的问题得到了答案:逻辑折叠使得可以制造更多的计算单元,在等性能模式下,降低计算单元的电压可以大幅度降低功耗,逻辑折叠缩短了走线进一步降低功耗。综合因素使得麒麟2026变得更凉了。这一策略在NPU/GPU等并发好的模块效果非常明显,在GPU/DSP等上面则稍微逊色一些。
8 D. h9 }0 c  b$ M9 N; J8 n! {- k& x- M! f, g) M; y) G
通过降低电压降低功耗不是逻辑折叠的专属,过去几十年我们把电压从几伏降低到现在零点几伏,否则芯片早把自己烧坏了。但阈值电压是有极限的,不确定还能挖出多少潜力。但是逻辑折叠,使得工艺密度不增加的情况下能够制造更多的计算单元,殊途同归,也是非常惊艳的。
2 r/ ]1 }6 u7 ^- u3 x5 O) z0 |2 J+ l1 z" A" T5 O: T2 L) A1 I

3 _) o) n5 s7 |8 j# d# J( h9 m最后说一下,逻辑折叠的潜能还远远没有挖掘出来。华为把Hybrid Bonding数量提升到五千万,并计划进一步提升到两个亿。但是只用到了10-15%传输信号(其它用于冗余还是power之类的?)。文中也提到了现在设计还是很依赖工程师手动做优化。后续要挖掘更多潜能,对EDA的需求会更加急迫。有了得力的工具,逻辑折叠的潜能才能完全释放出来,让华为下一代芯片变得更凉,更酷。) Y  f) h1 Q7 p: S1 k  R
/ V, B1 i) u5 H: |2 x2 b
我辈当自强!
" b! e6 U  w4 ^" k! E$ g6 U0 g8 U6 {$ z! s3 v0 d; D* |0 a

( d& U$ S; H% Q! i) N  m$ \/ a
* E6 I, R1 ?1 p, [0 ^
: k7 _  c" f; R/ p
2 ~$ k1 I$ n# _8 l  C; |! A# a, i9 g  Y6 d8 t

tau_fig1.jpg (207.37 KB, 下载次数: 0)

tau_fig1.jpg

作者: 隧道    时间: 6 小时前
今天偶然让AI对比了一下骁龙8E5与麒麟9030,才发现其实麒麟芯片落后很多的。! I, p5 z: ^2 Q! Z+ H
但愿9050pro能赶上来。
作者: 可梦之    时间: 6 小时前
隧道 发表于 2026-9-11 12:02
9 {0 q8 p( a$ i9 w- }  `今天偶然让AI对比了一下骁龙8E5与麒麟9030,才发现其实麒麟芯片落后很多的。' a8 _8 `- |3 ?* R- T
但愿9050pro能赶上来。 ...
2 y/ p7 l7 t5 I
制造差距摆着呢。一个台积电3nm,一个可能是中芯国际的N+3,大概介于台积电的7nm到5nm之间。
作者: 晨枫    时间: 3 小时前
好文!还在消化中。
: u0 R0 F" E4 n1 ?- [. T) x  Q$ A# c& u& e; `/ Y7 s$ ]
可以“盗版”到观网风闻吗?会著名“原作者可梦之”。
/ Z9 C3 `& R1 U; A8 c4 g" `0 V: e3 r# \7 s6 W
对了,第一个图转不出来。
作者: 可梦之    时间: 3 小时前
晨枫 发表于 2026-9-11 15:05
1 e- `% r$ l" c8 A* i* [% Z! A好文!还在消化中。
. G6 P- S" `, `$ u- I4 G
1 Y. _% k0 f* D. \/ w6 A, I9 b可以“盗版”到观网风闻吗?会著名“原作者可梦之”。
. O' y& D1 }  b( L4 z% {6 t, }
可以,多谢。5 N3 v' r. b) Y6 O3 r- C& T
4 h" k( h; m$ F4 q' f( H
图片网址是
( F: l% u9 N7 y: R8 J+ mhttps://pic.imgdd.cc/i/034MdXQk6oElQ3UA3eJ7oQ.jpg. H" G  y5 j+ o3 L# ~7 ?

$ q+ b/ P/ z. j' p如果还是不行,就是论文中的图1,我也是从论文上截下来的。




欢迎光临 爱吱声 (http://www.aswetalk.net/bbs/) Powered by Discuz! X3.2