WiFi 发表于 2025-2-3 11:15" Z& J1 }/ N0 r$ b8 W9 z
应该是用的H800,不是H20
晨枫 发表于 2025-2-4 01:35! H1 p; _; K* Q% Y6 U
两个说法都看到过,我都糊涂了。哪一个更弱?
xiejin77 发表于 2025-2-4 23:58& g2 \, o: d7 r8 N! T
相比于绕开cuda的突破,其实ds自己设计的Fire-Flyer AI-HPC框架,更值得自豪。
# c; R3 x9 }, y
在训练的尝试中有意绕开了 ...
晨枫 发表于 2025-2-5 14:13
这个能展开说说吗?
xiejin77 发表于 2025-2-5 00:21 `" A3 Z2 T: [$ Q, `9 I
ds自己有篇论文,我找时间专门解读一下吧
WiFi 发表于 2025-2-4 01:15' q1 |1 n" r9 Q* J2 H; j% x6 g
应该是用的H800,不是H20
In detail, we employ the warp specialization technique (Bauer et al., 2014) and partition. E$ i; r/ m3 }% {0 z
20 SMs into 10 communication channels. During the dispatching process, (1) IB sending, (2)& ]! p: y( F' p; f0 O+ n
IB-to-NVLink forwarding, and (3) NVLink receiving are handled by respective warps. The" N' A+ T( y T. P& D9 g
number of warps allocated to each communication task is dynamically adjusted according to the2 o/ y; V1 W' G$ R" a: Z- y
actual workload across all SMs. Similarly, during the combining process, (1) NVLink sending,1 \9 I+ d4 n0 u! q' {+ [
(2) NVLink-to-IB forwarding and accumulation, and (3) IB receiving and accumulation are also; V# [9 b. }: ]/ D
handled by dynamically adjusted warps. In addition, both dispatching and combining kernels$ [/ T% C3 W" w: k ~
overlap with the computation stream, so we also consider their impact on other SM computation
kernels. Specifically, we employ customized PTX (Parallel Thread Execution) instructions and
auto-tune the communication chunk size, which significantly reduces the use of the L2 cache: X8 Q1 O4 O7 A, F: ~4 _4 e4 e
and the interference to other SMs.
xiejin77 发表于 2025-2-5 15:085 W4 E# c/ K. Q% F$ Y; Z
晨大的这个说法,我查了一下资料和信源,正好我之前写过ds-v3的解读。感觉可能是有点偏差。/ T5 V, E4 D, H5 O7 Z0 ?5 X* b& j
Parallel th ...
xiejin77 发表于 2025-2-5 01:08
晨大的这个说法,我查了一下资料和信源,正好我之前写过ds-v3的解读。感觉可能是有点偏差。
' u1 n1 x( C3 G9 h9 ~% W
Parallel th ...
晨枫 发表于 2025-2-6 02:13
PTX是不是本来就chip specific?有可能利用大模型反过来把PTX写的东西反过来生成伪码,再针对新芯片的相 ...
xiejin77 发表于 2025-2-5 18:421 r. D1 n5 j |' Y) _
晨大好。
3 P0 b3 A9 r- A ?1 l" J. `. \
我的理解,类asm的语言都是和硬件架构和芯片的指令集深度绑定的。
晨枫 发表于 2025-2-6 08:50
多谢解释。那DS为什么不直接用CUDA,还要费事用PTX呢?
晨枫 发表于 2025-2-6 08:50
多谢解释。那DS为什么不直接用CUDA,还要费事用PTX呢?
唐家山 发表于 2025-2-5 19:51- d& p% K6 G9 x; m- Y
应该是性能的原因。打个比方吧,操作系统内核一般都是用C语言写的,但是一些关键部分会用汇编语言来写。 ...
晨枫 发表于 2025-2-6 09:53
多谢解释。2 d2 Q' [/ m; u. S2 v
( i9 J3 n# @, |/ f2 T
那DS如果把模型移植到华为芯片,应该需要重写软件吧?而且无法从原有的CUDA架构下移植? ...
晨枫 发表于 2025-2-6 09:53$ U( v7 d- c2 P" _- \; Y
多谢解释。1 x5 k( e, x& Y# ]: I
5 J7 y& E* |4 G: _8 \: N
那DS如果把模型移植到华为芯片,应该需要重写软件吧?而且无法从原有的CUDA架构下移植? ...
xiejin77 发表于 2025-2-5 19:58
这部分是DS用来做模型训练、推理的辅助工具软件使用的底层驱动,理论上说,效率可以接受的情况下是不需要 ...
唐家山 发表于 2025-2-5 19:59 _5 Q0 K0 p1 {3 q6 ^
确实需要重写。不过重写软件的代价并不像外界想象的那么高。显卡(计算卡)的硬件架构比较简单,上面用的 ...
晨枫 发表于 2025-2-6 10:04# J0 Q4 P2 r y) F. f- B4 B* ?
多谢解释。
我用过的语言不多,除了常用的科学计算语言,工控语言用的比较多,各厂家之间基本上无法移植 ...
xiejin77 发表于 2025-2-6 09:58" E; K1 w. o; j' {; l; e) y% X4 K, y
这部分是DS用来做模型训练、推理的辅助工具软件使用的底层驱动,理论上说,效率可以接受的情况下是不需要 ...
大黑蚊子 发表于 2025-2-6 10:430 _8 b4 v) O8 D
DS训练用的是自己以前买的A100/H800,H100有没有,有多少,印象里DS没说
DS自己也买了很多华为的910B,事 ...
晨枫 发表于 2025-2-7 00:59% u6 v2 S% c6 l
长期看来还是得上国产卡啊。
不过美国也真是郁闷。中国这蛋糕没得吃舍不得,吃了,结果人家老母鸡变鸭了 ...
大黑蚊子 发表于 2025-2-7 01:035 Q! b6 D. u& j3 Q
看我这记性,说了一大堆是因为nvlink而起,关键东西忘说了3 L5 X; S1 Z1 U9 \$ x+ ^& l
910B的单芯片性能据说跟H800差不多,但是多芯 ...
xiejin77 发表于 2025-2-7 09:31( z3 Z% w+ a _: `- u7 z: N5 u# G' ]
蚊行的知识面是真全面。' m( ]- y+ I- d: w2 _
# |! b5 J; n$ r
RDMA网卡的品牌厂商主要有三大巨头企业,分别是Marvell、intel、Mellanox,其中 ...
| 欢迎光临 爱吱声 (http://www.aswetalk.net/bbs/) | Powered by Discuz! X3.2 |