8 F B1 G. u t0 u: [% e$ R: a这里提到的A100,和英伟达的A100卡不是一回事吧?/ ^( j. z, u8 a; u+ c: I: B" ]* e
6 ^9 b7 s8 [1 o; ~最大的问题:这样的做法在scalability和transportability方面有什么长处、短处?因为没有看懂,所以还是没有解答最初的疑问:如果换GPU,换模型架构,或者极大增大模型尺寸,这套架构需要推倒重来吗? 9 ^0 E% ^; x" _7 z2 n" _/ |( O) m% p8 ?6 M% F: g! I
这是case by case optimization,还是scalable and transportable framework not only in terms of concept but also toolset?作者: xiejin77 时间: 2025-2-8 11:13
晨枫 发表于 2025-2-8 10:55 2 c ?5 [" i8 {* t, x m我也从来没有称呼过没有教过我的人老师。看完后,我尊尊敬敬的称一声:谢谢,谢老师。不过没有解惑,因为没 ...
) Z9 p5 y+ y, N' w4 l
晨大你这么说我可当不起,看你文章十几年了。 + B" _3 S& B: k7 E* c/ }1 l. K" U& K v( H+ |
这里说的A100,就是英伟达的芯片。基于A100的芯片设计的有不同接口的卡。SXM的满血卡可以组成DGX a100。* K: |% W6 ]. X8 s' Q; U7 C3 a
/ e/ S4 p& c8 z2 j, e火烈鸟的这套框架体系,我的理解,是可以作为相对底层的基础设施优化的,不算是定制的。但是具体到用PTX的手段,就是和硬件相关的了。这是两件事情,框架和架构是相对通用的,但底层的针对性修正是case by case的。9 n) S& j9 l" o) o
3 y5 N7 H$ H6 ~ R% E
我深度的梳理一下,争取能让晨大理解:( { k" d2 _2 ^' D& F% H
, }3 ?1 w7 O' f" O3 Z0 ?
! U+ ?7 {3 w' Z# @/ Q! j, O
这套 架构 既 包含了 case-by-case optimization,又 提供了 scalable and transportable framework,在概念和工具集方面都具有可扩展性和可移植性。 $ |& g/ ]$ m) b# I * }2 I+ \/ K' p. L# \$ N/ m) y( t1. Case-by-Case Optimization 的部分. ]- e# t( W, \$ v& |$ q, B