TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
) G- O7 e: o7 {9 I# o1 Q+ q- R
, @) O5 c. P: J3 A' J! q: m8 Z' }一、总体分析框架与核心结论* [; S/ \5 W* [2 i! ]% J" P; _
1.1 分析框架概览4 e9 W9 w( z% M; k5 t. V# J" ^
拆分维度
+ K. [# k' x! y# F2 f5 ?
f6 K2 {" M9 P+ @3 ^! Y阶段:* j- Y+ r: r& l8 Z6 T! e# p
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
2 V' | u. J0 O) i* Q运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等3 c8 C3 G6 J% K+ i, ?/ w
区域:
/ F) S1 w; I5 [8 h. M中国、美国、欧洲、中东(以海湾地区/UAE 为代表)5 Z2 [) E- [3 D! z. L0 A+ z6 R1 |" R
技术方案:
8 Q# D2 d1 v5 XNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
( M, y" L' k5 A0 r8 sGoogle TPU(v5e/v5p/Trillium 等)
|4 H* q9 v. N- T I' p& G3 G中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
, o [; O. y7 n算例基准. l6 Z, a& i+ g+ p- t$ |" F
' R' q6 ^: P2 l+ M. q! t- \以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
- ~% h4 W6 o$ N5 h& e3 m其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW5 S$ v$ P* c$ ?. r& w, L
PUE 假设约 1.11(高效液冷场景)[1][29]( g( j9 |. C* L$ t6 t
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]4 Y4 a, @ u+ \- o
关键指标
/ u0 p5 x# i' U- B# l
$ @- U* f# g& z4 `$/MW 建设成本(含/不含 IT 硬件)6 O3 Y5 M$ V! t( m
$/kWh 电力成本、L/kWh 水耗2 P5 m1 C( E9 l u, [
$/token 或 $/百万 token 的综合成本
% C: F6 y/ M/ U) a( XToken-per-watt / Joule-per-token 作为能效基准[17][18][26]8 z: b& [( p7 D }6 K- p2 C; @2 }( s \
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租) j) _; q: X. J! Z! s
1.2 高层结论(供决策快速参考)% i$ c- B6 G4 `8 B% c
建设成本:AI 数据中心相对传统云数据中心成本翻倍1 u8 G6 f0 o. t8 b$ @
; Z) y1 @' c9 A6 F传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。, t2 P f0 o* D; {
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。- a. N1 P. k2 G U
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
( y, r; b1 g* @& @1 R$ W& s区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区1 l. o, k+ a( I; V3 _
. N' N& U# K* d: `3 z中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]: i' ^& X3 ^7 m, i [* h$ Z
美国:$8–12M/MW,400 MW 约 $4.0B[1]3 L5 g% r: R/ [' U3 ]: o0 s+ R
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]. {0 _, |( C9 p& w! O
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]5 F' G, O1 x2 {8 L+ B/ j( r, [! W
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
* X& }6 P% ?- IOPEX:电价与人工决定区域优势
# j6 N3 o L! N/ y/ ^" ~3 P T8 G# u( w; y0 X0 D
电价(2025–2026 工商业大致区间):
. M- U6 i' z1 X1 i- C5 e( b/ d中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
. K$ s( ]! O- v! u1 c美国:工业用电约 $0.085–0.09/kWh[44]2 I( N8 I% `! ?7 W7 z, r( v
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
/ F0 ^) F4 I# c/ r! U7 h0 b中东/UAE:工业用户 $0.07–0.13/kWh[47]4 \1 A5 S( z4 D
人工:# k3 {; n* u! B3 C! D; h- }6 j# |
中国数据中心运维:约 $22k/人/年2 ~& j* w! ?- L X3 D1 ^7 C
美国数据中心运维:约 $120k/人/年[1]
8 k) p9 t) E Z) z8 n0 `4 d结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
( `# x. n( y% @. G; V3 t能耗与每 token 能源成本:能效差异远大于电价差异
, x/ l/ P/ v; ~" s& `- q+ G6 X- u& h; j
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。: G. w1 M$ ?" D: K/ Q# T
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。- P( f1 P# }0 g
将 token 能耗约化为统一口径:" s) |4 n: l* |5 d
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
K0 b0 h# z l7 W# K f: @中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token. {& X8 y$ {7 B# A
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
1 b7 M8 b7 E9 R k- Y对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。4 }8 E, V( E. g" ~
不同芯片方案的核心差异
; _5 {( Y& D9 l0 t6 |( \ l4 s+ {1 B" m3 E# U( n" A
NVIDIA Blackwell/B200 & GB200 NVL72:
1 z+ t$ L, ^' T- @单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。/ x4 A5 W4 x) [/ o9 E1 _& C9 G. c
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。5 r5 w$ }( m" F0 Q3 ], a: }7 z
Google TPU v5e/v5p/Trillium: ]! C+ z4 j9 L+ W0 P3 e
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。2 `, b$ r0 {: F, v1 ?5 O1 L
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。! W" d% |1 H, w/ N. \( T& Y
华为昇腾 910B:
! S: f' X) t# WFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
7 M+ \+ t3 `+ u- V- N# t单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。. q, Z0 {. C! j4 g* O4 i$ |
阿里平头哥真武 810E(Zhenwu PPU):
4 Q# q% x- P4 ?5 [7 u( [5 r! J96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
! M5 s7 f9 e0 r* i4 K结论:5 T3 d1 C# p; E" |( i5 g7 [ I
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。. I3 ]6 y4 ?' W7 [+ f! K
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
$ n) I% t! m5 N( D+ R对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
2 w& O+ Z& Y- U' a* [6 ?$ p9 b自建 vs 云租的 TCO 与 token 成本
/ d+ ]: }, J9 l4 z# K( b
8 i1 l& B; S2 T- yLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
, ?, Z- ^" H) g& i. ~8×B300(Config D)自建 5 年 TCO ≈ $1.01M;& r% _5 j8 e: o( Q3 Z2 z
等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。' W- n Z" F/ M# B8 d+ [: `- S
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。2 H+ N: R' d' l3 ^ m
Token 成本对比示例(LenovoPress 场景)[28]:
; T# P+ i% ]' y. ~3 YLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
" P4 Q: r! O5 ]+ Z) @. J: yvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。0 d8 ?7 S ?+ R6 U5 b: I4 P
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
6 ~4 B1 i: s3 j% RLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
) ?4 u- _) E6 e结论:
# {) U! S! e) X高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
- Z4 f, U, z: L VToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
% y$ n4 W. e5 w: d5 R# x二、建设期成本分布:区域对比
; n* B% w$ z5 \1 J) x. e以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。1 Q, a* a0 Q/ s1 D
! K, Z9 W3 s! V, t9 H; V6 ~2.1 全球/通用结构(以 1 MW 为单位)" l: V+ y- ^8 X+ c1 b+ ~
综合 JLL、ConstructElements 等[2][41][40]:
) { M8 P, Y8 i9 X" I" i* R8 H4 s9 c1 r( m, l2 n# ]
壳体+机电(Shell & Core)
0 C- _. {8 n. P$ C
! F! l: K1 d$ f+ n/ R2 d }/ o全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]# k- N. z4 A4 F! C3 J# k ~
其中按成本构成[40]:
& V& m+ ~8 q3 B- Q/ g' P电力系统(变电、配电、UPS、母线等):40–50%
( y& d6 x; Q* U, P t7 Y4 _机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
( g0 E0 d% m4 i! d6 x2 ?, D `" {建筑与土地、结构:约 15–20%
( K7 D) n) J1 n& u其他(消防、安防、楼宇管理等):约 10–15%
% {! ^" U3 b. g- ~IT 内装与 AI 基础设施(不含芯片)
1 q7 z5 |( ~3 m; p0 j
5 w% X$ a1 b/ a; Q9 ^4 ], O% z高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
$ \+ N6 R4 R! e# Z/ i3 mGPU/加速卡硬件 CAPEX
" `- ]8 B+ z; q' V% y
$ }- a$ W/ g3 m4 V: ?多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。: k# r( ^; ~2 p& S; H3 m
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX& }" _) G6 c( {! q* s# |
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):+ m" j& I+ s7 Y' S+ I
9 k' ~! @3 Q; {
区域 典型建设成本(壳体+机电,$M/MW) 备注
- Z8 Y1 I+ B% z( \' e3 t' @( c3 p中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]0 d+ T1 l& Y9 h8 q6 Z
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
' D( X. `( K7 ^, [& b欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]/ f3 r" n$ I6 q6 M) n
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
+ V- P% Q- H o8 N结论:
: M% Y" o B4 T+ p. d6 ?, U" c, A6 }2 b# {; N5 b" S( I
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
# i3 H! b; `- ~ |% j若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。 j$ \! P% E+ c. e! G7 C5 h1 c
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
8 }% C2 K8 Z* \1 ]以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
2 S j, Z' `" d. d4 B2 ?9 A3 n( D; p
! x! @! Q. t8 x- W8 g假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;) D8 b6 M( G! O" K. P
GPU 配置:- J1 E1 r: S; A6 w% f
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);1 Q' t0 P `' P. Z/ U
每 rack 成本 ≈ $3.0–3.35M[34][69];
' c+ a$ @3 z% r* l4 a1 v* I/ ~GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。) l& h* ~0 |- ?% k6 r B) d$ M" A
与不同区域壳体+机电组合:3 X8 y# h: e1 E: H" g9 I, i# i3 S
2 a- T. f8 {8 A- S I0 c. D q
以中值估算:
) c& Z/ p2 A3 ~( m7 {9 L. v: Q: s% {. M2 m$ o
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
7 n# I# |& j7 }/ P4 C美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
$ a& |1 Y' J3 r6 `2 V欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
# E6 H* R5 |5 F' S1 S5 u中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
+ Z+ Z `$ S, i( w7 g3 g可见:1 f! s6 b$ K/ {: v
4 y( T9 x% c9 R( j" O4 Y% _# z! k
GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。! o3 d9 ^4 Y- k5 V
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
+ c: i" U. Z7 R4 J. @三、运营期成本结构与区域对比
1 h1 J! x2 X* g3.1 通用 OPEX 结构(高密 AI DC)" ]5 g3 p S/ ~$ X7 q9 G
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
+ M. F& o) n) ^, s4 ` R+ Q4 H) h8 C/ s* J" _& b
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。$ k/ G5 H" P5 s9 t# \" r
冷却与水资源:9 J- U/ t7 S; B; j# O
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。$ s0 N8 ^ M2 @! g* X6 H
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。. o& u. \ |9 x$ v( J
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
' w, {, ~+ R4 l. V托管/物业与维护: J2 T! z6 f, O& v
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
( j/ r# { F; z. _, A6 ~# Q' O硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
% M/ ~4 W6 v+ P. G3.2 区域差异(以 400MW / 3 年期为例)$ t M& ]! R2 O9 F% V
使用 ChinaTalk 的电费与人工估算[1]:' L) {9 S, Q1 O: Z! p
- s3 Q! i. b6 l# U, _6 v电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:- L( N$ k$ P, f' T) D+ }
中国:约 $0.06/kWh → 3 年电费 ≈ $350M2 {! u) v4 Y( L( J, w5 X+ L1 T1 e
美国:约 $0.09/kWh → 3 年电费 ≈ $600M
3 K5 }, n; L8 H4 Q$ t" ?6 }( z中东:约 $0.07–0.10/kWh → $400–550M( J8 a! C9 \9 B4 @9 D+ \$ L' u$ R
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)) w7 S) W% _) x' ^" A
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:5 f! \) A0 ~! y& E7 s0 ]
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
+ z: a' p' U2 \/ x* v* R三年水费级别:
5 H4 z7 X7 A9 j/ _ m) m' k% T美国:$40k+
' n' M8 A* u- }% u) V u* u. S中国:$20k+6 X4 h% ^: X- ^* s( P x! o2 Y
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
" k$ U. Y4 w% G/ N' j人员成本(3 年) – 假设 500 名全职运维:
% w; M3 G5 y {, z$ |美国:500 × $120k × 3 = $180M+0 t5 @2 ]' `$ w6 p7 I
中国:500 × $22k × 3 = $33M+8 {/ C. k2 ]) {. M4 I6 e" Q# W
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。5 W; n; \4 V8 x7 ?: }- U4 z) x* z
整体 OPEX 粗算(3 年) – 400MW 场景下:7 q% ]% j8 q: h7 W6 z( R
# V1 m8 q- C/ N
项目 中国 美国
+ t3 k3 l! p+ k% Z( i& O/ `电费 $350M $600M1 v" }/ ^& w& G% z
水费 <$0.05M <$0.05M. L9 S3 v1 _# Q
人员 $33M $184M9 a, F& f- V4 E3 K
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 " q! O9 O; ~& c8 W0 q" R/ x$ W: J! l
结论:
2 P* ^, o m+ `, ~% B
8 M( k) \9 m+ ` d, ~, P就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
, S+ T3 Y6 \0 x% C! X- @对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
. Y @* U9 q" x. Z4 u! L四、基于 token 的成本与利润推演' J6 o; w, \- N
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
# v& ^+ y# h% N6 `& X6 ~7 x4 V统一假设:
3 A& {$ {, N w' f; C6 H+ @
4 B6 _* Q4 f& n1 F8 ^. F1 g6 |, B典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
: x" @4 P5 b$ {0 D1 p0 P1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
$ K7 {3 M& o) s8 o( j1 百万 token:278 Wh = 0.278 kWh
6 A2 V+ `/ z+ a% C O场景 A:美国电价 $0.30/kWh3 M( e2 c& A1 Y8 }' p
电费/百万 token = 0.278 kWh × $0.30/kWh
5 j) d3 Q2 x: A9 E" s* K0 `≈ $0.0834 / 百万 token7 f" H$ X0 h4 f# ^) V
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
( H/ B1 I1 n' Q. |- h3 U* Z2 s n电费/百万 token = 0.278 kWh × $0.042
W' s9 o4 f+ m" L z9 f≈ $0.0117 / 百万 token
; r) I3 {- U' u对比当前 API 价格(OpenAI 2026Q1)[62]# n6 _' [* Y; R% w1 a8 g. n
以输出侧为主(成本最敏感):
+ x3 t2 e1 u, M. m, z: q9 q
0 M' {. ]/ c D: ^% T% A模型 输出价 ($/百万 token)3 j0 o' s& a" r7 K- b
GPT‑5.2 $14
# @# Z1 |5 E3 e% e. ?; H PGPT‑5.2 Pro $168
6 e. W2 S* t0 l, w) f0 {GPT‑4.1 $8
' [. ]+ h5 }5 E. a' L$ RGPT‑4o $10! {1 Y% z2 d L' f2 b* p
GPT‑4o mini $0.605 T1 ~, j* O" K a; B9 X
则:
6 n, e1 F* z5 e! q n9 m# b V
7 e5 s* I( n; k# k在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。9 b1 {( h; V# x! | i
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
Z2 z2 `% Y7 t4 }* H4 M) R5 d相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
6 q% d/ \/ f6 x3 N+ X结论:
0 f" W5 p- m+ N; r6 e( s即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
+ D3 ]; {+ t8 w: L6 @" c0 p+ M
4 F/ H% A( A* z% U) H2 ~4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
: |* g& w* u. ^% ?以 LenovoPress 的 8×H100 Config A 为例[28]:1 V1 B" }, I7 A8 N- A0 o* C y" L
- \/ o; r8 Z5 O7 l/ J4 y( s3 o5 年摊销下,8×H100 本地推理 70B 模型:
' X: a0 Z6 G9 U( y% u" o小时综合成本(CapEx摊销+Opex):$12.08/h Z1 @3 s0 y5 p' k
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens$ J! l# q2 p' _0 S& x7 d& q t; j
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
8 s+ E* {1 r: ^5 O, O* l电费在其中的占比:
0 L( c3 Y: R" @5 F8 b% ] l8 ZOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
1 ~! B+ m' L1 d电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token) O% I0 T5 o$ M) A! b% A1 h
电费占 总 token 成本 ~7% 左右。
" }2 l, \8 \3 \6 v& s `# L若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
6 P' U; I& ^% L2 K, G若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。& D$ Q8 u* Z5 u: F/ ?
. U, }' [5 l; R4 p0 \/ o
因此:0 i$ e0 Y# g$ m: Z3 O7 ]7 a
$ S z# Z/ t9 L% q在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
' Y, r9 ?) @ p- O* I1 `( X. ]3 S在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。1 E6 g. c/ E: y# [0 n
五、不同芯片方案的建设与运营成本对比9 F) |- l, b) }% f
5.1 NVIDIA 方案(H100/H200/B200/GB200)
7 V" J7 A$ ^8 @9 d6 R) {( J4 K2 e! @CAPEX:
4 {/ ? W/ _6 ~* H0 f- L% J! r# [' {! A3 S
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
1 g5 T) Y Y8 ^( l' p9 k6 {H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
# J( d; V( n( G; VB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
7 s" j6 j7 C2 hGB200 NVL72:! [3 E d& F$ D
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。7 c0 t) w) }; N; Z* a
冷却系统每 rack 额外 $50–56k[35]。
3 n& Y/ `' T3 C' G$ T+ U在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
5 S. }. |$ h6 {/ R$ ^OPEX & 能效:
( f/ }7 a5 K9 O3 `% n8 ^/ U. K9 h' l, ^2 k! P! B
单 GPU 功耗:! g; u! h: s! {; i
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。: m* L5 C1 p6 n+ z9 A4 [! U" S
H200:功耗类似或稍高,但性能/W 提升[9][10]。+ f, X! r8 E8 Z% c3 T- L& y/ P+ c
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
/ [4 n8 A+ g/ y* F8 Z# KToken 性能:5 ]0 o: c& ?: y$ \. [( y7 f
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。% }$ E/ B, g, f
NVIDIA 的优势:
( ]7 j0 N- ?+ C2 g' e3 z* Y" o7 s, h) b: j' z0 C# P, u
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。" W; R* b' P9 Y- q
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
1 t0 ]2 \& t7 ~6 S/ e! S. f5.2 Google TPU 方案5 h0 q4 R# C! G9 R
CAPEX:
6 C2 h. K, W3 ^6 q+ D' P6 n5 Y% T2 @
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
8 T! q* {6 y+ Q3 z# c# _, yGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
* b2 j% M9 P, t8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。7 X/ @8 ~6 {4 d6 l# o: z
能效:
7 F* K3 O3 n$ V- f
a: c' P4 P( r6 }' {4 Q' QTPU v5e vs H100:5 B" w$ s4 |1 {
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。0 f+ o0 x) U0 D/ }0 B1 S6 }
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。$ e# w* u5 K5 c$ N7 v( z2 `
新一代 Trillium/TPU v7:4 c3 K, l; A/ H _
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。5 H5 U' z0 x# R) N& \7 O
Google 方案的特点:
. @5 u3 y" E" O* z4 u5 C( A
- S8 ?* Z5 Z' e; H- q自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;) Z/ L% g" G( ?: H
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
8 P+ Q6 Y4 C! I5 H$ U) U5.3 华为昇腾 910B / 910C 方案
7 C0 x6 ~6 R( G( @9 SCAPEX:
; {. Z' w0 _& `9 ^/ g+ e
+ b6 Z* L8 v& B* K \" y: D单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。& Y$ d7 | m8 J1 Z' L) Y2 y7 W
与 A100 对比:+ ? c4 J. D1 \9 C2 I* l
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
4 X% l5 G% W9 J/ H$ V市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
4 C7 X! u) ^) ~8 |+ r, m; Y" m: c使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。, @- R( B0 ~2 z
OPEX & 能效:; l/ O# T' }/ n$ f, a; _, x+ v2 S- z
' {2 r: O/ O1 i# ~; `$ ?910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
+ s5 B# w: m9 u" U* X部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。. k6 f/ R0 `/ b( S
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。* |3 h" u8 x( q7 D% I1 ?
5.4 平头哥真武 810E(PPU)方案
" S( Z* f. M9 y: hCAPEX:; w& [! B+ x/ `1 [7 D$ d
% e6 M; h2 b0 ?5 ]+ z
技术参数:
4 [: }( {' k* ^96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
9 T: Z( z3 X' t5 G2 c" a性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
' q" d& S! J' D1 _0 W- g/ e价格: d( T" N' j1 t3 ?
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
; G$ Z2 v0 j2 E. A$ {结合国内报道:
2 `- E% X, b Z5 g2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
; m n C/ Z2 o4 N3 ^5 Z# o数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
0 |0 e- Z" r! a. h |3 Q9 AOPEX & 能效: s/ p* s! i# z! e& b
" P, W4 O& H0 }* @' }/ E& j400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
$ _4 v4 T h( ^, A在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。4 G' N/ Q0 h+ H
六、综合比较与策略建议8 h1 Y( d& K$ V( t/ B. g7 u+ v. v q
6.1 区域维度:在哪里建 AI 数据中心?1 J4 z* W8 W2 J( ~' V6 z
纯经济性(TCO/tokens)排序(假设无政策/合规约束):
9 X* [3 n2 E5 V" v
$ [' e; b. E8 Q6 Q3 f4 e, n中国西部/北部(电价低、人力低、建设成本低)
. B- y7 D) W( D8 |. \1 ^6 }中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
2 w+ \5 e* d( p" q b) s( Y& [美国电价低但人工高;东海岸/加州电价上涨压力大+ L4 f, s2 W1 }/ Z$ M% }
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求6 K5 w; A1 Y1 U- n
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:2 k) e6 @9 M! b' U, G7 y" z! M
3 ]; q/ ]4 k6 t# a2 i
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;# T8 }. p. _0 y
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;& M1 O7 ~" D& x! ?4 }
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
: k2 c h# Q( [+ ^6.2 技术栈维度:选哪家芯片/云栈?, Y- ]! w3 B, d8 B) s
若目标是全球最优 tokens/$ 且不受出口管制:
) J3 `) D0 \8 \1 x1 A
! {# Q2 b/ `' o0 M( U. pGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
9 E. e# \/ B' F4 j若在美国/欧洲,能自由采购 NVIDIA:
' Y! D$ ]" S: A9 D; X0 Y: a( }+ s
; q7 k6 S3 }5 q$ m/ A短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:4 D1 Y6 t( V" q) t8 W0 {: B
成熟的软件栈与生态,极高的 tokens/s/GPU;) [. L7 O# k e5 Q( s/ M
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;6 [9 w) J7 t. Q: P+ X
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。8 B2 Y4 y7 D: V. R& j; g
若在中国或存在出口管制约束:3 m- Q9 z1 X$ ]9 Q
& C4 n1 i6 e6 U3 k
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
1 }6 s: S" t# u% a/ ~& r性能上已能覆盖大部分 GPT‑4 类推理需求;
$ H7 l4 {3 h* r; \) y+ d单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
7 ]4 }& H' \" U) O0 i软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;. \0 w* Z8 k1 F8 K/ l5 J
建议配合:
6 L& [8 q: y2 ?' |高效液冷(PUE~1.1)、, G8 `" t, B8 y' g0 l' f
大 batch、路由(浅层任务走小模型/低成本芯片)、
8 q+ }1 O/ }! b7 q强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。+ L' X5 G6 [" b& y. J( V" T
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:: ~' e* w; z: }- B" }
% x( S2 u2 q3 \% A) G( t数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
+ C( K8 _* F& F6 E; {这意味着:
- i' \3 \" A% G/ y优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);: B: | w! {$ i4 g, I
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
. H6 h! s5 l- h1 O% q7 B6.3 针对你关心的具体问题的简要回答
( I1 q& w4 B4 ~; MAI 数据中心建设 vs 运营成本的大体比例?
: t( e% B( I6 @! a* @4 N9 a& H& q M
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
& J! p B+ e: ~6 u8 b) m3 Q其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
n: }. m6 u2 \% W" [/ j4 A2 j中国、美国、欧洲、中东的成本结构区别?
4 G ]% V1 M9 E( _' x
! K( a4 N3 g, A2 U ^5 r建设期:
4 z7 c+ y6 q! c( v; S" D* A中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
" R" W: S. H! s) D$ k/ H+ X' t运营期: ]) @+ K V* C7 E H! h+ x
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
) z {! y* z: |: [. f h人工:中 国 ≪ 美 欧,中东居中。
! R# {2 F0 @& a% d在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?$ T) M$ T+ ]+ U% A: N2 I
( C8 w. \0 ?( n* l4 \
对于典型 1 J/token 推理负载:
. ]/ X4 h% ?' X5 @美国 $0.30/kWh:电费约 $0.083/M token
; J+ r0 I# k" C1 {) i7 o中国 0.3 元/kWh:电费约 $0.012/M token
6 z$ `3 @! F$ s7 r, D% h对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
/ G/ H! m$ M r! D% c* P+ d不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?7 C! `3 ^+ J) N" O( f, u
7 I. u- i1 @9 B. a
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;) u: q; ?6 j9 l, h
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;3 R3 s, R' U) D2 g: i# _% }$ Q
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|