TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:5 e+ v K: x7 b" c+ I& t& }
8 H4 a" q$ w% P0 \- m一、总体分析框架与核心结论( _2 Z" f( p$ Y+ L; z
1.1 分析框架概览3 F% \. F1 ]* B& V$ A
拆分维度# s, a) d9 F+ q/ z1 ~; b& H
7 o0 Q* F+ a- T0 ]- M. V
阶段:
# [0 V# e- K+ |: g8 z建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施1 i1 E9 ~9 p" r. d, y2 K b' ^
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
0 ?( b9 P* W$ ?9 ?. h区域:/ G$ f! l8 S# u T7 J! T6 W: U
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
. @" U$ [9 W2 ?) u技术方案:+ H6 Z8 Q( V3 e! K6 ]9 {0 Z
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)9 ~" A+ C h% i; ^* |
Google TPU(v5e/v5p/Trillium 等)% b$ u+ W1 Z8 h' {- |. ]7 ^' R; _
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)0 s/ ?4 ]# P: V" c9 ~+ R
算例基准0 B* j0 M* b- n. y- P) q
0 L3 q9 M6 u0 p1 L
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
- i, {* L- ]% J ~4 K其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
& y$ J6 V4 n+ VPUE 假设约 1.11(高效液冷场景)[1][29]
. I* Q# O* z0 }% S5 I3 r时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
i4 c- d$ L+ o% {关键指标
% G: s. x8 V2 a
+ n8 E" R2 \! r' @4 U: B$/MW 建设成本(含/不含 IT 硬件)
4 a5 |" I" w! f: @; a$/kWh 电力成本、L/kWh 水耗9 {- C1 Y5 p8 \( R
$/token 或 $/百万 token 的综合成本
& z& t& ]! a Q/ K, ]: k8 Y9 @Token-per-watt / Joule-per-token 作为能效基准[17][18][26]& e) b0 }( f( ~. o0 v; i! }
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租); V3 f- ^3 E4 |
1.2 高层结论(供决策快速参考)0 o$ @- b4 V. u' X
建设成本:AI 数据中心相对传统云数据中心成本翻倍9 h- l! u+ q; i0 {8 i6 B: w' f; C2 V
9 N3 k2 a/ b) l5 e
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。% g! B! \0 V- l/ c
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
: }# y t# y0 M% _1 k- `- U) I按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
- `! i: p# S6 x( m8 V& a J0 `区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区- ~8 R# V) m% y6 @- O
) d+ h5 P+ r6 w, F4 C: I
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]- a/ d; Z0 q8 h0 `
美国:$8–12M/MW,400 MW 约 $4.0B[1]
8 Q. S0 K: H% ~" L$ h. j7 F欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
N! R; b4 P8 K$ e% _: @6 i中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]: @# t5 [% f" O* B9 D
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
% o, i# s! Y2 _# n' K% ?% z' SOPEX:电价与人工决定区域优势4 Z0 I) b4 J# C4 w# c
- j j6 j1 | o) |, O电价(2025–2026 工商业大致区间):8 v, z2 c7 S9 x
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]/ I9 M) B) V R' L) |6 Y$ f
美国:工业用电约 $0.085–0.09/kWh[44]
: Z, _* A0 G( z欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
( x* n' Q# h5 W0 j+ E* x4 h中东/UAE:工业用户 $0.07–0.13/kWh[47]
; V8 [' f- a8 V* z! v) Y, N: l' c人工:
' H, C9 o/ w: t% B中国数据中心运维:约 $22k/人/年
( [4 o% ?9 m8 }" e& m8 H) d美国数据中心运维:约 $120k/人/年[1]8 n' B2 }+ p! `8 B" v6 Q
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。0 z- g* `% Q% m; z0 P
能耗与每 token 能源成本:能效差异远大于电价差异( f1 ?# s- S! `5 q. l; _: x
; g+ s5 c1 B. G2 f+ q- C9 {& I
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。) m2 C4 \0 n3 y- }
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
/ r3 O8 _0 N O! C, G, P/ K将 token 能耗约化为统一口径:/ H! @0 C9 f5 q% o/ v2 e ]
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
0 u6 ^. A$ P! M# l+ G8 ~( Y5 F8 L中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
5 e- i/ A( m* j2 q; D美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token/ M1 a: a7 c) ]: G) `* S6 b2 O! W
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。5 v9 Q1 A9 d( W% ?. g
不同芯片方案的核心差异
0 L1 i) K7 [& _! I: T3 e7 b, {' R* \# D W% c! }
NVIDIA Blackwell/B200 & GB200 NVL72:
# n" z; P d. w0 A( N& Z单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
* {6 i( o2 t* C9 MGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。% x/ |$ O- L5 e- [
Google TPU v5e/v5p/Trillium:; x( \' q4 T& V7 u
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
1 n( c9 L3 U2 ?Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
+ l% @: W5 N6 P华为昇腾 910B:
, ?0 J. N8 p, P3 X3 g6 [FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
5 D$ k9 w+ y6 Z- ^ b单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
; e' J3 w4 k% H1 G5 s阿里平头哥真武 810E(Zhenwu PPU):
4 w% I5 [8 p+ |4 Z" z; a96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。# a! V5 f# A2 O: X
结论:0 I6 D, b# D! C0 y+ I) j
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。) D" K4 e a+ W5 q7 n* U$ Q/ `7 z
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。' U( Q( _$ i8 a
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。. H7 c! [* ], G7 @- s
自建 vs 云租的 TCO 与 token 成本 p/ N( T* r2 d& O7 e K
( `1 S8 y, V Y, cLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]: U' k6 A9 [8 U: ^
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;/ N7 G: t+ E; b$ f0 t8 H
等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
: E* c6 W# h0 ^! k1 ]6 G; {* r2 a8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
0 B8 M* v; ], H/ F8 JToken 成本对比示例(LenovoPress 场景)[28]:% W, ~6 p e& d2 B
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token: C S; D9 ?/ G8 V
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。0 H4 w" h( z4 L. f! [7 P. Z9 ^
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
. W3 x" g6 U( F3 wLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。- B M5 Y j7 r, t i r
结论:" Y& J1 O" J9 Q9 V! F& i
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。4 l0 ^6 k" @9 ]0 o4 d! I. y
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。. v) p9 {* e9 J8 I
二、建设期成本分布:区域对比
2 ~2 U: p, V1 r" y以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。" J0 I' W8 r: m* c
. Q7 ?) e, S% P+ H7 c' \% e9 ^$ ^2.1 全球/通用结构(以 1 MW 为单位)
Z* V) p8 N! F3 T+ D+ X [- h综合 JLL、ConstructElements 等[2][41][40]:1 P9 H$ z! P) `% q) z/ m% F5 A/ e
* X! v) a4 X0 L: u0 s壳体+机电(Shell & Core)
& C$ M/ p' u2 J5 G& g7 a* u
9 g# p8 o. M( X) Q% g全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]" V' n0 U% s, k B' Q: m' D
其中按成本构成[40]:, c- L ?+ _7 q* l( j: L4 J" T
电力系统(变电、配电、UPS、母线等):40–50%% u. L) m) o5 S- @! \! l$ G6 }
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
- o# @- M5 Z3 u0 ~" x/ H9 v( n建筑与土地、结构:约 15–20%; y0 q9 P% F5 p
其他(消防、安防、楼宇管理等):约 10–15%
& t& ^6 h7 W( J/ uIT 内装与 AI 基础设施(不含芯片)/ s+ A3 t7 l9 T( b; j
; t' X5 P: H9 }高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。8 Y& v/ d# l2 e% e" Y( H
GPU/加速卡硬件 CAPEX
" n1 w" T+ s& L" L( S( }* o6 S9 q9 G1 ?3 z3 ~
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
* a! @/ V, T) [1 W ~7 ~ ]7 B$ B: s2 W2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX
. y0 G, K( B+ u6 ~ o/ h5 t$ }结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):+ c+ M- @7 x3 C- G
4 w+ F* W& Q2 w) ~1 x
区域 典型建设成本(壳体+机电,$M/MW) 备注
6 V* N6 l/ P }中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
9 k: b& ~: m5 @: N* c6 R" c2 s美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
; W/ u" E# j' E欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]3 a; i% i2 v% U- V" x% P. e# i. q
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]- g. a4 l& v; [6 L
结论:
# c) r5 i7 E/ @( I2 c4 m% N+ i
3 @' }1 ~9 e! l% G7 C& d+ ]8 o单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。. r) _. e9 x3 ]9 J, s5 F- Z! x1 J# `9 @
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。+ s! z2 ~" o( c8 ]1 A
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
- {- h D* e; s9 y3 k以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
3 U1 i6 S& o0 a: ]+ k5 P D
( P8 `; a1 _; i" y& j( w) P假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
: Y) v+ `9 r$ ~5 YGPU 配置:: I. T" _; b7 q- H
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
2 O7 S* j' P1 z每 rack 成本 ≈ $3.0–3.35M[34][69];
# Z3 P/ q) Q4 m# j* lGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。$ C# g1 f6 l8 b7 H) e4 t- y' m
与不同区域壳体+机电组合:
$ e2 X$ W( A: V" H4 ~& P6 m- ?4 q) g% I- S) ]
以中值估算:
9 a0 d: d8 e, O1 g9 ?4 \+ ?: S
8 h" H/ }3 f5 l# Q中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
' D7 w4 l( e2 \ a# G美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
0 G8 `& f; ~- h+ X h欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B; t6 E* u0 U5 P1 c: q
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
% G/ l0 J0 I5 e! F可见:' z* k6 V) {' H; N6 p
6 J! |' _3 w* t" nGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
$ n5 k! t7 N7 I相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
; r/ r8 X' F+ c4 R( ^5 b) V三、运营期成本结构与区域对比/ y/ g; I E# P4 L% m5 B
3.1 通用 OPEX 结构(高密 AI DC)
5 i. g6 j9 ?) g0 N7 J, c结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:: P/ d0 A+ B5 y& }
& y1 S5 a( B- c% a9 n4 B x& ?( s j电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
3 o8 w& X( ?6 v% W& K冷却与水资源:
3 I8 e' M7 C! j# z" C. q$ f能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
# ~0 P e) `8 H1 }水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。" h" S$ m- M; ^- _* w6 J/ e: U
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。6 J- U H4 k& ?$ m" u7 {# e2 Z: S
托管/物业与维护:4 [: Q! {8 F- x+ H; l
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];3 b0 N: E* w$ p9 ~% G& }
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
8 {* ?2 g4 a: d" R- n3 L3.2 区域差异(以 400MW / 3 年期为例)
, s% R+ Y2 n' \' v0 y使用 ChinaTalk 的电费与人工估算[1]:+ k$ G+ F8 j$ x9 i# n t; I
7 X* b1 ^& K2 D/ U: i电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
) N( Y( v a& \, |0 f2 i中国:约 $0.06/kWh → 3 年电费 ≈ $350M8 ~" j7 f: ]' f( ]; A9 @- p
美国:约 $0.09/kWh → 3 年电费 ≈ $600M& [" T/ d: v, ?4 E7 I1 C6 i" q- c
中东:约 $0.07–0.10/kWh → $400–550M
6 h( |6 h6 e, \# V) V; [ m; H欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势). {, W" d, b- W, H
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:+ c3 V- x4 l+ x: \7 S0 Y
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
" T& h; l. L- F) i! f9 l三年水费级别:
/ v) o$ R1 h) q' y% S; R1 p美国:$40k+0 W6 S6 k( P1 ^0 [) F: D
中国:$20k+/ j8 U/ {, Z# f& P! k
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
9 w; s' z5 X+ H3 W t人员成本(3 年) – 假设 500 名全职运维:& M" W+ ~& x d( U' k* F0 g
美国:500 × $120k × 3 = $180M+
! W& c0 P% \& }6 {+ j. o/ {中国:500 × $22k × 3 = $33M+) i6 U6 p) Q& G6 U
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。" t5 q7 A" Y5 ^; y. F
整体 OPEX 粗算(3 年) – 400MW 场景下:
% T8 l' p( [6 [1 E+ F
6 o1 ~% X( q; ~5 i0 \项目 中国 美国
- h A# w' J& ^9 m$ h电费 $350M $600M
$ `2 h% y" x: `5 @8 F水费 <$0.05M <$0.05M. k& K% N. L. _: O. u4 x/ E
人员 $33M $184M
3 G# Z4 Q9 m4 `. y( D5 m+ _9 O其他维护/托管 同比例估算,地区差异主要体现在人工与地价
& Z% f3 L z& W( B# H9 Q结论:
^! O1 W* h* V9 ^% P5 J0 W
4 w2 C0 i# p9 D- s9 B( f就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
' q: b' F0 Y- o: P V, e对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。$ Z3 d) g0 \9 R! d- [
四、基于 token 的成本与利润推演
- d" n0 A$ r# ?% r4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元) A9 d" c3 b* A
统一假设:
, W: K) y1 C& l J; m: X- w. u' } T- p* I
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
2 d: {) @! B, c0 p7 A1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh; C2 R3 s$ @ t# Z: O3 U0 ~' S
1 百万 token:278 Wh = 0.278 kWh) Q0 R8 w4 ]: j% u
场景 A:美国电价 $0.30/kWh4 i! O* I: Z. j+ N& s$ T
电费/百万 token = 0.278 kWh × $0.30/kWh
$ _/ b& J" U4 i/ d8 X0 d6 i≈ $0.0834 / 百万 token L* w0 g- R" q8 m" U/ z$ `$ J
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh) y( \* h" E; d0 b) I2 _
电费/百万 token = 0.278 kWh × $0.042$ _9 k I3 d! ^- H& q5 q. e5 b0 o3 X
≈ $0.0117 / 百万 token
( S3 Q2 y4 f1 j) L8 x对比当前 API 价格(OpenAI 2026Q1)[62]
3 F( j+ _' I: v% H" ~! Q5 G0 U以输出侧为主(成本最敏感):2 Q M; V1 L* Q2 i/ a! k1 r
H/ m# E% \9 P! q0 v
模型 输出价 ($/百万 token); K4 m1 X' u3 ]) Z) \1 w
GPT‑5.2 $14
) V9 g9 c. q# o: V: E8 A. `' K; yGPT‑5.2 Pro $168) B8 n8 V9 Y( W$ }
GPT‑4.1 $8# z0 r4 a# [- q; J0 i4 o# q7 r, a& x
GPT‑4o $10, R. K L2 D" p E
GPT‑4o mini $0.60+ M3 ]5 K! P" X; B
则:
; H5 j- Y0 l& b) ]
3 f1 R B7 A7 a5 W" d8 H在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
~" `) \9 G2 j; h6 I在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
! n @! k3 L3 [2 P. {相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。2 H4 B1 ?; p- a- {, z- F
结论:7 r, v8 D( |8 w# R
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。0 s0 M" j1 f# }) k9 A& E( k
! U! X% s8 v* G% k" J! o3 \4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
; x4 f' _( l/ T! R以 LenovoPress 的 8×H100 Config A 为例[28]:
* N3 g/ Z: s$ Y% K! D: }
$ n1 q9 G0 S3 z( Q5 年摊销下,8×H100 本地推理 70B 模型:( ~' M4 C6 Y' H/ J5 U
小时综合成本(CapEx摊销+Opex):$12.08/h
) y, q& c$ n, f" Y/ O吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens" J6 W9 `" q6 W& O* G8 Y
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token5 M/ h$ L6 o2 C5 v) G
电费在其中的占比:. U+ o; Z6 R( a/ r
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]# ~! y% B2 N- ~
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token* [1 @: Z8 E `: j; z0 J
电费占 总 token 成本 ~7% 左右。
7 X7 ]: ]/ p# q! d# n" u若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。" d# u3 v0 P- r- b4 `* V/ e
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。
# V3 D8 B' T( x9 d. @
) R y4 j i9 `0 h( H; M/ o3 {因此:# d& e) h- B( T3 K. \/ e
$ K) [' T3 y5 u s' o在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
: D c0 a& u2 q. P4 _+ f3 f: b在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
# @/ W3 J' j% r7 n! P6 T五、不同芯片方案的建设与运营成本对比
3 E" ] J4 `9 ]9 |4 h, ^! F2 h5.1 NVIDIA 方案(H100/H200/B200/GB200)
% d- z+ m5 ]# Q0 D0 _1 b; N5 _& _. GCAPEX:
+ V v, t* j' j: I9 n; ^6 F, {
- [: U. K$ ]. B3 z8 @% F- ?7 t; K: @( `H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。" D; ?6 t' e$ I
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
( X/ Y% k8 E' d# G& [) @B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
( P7 E# x) M2 F, V; ^& w8 A xGB200 NVL72:
$ ~ ?! m; Q/ o! _" O9 S; h" @每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
) }' r' T/ P8 B1 x, p冷却系统每 rack 额外 $50–56k[35]。" ^- h, T$ L" b4 B+ m
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。! `6 Y0 p) `& m, C; m# h% Z% B
OPEX & 能效:; Z2 V# U5 ?( ]* {0 S* G
' ~9 o; {7 I$ k x8 p7 g
单 GPU 功耗:0 g" C" U( f. r" X
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
! v# Z7 r8 c3 h& dH200:功耗类似或稍高,但性能/W 提升[9][10]。% e! H3 C6 b" ^/ q# S) Q
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。% K6 s: S% B& l2 B7 A
Token 性能:- M( Y" j: v. m, {6 W/ l9 k
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
7 Z) ]) @, ^$ M1 u+ z% [NVIDIA 的优势:' Z" I) B9 T3 [/ B2 X& |4 p2 ~) e
?# V0 h4 i2 }1 t4 U' v软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。. b$ W. \* j9 |* q9 [
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
) a. z7 k; l; l- h( t. L* x6 q' u0 C5.2 Google TPU 方案
. |; d2 ?) B: e5 Z5 O. O6 [CAPEX:
9 `! X d0 `6 }# q
5 B1 \# n+ d- @1 L- A单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。6 `$ `3 @. E F
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
) V( b, }$ V* Y8 G$ w8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。( F0 x9 c1 M6 N/ R* c/ G! F4 O) p+ v. v
能效:
* I! C, H1 R# w4 y1 v4 W0 C1 ^
6 r9 ?. i$ T# A* _0 o0 j. _0 hTPU v5e vs H100:/ P& ~0 r5 K; ^8 n+ Q) ~
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。* n9 S& i# Q2 t1 v
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。5 ^: R/ w7 {) ` I1 `& Z
新一代 Trillium/TPU v7:7 L: z' v* `0 w7 O8 e. ]4 v. _
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。6 {6 o ?# y, M7 l3 J
Google 方案的特点:
8 j; T5 a% k/ ~, E4 B
3 z: M0 k! ^5 S# Q/ ~2 m自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
0 V% ?* f$ W% r+ Z2 h# t! J1 V. @对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
5 y( p9 H6 i. E) }& Q0 k. Q5.3 华为昇腾 910B / 910C 方案9 g- N; d* n6 J* ]8 ~# b
CAPEX:0 g- d8 U, Q" N2 D# l: i6 z
) }7 G: }1 p) j2 P9 S
单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。1 f' u. T: }0 Y1 T
与 A100 对比:
3 F% U6 A; G6 [1 V! O8 N7 pFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。% j' o+ j; D' ^% v
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
2 Q7 B# T1 Z! ]6 F使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。( T' R: \; P* P/ L. }& p ^+ X. w
OPEX & 能效:
0 i" g" x: V6 ^! Z' B3 m
4 B9 ]) R' @) @$ `; B910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
; b; L9 T; e+ s5 G7 k5 ^部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
+ Z/ V, }: q) w3 j7 N$ q在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
}, a5 z) H: e' Y @5.4 平头哥真武 810E(PPU)方案
* [ A' V L$ [8 q* E" @8 mCAPEX:
2 q0 e8 _& X2 d% Z6 A0 b- u/ z0 }2 y
技术参数:0 s. m' \$ t3 ~1 `3 ?( u- d
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。. r# |8 y8 e: c3 I
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。- V( S. H& F% C) f8 i
价格:8 E ^0 ^( n4 p. \6 Q% f' i6 @# p
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。8 w1 _. W4 g, U
结合国内报道:0 w3 `# s- o1 o
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
. t1 ~3 Y4 n9 F数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。0 Q( h/ X; g1 Z/ e2 P
OPEX & 能效:
; o9 i! Z$ {; g& ?* B) C. w( i
! P$ a) E3 c9 {- }2 @' O7 ~ o" g, w400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
$ y7 `) G' @4 B在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
% `- s* R4 U5 g. Y3 i9 Z& D& e六、综合比较与策略建议- j7 n! ?- V; \9 W3 ]( C9 u
6.1 区域维度:在哪里建 AI 数据中心?
' M# f* U( f1 f, l; c& W纯经济性(TCO/tokens)排序(假设无政策/合规约束):6 s; {4 r& s0 s
4 i+ n+ U2 K% o中国西部/北部(电价低、人力低、建设成本低)0 l6 T+ b) o$ V7 V
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)& ?7 s4 n! W& n- g/ y5 I% B9 q
美国电价低但人工高;东海岸/加州电价上涨压力大% O |7 E! c! Y* ~2 R+ _8 i
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求; E" p6 e; N1 \! p; k8 d+ k+ R
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
- E a; Y B% N0 {$ o
. L y% l& I0 k9 H7 O纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;2 N( W* m+ X: k" O
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
/ p- H x' h! v. b6 @但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
: o/ A1 l* w, n/ A C2 z6.2 技术栈维度:选哪家芯片/云栈?
& v. M- U$ B" D* O若目标是全球最优 tokens/$ 且不受出口管制:; w, |1 Q" i+ @
7 ]8 v- a1 `, t6 T' gGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
3 x5 W' g3 H8 A: Q' d若在美国/欧洲,能自由采购 NVIDIA:
/ p- C) z7 w$ Q* v: x+ y3 T
- R) e; ^' J/ S- v! d短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
# R+ j1 C0 b; T, l: f2 c& ]成熟的软件栈与生态,极高的 tokens/s/GPU;
+ s7 ]0 L. {: V1 n( _在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
. w! k( R& y2 E! g8 e( l: d* D但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
; L# N0 X# c( Y, a若在中国或存在出口管制约束: c. O4 U: w' g7 f$ ]
' X+ c! B1 I8 N3 p2 h昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
+ M) [% F; j8 V- g# d5 Z/ i性能上已能覆盖大部分 GPT‑4 类推理需求;. l: Y) Z) r z; r. L
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
7 v7 ?/ H! f5 y软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
5 ?# i% g9 H+ M* F% p. Q' E建议配合:
! k9 t% B d5 i" Z7 _7 s) D* j高效液冷(PUE~1.1)、& G( M5 R+ m$ C5 v8 ^: l4 }
大 batch、路由(浅层任务走小模型/低成本芯片)、
- B9 l6 h/ @7 J) S强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。3 K( l" E5 z* h
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:, R2 [3 [+ R- u! S- B. s- x8 A
3 A2 B: `0 I4 s2 q# t6 e数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
7 m. n- ]2 s |, _这意味着:
7 x1 B6 A8 a. ]) c0 b$ g6 M优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
/ o. p8 s; @8 y" g `" O' e0 @# X8 s精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。8 I! {5 t0 P, e& {) G# C
6.3 针对你关心的具体问题的简要回答! P# s+ K5 c" e9 Q
AI 数据中心建设 vs 运营成本的大体比例?2 W6 X; A+ h: F2 \% C
9 w1 J# ^( `- D% m在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。, J9 C4 z% W, P
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。" e# P6 R2 s# s1 w8 A* y
中国、美国、欧洲、中东的成本结构区别?
4 Z; V0 ~/ O S# H& K
# H4 \$ T' Y/ V- y建设期: {: |( e4 T! c: ?& _* `
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
' q k6 P1 @. j) X( G5 Y运营期:
@2 z: M& e4 E# i) [电价:中东 ≈ 中国西部 < 美国平均 < 欧洲1 L% N8 w1 }/ n Y0 m) q$ m
人工:中 国 ≪ 美 欧,中东居中。
/ Z1 Y ]) M5 n5 C- b8 F在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?1 w+ q! u: `7 |& m; \
1 H+ {* n) i8 X3 [对于典型 1 J/token 推理负载:% Q: B7 |* X& }
美国 $0.30/kWh:电费约 $0.083/M token: y: V6 {2 g7 K; y
中国 0.3 元/kWh:电费约 $0.012/M token( b7 u; G" Q6 l/ j# v" d
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。! T: R5 e* N$ T5 w/ p% ~
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
7 ~# b. d: l* M! T( e
. }9 y) O6 k) H8 _& Z: f8 y6 K8 W在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
( f* n. g' _, L9 Z# Y全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
; g: k. p3 N) b4 A: ^3 u中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|