TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
- E. E% X9 h* H* q) y. H7 v
: y( @% p, q$ e' }' {& t一、总体分析框架与核心结论5 m/ P- i4 _8 H
1.1 分析框架概览% J. ^/ P" l& Q8 v. {
拆分维度" f6 z& C8 d& N5 e
7 e0 E1 W& C5 `# l1 B阶段:
2 A/ Y$ s, _' R5 F建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
' q8 w0 a3 f! w9 X8 r0 g运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等% v f& d) c. i3 A: \1 Q
区域:
# ]; V- k6 N2 ~0 x中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
2 R( `- O+ l+ ~! S技术方案:
' X1 l& K: c9 W5 h# p( {+ Z4 O. C; pNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)& |+ l2 @2 Q8 Z
Google TPU(v5e/v5p/Trillium 等)
$ p+ W- g; m) ?3 O; a* i: U中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)) \- s4 F+ ~, w: b( j
算例基准% c9 x, e9 b0 ~: Q8 Q4 j
! A8 o9 @4 }5 f6 L9 Z( |以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
|1 r" |& Z5 C J9 x$ }其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW. Q) ~( q" S F5 L4 c+ J
PUE 假设约 1.11(高效液冷场景)[1][29]4 l+ o& F. \$ @" N- Q/ d
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]5 U5 w, c( Z) c6 w
关键指标* w0 J6 a; O) K' _
) J+ j' p7 R9 z9 |( b9 d0 f9 k+ p: J$/MW 建设成本(含/不含 IT 硬件)% Z# F/ L0 g" N: o
$/kWh 电力成本、L/kWh 水耗
8 M& a9 w4 s' }) ], C6 c% A$/token 或 $/百万 token 的综合成本, P" m `* X: T; S$ p9 @7 k* r
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
$ W. q, K; h: }! `. K/ T项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
; j5 y! A% y" g1.2 高层结论(供决策快速参考) f& s# T4 s+ \1 O( g6 z- l
建设成本:AI 数据中心相对传统云数据中心成本翻倍
& N, C/ f0 g+ b9 g3 ]6 j5 Z* c1 |+ A& n+ R9 ^
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
, N8 ?7 N% P4 MAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。, q; V" N* c/ W2 q
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
# g) X8 Y% B4 V+ e5 f! ^) r X' W7 b% g区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区2 C- N9 w' C& F5 a, P/ f
+ n+ V/ y C! @7 {( p: X' w$ Q中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
0 h: \9 u0 D" {$ |; [, p: k8 |) k美国:$8–12M/MW,400 MW 约 $4.0B[1]
, D4 Q% n1 }3 P6 e8 u% p6 i# R欧洲:接近全球平均 $10.7–11.3M/MW[2][41]
- ]. q* _4 B) ]& }1 S9 u中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
3 | j0 y1 x: s! z' F' j2 A结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
7 g( q! [ k; c& ~% f b5 AOPEX:电价与人工决定区域优势
- d5 x& h* P/ Y
1 v3 ^. m7 D$ V- e" x# Z" z电价(2025–2026 工商业大致区间):% P, b/ L" z$ ]/ i% r4 p: A
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
" H- K; E+ o6 `4 P# m美国:工业用电约 $0.085–0.09/kWh[44]
! x' r4 C# ]6 z: Y3 d+ F2 S0 @欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]. U- ]% u# ~2 o4 g
中东/UAE:工业用户 $0.07–0.13/kWh[47]6 H; _. D5 v" R0 p, ?3 i
人工:# D! @( f [0 I6 z2 E" S, F6 N
中国数据中心运维:约 $22k/人/年" |1 B$ K" v R
美国数据中心运维:约 $120k/人/年[1]1 I4 B+ ]7 F; d' K7 F
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。3 f! Y0 W+ w" l @5 j W
能耗与每 token 能源成本:能效差异远大于电价差异1 v' P9 t, e$ X+ }0 F& z0 N
1 \) I$ b$ c' t3 ^IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
. x& f) c" l' I7 D$ x大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。6 I# S& A0 t& h/ j6 I+ ]
将 token 能耗约化为统一口径:8 j$ G% S+ G; ^2 m. Q
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
# I$ x& Y6 z+ F) O9 n中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
( V3 K5 \' a+ W r }美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token; N' }, g' _4 `- ?( k' c6 O
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
$ R- w6 [9 Z( M: o" H* Q% W2 n不同芯片方案的核心差异& K8 o7 _' q6 Q
& S3 I% Z+ K5 |) Z9 y% aNVIDIA Blackwell/B200 & GB200 NVL72:
0 y4 R0 r7 U: O1 C6 r单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
1 p2 D$ C1 ~3 G# L7 q9 w9 k9 HGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。% |$ j/ k) J2 ~, o) {0 r
Google TPU v5e/v5p/Trillium:3 Q) I8 @2 b% D* V8 G {5 C+ y
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
0 D: J. m6 l7 x8 qGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。) d6 W* h8 n( Z
华为昇腾 910B:
7 ]4 K; R T! I; [6 [FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。5 u$ H* @+ H' P: m$ h
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
i3 U( F, ^* p* x2 f, u阿里平头哥真武 810E(Zhenwu PPU):
5 C$ W$ i6 }# c& t' Q1 i! i# D96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。' x) V; U) [9 b1 y$ g1 G& l/ m- s6 k+ J
结论:9 i2 q8 n" L# E+ B+ L# m5 G
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。4 l6 |; s- Z9 l9 r/ c
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。1 g- b! f. t X$ L2 U; b
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
% k3 p y2 C* n. c. B自建 vs 云租的 TCO 与 token 成本, v1 p( n9 |5 ?2 d7 L$ V* J
, [- }/ ^! z. v; n& L! o# W& @# t
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
) r x) x+ ~+ ]' e1 H8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
8 P1 d7 y- K) E8 @; ]等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
( E! h- o( L% f, F8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。% P3 m. e! L$ G/ t: R* [# s
Token 成本对比示例(LenovoPress 场景)[28]:3 y" B/ S/ \+ Z% A+ l% V+ A
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token6 A. h& g1 b# Y% ?3 C
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。9 I; a/ p& [! o% V3 I- j( T5 u$ x
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。/ U* }1 _; W, s
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
7 A$ P+ b2 p; W- J3 f结论:
3 g9 E( [9 s Z7 Z8 y高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。8 u0 j1 ~ _; K+ z4 u
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。 [' q! B& Y- m$ ~( W
二、建设期成本分布:区域对比
6 g/ z) F! j+ o( R4 _' `8 v( j4 z' g以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。7 x5 \7 W, z" B: p
8 ~5 S8 o7 F1 S$ t4 G0 Z
2.1 全球/通用结构(以 1 MW 为单位)$ r/ g" o P+ d+ o% A3 K$ j
综合 JLL、ConstructElements 等[2][41][40]:
! S# Z& K) Q7 c; M D6 z
" o6 i, n' A) B; _' u2 l壳体+机电(Shell & Core): ~# U; A6 g1 L f9 P' r
) ~! ] U5 ]8 p. ^7 Z1 c, ~
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]/ H. J5 h5 h# r* ^" T; V+ A3 w, y
其中按成本构成[40]:" `: E/ ~) ^$ n! c1 N( E) u
电力系统(变电、配电、UPS、母线等):40–50%
2 w* e* U7 H0 p4 p机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%/ q3 P4 A, c# ~
建筑与土地、结构:约 15–20%
5 F J; ^; l! U1 W- R9 R% Y% [其他(消防、安防、楼宇管理等):约 10–15%8 g& E, Q }0 D6 x2 m, ?
IT 内装与 AI 基础设施(不含芯片)( y7 D# B% Y- V5 W
! |' Y4 h& x. ?9 c
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。* v8 T! X) r- X7 z4 w8 R
GPU/加速卡硬件 CAPEX; T; H, P0 C) M
& h( X& B3 \3 l& `多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
; r" q9 C% I: h- o+ d4 W4 |) Z& n2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX# Q: H- _2 m( U( |& P
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):+ J3 o P3 j4 ]4 x+ o
* w* }8 p' y( Z( ` x/ F区域 典型建设成本(壳体+机电,$M/MW) 备注6 x6 p) K; r8 L: S
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
: P) P. w% F! V5 W美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]! r( B- t, E x/ S6 A$ h6 A3 Q, s+ ~
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]: Z1 h: i# U$ p6 Q" a) G7 k7 C1 h
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
4 U" Q8 a8 m3 f& H" a0 `% z6 k* y结论:$ z6 U+ ?& n) X1 ^6 A
K8 N! c U1 L) [单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
) ]' t0 c$ V* }" P, U$ k若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。" S+ B- `) O5 r7 E4 I6 p. e0 D
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
; L6 P% S7 h5 Y以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:5 R% w2 h# s/ |
+ }5 o; x2 h9 y& f/ p
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;8 D2 [/ C) J/ R+ m' n4 J9 @1 s! L
GPU 配置:
! M s$ L1 ^& L9 r5 j$ h有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
& d. R& M1 ?7 T) R! u. g4 u: x每 rack 成本 ≈ $3.0–3.35M[34][69];
2 z) Q3 {$ L( _0 pGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
# E/ {3 n; K+ s! ]与不同区域壳体+机电组合:
# m9 m: D5 w. o
% l$ V# e4 ^8 A# Z! b& W以中值估算:
7 W. A6 e4 V! A1 p% v& U
! {( t! Q4 a% o* c. X中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B" ?" q, {0 N' J- q+ D; \0 V; T
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
E/ P' M6 _# D" z( {欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B) k: @; m/ R+ S" b0 M" k
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
- l) j9 w3 ~2 \可见:/ ]# `3 X7 n9 o) H6 a0 u% _
3 l' @( b; b0 pGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。3 _& k: r& ]' Q" [& M
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
6 t7 ^, \* m# _ }% A; K( O三、运营期成本结构与区域对比 i! q& c* Q8 a; K! X
3.1 通用 OPEX 结构(高密 AI DC)
" ~8 K# F+ u6 D8 t- q7 r5 c( H) |结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
% v. H* B: p* S
; Q3 k$ E! d1 O2 D# |电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。: Z: y1 S v$ B
冷却与水资源:" y! p# S- n* A' j2 v0 I
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
$ U1 m# n; S" ?# S M6 J ?* X" Z' i水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
' Q' o7 K& }5 @6 N0 ^人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
4 X" a' L. t1 K$ `$ ]8 n托管/物业与维护:9 ?* H( P- ^8 @ v( Y6 p
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
+ C" A7 |+ C2 G; @- w硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
6 A8 D& F% Y1 M; L3 ~% N2 r9 P3.2 区域差异(以 400MW / 3 年期为例)
1 J3 E2 Z" ?/ S/ F% i使用 ChinaTalk 的电费与人工估算[1]:$ T: {/ v) w& P# i; ]! i2 e/ D% B
4 _1 u# C" Y v* y6 a4 E
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:8 I: m3 R" P5 Q5 F2 X
中国:约 $0.06/kWh → 3 年电费 ≈ $350M
, a- a: U2 y: k/ |$ ?美国:约 $0.09/kWh → 3 年电费 ≈ $600M1 l; m7 U1 B, _$ ]. O4 D$ I* G
中东:约 $0.07–0.10/kWh → $400–550M
3 i$ H9 F$ I7 a: {/ a# k+ F0 N, H7 j欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势). W8 m6 B0 Y5 j3 f! J
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]: w& n2 o: I7 [- t( W" M' u
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]: O6 z/ s1 Y" C& Q
三年水费级别:: F% Q9 r$ B z3 G& ~3 s. ^
美国:$40k+
' J$ [. _: v( B9 k8 j7 d9 y中国:$20k+! q" k1 H# R& p
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。1 C+ m7 _; A% x# z
人员成本(3 年) – 假设 500 名全职运维:
- R1 U1 `; G, L' C" s美国:500 × $120k × 3 = $180M+7 O% l6 x: n4 E: }0 \ A# c
中国:500 × $22k × 3 = $33M+
0 i8 c& w- T; N! G& x差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
3 ]4 W9 f6 U$ g8 c整体 OPEX 粗算(3 年) – 400MW 场景下:
, `' q! s1 [! O9 q9 p
! B: t5 s* v _" U项目 中国 美国; c" W# [5 J# G: v
电费 $350M $600M5 T+ @! G+ f! o5 b, w* L# [
水费 <$0.05M <$0.05M# ~/ N; w+ Y7 `, Q/ x
人员 $33M $184M
# }+ J" y" U. Q4 k% g0 F9 B其他维护/托管 同比例估算,地区差异主要体现在人工与地价 . u- Z8 K8 l) K) M
结论:
& C2 x2 w E4 @
( r: p3 n1 ~3 _& T/ z) l* L就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。
4 R3 g$ f* h$ Y* e, u对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
) k0 {$ @' C5 ` i1 o四、基于 token 的成本与利润推演
: M/ h$ B+ |8 G. Y8 m& G$ R4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
' a7 L5 m' L# p1 F统一假设:5 w: Q g% g4 N- _, t
6 |+ c9 v4 E/ v' [7 @, I典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
9 k! u% _# m. j0 w1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh9 x! X6 X' Z3 h3 P
1 百万 token:278 Wh = 0.278 kWh
; v w) q0 j/ m6 G- y& H场景 A:美国电价 $0.30/kWh1 P x4 \8 F5 ?
电费/百万 token = 0.278 kWh × $0.30/kWh4 o! I4 N& ~! y* w
≈ $0.0834 / 百万 token& a7 X# m$ G7 ?% F! T
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh3 s- m: x- b0 a2 M, z% m! m
电费/百万 token = 0.278 kWh × $0.042: U5 `0 Z9 w: u& ~' _
≈ $0.0117 / 百万 token# j) ?- _9 O* e/ N+ O8 q/ ]
对比当前 API 价格(OpenAI 2026Q1)[62], _; U) `( G2 w+ a) G
以输出侧为主(成本最敏感):( y4 d8 c3 n: q: D* n
7 _. B& s% R: {0 l6 l模型 输出价 ($/百万 token)
* O5 v6 h ^2 a7 IGPT‑5.2 $14. o0 m: u/ F4 \6 \6 b
GPT‑5.2 Pro $168
; ]; `5 d E) ^* T5 qGPT‑4.1 $8
, d; B( c5 ]( T" n4 K6 B+ cGPT‑4o $10
% `+ ^( P% D, f0 E5 FGPT‑4o mini $0.60% G3 K; \/ T4 m0 m
则:
$ u j0 @! m5 p* S' A: \- s g) |& [7 A& S0 G
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
: ^/ v0 U8 n* v d5 q- H在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
9 b j2 H. j$ R相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
% ]9 e+ E2 ^. c结论:
$ C9 k' r E; y% o* o& t8 t即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。/ Y$ I0 A$ j+ I E8 O8 R3 J
7 U5 z) B$ M& I2 r0 m* ^. w1 l4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
8 Z1 \5 w) g. ^# o以 LenovoPress 的 8×H100 Config A 为例[28]:
: u% t4 `3 n: I# M+ L1 i R: c$ M$ a0 F. M5 m0 r; c0 V( W
5 年摊销下,8×H100 本地推理 70B 模型:
/ f' F( R7 b1 B" u5 F' P# h6 J小时综合成本(CapEx摊销+Opex):$12.08/h" y o( b$ y4 e9 ~7 Y
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens7 w. s0 b. y" P( z2 K+ o2 f. K
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
7 s7 ?0 f. Q& \- ?电费在其中的占比:
. ^ n3 V$ U9 m; C- s' @# [Opex 6.37$/h 中电力+冷却约 $0.87/h[28]
( d2 V1 m/ o3 C0 Y* Q5 B# S电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token% B) g+ ~/ }4 c+ M4 I) }) i3 d6 d
电费占 总 token 成本 ~7% 左右。
) Q1 J% I$ E4 [" U3 I% I若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
2 X2 t& ]8 Q/ z! \6 s4 w若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。# z! q" f; j3 P; Y/ f
0 Z- q6 {9 N* I6 y5 r因此:
, b @3 E. p1 S% p0 n
1 A# K. X) S" z, `6 Z在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
6 O7 S" E ~! h* F* }1 q在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
5 O/ x7 y$ [7 }5 ^0 n: a: O五、不同芯片方案的建设与运营成本对比' W4 Y2 @9 i: G2 b
5.1 NVIDIA 方案(H100/H200/B200/GB200)+ _5 w, y& l$ Q0 V
CAPEX:
# m" G, \0 @# ?2 |, p( L/ Z
' b0 d; W: O# S* i! n* V- VH100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
0 D: C8 C6 H# T+ a5 fH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
. t6 `0 J Y$ h: B6 K1 T( _; b4 KB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。; V; J+ y& a$ t6 j: N) z
GB200 NVL72:
% y6 {* d7 _/ W; i; B: q每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。. d' a) y* L2 N* `5 ~
冷却系统每 rack 额外 $50–56k[35]。
\$ g9 y0 G6 g在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
, Y# Q2 k; D- j' }- POPEX & 能效:4 l- T$ N3 g" {" H1 d& n
6 i) D% H) N" S) l) V
单 GPU 功耗:
8 J* j9 c$ X# @0 S: p2 ^H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。+ S c7 o2 M% X: o# {' M& M
H200:功耗类似或稍高,但性能/W 提升[9][10]。0 j) Y# C7 y1 V6 O% z
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。1 E$ m& K! x5 J/ Y
Token 性能:
4 m, ^4 I' B9 f7 t+ k4 \* ZB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。( Z! H: n& @' i R$ R
NVIDIA 的优势:' U7 Y( _5 X; q: }. H e. V" s
* c+ u. W! c, d9 [8 P3 [8 R( M
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。+ t" b" W% ^/ f j' B6 j( {
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。; T1 ~8 N* B- X9 W( G
5.2 Google TPU 方案/ j4 j" j. {/ k5 J( q
CAPEX:
0 w8 t% H6 G9 D3 c
) `+ E4 d' O9 c& y! R3 t单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。+ n0 P, @* }2 p' H; x6 D; \
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
; m0 V2 C- Z M/ ?& X) h( }8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。) @; F2 F) N- A. y6 {
能效:
. a0 N9 E/ X4 m$ z
3 m9 }6 ]& S7 N$ M0 ^1 W1 \TPU v5e vs H100:
2 _- g9 [4 D' J- X/ ^4 {% G* C1 o同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
: ?, e+ ^! L4 {2 o测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
9 N, T2 o$ H5 \ D新一代 Trillium/TPU v7:( m/ v/ H. Y* r. t
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。* s M8 y, N% M2 w8 D9 I
Google 方案的特点:
7 h% l/ O4 ^# s o- M3 I
! K) n/ o/ O7 D4 T) K: u7 T自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
( Y- e2 l4 {9 y) L, o; }! o对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
1 P R, l( T7 n7 {+ t# }1 c5.3 华为昇腾 910B / 910C 方案5 B* R! F2 i" b: K
CAPEX:
: y# n$ M& Y; @ [
w- t$ P6 j; d. c3 y单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。! O6 m+ m/ s( U$ v+ b% T
与 A100 对比:. [% c1 u4 c5 r
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
- Z! z- N) Q/ K2 ^+ U) {/ ^市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。# a1 ^. Y: z l* _. h
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。, \. E) @4 a' J3 L/ ^
OPEX & 能效:
2 C8 S$ z' Q- _9 p4 U7 m' Z$ w6 E% Q
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
5 V0 L# e$ X& y8 D3 u部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
9 v2 k' O* L& ~6 T5 _6 J5 _* ~* d在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
# d5 ]( {& o9 {. e1 h5.4 平头哥真武 810E(PPU)方案
" y: b% E2 d6 ACAPEX:
. Q# r7 S D! b/ n0 y! j: k5 Y: a6 y7 P% \- k$ A" t0 m
技术参数:3 P n* F4 i4 \6 `% n
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。, n/ c& }- C/ q3 ~
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。
0 ^7 Y9 W+ B ]! v& B% Z; y" d价格:9 Z* o8 [# K; O0 [" @0 a7 C$ e
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。& H0 z0 W4 z" P* P" E
结合国内报道:
. s+ x6 }. p5 N" u8 X2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
# g1 k9 b l$ b- ^8 L/ H- [数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
- c' ^7 O% Y1 Q' VOPEX & 能效:6 N! Z2 L; H! u) U7 n. p
1 y' j0 D1 G/ C' b" _3 D- p400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
0 L$ w/ ]( U1 ` P- u在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
4 `" [" Q: ^/ w7 D; r2 S7 U六、综合比较与策略建议( V. ~: Y4 ]4 Z4 d. y
6.1 区域维度:在哪里建 AI 数据中心?4 E% A5 `, F& t9 k' Y5 I6 p9 I
纯经济性(TCO/tokens)排序(假设无政策/合规约束):
% x/ U3 {8 {" k' J z
$ t. K0 C( H5 W6 r/ q# R& d中国西部/北部(电价低、人力低、建设成本低)
/ }! Q: W! b9 Z: ~. ?# c0 ?& Q$ q中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)9 _ w6 I9 M2 K; @
美国电价低但人工高;东海岸/加州电价上涨压力大! e) S' ~2 F$ F9 |# I$ o
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
) s" S! ~8 L$ e5 Y5 J: w若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:& G. X- j" K% s9 u6 z. i
2 p5 {' @& S! n( \8 I6 N" s m4 H
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
) g0 b) K3 G- J+ j! _, z对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
8 N, ^! ~- e/ }; K6 U/ S但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
) U' _% n0 R4 u' [/ h8 L( h: ?6.2 技术栈维度:选哪家芯片/云栈?
3 ?% ^# F: F- _ a. _若目标是全球最优 tokens/$ 且不受出口管制:) T3 Y0 x6 o: w1 X! g2 W
v2 S* ?. c' X$ I5 H _Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
) U" B8 `' E. q9 y' B$ f若在美国/欧洲,能自由采购 NVIDIA:3 G' ]% e% ?( d
/ U- o9 [, P! l8 ]5 B短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:& D v, m, g' t7 }1 Z ?' N
成熟的软件栈与生态,极高的 tokens/s/GPU;
. O# M! s& h" O在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;' i |! M: f- @5 z
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。' x, R# l' _& s0 H; c$ C
若在中国或存在出口管制约束:3 @* k0 |( @# N+ E8 f
; v% C+ n$ r, h4 b- v昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
8 g; M2 R6 W6 H# u. K! W$ m; h性能上已能覆盖大部分 GPT‑4 类推理需求;
( l! Y: @. T7 ^" c! u单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
- |6 \7 G n) e# h+ ~软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;% N3 x% |' l$ |% o$ m, a
建议配合:2 j% M2 Z* o% p% Z
高效液冷(PUE~1.1)、
3 r& @0 L" _, ?3 j! k* [+ g2 l& O$ {大 batch、路由(浅层任务走小模型/低成本芯片)、% f! E# @8 j& ~; y
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。
7 v. O5 W9 S1 Z6 z5 s& |; o1 D% i长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
' g3 m9 z& i0 g, e) W: v8 q
# h* g4 D7 S- g* A4 N数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
' j* d, l" j! s这意味着:
2 X/ N3 F5 S- t- w优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
) Q( p( P3 ~- @/ m7 s0 Q0 U精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。( v/ b& @$ h+ m! I
6.3 针对你关心的具体问题的简要回答
2 t, T/ @) v m; W; B5 XAI 数据中心建设 vs 运营成本的大体比例?- |$ D: R# Q* G, Y
; H5 _9 x. _: O% [2 y+ m4 H在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
% a6 J2 `. L( [其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。& r& P7 {- @8 Z" I
中国、美国、欧洲、中东的成本结构区别?* Q; {% H/ d, r r( E& \
' G# c R: P. F) {: ^' \
建设期:
) C3 Y. S8 G0 ?3 [/ C) |4 ~+ [中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
+ D# F) {3 ]8 g运营期:' ?/ q( m& l6 H$ R
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
( ]; _$ N6 P$ ^" O( |人工:中 国 ≪ 美 欧,中东居中。
U, o C" u: g1 x( R8 c在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
! w4 W0 ~! d. M$ f$ m: U
9 \6 c8 `/ E. `1 E5 {对于典型 1 J/token 推理负载:& \% S+ d' G9 e0 J2 S5 N
美国 $0.30/kWh:电费约 $0.083/M token
4 [5 k3 g Z# r5 w g/ k中国 0.3 元/kWh:电费约 $0.012/M token
/ ~; X6 J% V/ W! a: x对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
) J+ E+ E8 `& H. k9 O: t3 G不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?; }! m, Q/ I' d! l0 f
# X. ?. {1 I4 g9 t
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;0 u$ g# {6 W- X2 ^: ~2 |& n
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
2 `2 [9 U/ {2 r, a4 a5 b+ G# z" I1 J中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|