TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
+ S1 \! z% r1 y/ F
( C: f" h+ v7 K一、总体分析框架与核心结论' [, B. c$ C/ L* f( {: E
1.1 分析框架概览
5 I$ r, N- y) z1 s5 ]# T拆分维度; L% K ^* \& M7 W9 m9 i, E' K
0 D! F6 X) p- O+ M; g% g, v
阶段:! m. h+ h- w3 `! ^$ s& Z/ b
建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
8 l9 P# T |1 w$ H运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
7 @$ E' Z. C- N' K1 f区域:- Y) u9 r4 A z9 ]7 k
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)6 ~$ H" l# ?$ k- l: m/ y
技术方案:% f0 y- L4 R3 @" u
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)' `3 G' {; G$ ^+ F& |$ V. A8 s, h
Google TPU(v5e/v5p/Trillium 等)
' ?* G5 u6 R' l+ O0 N8 v中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
# a1 L& L+ w- O! X算例基准
7 I2 S4 W0 K" I8 p' n
# r; ]- |8 p- b以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
2 s2 P& `1 g7 }其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
9 Z$ O: O; w; `6 _! J* ]PUE 假设约 1.11(高效液冷场景)[1][29]
k. t. A. H0 H5 s时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
" u/ I! a! w! L$ @- L# v关键指标
$ D9 P, Q( v8 L4 ]6 N( o0 }
! j1 S9 O. B8 z7 k) H$/MW 建设成本(含/不含 IT 硬件)0 w4 W% p9 ~# u( j- N$ J. B
$/kWh 电力成本、L/kWh 水耗! M% O1 V) w0 h/ o/ g' R
$/token 或 $/百万 token 的综合成本9 s' E, B* ?+ T5 p
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
$ X3 u2 U+ b) X项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)7 |, [6 e+ Y0 K& S! Y2 ?
1.2 高层结论(供决策快速参考)0 k2 |" J t1 c7 O6 N1 S r
建设成本:AI 数据中心相对传统云数据中心成本翻倍
6 e0 e3 C9 X- n9 a# S2 q0 y" ^; K) n5 X* }
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。# s4 A' a# O E+ ?$ |+ S/ P' ?: A
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。6 n- `/ r6 U: y7 h4 L) l
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。- q: K, K0 i8 l3 s9 z& E0 l* V- L
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
- S; r8 F$ V3 K9 z- Q$ |4 u* K
3 ?$ Z' z0 E6 n7 t, f0 }# ?% M# u6 j' e中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]
" T' B$ d5 H4 X" Y7 d美国:$8–12M/MW,400 MW 约 $4.0B[1]7 M/ I3 e$ Z" k0 O
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]7 R3 ]8 `$ w. g q% j) |
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]3 }* ]% d6 ~! n, n |
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。' \' K1 {8 i8 \
OPEX:电价与人工决定区域优势/ ?! q7 z- A8 I+ E$ a
7 V& C( _* X* v$ f" A+ Y电价(2025–2026 工商业大致区间):
- J, }6 ~& _4 P6 Z中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]/ _/ y$ X& W) t) I7 x
美国:工业用电约 $0.085–0.09/kWh[44]
G N, o( S8 c4 y: N欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]
: |: S3 C3 ~5 O5 L中东/UAE:工业用户 $0.07–0.13/kWh[47]
& Z+ F" {6 ]0 U. }& o1 M2 k8 \6 a人工: m/ D0 G$ G/ K, I5 k
中国数据中心运维:约 $22k/人/年6 U' H2 V, e! y. D; ~; L; r8 ]
美国数据中心运维:约 $120k/人/年[1]% H6 j. F0 ^- a( m T/ }
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。. v% @) o B3 h5 b# I$ k) F
能耗与每 token 能源成本:能效差异远大于电价差异3 }9 O0 H: X0 b" L) ^+ N
/ F' J- _* B+ k+ ^' B7 l* J( JIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
: k5 I8 o: x, M! u& S大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。9 C1 }# W% ]: X& A! G, C
将 token 能耗约化为统一口径:& a2 G# C3 r6 f" o, ~
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:# W% w3 d* ~( D) u, Y1 J
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
: D" H8 k5 V! Q2 K美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
+ w% S* K- B1 r6 W. s+ v( A% q" X对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
5 z8 N" `7 J4 O$ y不同芯片方案的核心差异
. h0 @+ _% x4 t8 ^9 L0 ~0 l0 m @* L
NVIDIA Blackwell/B200 & GB200 NVL72:
# P$ H* q( g E, Y* G% T4 q单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
- W% d% _- l: T- R1 g0 `GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
" \! v4 {; q8 I2 yGoogle TPU v5e/v5p/Trillium:
, }4 i) W( z$ G* H6 H! YTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
& H4 n+ {7 J. {: }. b2 sGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
- E l# g" u6 J0 R. K华为昇腾 910B:
' Z( a0 z# ]3 qFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。+ m# W% X# x+ L0 ?, @0 S
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
" y" {* c# q# v; L" W/ L6 w2 V8 ^阿里平头哥真武 810E(Zhenwu PPU):( o: V* n5 }0 U8 H0 M4 u) a
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
8 m: d; N9 i, a1 I! L# V结论:
4 E0 r( H5 b6 i& Q) D7 i; u能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
- B" T4 Y+ X( c" z e单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。. ~9 n7 {# e1 O) \
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。9 ^" z/ u8 @# Z
自建 vs 云租的 TCO 与 token 成本
, \! s2 ~. h1 M( O" I6 R$ U- L3 S6 ?0 y# Q/ c5 l. j# R
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
% F& ~# Z/ f3 |8 m& ?" o8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
6 Y$ n, {( \1 B% Z等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
$ E C4 J @& |( c1 v+ V8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。& W" A% \( c: ]) r6 V' G9 G
Token 成本对比示例(LenovoPress 场景)[28]:
0 P. c7 ], F( W* S' }; D3 HLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
4 k* T; y8 ^0 g! v. a& Jvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
* g/ s- U- E5 c) M" @同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。
4 P* U2 i+ B0 U I+ J' e$ WLlama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
# E7 p# B# H0 L' p+ k8 O结论:5 A% x! j# F8 k4 }
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
" e9 V7 J7 H4 XToken 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
4 {" c9 W O( {1 N/ |二、建设期成本分布:区域对比
) ]: ?6 i9 t" |" P3 O以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。6 ^# a9 @7 z8 f; V
* W2 x+ o# F. q$ x2 j$ g9 t- _2.1 全球/通用结构(以 1 MW 为单位)6 F! e5 G: w( P! G& s. [2 Y& r
综合 JLL、ConstructElements 等[2][41][40]:
$ G( G2 x {9 ?% k7 f$ h. w
4 G1 z3 N" P$ y ?2 q5 ?壳体+机电(Shell & Core)2 e0 M$ X" ]' B' g- M+ r
3 G( [4 \- [, Q P4 _" N0 B全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]0 Z- g# G7 E5 V7 [. D& r& R1 x
其中按成本构成[40]:
; |4 m/ k' |' r电力系统(变电、配电、UPS、母线等):40–50%
% C& ?; Z( T4 w机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
4 L% z# S' ^8 j# I0 n( _建筑与土地、结构:约 15–20%* d+ _* P8 u0 i1 Y0 Z! p
其他(消防、安防、楼宇管理等):约 10–15%
H; O$ d9 U2 eIT 内装与 AI 基础设施(不含芯片)
- P. e0 y, h8 U! Y: k
+ e, N/ f: G+ F8 |! U, D( Y, E# i高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。7 M3 Y/ v8 v# V* y! ~
GPU/加速卡硬件 CAPEX `" O" o+ K/ i+ X2 S( X4 o
; H. z/ v& K/ `$ x
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。) n ]; h/ v9 O& f
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX! X y6 a3 y- V8 b1 r/ A
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):3 M; i& t3 S( z# m* E5 ?
+ y1 |; I4 A t
区域 典型建设成本(壳体+机电,$M/MW) 备注
! f- ?: O4 {* V' @7 G中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
' w e6 N3 c3 E" }美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
( H, u$ a- e2 J$ l, r9 W8 Q欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
0 G u" j9 W; L2 ^' X" M9 u5 E中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]. F7 {7 ]1 }8 y* |. |! f* z& Y
结论:
/ e5 z5 w, }5 u! R0 T
% Y: V$ ?. }% v, I单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
* Q G# c6 J8 Z- |若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
+ T9 M# e2 D: B7 e- X' y% `5 g2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)5 L4 `$ P: [5 G( v0 T1 T
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:0 \; Z3 H t% t, U ^% x' x
# ^" s. R" F5 m7 [+ M$ X9 `- p7 q7 b
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;" K& A1 Y& s! }* ` b8 P8 ?3 l
GPU 配置:
3 L/ F% ?' K) {2 t' i有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);, e; q e1 n$ n& A2 E% t" H
每 rack 成本 ≈ $3.0–3.35M[34][69];: ^' ^; M# ]) h* D. v- |
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。7 ]1 I- @5 `. R( S: v8 }5 ]
与不同区域壳体+机电组合:
; v) a. s0 \9 U, I9 n) T& z0 J h4 Z ^+ R' u+ z" R
以中值估算:& s U9 t9 Q8 q) s: S9 d) N! `
: i$ i/ c) M z8 {6 R. _
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B3 l, g% U' q4 X
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
B H4 Y+ S" C6 z* ?欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B9 l7 H. N. h1 Z3 }* a
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
" Q R0 a0 C; K# b( W( l可见:4 G- w+ {/ }8 ]& O
* {' y6 \5 |) b7 |; @! c8 _GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。5 R f2 [0 C, _% ?3 ^
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。+ A6 Y8 p) y$ m5 C' b6 B
三、运营期成本结构与区域对比, q4 D2 A8 C# \+ `: y: j& s
3.1 通用 OPEX 结构(高密 AI DC)' L+ j! d( a: N7 Q' ^: Q
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
0 G5 R. S: o% d* A8 x
2 V0 ~" ?$ Z( A/ M& t; T/ R电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
: }8 Y6 A: n# f3 |2 Q冷却与水资源:
2 P0 ]7 e) Q+ Z' ]能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
8 n6 S$ J6 x' a* o) M) v: }水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。# S8 F4 Y& c. H( v) z& a
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。8 P: U$ M- W3 t3 P% q
托管/物业与维护:
3 M" @6 c& e8 a. y: n托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];& ]$ f3 l' K3 F& W# a
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
3 [' W7 ~1 O3 {9 c) H! U- P) h3.2 区域差异(以 400MW / 3 年期为例)4 @5 Q$ y2 Z$ z' c( c
使用 ChinaTalk 的电费与人工估算[1]:) j, Z$ |* W4 u
- J! \; B V* }+ t9 z电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
( N( O+ r: g( r7 u中国:约 $0.06/kWh → 3 年电费 ≈ $350M: t, D5 V$ K! q, g( N5 U! e* j
美国:约 $0.09/kWh → 3 年电费 ≈ $600M
5 L; @: Z- v" k' K5 q5 I1 Z2 [中东:约 $0.07–0.10/kWh → $400–550M
2 ~. v8 r# K( W. l) [欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)4 c3 O, T7 u7 u/ O
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]: Q" H2 c* j- x! t" h0 M* S; [
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
$ c& x; l; D! z) h8 Y, A1 v三年水费级别:0 t g3 X/ i( P! Z
美国:$40k+
+ f8 C8 @4 Q5 d5 H中国:$20k+
U$ D3 e! |0 m. _- A! f结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。4 a( A8 L0 r1 b% Z7 a
人员成本(3 年) – 假设 500 名全职运维:% j2 t' v+ ^( j5 ], R
美国:500 × $120k × 3 = $180M+ t( Z% P/ C, c/ |4 a" {
中国:500 × $22k × 3 = $33M+9 a6 ]8 x0 h" s: q) H
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
& p$ A8 q$ e) S) q, q整体 OPEX 粗算(3 年) – 400MW 场景下:
) r9 J( D7 Y: Q8 I$ o; |$ |" Z4 i% O& H! K
项目 中国 美国
1 s' `0 }0 N$ W- z2 e: a4 {2 c( i电费 $350M $600M6 `; w( o) J9 X( s
水费 <$0.05M <$0.05M
( M: ]4 f5 h6 b, D' O @人员 $33M $184M9 T2 c4 h4 A: U* `
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 D8 H$ b. I' C1 J9 z4 x% Z
结论:" C: M) H% B8 k' p% q0 M S
! p% n; d1 U2 q8 v( C8 C就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。9 ]! K. G) V/ C& C5 P
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
2 y% |' @' w( u1 S! z4 x8 Y四、基于 token 的成本与利润推演
6 u, x: u2 E* n8 ~& I! _4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
# a7 B4 W; F$ ]$ w1 J" s6 U/ K# i统一假设:, e( \1 E# o1 F
e5 o' s" ?/ v) T0 \典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
: U2 l* ~0 }8 a5 C1 c) \9 ]1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh1 q# s7 y4 U" l/ Z& H
1 百万 token:278 Wh = 0.278 kWh
% g5 }! g% [( x) C/ j9 ~3 {1 B场景 A:美国电价 $0.30/kWh
9 W0 ^& g. T' @) k电费/百万 token = 0.278 kWh × $0.30/kWh
$ {! h$ W. x$ }( }0 F2 y≈ $0.0834 / 百万 token( G: ~ S0 S5 y8 g) q" C
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh% w0 T8 x4 f2 i# @1 P
电费/百万 token = 0.278 kWh × $0.042
3 Z3 b, v* z% L7 k( P5 k0 k- ~≈ $0.0117 / 百万 token1 h# v' u6 X! Q
对比当前 API 价格(OpenAI 2026Q1)[62]3 u3 N3 x- E {- o
以输出侧为主(成本最敏感):
1 ~% F4 t8 `, T; h
2 ]6 @) c0 l2 l @! D模型 输出价 ($/百万 token)
! D' T2 P$ [( S8 e6 c8 O5 ?: e* W2 PGPT‑5.2 $14
3 y. r" ]' Y/ D0 H( RGPT‑5.2 Pro $168
. k3 m$ E& a& ]# h. s* YGPT‑4.1 $8
8 Q% C5 Y. w4 f, GGPT‑4o $10
1 E3 a, t" Y& ^" ^GPT‑4o mini $0.60
, ], q- [& S' _/ J则:
8 D: ~/ I* I. R9 x6 \2 B! q5 c8 _# ~7 V. i0 |3 W
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。% P1 h) s1 c7 Q: M) L
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
3 e8 ?0 l: i: o$ L! V/ U- z相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
/ g, B8 p) p7 K3 \. A) Y结论:% F3 l" p$ [, T( p+ B& L/ {
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
( R% ^6 ?! y% t: O
1 l. b8 Y' x2 s6 @+ i+ { Z6 G4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO): }$ L! U; w: l6 L. E
以 LenovoPress 的 8×H100 Config A 为例[28]:2 p% M) q8 i) t8 C0 }3 \
7 y) ^( C- D1 G' k5 年摊销下,8×H100 本地推理 70B 模型:4 ~8 u- U# i3 v) m& E. P3 O
小时综合成本(CapEx摊销+Opex):$12.08/h1 K7 h3 U* g! G! r! } n
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens- [" A" O6 H" a( |8 `9 r
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token& s; b$ z8 l( A5 C, p* o# i
电费在其中的占比:
5 a- I, m h- e9 qOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
# k. ?& l' R2 E3 c; b电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token Z7 x9 ?* Q9 ]- b; P# J3 r- g) Y
电费占 总 token 成本 ~7% 左右。
# A/ ~+ b0 Z+ U" S! v A U8 I6 K若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。% d0 ^$ H1 \- @3 [5 w2 M
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。0 r& X8 ?) y. {, z' F4 _0 D+ S* {
0 T3 \! D; k+ u& v0 Q; x
因此:
n3 ^# y E! k0 _
3 j# [4 k/ r! o* h. S% I在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。4 T3 K8 p* x- M+ j- w6 d9 k/ s
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
, `) D6 e m9 b9 d' g! p# s3 H五、不同芯片方案的建设与运营成本对比# [; P/ h7 Y2 b; p) L
5.1 NVIDIA 方案(H100/H200/B200/GB200): ?6 a2 J/ _6 b! J, k
CAPEX:' ~) M4 L9 T8 g, G/ A
3 N1 J/ V- Y4 R! EH100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。
: x' p# }, t4 o* q! QH200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
+ w8 ?& m& m& H+ X aB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
7 C4 |: S3 r- }, k* IGB200 NVL72:
. d, a. ^! _" R; ]) Z# w每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。. A& G+ L. R" m7 ^% B
冷却系统每 rack 额外 $50–56k[35]。
. S# Y& Y2 e% |2 X4 ]& f: q在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
% k, J) n* a M: Y. w: d- P9 C4 x+ IOPEX & 能效:; Y, G& A/ L$ [! e
( F" O3 e+ X4 H$ m" L. s* [单 GPU 功耗:
( p/ O3 \ H! T* y( P7 WH100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。5 _8 S! r5 H7 [$ M+ Z
H200:功耗类似或稍高,但性能/W 提升[9][10]。' g) ]: v: u V3 y# W3 R8 _
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。! ~8 d. r3 F1 y; V6 n
Token 性能:
7 R' u) s T# N/ Y2 X( q ^" wB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
+ E5 l- v/ Q; H. j9 o( K y) N) fNVIDIA 的优势:
' O2 Q, X+ I$ G* t
2 D9 N0 Y, T% v$ l: u软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
, R$ f- Y( l5 H' s& B8 u但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
* o, _& e: Q i% D! x5.2 Google TPU 方案
- r( d- V) S/ A* U+ A( dCAPEX:
" `1 ]: u5 d% c; T) i
$ g" N: `5 F( v( R, W m; {1 n! N单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
0 O, z0 f# }% z' p) d2 VGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。& A6 U: C: w8 O8 L- ~
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
$ M) s: W3 F5 k$ B能效:
& k, \0 k! n* _' G, a
0 I% w7 T+ f: f' v9 \3 `TPU v5e vs H100:' i1 ]' a* |8 L" E
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。& i G8 Z- o, t
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。8 ]* i( q: u) y K4 o
新一代 Trillium/TPU v7:( r2 M4 W# p8 Q
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
- A: Y3 H0 S0 ]" ?7 Q4 VGoogle 方案的特点:/ e4 D# j- S# h2 i3 y( M7 a' ^
5 ^3 n& D' u4 @" t' O+ P' c+ w
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
" l5 s3 w; q& N对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。 q( p3 I4 z f9 Z- m! P
5.3 华为昇腾 910B / 910C 方案
8 j9 G! l6 M$ GCAPEX:
3 B6 M( ]8 z1 x5 `& i" s% R
, U& Z% I& h4 P; H4 q7 j) w* e单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。7 D c& X" z9 B0 F& w7 L
与 A100 对比:
; X: f( ]4 k$ |& o$ @FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
' r# C6 E0 ^. d: C/ Z市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
3 E# q) c; N( ~& u2 z. q k* @5 p使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
7 v; `' t' S/ ^# @# |4 M! vOPEX & 能效:
. L0 j- L+ c0 d- j: o# Z9 U* N
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。( y9 y! `6 X$ ^ k
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
l5 T+ _' E. u在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
+ J! f( h7 W" _( |5 D R5.4 平头哥真武 810E(PPU)方案
/ o! B0 |4 J% s ]0 {& @CAPEX:5 y' W. Y* e$ n: `- P0 U6 {
" }4 Q& D) T& f% m7 l
技术参数:
7 ?) T9 U7 N3 W& K' E: @96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
- s4 M% x/ C8 ~ }0 ]) p @2 G4 k性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。! a% z3 m! k0 @: ^
价格:
. `2 o: ~. H4 T |未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。1 C- S {1 y; F8 f3 Y# _. b9 J
结合国内报道:
2 s' A# R# H/ q8 \( q2 E2 c9 E2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
- C5 x I2 ]6 u/ W7 \' n数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。7 ]4 S+ \2 x0 {, _! @) o p7 G
OPEX & 能效:+ L4 ]5 i, ] D
$ c4 \. k' Q8 S9 C) R7 `' N400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
2 Q) E7 j1 \& ?5 k( h7 G! ?* z在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
9 ^/ q3 p" U+ D六、综合比较与策略建议
6 ^' ^4 t( n; X. c( y& g( H6.1 区域维度:在哪里建 AI 数据中心?
3 f3 h9 O$ Z! y纯经济性(TCO/tokens)排序(假设无政策/合规约束):
" Y; p% z& `1 i: m
$ @* D4 ~9 N3 [7 s& |2 Q中国西部/北部(电价低、人力低、建设成本低)) X# L! {. L- M
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
* X% v ?! l9 _美国电价低但人工高;东海岸/加州电价上涨压力大
0 ~( z! j: k% S- Q, V; W& o欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
# W. [, z7 O; H* C$ a; f2 ]若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
0 h* g, V& r$ Y4 K- v+ P" N: ~: a9 g
8 f/ w+ F8 u$ ?纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
& Q& _& m2 i( W8 q. y2 } E7 O% I对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
9 g3 V$ {: J* H) c9 F5 h1 G但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。2 I9 [2 H! x% ?) S, }
6.2 技术栈维度:选哪家芯片/云栈?6 v, J" M7 N: C$ { y: w
若目标是全球最优 tokens/$ 且不受出口管制:
4 G3 A7 a( L7 V' }% |8 p V) P$ n) l1 ~4 A
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。& h! l( ]3 s1 x; i- [ M
若在美国/欧洲,能自由采购 NVIDIA:0 d$ y" z& j) U9 t$ j8 s' m
# ~* X, w, J- K, H4 z: I
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:. w0 u7 K7 W/ C1 W) G7 G
成熟的软件栈与生态,极高的 tokens/s/GPU;4 g( b2 W, y7 V- A( l1 w
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
7 ^6 v; v: n. j7 H/ U但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
4 a3 v9 F; I4 L4 L' N" U5 B5 H若在中国或存在出口管制约束:
* z8 ]: z: a9 l: b4 g5 D5 }0 u& ]! W/ a- b
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
, n" e+ g1 |& Q8 ~性能上已能覆盖大部分 GPT‑4 类推理需求;% x/ P4 [. q- R: d9 D
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
g7 ^* n* z0 D( ]( {1 Y软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;9 `9 M9 E# x/ A: X% `; d
建议配合:
/ Q4 h/ Q! ^( M+ m3 h$ Y" W高效液冷(PUE~1.1)、' d: V4 ~- M7 J X% N* c
大 batch、路由(浅层任务走小模型/低成本芯片)、7 z& ~0 ]4 N/ {' \6 `, ?
强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。3 ^( I$ `2 N# M% q8 a
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
& Z! `3 ^6 N1 _% m" L* C+ m
* n) I5 \# T4 v* ?& a$ Q( g2 Y数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
* @4 r+ c/ V. O3 I3 z% J这意味着:
5 e9 J% D( H8 |2 c* c' k优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);4 C2 P. j/ y% \ \. @
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
0 ]8 z! B0 {& Z$ o, K6.3 针对你关心的具体问题的简要回答
/ ?8 G4 V- V+ W, qAI 数据中心建设 vs 运营成本的大体比例?4 O9 O. p. D$ I* E3 I& }+ j( D
7 x" Y4 D3 _9 X' O
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
Q' I j+ b3 y$ h2 J% y其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
- v) R7 J2 g$ N0 D) ]9 }, |# m中国、美国、欧洲、中东的成本结构区别?8 [/ w7 r; a5 P0 b" h8 |5 o
6 T! s& a2 h5 K& w# o6 w建设期:
3 W/ C1 C$ h7 g1 X5 b: g$ t3 {& y中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
+ ~ J/ D' [% X; R运营期:1 b+ ~6 M- L* l- p. x/ Z
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲( H/ u5 y% U d( _* s- E: Q' U
人工:中 国 ≪ 美 欧,中东居中。2 t) Y- G7 O" ]' S% e: P/ l
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
2 K+ |& A) V' h0 g% ~2 t3 e7 e9 Z
对于典型 1 J/token 推理负载:
: ^+ L& u, g2 x/ z美国 $0.30/kWh:电费约 $0.083/M token
6 U* M' ^- _6 P' m# g中国 0.3 元/kWh:电费约 $0.012/M token
1 I/ p2 d" a4 x; |$ _, k对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
0 L( o; B2 l& c, ^5 Q- Q不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
: w6 _2 ^3 e, W: ~
" @. {' I( A9 V; B w' ?# u在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;1 O% c/ R( h! w; W/ s6 r7 }
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
/ c4 ~, p; ]' z' s% i& J( ^8 w O8 c! Z中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|