TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:9 M4 t1 w: a' L
7 s: t, g" a, K. f- G# M2 L9 \4 F
一、总体分析框架与核心结论
. G* A& s' b! s% H( |0 X' L1.1 分析框架概览% u& N! `3 j4 l+ ^8 Y; x" h
拆分维度' t) p5 G1 x4 i6 ]2 V, K" ?& n i
$ t7 S) B, P7 P. t f
阶段:
( j2 `! y! e* c9 }' Q1 e4 T0 C r6 q建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施& \" |* j% W7 x1 b9 F; Q
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等/ i6 ]7 O( @6 F( @0 @
区域:
1 h0 f9 ]2 A2 o. O% b中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
! Z9 f$ {4 M' s7 i. k技术方案:
' X, N- o* E7 ~/ Y fNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
3 j2 `1 P3 q3 e4 B8 P# t j. AGoogle TPU(v5e/v5p/Trillium 等)
/ ?* ?% u! ]& ^! K% |' ]7 \& | w- l中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
. h# e: t9 l+ p5 h" E+ i0 i算例基准6 B: B+ ~: K$ p P" @
3 K% @' l3 H( G* b* J
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:5 A; r( \6 d5 r0 p- j2 ?9 i/ Y
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW" E; R# ?3 Y' B
PUE 假设约 1.11(高效液冷场景)[1][29]
) g" G# U: b: \5 B1 K时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]# @- E/ Z0 F- l% l9 G! M& k
关键指标
, V8 a8 m! }! M; I f4 r, P9 o: l! N, n- Y
$/MW 建设成本(含/不含 IT 硬件)9 `1 D( e1 t6 t/ C! }" l
$/kWh 电力成本、L/kWh 水耗$ G b" v3 N% h6 c7 g% f; p
$/token 或 $/百万 token 的综合成本! z$ T* B8 A8 T" ^; @$ z
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]
% |; E6 k0 v6 E3 {& Q- ]2 q项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)0 A1 D: f1 ]( F- j2 y r9 s
1.2 高层结论(供决策快速参考)5 t4 x/ Y4 _: n, l+ @; b
建设成本:AI 数据中心相对传统云数据中心成本翻倍( ]( V6 F& G$ C# H! i B6 @/ B9 [
! v5 `- c$ ~- Q' Q$ C1 C8 N7 l I传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。: L% c) ?2 m* O; v
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。4 o0 }8 ~5 T$ i
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。+ d# Q/ b, Z7 X; {* r! h
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区: ~0 d2 |: K4 I$ B+ b3 d* q
- R4 H6 ]% y" s% `. ~# @中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]; o4 ]: d. F2 R0 l
美国:$8–12M/MW,400 MW 约 $4.0B[1]4 p b% B- C2 A# Z; h8 k
欧洲:接近全球平均 $10.7–11.3M/MW[2][41]7 W7 V* e) w) w# q2 n- S
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]9 u- ]* d, F k% ^8 X( t
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。# q4 B% a8 {/ s3 W, W+ Y
OPEX:电价与人工决定区域优势9 j* z; D; d P. @5 A
9 d6 X4 o! S8 }, M: {
电价(2025–2026 工商业大致区间):
# Y4 r* c1 Z; @! I! ~8 h+ \6 j中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
5 Z8 C' s5 x# Z) H5 ?9 J+ W6 S7 O+ H美国:工业用电约 $0.085–0.09/kWh[44]3 l3 y) A4 m. m6 Q' e& [% C' k. D
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]& i5 G4 D2 n0 @/ W
中东/UAE:工业用户 $0.07–0.13/kWh[47]: F! O6 K% T" |% a( h0 J I
人工:' v8 K! P" J, f4 {; e7 n! E
中国数据中心运维:约 $22k/人/年! t1 M' A7 h) L9 {0 a& N* R) F
美国数据中心运维:约 $120k/人/年[1]. X, V% f) ?9 Z! S7 A# \# p: `6 f$ T- E
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。% f$ t: {2 Q3 o
能耗与每 token 能源成本:能效差异远大于电价差异0 }" _, J ]. a1 U
* B4 l! T5 Z3 j6 v9 vIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。. K$ u" E. `% `2 z7 u% s
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。# h$ t! y( F3 E* B, W" w, o# W; Q# e4 A
将 token 能耗约化为统一口径:
# L+ g! O' T# e5 t/ N& V+ ^+ Z7 i粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
& R) A7 L, B+ Y# Q1 \' N b- B; q中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token+ \$ m$ a$ k: v5 x3 v2 P
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
/ v8 j% G& w6 R0 w6 R2 h, j% C+ n对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。, }0 R1 X/ c2 s! L* R' p. t. S
不同芯片方案的核心差异 B2 ~3 l3 a: i& X
6 e# |6 G& F( q- t9 |, K+ d6 J
NVIDIA Blackwell/B200 & GB200 NVL72:
7 {8 j2 b z7 y单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
j7 f4 X% ^- Z- sGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
" u W, r) \" J9 f/ FGoogle TPU v5e/v5p/Trillium:
" o2 l( [8 o F7 m5 G2 F6 VTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。1 G% i A4 X3 U C5 ?0 B
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。4 ~* F! U% G0 a* x; M1 N
华为昇腾 910B:
( n. Y5 M1 S. G1 ^FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。* x; e% j; H2 ^7 O! Z
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
- x# X! F5 I4 J" r8 Y* @' A阿里平头哥真武 810E(Zhenwu PPU):
9 p+ |6 ^# Y/ T- i( ? T96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。) Q( d% d1 r: m) Z0 G1 Q" K
结论:
3 B& n* h1 f. c+ }, g% k) U能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
* {$ D7 ^- ~4 j9 B: `单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。' j% ^5 d5 }8 \0 y5 b0 O$ m
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。* x$ N$ M6 T/ a+ s c- t
自建 vs 云租的 TCO 与 token 成本
+ Z) |6 n' m( }; ]1 n! q/ r' a3 p8 b" c/ @
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
: ^# I: o2 J# \! B2 e |' a8 o8×B300(Config D)自建 5 年 TCO ≈ $1.01M;# B3 T. P+ G9 _# X: Z6 t
等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。% ?6 R" L: J$ L! r: C
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
- t) K$ J, c4 W. q' ]. c# TToken 成本对比示例(LenovoPress 场景)[28]:7 I9 {( j, U+ O! u9 I7 `
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token* h) m& W1 s# `; w( ]( i1 m; T
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
# c8 [3 K& P- W同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。7 r" Z. ]* C6 _/ w
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。, J- P0 O1 `' M0 ^
结论:0 Y# F' u7 W; A
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。2 v1 m# B# ^0 ^0 m {" y# A
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。2 n, h- s- h+ Z
二、建设期成本分布:区域对比
( x# r5 W0 O; R3 z以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
3 S8 N, |, ~+ j' p
$ }6 U, F; ]8 A' V) G2.1 全球/通用结构(以 1 MW 为单位)
6 ?; U) z; ]1 c+ O* a综合 JLL、ConstructElements 等[2][41][40]:1 I7 W- {. M3 r# B
4 p; g2 {7 |( T# ^
壳体+机电(Shell & Core)' q) J" {9 O( z5 S
* `, z, K/ C* p2 y$ H4 d
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
( b: |3 K5 r" i8 {2 w其中按成本构成[40]: N% `! A2 l3 L7 m8 F6 h
电力系统(变电、配电、UPS、母线等):40–50%. v2 p8 M- e2 @
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%/ x1 @8 S/ Y& W" R/ |& j' h; o
建筑与土地、结构:约 15–20%! s( h/ @: R4 r2 H" Y8 c& B: D
其他(消防、安防、楼宇管理等):约 10–15%8 k$ I f# s W/ L S1 w% y9 S
IT 内装与 AI 基础设施(不含芯片)8 E6 T- w3 ?$ ?! V( `8 i' G5 s8 Z
. I) X& U0 z8 o2 n1 }
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。8 i& S) z( Q4 O( y& x2 e6 @
GPU/加速卡硬件 CAPEX$ V# y$ N7 P d. s4 F% A
7 h9 a" x7 E3 M6 Q
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
; O' l$ p& s* u1 Z( K) {( T5 y2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX* }% L2 M: M6 k- Q. i! n
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):7 I [+ B/ Q9 [$ B6 \! ~. `* u
/ C1 {6 U8 \: T, s+ B+ o3 J
区域 典型建设成本(壳体+机电,$M/MW) 备注/ p& X6 @. u1 Y2 N5 f; }
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]5 Y9 F. f, F& ~+ @ O2 U
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]) y! W5 b; Q2 D! S1 P4 E* d
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
0 }* w' K) K- @% [: t6 h# `中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
' o, [% V6 _8 X% _4 }! V结论:
, m9 |9 j; J/ ]8 J) g
8 k% C9 G( _7 A% ~; n. N单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
* Y1 H0 {) v$ y& r* W若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。 T0 H+ v1 [7 A# v* d
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
& n. v: F+ Y& B1 |$ s以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:. o( `* z: M& l4 q$ G! {+ u
4 _/ g0 o. u7 Q* |4 c
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;, v) O2 j# g2 r4 Y/ p
GPU 配置:/ C5 N$ F0 Z( f* i
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
3 S+ p" u# h2 w# U每 rack 成本 ≈ $3.0–3.35M[34][69];
/ e5 L, U& Y0 U% _GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。- H4 q5 W7 n7 ]) f! a- M* q
与不同区域壳体+机电组合:$ R* h/ [9 k( v2 S- ], R- D9 f
; @! a, D2 O& m6 X/ x2 j, d, a
以中值估算:
0 L7 x9 J6 J& E. e% n2 w% C5 r0 M) M) d1 Q- Y# e
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B8 [8 B2 @2 \! t% U( x) O" S
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
9 e6 N4 P$ b. d# B% p& C: D欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
% A h, D& _* u) L8 t) [: `+ E中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
! @# P' j) N* a7 l3 \2 @可见:
7 T$ C* I& b6 L `) b
9 d2 i, \' V9 U" }GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。/ f8 J6 c* e4 n# q
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
9 z+ i; c1 p. n0 s+ _6 [/ f( ^三、运营期成本结构与区域对比
8 Z4 u9 ]2 i2 L! r3.1 通用 OPEX 结构(高密 AI DC)
2 p5 n; q% E" A4 C* x9 e3 c结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
" J! x4 L* _6 C4 k8 ?7 O# z& b$ |: D! A9 v7 U9 F
电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
. `; B" B0 _& C2 j) i3 m冷却与水资源:
+ O( `0 C. v( E+ Y能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。* B2 x! H0 c6 \- s4 b
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
/ ?6 k. a1 h! ]/ i# F人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
7 ?. R: o# E" Q0 W5 F' H9 I9 k托管/物业与维护: w- d) l8 Z1 v+ T* ?; q/ V$ r$ D
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
/ k" F, d* L v* ~硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
+ s) P; w0 U) m5 ~+ K& _) e3.2 区域差异(以 400MW / 3 年期为例)
* z" W% \9 d2 x" O5 J1 e; c7 Q使用 ChinaTalk 的电费与人工估算[1]:
$ p3 F$ K5 D, ~1 U) _
) ^/ {; l6 ^' R# x6 j' @电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
" s6 q* k9 A2 ~* m中国:约 $0.06/kWh → 3 年电费 ≈ $350M
: z! W2 M F1 r8 `, W美国:约 $0.09/kWh → 3 年电费 ≈ $600M7 `: Y$ f9 Y7 Q& B- }
中东:约 $0.07–0.10/kWh → $400–550M5 B$ M- E) t% ^( {# E
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)- `/ [, B; A. i- K8 }' l" b/ y
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:' ^6 P* H6 P; P3 C" t
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
) O' g/ R; @+ d; I$ Y3 J4 |三年水费级别:
1 p. L: y# M% }# z美国:$40k+4 L* [/ R; {; p- e4 D
中国:$20k+
- t+ g: G' p$ E. }结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
' e* ?" C7 b/ k: v人员成本(3 年) – 假设 500 名全职运维:/ [' S0 {: x9 ~6 }
美国:500 × $120k × 3 = $180M+
! D! Z& |2 M M0 C中国:500 × $22k × 3 = $33M+
/ y2 F2 O* O# T7 M1 }/ A差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。* B" b# m$ {' U3 s- M& b
整体 OPEX 粗算(3 年) – 400MW 场景下:
6 Z2 x( L. U* D; Z
( v/ O2 j$ w$ I1 ^+ C- ]项目 中国 美国
' n0 ^/ F2 `% p8 a9 g' z& W0 R! v电费 $350M $600M
& ^" q; v, E7 E; y! x0 h, x8 p水费 <$0.05M <$0.05M& F u! P2 @6 P& A/ I: O- N7 H
人员 $33M $184M! ~6 @# J! H- r5 f! |% i; J( b- p
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 1 D' K! ~0 l7 O2 g7 I" w8 m* j
结论:" x1 I1 N# s6 e3 v' N- [ ]' W. x
" Q. A& I, G% b' F( V9 O
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。- }1 {; n% i0 @/ P6 Y9 B# Q& U! }0 f
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
/ N( E% y0 O1 T" Z2 c: k4 W2 s7 W7 e四、基于 token 的成本与利润推演3 Y4 l, y' x' o) n: m
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)+ G" _! I9 k" B, i
统一假设:
, k" y3 \7 L5 J! _/ x7 O a
+ n5 t5 H/ E; \( s0 r4 Q! K& _典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])# f& L; \# n" N2 e3 F8 x
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
, n L- r$ l6 b( Z- w6 O" R1 百万 token:278 Wh = 0.278 kWh: \9 ]- t2 A1 g7 {8 C
场景 A:美国电价 $0.30/kWh3 m) w5 P' g' o$ E* @
电费/百万 token = 0.278 kWh × $0.30/kWh
! C% [& d, W6 w- k≈ $0.0834 / 百万 token
. L! ^, {0 O6 i6 f ?- ~场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
. M, C1 ^( A _ J电费/百万 token = 0.278 kWh × $0.042+ j1 J' J' {- A) o$ Z6 I8 N. d
≈ $0.0117 / 百万 token1 H/ o/ C/ f. x. L: |! i! N6 X) Y
对比当前 API 价格(OpenAI 2026Q1)[62]
' u4 |6 P; o: ?4 m6 i8 g9 X以输出侧为主(成本最敏感):
e/ h6 h3 A6 g8 x2 C2 Q; l6 h% N8 |/ n$ c" ?. f! G8 C7 t
模型 输出价 ($/百万 token)
% L, r7 L0 x3 _8 GGPT‑5.2 $14
" B+ f$ P1 Q2 @. k% q$ uGPT‑5.2 Pro $1680 p$ y' B' W1 I$ ~. k* p) }( Z
GPT‑4.1 $8
D* W! Q0 a5 H$ e9 q, DGPT‑4o $10
8 T! R! I0 I5 L# zGPT‑4o mini $0.60
$ o5 N% Q+ w9 k( ^则:
. B: O2 e7 [( L! Q% h, T' C( C* H
/ j6 j8 q" j' J在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。" A- z, t' l$ k6 H5 R
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
% t& f9 I! \* q相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
& U4 s8 M, V: ^% l: M/ I结论:
+ x& b; H9 @, Q* ~即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。$ S" `) A4 |- h d5 D$ C4 ~. F9 k
) U) l* e7 I' u" W8 _. Z$ m0 u
4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
U& N/ W/ q0 o& z" z以 LenovoPress 的 8×H100 Config A 为例[28]:
2 ]* W3 v% O: X0 g+ Z
5 ~+ G5 L+ i( ` R7 P Q5 V: `: i5 年摊销下,8×H100 本地推理 70B 模型:
* X. }5 M$ T* {小时综合成本(CapEx摊销+Opex):$12.08/h+ Y% t# l* w2 w9 C& ~1 x# S
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens0 k- H9 j7 q' N" |. Y! T. j
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
# r8 o6 l. e+ }" {5 c3 ?电费在其中的占比:4 I3 o5 T+ }; j/ a' W& O% N7 ]
Opex 6.37$/h 中电力+冷却约 $0.87/h[28]+ Q) s( N" x; f f3 B/ |. a6 S
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token. o- `$ g$ g+ T5 u
电费占 总 token 成本 ~7% 左右。% @( B# k0 _" O+ q& G6 Q) Q$ ~4 f8 ?) W0 j
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
3 t3 V1 b& N* v2 m% A若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。* i' }' H6 q/ u7 E
' A1 @1 D( i _! ^
因此:
$ Y( A: H4 X2 l$ W \! \8 _% d/ R6 W& g1 N+ D1 W& L
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。- } k% z) A J! Q
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
( {! \& S, P2 j& E五、不同芯片方案的建设与运营成本对比2 s; b$ r6 ~0 x& m! R; b$ K
5.1 NVIDIA 方案(H100/H200/B200/GB200)' h- ^4 L: W8 a
CAPEX:
. E5 @3 S' a. _; ~, s6 o8 I1 g5 Q% u$ i3 A, i& E
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。$ o# b+ U9 R! f; m$ K; |
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
* d- |. C X) p! qB200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
4 V1 U4 o; ?- R5 F3 s! s( N3 XGB200 NVL72:
7 E3 d5 n4 T- L" Q$ w: [每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
: m# d. H+ b, J/ R0 d冷却系统每 rack 额外 $50–56k[35]。- O5 c& X$ Y- R0 P
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
! y/ o$ d J6 G% ]# T0 p. K$ `8 bOPEX & 能效:8 e7 u* w! i3 N$ a& f
2 g2 J5 M% t5 p! s' _
单 GPU 功耗:* X; {9 {' \# D
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。8 ]. g* w# y( a* Y
H200:功耗类似或稍高,但性能/W 提升[9][10]。* Z5 v4 k2 V4 _7 D
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
+ ]% }, N5 G* ?Token 性能:
- l7 g4 } x% Y0 c3 l& [B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
& T/ B) U0 U2 s. xNVIDIA 的优势:
1 U& \5 x& {3 ^9 F4 i- a# [
' ]0 E" O7 S7 P0 U/ ?软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
6 h0 d- r( ~% z' {' y但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
8 o8 B7 y& P2 i, T" a# u5.2 Google TPU 方案
/ e- X$ n$ k X& M- R7 dCAPEX:
: ]! h+ h- A8 }/ a( ]
$ i1 a" t3 _4 n单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
" l- _! m( {' z9 dGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。+ A( F/ j3 P# |2 a# b4 `7 y0 t
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。7 F! Q$ _- N4 {9 y9 R7 ~8 S& r) i
能效:, j7 E0 @: ]% R
8 {* I1 R" n, T. t2 M8 a* T9 `1 x4 }" M
TPU v5e vs H100:
" k' o3 S0 A% [6 e8 Y同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。2 U% D; ~: Y; S0 F
测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
0 J% m7 f$ F9 L) V) a( g: ^新一代 Trillium/TPU v7:# F4 H0 T' P7 G$ {0 D
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
/ v8 J7 m, e1 ^Google 方案的特点:
W; q* N7 M/ ]6 s: K7 l( Y' V1 ~4 [; T; r7 Y3 B
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;# @! s5 P, r8 w& C: d* f$ @
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。+ D, g- [3 f3 Y
5.3 华为昇腾 910B / 910C 方案1 B! N; L, o V
CAPEX:
+ t2 ?) H2 _' q( Q2 e5 y& G- n2 l
# h' p5 T9 w; I, v$ t# y2 ?单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
0 d- _$ s* N2 O) H与 A100 对比:
. Y0 r- U7 D& u+ eFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。' ]0 z3 n9 q, h9 |9 _& }& W" |
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
1 T3 n" V! m( J9 M4 `9 L1 h8 O4 C使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。) Q( ^9 e+ A, U. S
OPEX & 能效:
2 g' K+ W6 W5 u% S* h$ o3 \# T9 A# d2 k2 P9 c* O1 E
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
: o# f0 f+ H! a6 E7 d) \% Z$ k0 a1 ^部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。1 N$ [7 {3 G) [( |+ j
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
+ h; N: d! \# L0 ^/ \5 L+ m" N5.4 平头哥真武 810E(PPU)方案/ n1 r6 Y3 }. @; Q' T% \3 F
CAPEX:; u6 A+ o" v. ~# r
5 @6 |: J: S F; M, B& s; \技术参数:
! ^5 d- J4 B- T, R Z96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。6 g5 U5 r8 i! J
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。: w! t. P* d2 v6 V! g6 f
价格:) M6 b7 c4 |0 J$ d# V
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
+ z9 ~# u" p$ t7 v+ d& i结合国内报道:
8 d3 y5 _' [* S& k- y2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。, _1 B- G& D+ w
数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。+ a0 g8 F9 W% s5 h8 @/ j% [
OPEX & 能效:
3 `' q/ i- ~) n& p0 b/ y4 _: ]" m; M4 O. x
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
3 t7 ?2 d; W( b; X) W2 A在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。- h$ U1 O G! Y- @2 ?( A
六、综合比较与策略建议
# ~2 A! g2 C4 ?& G+ @6 O6.1 区域维度:在哪里建 AI 数据中心?
) U y3 D8 @% y纯经济性(TCO/tokens)排序(假设无政策/合规约束):
4 u3 q K; `, o- D! a1 R; o" ?* ^1 [( ?' I, @
中国西部/北部(电价低、人力低、建设成本低)
; `9 F9 U( n( [3 _" A: b* l中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
6 ]0 a9 ` }9 i2 R美国电价低但人工高;东海岸/加州电价上涨压力大
7 [: E$ F: h8 C( C5 {& \7 Y欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求: ~/ t# z; ~1 G. ?# t; c7 s
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
* M7 H7 Z: V6 ]
, s- B' ^. E; i" y4 B4 V) E纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;0 c0 @0 X( g7 s; t
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;$ _4 L/ ~, V3 g1 Z% C
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
' d; W& {0 d" ~! A! Y6.2 技术栈维度:选哪家芯片/云栈?; ?- B! ?9 q4 q0 E. ` B S8 K
若目标是全球最优 tokens/$ 且不受出口管制:( G$ }2 M5 E5 m7 u N- v
& P6 e" t6 s" X5 p+ a# U# Z
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
7 [: R# ]: l8 c: ~) g若在美国/欧洲,能自由采购 NVIDIA:/ v: Y; o- n; I, f0 |9 p
- Y l4 a. ?0 E* g3 w2 q7 Q短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
! s% F- F2 r# u1 K0 w成熟的软件栈与生态,极高的 tokens/s/GPU;
0 I; w( @! i ]; o( ~% I在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
, K) |6 D( S& A7 ^4 m但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。" ^6 O1 ?# F0 j" y# s
若在中国或存在出口管制约束:
: E R2 u8 d" I
D5 |' [9 \! S) M O. m5 F昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:0 v+ {& Z1 I9 H) T* v- j- @% K
性能上已能覆盖大部分 GPT‑4 类推理需求;
& l7 x' D7 K* X7 i5 f单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;8 m) Q _. `! c6 ~
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;# J3 }1 C% {! P; }
建议配合:& H2 E+ T% ~! e8 \& E/ w2 E& ]
高效液冷(PUE~1.1)、& K$ ?5 `4 G- ^: l4 S5 S
大 batch、路由(浅层任务走小模型/低成本芯片)、
7 j" a5 F( C1 q/ v! Y" i. _3 R+ i. _强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。( P9 \- ~( ~: q
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:+ Z8 u9 J& R! M/ \- O* o0 T
- A% d2 X* f" x1 G$ p6 h$ q
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];! R' E `9 q7 I/ E6 P, S
这意味着:
) e% l1 ~ ] h7 u优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);9 w5 a8 r8 }# n3 f
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。. u' |/ H8 H r6 l6 Q* @/ Y5 m* J
6.3 针对你关心的具体问题的简要回答) f$ ]1 _% t7 }2 a ^) U
AI 数据中心建设 vs 运营成本的大体比例? q6 O$ V, Y& r, N' y! }( y
9 T3 F5 C* M9 b6 _8 O% z f3 t在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
3 a0 N# x9 q' u& H9 ?) o# C其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。: r6 @9 H$ \3 v; q7 I8 I, b: j
中国、美国、欧洲、中东的成本结构区别?
. [* d1 G0 F* g9 M9 z: \1 C' k4 o3 r5 o1 }' D3 K: G9 _1 ]9 P m
建设期:8 r% `# Z7 Y. w$ q) u# h' x2 r
中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
! k% D6 o' p; d0 h- Z运营期:- C% Q' u( B1 { B3 {" C) w; s$ k
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
; Z$ Z3 W: O! _/ W. V* X人工:中 国 ≪ 美 欧,中东居中。0 o. m3 L0 x& F1 ^8 V1 G% }
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?+ `" i- }$ J+ s$ A: D6 `/ t
" H4 n/ J) v4 C( a- N3 Q4 S对于典型 1 J/token 推理负载:7 `6 T" }. ^- t0 x9 ^: c* p( v ~
美国 $0.30/kWh:电费约 $0.083/M token ^2 ?' K: d- z0 j" Y; y0 K# N
中国 0.3 元/kWh:电费约 $0.012/M token* y% F7 E6 U1 p9 X0 g
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。2 k1 L6 h! s x* u. v, i8 a
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
& p0 ^/ b* X8 |* y# C5 [
3 D, Q3 I r6 U4 X M1 d在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;
1 H" i/ x) k5 Y+ W全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
! g N' {2 ]0 X中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|