TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
3 y1 F9 y& y2 V( `# i `) A S. [1 Q8 c# x$ S- y: U0 n
一、总体分析框架与核心结论
; `) n& x) W7 `; ?- u1.1 分析框架概览
% ^" h' x+ x6 A J, s4 n拆分维度* u- q$ }- Q8 Y( O5 j( L
: p4 W& T5 [0 X. h$ |! V- e. m, s2 ^
阶段:
! Z. t& V0 g7 a% l, P Q0 V+ B# t8 i建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
# V. F+ }+ E0 X! M; V! C, w7 n运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等3 e7 a# l* @2 Y. d9 w- V
区域:
& ]3 q9 K# |. h0 N: n中国、美国、欧洲、中东(以海湾地区/UAE 为代表)
+ `1 X; q& O0 l: `6 Y1 D技术方案:
# N* f# S" B9 B" zNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
( N8 z% X" D) p2 f; kGoogle TPU(v5e/v5p/Trillium 等)$ @7 y1 p C$ x; g! X# k# ]# c
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
* s- j5 m* R( T# ~6 R- Q算例基准
3 a. n* s/ t$ ]( u3 R* B, w7 b6 A4 V# I; L K3 L
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
8 V! \9 z8 f6 D其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW4 x' x9 K9 E& `+ x# \ k- T
PUE 假设约 1.11(高效液冷场景)[1][29]& R$ B' k& o/ k' `0 N& E" U
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
1 m9 `. U7 t5 t' _8 U" f" V: L% [( V关键指标
O/ E9 R$ V L: e8 \$ p4 [. f8 o
! C* \+ Q* X/ L$/MW 建设成本(含/不含 IT 硬件)6 ?# Q y) \: I. A9 g$ r! r6 H% F
$/kWh 电力成本、L/kWh 水耗
8 l! C; c8 _9 Q- V( W$ x$/token 或 $/百万 token 的综合成本) c, T7 l- S( R; V7 _0 |
Token-per-watt / Joule-per-token 作为能效基准[17][18][26]: L1 U' g! c4 S* T. |- r& R2 f7 h
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
1 R0 K+ d5 [' @+ T1.2 高层结论(供决策快速参考)9 ]5 s) m5 r% v7 i$ h3 t c0 d
建设成本:AI 数据中心相对传统云数据中心成本翻倍
% q+ n2 a2 [1 R7 @1 L" S7 |" [: ^& H6 \2 P; A
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。, b- T- L* l! n. H0 L8 u3 L6 U" ]9 ]
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。! @, v. Z. x1 @ j( t5 o. g7 d; H
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。% m- L) d$ C1 P0 T" s
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
; x0 j- p$ M" C) p5 v% ?( m1 ~9 a$ H5 j/ g9 d# k
中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]" h) e6 c6 j- P5 q
美国:$8–12M/MW,400 MW 约 $4.0B[1]
7 _6 w% u! u" U欧洲:接近全球平均 $10.7–11.3M/MW[2][41]/ ?1 g7 p C" u6 z9 M4 z2 d# N
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]
7 R3 o, h2 ^& X% m% R* E结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。
& y! H7 S' V) }1 ` {. OOPEX:电价与人工决定区域优势
2 S/ `( h$ R% \
( n. ?/ b9 s$ h$ U! n8 z电价(2025–2026 工商业大致区间):
- W, a& k5 r' w) t% {/ D/ q2 A1 X! D# P中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]. [6 ^( [( f' i V0 k" A
美国:工业用电约 $0.085–0.09/kWh[44]% Q E! v a: l1 x# b5 x
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]6 K4 j. {6 |, {; I3 N" d
中东/UAE:工业用户 $0.07–0.13/kWh[47]
% C! d5 ]( N& z0 n9 ~人工:, t G ~6 l/ {: B- e" c! J
中国数据中心运维:约 $22k/人/年2 H9 D1 _ A J1 ^ g
美国数据中心运维:约 $120k/人/年[1]- L* c. f2 v' u# {& H
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。
" v$ S7 y0 y" d) A能耗与每 token 能源成本:能效差异远大于电价差异& e1 l: ~4 f- p5 c
2 D2 Z/ ~! A5 B S5 Y( F+ S" T
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
, V5 ^$ L. g1 j大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。3 ^2 G' ]; U K9 ^% h0 e) c* }
将 token 能耗约化为统一口径:( ]1 U9 k+ ^* O: E( {; u- ~/ Q
粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
5 P% A+ ]0 F; Z P) ~中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token8 Z# f: e3 V3 K w+ O# W5 l0 Z0 X
美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token; A% Y; V* y. T" G
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
# q7 r* ]; V E不同芯片方案的核心差异' l- [$ R$ _! d, f; G9 w% _
; x& `) }5 u. ]9 z1 A6 E
NVIDIA Blackwell/B200 & GB200 NVL72:
2 Q: T4 s/ G9 t8 M) P# x7 {8 K单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。$ U5 Y, [1 v+ |0 j+ O- H' d- \
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
K1 y2 O8 b3 EGoogle TPU v5e/v5p/Trillium:
' q! x5 d* n( G, @% C& g( W9 @6 pTPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
+ v+ R8 O: w5 e4 `Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
; r: L* p4 o7 N9 g/ C( u华为昇腾 910B:" X p0 x r; Z; M* n. A Y& F' Q
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。' N' K* C4 H5 O3 j
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。- ^# s, ?* O% \8 x* Q! y* h2 ?
阿里平头哥真武 810E(Zhenwu PPU):2 v6 d2 Z9 s8 P" i, `7 G; d1 U: V
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。5 L( J" J _* D; W* d' ] Y2 ^0 u. h
结论:) [# x* |' n: [% I1 |
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。 _8 A% V) q5 ]9 V m2 a* G8 g
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
& ]! ]1 {# v T f3 A( z6 w/ k! U+ L对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。0 D4 L, L! d6 D* J, T( ]
自建 vs 云租的 TCO 与 token 成本9 }- C$ ^( {) W) d
; w, Q( Z# w3 c$ C9 c
LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:& v! n; G* I* h
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;/ ~* C! ]6 d$ X8 d8 @" [1 z& Z
等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
+ D. A G+ k* \$ }8 g1 K8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
, P( S+ O4 z2 JToken 成本对比示例(LenovoPress 场景)[28]:) p- A1 L) T; a* L+ i
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token. f, }, y- F* C
vs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。5 `+ m2 d7 {0 i i6 O+ d
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。5 K# g9 W, c4 j, i2 E- @2 h6 }- c
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。
* o6 w0 U& O# S1 Y! e4 i: u结论: N3 ~' n, _; B$ g: l- h/ K7 {3 K
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。# Z8 ?8 i4 A+ K8 f& t) A6 h
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
* y7 H0 ]4 D' o& ^ a7 w$ U* O2 q二、建设期成本分布:区域对比1 {' H! k1 \. F( W; S' b4 j' @) a
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。
# k: s7 w& s# Y5 c7 X
" o2 _ p$ H( [0 i& H, J2.1 全球/通用结构(以 1 MW 为单位)
. g4 \5 r( q4 b7 c: d综合 JLL、ConstructElements 等[2][41][40]:
2 v2 f' Y. g2 g8 b
. U- B9 ?3 _4 {" @: {! s# Z" x壳体+机电(Shell & Core)
+ C8 ?) _/ `: U' m8 @1 M0 `( Y8 Y
# m$ b# k! s& j全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
+ z" y1 w6 n7 _. f( A) ^其中按成本构成[40]:9 _5 x; w) X0 T; r& h* \
电力系统(变电、配电、UPS、母线等):40–50%8 ~) j! M1 M5 c0 Z0 v
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
3 n4 I7 \$ p7 _9 P6 ?1 O9 x2 C7 K建筑与土地、结构:约 15–20% `/ }# K6 @/ U- V) S0 }7 B
其他(消防、安防、楼宇管理等):约 10–15%6 j5 D" j* x) J; V N) b
IT 内装与 AI 基础设施(不含芯片)
! s7 R( H, z' E- @( _: Y* J. s4 I7 N7 F& |) j. C% L
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
' {+ K1 ]- N5 }9 OGPU/加速卡硬件 CAPEX a2 e8 A! ~! G$ k: K/ d
! }9 a$ k! `" t# z5 H. c多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。8 B# n& G3 v4 J9 _$ a+ \
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX7 ~% D, f# Z" A& s0 n
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):9 e4 E0 \+ M( H& S9 Z0 c% }; W7 a
1 ~6 m& f$ X! f$ v8 r* [区域 典型建设成本(壳体+机电,$M/MW) 备注9 s& R0 X% g2 h# ^
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
0 z/ o% g( u; f6 C美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
" S) [9 Y/ P& f. V) B欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]3 z' g! u: t; J. V
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]
6 X8 E4 N( z/ u* e5 i结论:# k. p1 S) W7 V% x: v
0 P1 a. O5 z+ q0 g6 J) f
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
) ] R* @, o0 Y2 m' f+ G5 ^若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
! r9 r% ~* O; A2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例), a! d; b2 e# |4 F$ D; [
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:* w- G. P3 b8 s0 q' O
, A# P+ u9 K# g; v: I- Z假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
& ~, T6 `- e- i6 g% c" p' DGPU 配置:8 M2 t, w7 Z" A% W9 N6 t
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
3 x& F7 f: ?$ y% e' T$ n/ K6 L: g1 X每 rack 成本 ≈ $3.0–3.35M[34][69]; _6 r' [) ?8 n3 [- D( V: M4 ]$ q
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
6 S% i' i! k" h& F5 R5 w5 f与不同区域壳体+机电组合:' K+ @. G. W, ~$ _. {
: Y! m* S- ]; l% z& q$ N以中值估算:% D8 g0 Q( \/ _6 o6 t6 F/ ~
: K* v$ d! F5 ^* e/ U
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B; }# E h7 w7 ?6 P# ?6 c+ b4 O( v
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
6 d/ f# Y/ X+ t) K+ ?- I3 u# @! e- F! e欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B3 L5 p/ [9 U6 u- @4 j" ~
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
" o# t. P) Q; K3 f$ n) v可见:
3 x4 R7 O2 j7 u0 l
9 h% a* J7 S j- B1 b J! TGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。 I- ~0 A0 }! C. m2 m
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
: J/ ^! k* t8 i' v; `% w: ]1 Z6 m三、运营期成本结构与区域对比
/ a$ s% R9 P7 _) F% P$ H p) b n3.1 通用 OPEX 结构(高密 AI DC), ~0 W3 h: `! g$ `, K' W' ]
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
; }; E$ @2 x6 d/ `0 M
& Q2 X8 e4 y* `6 R7 V% k$ `电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。
7 B3 i/ z! N' c# T: J( \/ v# O冷却与水资源:
. A2 \9 [5 N* Q! ~3 B d能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
/ f* |7 j/ ?% B7 n: b( r水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
" X2 W/ [) f: ]2 Y1 d4 d: s人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
3 h5 X; C! V) ~ C托管/物业与维护:
& c; i' j, f5 Y托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];( o \2 O4 ?, O9 N p6 c7 R
硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
( \: Q# k; A' Z. @. i5 e3.2 区域差异(以 400MW / 3 年期为例)6 x) G, @% ?; V5 s3 i6 H
使用 ChinaTalk 的电费与人工估算[1]:
* C1 _7 z& C, a# x+ @' B i2 U4 e# r1 H) A6 w/ w
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:
& U: x. }7 d8 H5 O& h8 F中国:约 $0.06/kWh → 3 年电费 ≈ $350M
0 t+ B9 m, a2 ]- W% C, q. ~" h+ J美国:约 $0.09/kWh → 3 年电费 ≈ $600M
2 j& V. `+ k8 o中东:约 $0.07–0.10/kWh → $400–550M
% @! P$ O3 o7 Q, x: ?欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)9 I" Z7 c5 S% Y4 g0 e- u- |8 O
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:
, R( t6 u( m, a+ _7 o美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
0 R) c; E* |) l三年水费级别:
. z( j- l; l/ ]2 u美国:$40k+
+ ]4 b. R7 B6 g$ |! G3 I中国:$20k+
% } O& A5 ^" C( p2 [1 m) \4 d结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。. ~& s% o! A6 r
人员成本(3 年) – 假设 500 名全职运维:; i7 }, X6 T' @& i
美国:500 × $120k × 3 = $180M+0 H( f) [6 v C0 U& e' U
中国:500 × $22k × 3 = $33M+9 m5 o$ f$ u& u9 g
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
j) w- ^* l4 ^5 F; q整体 OPEX 粗算(3 年) – 400MW 场景下:# Z) f/ m- Q7 b9 W: ~: p, N
0 ]* w& ~5 @$ |项目 中国 美国
9 w/ K: ]. \& u# y0 P9 M5 H! F电费 $350M $600M
. z8 s, e( y, L' J- H4 s) T水费 <$0.05M <$0.05M
) y1 B4 B% {& a% ^! s8 K* U人员 $33M $184M
+ ]: j0 O! W% C) h% q其他维护/托管 同比例估算,地区差异主要体现在人工与地价
( j$ V( j3 l7 r L. h结论:
. H2 J5 Z @" y: |7 M0 x$ ~2 W' }# H, V7 E0 z
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。9 P# n9 M/ S+ q2 k' i; w" a" A
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。 S- K2 Q% z {$ J; O' Z! o
四、基于 token 的成本与利润推演: K5 {) G& _* ~/ R2 Y
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)% V% }% n: R- ?9 K F/ _# u1 S
统一假设:
5 R% u4 P) Z# }7 a6 k( R1 U; M2 `: m# Y% d$ _: q
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])7 |0 z" k0 u- `% K
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
1 z1 K" G) P6 o& d( W- @. s1 百万 token:278 Wh = 0.278 kWh
/ @7 W1 }( {9 l* P& \! I" [6 Q场景 A:美国电价 $0.30/kWh' E* u' k: }* h1 E0 i0 ^
电费/百万 token = 0.278 kWh × $0.30/kWh
) P' v3 I) r- ~; I% U≈ $0.0834 / 百万 token
" ?1 h. v( A; ]( j, a场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
! e, J2 G+ I% e电费/百万 token = 0.278 kWh × $0.0429 x, u) G+ a8 i9 [$ |
≈ $0.0117 / 百万 token( M9 N( w: b9 B: m$ n, o
对比当前 API 价格(OpenAI 2026Q1)[62]7 X$ M0 M* Y4 c. i6 l3 p5 N
以输出侧为主(成本最敏感):
% f9 p3 s6 v7 C8 i8 y' [( ~& J7 D- m. n+ e4 w
模型 输出价 ($/百万 token)+ N5 a& p) s$ a1 M3 r. J" _/ c* U7 Y
GPT‑5.2 $14( B4 j! r K* q- H0 h
GPT‑5.2 Pro $168
0 O& o1 L* W1 K+ J0 dGPT‑4.1 $8/ z/ \+ S$ {9 ~" A: u/ G1 |
GPT‑4o $10
1 @. V: g6 d, I8 K2 `/ ~- yGPT‑4o mini $0.607 V' {0 @7 J6 s2 g1 @% V3 W0 S8 K$ T
则:* F$ F5 E O* R; @
+ I4 M- h; ]4 a+ ^+ C在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。8 O% M+ v/ E0 ~4 T* o6 u
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。
- n9 z0 n' C, I6 I0 S$ L0 D! m相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
7 X) {' P' h# d: Z: @结论:
6 d% p' Z& R& u7 V: v8 X即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
2 C0 i' s: ~4 P! a; [* Y
% T; b2 e4 t( z) ^4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
% g9 ?9 {0 w0 Z0 t2 A以 LenovoPress 的 8×H100 Config A 为例[28]:
, I4 A6 R$ o; g+ F6 Z; J. G6 S2 A9 p$ o2 s( \3 T7 L: ], x
5 年摊销下,8×H100 本地推理 70B 模型:
' y8 e3 l8 T- F( Y6 J# Y小时综合成本(CapEx摊销+Opex):$12.08/h
4 B7 h: P1 d( N" x0 Z吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens' L7 j) m( ~% M1 X0 ]* t* x
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token5 C2 d2 G7 ?5 G; U
电费在其中的占比:
. g3 ~' y& a" N) A$ HOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
- T$ a$ T3 Z. J& s电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
0 W T; p5 n; U' O. J电费占 总 token 成本 ~7% 左右。: c& R4 k9 c) {
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
4 Y3 y# i0 K2 }0 S若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。( U2 L& ?- b% C# L# G2 }( [
1 Z% t( i& r1 l; G/ v因此:, m O" [: T0 c5 o/ {
& a4 s, Y+ @! @9 A6 U5 v8 n在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。) o0 C3 U& e+ d0 T) |
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
1 Z4 ^" A1 q2 X# M五、不同芯片方案的建设与运营成本对比
! D# N7 F" z X7 X# ]3 q, p) Z5.1 NVIDIA 方案(H100/H200/B200/GB200)! \$ P* J7 L* Y( a* K- t" }
CAPEX:, x) ?! Q$ T7 o" X0 M
* _6 f5 S8 E9 h- {8 y7 B
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。2 P9 V( `; C+ t
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。( J- ^, i$ W( X) X! I9 t
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。, e5 R4 i" T6 P8 X( q
GB200 NVL72:
! y9 T# l) k; {; D每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。% U; f+ e q2 i0 W1 b; D
冷却系统每 rack 额外 $50–56k[35]。
q/ y5 j" Z% O; S在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
, f" M7 v& K- v) D; E6 DOPEX & 能效:
. s" Y6 d! j0 s; l
( E- m) @0 s4 G1 R单 GPU 功耗:# g: @' _7 f8 e2 ^* x+ N9 h$ C
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
0 k; j0 ^8 P6 r9 |5 FH200:功耗类似或稍高,但性能/W 提升[9][10]。( M8 ~: B! J$ S. n: G
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。# Y6 V0 ?2 D5 |" f+ G
Token 性能:
! H) Z1 R. _4 @B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
4 P3 L' {+ A$ ?9 A' |/ YNVIDIA 的优势:6 p5 c4 v$ J: ?! b+ Y9 h
# v; Z! G' }0 e3 q% _
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
/ T" O0 k% L0 r% M( Y! O* A6 w2 `但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。
" r+ x& F0 Z+ E; L6 y! r5.2 Google TPU 方案7 Y0 N& g; X: [" ?( i R% k) X
CAPEX:! ^' e8 g# [7 K/ t
' _! k! D* I+ n' e单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。3 ~% @# v! t6 R
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。
8 g+ T% t3 C- }- j* l8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
( e6 r2 |: }1 Q$ i7 W能效:
' j. W1 k+ [! D8 t" d1 [2 z5 G2 F( P e+ O- A
TPU v5e vs H100:/ L- U! m+ ^$ u( |; D
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
" z; r1 u- P2 r5 n& k5 \5 y+ Y测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
) x( U# u& T2 C0 }新一代 Trillium/TPU v7:
4 {( u. ~8 Z; x! x D, W }1 c能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
- e1 q) {$ i9 N0 tGoogle 方案的特点:
7 ~# R4 d& B& \" \" K5 h0 U; s% H/ B1 o5 }
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;4 D8 B u4 F T
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。4 |" N$ H5 Z# b4 d" k3 I9 |. y
5.3 华为昇腾 910B / 910C 方案
/ X- g t, i5 rCAPEX:
& y: {1 S: o% i$ Y8 ~# l3 {# r/ C
$ E0 V% x( p% |# }单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。4 R# b+ I, T' M' t7 ?& c6 D9 K" ?" t
与 A100 对比:
9 b5 d$ R" d. |9 R$ a/ K* C, VFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
& p+ o1 y4 ]2 Q+ ~. X6 i' Z市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
8 k3 ]2 }5 F# A' b$ I% P使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。- } P" B3 i w" k9 H8 U2 Z0 y
OPEX & 能效:( ^1 ^( a' r1 j) |
1 c) K# @" ?4 Q$ c
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
, H9 m) i3 S2 f- C2 t. ^- O2 ?部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。1 G. w/ b: Q* c; X. {3 D
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
3 Y: }/ [ f2 g- @7 H- c% F- a5 [5.4 平头哥真武 810E(PPU)方案
2 H8 J: X7 F( lCAPEX:
% [! k( ^ x7 G& q/ q7 s
: O$ Z# z8 E2 o; A技术参数:9 f# ?# U" x3 A! q
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。2 h# A9 z7 J; @8 t# J' }
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。7 e0 X# ]+ g& l% W& i, D7 F5 u$ J3 k
价格:
' b- S& c( F9 C未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。
( F% e, n B2 k结合国内报道:) P$ Q2 l" o0 t2 Z# h7 X
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
, X9 s7 o/ [- q( U数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
, o* \, J2 H. c/ e9 O; [* EOPEX & 能效:
0 ~9 G2 z+ p& P5 m6 O9 S" ?6 ] [" a p2 f8 p$ ~, _1 r
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;+ G6 i) B4 X: \1 v7 `' n$ r3 U. O
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
4 M* d# A2 i* f六、综合比较与策略建议4 D# K' T1 h$ _6 f' X6 T
6.1 区域维度:在哪里建 AI 数据中心?
, O: V# `- ?5 F s纯经济性(TCO/tokens)排序(假设无政策/合规约束):! p. Z5 r: k2 k% \) W2 y" f
9 K) L4 z1 r4 P: r# b中国西部/北部(电价低、人力低、建设成本低)5 h2 s$ T8 L% ]. B8 G& i
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)6 l1 W$ F" M! Q: g i) P
美国电价低但人工高;东海岸/加州电价上涨压力大
$ e0 b& p6 k+ U: Q2 C, o3 d# V欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
, `$ G4 N S) {7 Y7 i& `8 ?( W若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
# I2 Z! p1 N$ o) j* [4 }
$ f4 H" v9 \8 W3 d9 V+ K( e纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
8 o8 f0 D# N! Q( O7 z9 I7 v' G对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;, _! }* H8 F, E! S# k
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。+ }% x, z8 M. y% J6 I( ]
6.2 技术栈维度:选哪家芯片/云栈?( S% J1 R6 c! J: A1 V
若目标是全球最优 tokens/$ 且不受出口管制:
N9 U& h+ l, r" [, Z$ _, z3 N1 X' a- L9 t* D1 L' n
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。1 n6 t3 _" a$ V: F
若在美国/欧洲,能自由采购 NVIDIA:$ `) I9 b& P+ z v7 d
; K: l/ _4 D& s3 X" d$ ?短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:# o& s, _7 w! k$ I7 s' I
成熟的软件栈与生态,极高的 tokens/s/GPU;7 ?- R& c1 [, C2 i4 S1 T' l
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
, n& | U& E: N但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
- j- M' u* U0 Y; ~* w. G若在中国或存在出口管制约束:
4 P+ a" b u6 l# E; v( R. _
; y/ ]% W* z/ b N! A( t5 z昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
! ? M5 d, U. s0 v0 i" R性能上已能覆盖大部分 GPT‑4 类推理需求; a7 Y9 k9 u5 _! ]' @' C
单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;- G1 F: x! x4 O$ D/ u
软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;2 q/ @0 a- G+ b# I
建议配合:' g' |% f3 y8 A! g2 ]3 H& B& \
高效液冷(PUE~1.1)、6 c1 C7 J5 ?3 W6 J
大 batch、路由(浅层任务走小模型/低成本芯片)、
' M6 }8 T0 P: i' P& v/ P5 x% X5 U强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。9 }6 y( A) D1 w3 N; b6 S! ^% I+ [5 d, @
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:% @, F [8 p. s7 z7 y8 a; M1 n" W
' i- x4 j% a. X9 n& }! Y) @+ |4 @. l
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
# ^0 `( }3 j: f0 b这意味着:
' N' d# W4 F& j- A# n优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);$ [, w% C% z; o/ ~8 b9 c; L* V% O% P
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。2 ?4 e6 M5 h; Y" F) Z7 r
6.3 针对你关心的具体问题的简要回答: q: Y( [* y# g/ x# m( U6 `
AI 数据中心建设 vs 运营成本的大体比例?3 \: J; K7 C9 ~
* O% A3 l& S) `; A6 l8 u
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。: x3 s& C- t% i, J+ ?; V7 E
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。8 y9 H5 O6 O8 ]0 Y: c5 o
中国、美国、欧洲、中东的成本结构区别?1 y6 q7 o% t5 J! F9 |% {; \0 u$ v
: H! `% ^, q2 ^: R# r5 K) y' R
建设期:
6 R" q* m& h( U7 M7 ^中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。6 L+ Y$ g# N4 H9 f1 o. P0 x
运营期:( x4 G, Z; q9 G, I: q8 ^, [
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
* d: X/ l1 E: n9 W人工:中 国 ≪ 美 欧,中东居中。" _% Q* i! e# s7 z1 u6 R
在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率? Z* n! V# G0 M. i* E' W$ B. o* Y
. P' p% c2 ^, L9 i对于典型 1 J/token 推理负载:9 }9 [) P( b. v- _
美国 $0.30/kWh:电费约 $0.083/M token* U, ^# X1 s; @9 |
中国 0.3 元/kWh:电费约 $0.012/M token
+ g3 m$ V" h- O, Q$ O! y对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。6 b' O6 L, {2 ~! p: p; g
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?' M5 h2 D; Y* ]7 s1 l
0 J, B/ E1 a; W" c1 _ O
在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;1 G7 M; M$ L; \! S& a; C& @% e
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;: S8 k# G, p5 O& @* G9 F% A
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|