TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:5 B6 b7 x: l% w8 x1 L) |
! o. e' p2 x ]7 N( w, P4 i; I! v一、总体分析框架与核心结论
" r* s6 G7 p+ V# X* J( u7 d1.1 分析框架概览
9 {3 H! i, b' Z9 C拆分维度9 C3 z3 U! s/ p2 p
- e$ K5 t- ?% c1 Z* [) t4 _阶段:
2 W* Q9 {+ Q6 P9 [$ c- f4 b. L建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
3 W Y1 B# P4 s$ }运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等
1 d4 P0 e+ Q3 p' c, m& l1 ?区域:( E6 I b8 P* S& t6 N4 g
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)7 z3 d1 `0 G7 B3 Q7 r
技术方案:
_' H+ O9 \6 {; X2 ?9 r- yNVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
& A6 b: o* v, w1 ?* B. S$ z3 nGoogle TPU(v5e/v5p/Trillium 等)
5 H2 a9 `* P* K6 W中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU): Q3 Q( U3 }: Q9 l3 `" q
算例基准 k6 T9 q0 P5 e: U
/ ~: l6 d! m, I
以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:
6 \) u* v+ m" Q) ]% D5 j5 ?2 D其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW) f4 a1 K. E( |. |
PUE 假设约 1.11(高效液冷场景)[1][29], S3 A" N' v. V5 C/ R Y0 ]
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]: D" `3 |" V, o( z
关键指标: h6 z Q+ x5 ^6 W( t; k( h1 i
/ Y$ B: Q5 g: B0 s5 o: ~$/MW 建设成本(含/不含 IT 硬件)" L7 P4 ~6 [; k' |
$/kWh 电力成本、L/kWh 水耗3 D9 U* Z# S! ^) ~. W$ e5 r
$/token 或 $/百万 token 的综合成本
$ h" P8 y7 ^. t) ~, o$ u) jToken-per-watt / Joule-per-token 作为能效基准[17][18][26]1 @8 S" ~* ?' K& C9 Z
项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
/ n# y8 V" \# ~9 P# }# T4 X0 L1.2 高层结论(供决策快速参考)- N" w4 G0 T7 }; x; x2 C# c0 }* ]
建设成本:AI 数据中心相对传统云数据中心成本翻倍
! H$ j, U& t8 a; k; c
1 e# ?! P4 V5 H! d/ s3 h( I* H传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。$ m# o% Z! ~3 n8 |" n! _
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
3 J) P- U8 g9 c按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。" ]8 [( Y; e9 k2 l6 C0 N
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区+ F1 V& }7 o* R% o: m, @" I
2 c' ^, J; r7 j8 A6 K& j中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]& m8 y/ B4 W) E, n- V9 d
美国:$8–12M/MW,400 MW 约 $4.0B[1]
) _1 v1 \. I1 |) z4 S! d* o欧洲:接近全球平均 $10.7–11.3M/MW[2][41]7 y) R, G( M8 G. N& U8 H
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]# P& f, Z+ J+ X
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。, o6 i. L1 S8 x& u, L" F
OPEX:电价与人工决定区域优势
5 y C( o1 @+ h: N/ g( K P/ r) J A
5 {& w; M: T3 Y, k* A电价(2025–2026 工商业大致区间):8 J4 F) @" E. \* Q
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
3 N" g1 k% Y, ~7 _: h! e美国:工业用电约 $0.085–0.09/kWh[44]7 P% ~/ G4 t1 V5 o. E
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]6 I7 A; @$ @' p( }4 R
中东/UAE:工业用户 $0.07–0.13/kWh[47]9 }0 c+ G0 ~4 [! g+ ~
人工:/ Q4 M B# e8 n5 {/ n g* m, ~" c
中国数据中心运维:约 $22k/人/年
( T9 i9 @% g, f# |6 L, E美国数据中心运维:约 $120k/人/年[1]# j/ _1 C: H# ?& C, W0 h
结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。1 ]6 g, N0 ^( s F
能耗与每 token 能源成本:能效差异远大于电价差异
* T3 v) L" y `1 l/ | o* O+ {: O! k
) ]2 V; f$ \5 d! N+ D: z& PIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。5 m! Q9 s' U! K& J' X7 P
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。9 k( Z: w6 Q {; w
将 token 能耗约化为统一口径:
6 a% H) s/ L, O7 P0 y% p粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:; \$ r. Q: _0 |/ j: b; h
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
$ R7 _3 H0 Q+ ~7 G/ c美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token$ n8 y" i6 P" E! d
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
* }7 A9 }2 P/ [7 j3 ]5 s. s不同芯片方案的核心差异
+ b, R( _1 \/ i5 h0 p5 y) Z1 d1 U3 x8 h" t) ~/ K* {: Q; ]; t
NVIDIA Blackwell/B200 & GB200 NVL72:6 [7 }5 d& }6 u2 A- u
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。( E. i {: `/ x7 b/ y, l4 x4 S
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。& x9 ?7 T0 K% w$ h' D$ W# K" R
Google TPU v5e/v5p/Trillium:
i6 N" j/ c; d+ |TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
+ k, W8 N0 q* HGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。' N7 U: v2 V: y8 r3 M
华为昇腾 910B:
5 _; P3 c' O1 \) tFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。2 g/ t! B3 f3 w5 o/ m+ r. ]1 H V' L1 ?
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。
$ P8 E* ]; t1 H5 r$ Q2 [& p阿里平头哥真武 810E(Zhenwu PPU):& v2 [: a5 E' o- y& \& d
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。
) u" i; A! r4 g结论:7 Z! T0 y2 k# d6 O" X2 ^
能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。4 g1 @* b" t# Q" G! R9 f) I* \! ^
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。' I0 F; U& K: E
对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。5 n. y( @( {. l1 [
自建 vs 云租的 TCO 与 token 成本8 u4 {* U2 ^, O9 @) F# a: I- q
+ v7 i2 C1 E5 q2 M/ R6 X( B" g' ~LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:: l8 a& v x8 A: Q! k6 S
8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
0 H% c1 D& ^3 i2 r% Y1 h% G等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
i; V0 e+ f& O9 k4 e* ?8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。* m& ?6 T1 Y+ w
Token 成本对比示例(LenovoPress 场景)[28]: Y- `5 R2 x0 j0 G _& |; N* a
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token
' Y2 G! y& K: A3 d( Gvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。$ m# y" j$ l* w( c, W
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。1 B8 v& S. o* @7 t" [0 a5 J
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。, G$ j7 s, O1 v0 V& m4 @8 W
结论:6 o- S+ f: x& M0 w Q
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。
7 X% T$ ~0 `9 ^Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。1 Z) A+ x* Z- z, f0 `
二、建设期成本分布:区域对比+ G1 z1 Y0 M# V/ {8 C3 Q1 l
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。+ h- ^* z- C$ H: C+ X: p1 Q& Y% c
- P& E/ z8 F4 {' ?2.1 全球/通用结构(以 1 MW 为单位)
* J* R! R% g! _5 Y6 o9 g综合 JLL、ConstructElements 等[2][41][40]:
, v4 f3 V- r- G/ ~. K* W$ g& m4 P8 F
壳体+机电(Shell & Core): k7 M& e0 \5 Y
% H: e% }* Q5 ?9 O全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]1 }; t: _. h0 r ~
其中按成本构成[40]:+ N* _8 ]# r: a' a
电力系统(变电、配电、UPS、母线等):40–50%
. ^4 H, U2 N* `! y) \& Y机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%! ^3 k0 k! q8 w9 Z
建筑与土地、结构:约 15–20%
8 A5 ^( P" B' S4 R2 F4 q S其他(消防、安防、楼宇管理等):约 10–15%4 C4 c( Z" k: ]& S# o7 k: a
IT 内装与 AI 基础设施(不含芯片)
. r. K7 z4 X- C0 q- U+ c2 Y: q8 l, S8 C! R1 C
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
: {- m3 r+ S3 o. `8 XGPU/加速卡硬件 CAPEX5 w9 n& x) z) }; o! p e- v$ d/ A
' `) y7 R9 h+ k- J9 _$ G多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。
+ @ T, ~* E% f) y4 @2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX! W# e" g' D# r7 q& M/ _
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):2 n' Z5 m, N7 {8 [) u; _
2 O8 M0 O. [( o* R: } S" y区域 典型建设成本(壳体+机电,$M/MW) 备注) T( ^. D$ q& x6 a& g
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]
$ s0 t5 A- |8 [8 R4 p; Y7 r+ n美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]
& _, |( K4 {; l! v& q9 L欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]! y' X+ P9 C0 f' v& _# u
中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]4 X# j& O1 h: n! C
结论:! i4 Z1 O! n( E; W1 n
1 f4 G8 b* a% E7 `# j单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
7 d* O4 }+ W' D7 F$ B/ j V若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。
6 k9 L# W/ @7 ^/ @+ h4 H+ e: S2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
2 m {* O- Z: P+ ^- ?& M8 z以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
9 o9 T$ G6 O j1 v7 H$ }0 U
. S5 V+ e1 W5 c# t; W, y假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;0 j" \2 \ c& k) U: j# @
GPU 配置:5 k. d [" b" w5 l, C$ L- ?. L% P+ J
有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);" k w7 h9 `; E" f
每 rack 成本 ≈ $3.0–3.35M[34][69];1 b5 f& M* u2 V4 {( J. r
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。6 a. G* M+ M4 Q, W
与不同区域壳体+机电组合:
/ K% F4 ~$ n% H4 {5 V8 n8 }( w
|+ V/ Q" T& L) P7 E以中值估算:; t* ~' C. c a
; _; I7 B9 w3 a( t. q! U& N
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B6 D2 R6 ~; D% L! Q- G3 N
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
1 B6 d' t# s$ }0 [0 _/ E欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B& Q. Y ~: g7 b9 {, n; {0 X7 r
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B+ N1 F" z y5 e' O$ Y
可见:
" v0 k6 r: t5 u( {2 f4 t6 p
* h; r8 a: {- }; QGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。7 @: G( g0 h) y% ]2 _
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。
) e, K' R7 \, k7 P- |' n$ r/ i三、运营期成本结构与区域对比
! W4 v* m; d' P" U2 R( t% t1 u" ?2 w3.1 通用 OPEX 结构(高密 AI DC)( _$ H9 k1 Z" Z
结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:% b# s* c) J6 g
6 C/ n1 a' t- [' g, O6 N0 D) K8 C# Y电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。: |. n. @. q9 c* O0 r* J" f
冷却与水资源:
* I) k) b5 Q# y4 o能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。, T. U, a. p, M2 {) Y
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。3 M& t4 o" E& w5 d; o
人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。
- `! i) ^, X8 b; N/ S/ _托管/物业与维护:+ V1 }( _. G+ p1 |- T8 r$ o- ~0 q
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
1 T9 F. i. P: R' Z6 Q# Z硬件维护:LenovoPress 模型中按设备价 12%/年[28]。
9 j% n: ?; c5 Y% I Z+ ?3.2 区域差异(以 400MW / 3 年期为例)
6 }2 h/ x9 s/ m# V使用 ChinaTalk 的电费与人工估算[1]:. n5 _5 D' K: v' I; k2 l
) ?5 X7 [/ D; |) |: Q& @, h
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:0 D* d+ ^2 v9 e' I9 W
中国:约 $0.06/kWh → 3 年电费 ≈ $350M" R6 X9 e# _/ k* Q% p g; ~/ A
美国:约 $0.09/kWh → 3 年电费 ≈ $600M
; Q, u$ M9 b- C; D* q2 m2 g0 T中东:约 $0.07–0.10/kWh → $400–550M7 f+ v$ e- Y0 P3 e& {& O
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)
4 D7 Z% R$ N: k, ~( v5 A' _1 c% M水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:& n4 X% s. w G7 E3 m
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]
% x1 c* C; Z. Q3 k三年水费级别:
; ?7 e/ O/ X$ O. ~7 h美国:$40k+7 K$ [* e, z) b7 \( B& ]
中国:$20k+
2 ^5 a t; t2 t6 d4 K结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
5 j. h9 `" s/ n; ~- l' u* T人员成本(3 年) – 假设 500 名全职运维:
9 C) ~6 v. h* o) M9 g3 I* C美国:500 × $120k × 3 = $180M+" P J$ k) v! M$ f
中国:500 × $22k × 3 = $33M+1 l1 B7 C: |- v# n) k4 k, q$ F
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。
. c. ^0 ?8 Z1 C! n/ |9 r整体 OPEX 粗算(3 年) – 400MW 场景下:& Y9 z, m* R o$ U4 v' \" s/ B
, a& x" Q1 r; |4 G$ |
项目 中国 美国
6 A( Y, j, ?1 Y. L) U) \; |6 [电费 $350M $600M
/ e* s9 w0 p+ h/ T水费 <$0.05M <$0.05M
, c6 F# W& v' V+ N# [人员 $33M $184M! O7 R/ @ J+ K; x3 r; T2 b) b
其他维护/托管 同比例估算,地区差异主要体现在人工与地价 & c6 a T$ x0 W+ z: y: J; J
结论:
. H' N V3 F$ \7 X1 n9 K; z2 l E1 ~- s
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。' e9 s6 ^. U, y, Y
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。. X9 \8 F* V* l' E, q6 z. j7 ^
四、基于 token 的成本与利润推演' w$ D: a; ]0 @1 r" C: {
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
1 w4 E: \- W& P( T! d; O2 ^统一假设:0 V' j5 z! s* ~& H
$ X6 B2 J' Y, U& Q( u. M
典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])8 {8 X- Z0 y& u1 k
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh5 n- T1 ~* x# Z" a6 E# n
1 百万 token:278 Wh = 0.278 kWh
9 n6 c R+ R2 N6 y场景 A:美国电价 $0.30/kWh: Q3 b2 r2 j" R, J3 L: f
电费/百万 token = 0.278 kWh × $0.30/kWh9 ?) n9 k; g+ M
≈ $0.0834 / 百万 token% J- ?+ [2 h* y- ]0 k
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
- k* {: s/ E/ \" b0 \2 }' u1 ^0 K- f电费/百万 token = 0.278 kWh × $0.0420 G( Y |5 h0 s* j+ B4 v' a! y
≈ $0.0117 / 百万 token+ x! Y$ A# z$ {5 A
对比当前 API 价格(OpenAI 2026Q1)[62]* \7 c2 s% O* j F
以输出侧为主(成本最敏感):! |" u2 u7 |0 r6 [6 k3 C- h" N
2 p* m0 J; Y$ e) n! A7 l4 ^模型 输出价 ($/百万 token)
8 m: l" O8 L2 `7 Y( ]5 ~GPT‑5.2 $14
$ Q, l- h+ X1 I& V7 hGPT‑5.2 Pro $168. B# j5 B/ x7 W& T7 x
GPT‑4.1 $87 o, U% A: }1 `1 {
GPT‑4o $10! @, k. k- T+ C) s/ \0 S
GPT‑4o mini $0.60
# m! ~3 {, g1 Q; S6 d' ?则:
" K( z2 t7 K" {5 t* x" V v( f
5 s0 Q! f& _1 e+ n# k在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。3 ^. I) [6 ^/ S; r- T! X' Y) I+ z- t
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。+ [, e" g0 Y& U% ]- [
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
+ J$ Z9 b/ ]* g, z+ K' j# W$ U结论:
) S0 b) y5 }% `/ a2 r! b. |即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。/ ~; J! l0 z( d5 e
, \/ P/ o' u3 h3 t1 F: J4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)' ]1 B X( r4 y% d Z( I! N. k
以 LenovoPress 的 8×H100 Config A 为例[28]:
, T3 w; B0 _% S5 ~/ E, [
# e, ]. {/ R' _4 k9 U2 p5 年摊销下,8×H100 本地推理 70B 模型:
% z% t& g# X- m" Z8 w小时综合成本(CapEx摊销+Opex):$12.08/h
% E. y7 J8 Y* e8 Z% i; t吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens$ B/ h0 c' Y: K/ |! L
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
$ q6 P+ Q4 T6 f! e; N: k9 G' H电费在其中的占比:
# z' z$ x7 }2 AOpex 6.37$/h 中电力+冷却约 $0.87/h[28]
; \9 S" s$ b7 u- @电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
7 K) O! d/ X* x" [& G1 V" k电费占 总 token 成本 ~7% 左右。
9 E' m1 P: k% I0 J* @( M若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
) r2 M" j7 ?( v9 f% ]% B若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。, o5 T l* \8 r4 R
* a$ ?* v; ^$ F6 G6 u& r& T
因此:
/ J% G( r9 q1 W/ v8 ]4 B+ {' p- U) t. R3 Q
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。. t/ ]/ s( a) }' k
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。) V+ w' q7 x2 ], y6 {2 l, ?
五、不同芯片方案的建设与运营成本对比& q. @" k3 b4 _0 x/ j
5.1 NVIDIA 方案(H100/H200/B200/GB200)
' f( F& |. D; `4 L0 b5 m t* _) j9 ]- uCAPEX:
9 ?* Q/ p+ h9 c0 J
$ i" o( U* P# m! fH100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。% ~- C, m/ S$ N
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。$ n/ {8 q6 I5 U0 [! m, O9 j
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
( W$ Z6 W2 Z w/ ZGB200 NVL72:
% m% }- @5 |% B" |每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
, C% E/ T6 q1 m, j2 d6 A0 E' D* ^冷却系统每 rack 额外 $50–56k[35]。; W! o# G" b, O+ _% {. R n) ^! V
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
. F; Z" U- l) [' L& S OOPEX & 能效:- J2 D* {+ F5 H! j: ~# @
. G" P/ u ^0 Q) L9 {* e [单 GPU 功耗:
8 X3 s8 }0 W1 h) C9 U2 X; J0 B/ z4 V. ~H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。9 x: S1 N" C2 y4 c" ^
H200:功耗类似或稍高,但性能/W 提升[9][10]。
) Q4 g8 H$ D; p' ?2 n; |B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。' Z8 g" R2 P, G, x9 J- n1 s( s8 V/ Q
Token 性能:- l7 L4 l; D# E/ R. t: d, X
B200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。% S6 o4 b. S, p' X& ]6 F# W/ J
NVIDIA 的优势:& R! c2 w1 L! ^/ j% W" J
" X" G* r2 p' L7 j7 J# ]4 Y) f% B软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。9 I' E' G3 G \
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。0 e+ e9 y: X5 s8 m1 _; }
5.2 Google TPU 方案
4 I8 M- G$ P9 `2 E6 @. o4 g/ x0 qCAPEX:9 I+ |! Z- T) ^1 Y: O- O/ o1 Q* W
2 z' ?& L6 m% s* |9 T/ k5 D
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。
3 d! z( I1 w! Y4 x, t% ?0 f: Z) SGSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。# r) \0 E2 c9 ?4 ^* `# N
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
" p8 Y' t; Q# a& c9 }! |* o: N能效:
4 K8 X5 U3 {2 C3 L6 U! G- f# ]8 ?* { t2 p/ @
TPU v5e vs H100:
/ s, h8 ?" n# E9 H- r8 H: k, x同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
" S9 }4 _. B* q+ [" u8 W测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。- C7 l; P/ D/ [" Z: u+ ]8 w
新一代 Trillium/TPU v7:
/ K' {. ?7 V+ c$ G( @# q能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。
3 K) n4 o, s KGoogle 方案的特点:
2 h" ~% E* n' M: ]' c: u3 y9 c, s) w; |: S& Z- E' `
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;
* i; ?) U& N: n9 ]7 G对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
U6 \! E* i% X5.3 华为昇腾 910B / 910C 方案
! j5 d3 G. p# `* Y8 q7 s9 kCAPEX:; z3 B; [# G9 [. O* T$ p) N) m
2 V7 w7 K: Q3 T) X单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
( F7 ^3 V g; ^ P与 A100 对比:
- F7 ?8 v L9 J; K% ^FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。1 h" a7 a4 S) c! j- D
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。& I( D6 q0 j+ P! g0 B
使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。
) D/ j8 S2 G4 t4 H5 LOPEX & 能效: z3 }0 l$ K8 |! V
* v8 `5 n% N% A5 |3 X' [
910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。+ A- T: i0 Z: ^1 l8 J: v
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。" }8 f! N7 k* g5 A) m& s
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。* d4 C4 w& t" y9 j9 \
5.4 平头哥真武 810E(PPU)方案2 r) c7 s. O5 `+ M6 h y, K2 N
CAPEX:6 Q! g* Y3 V0 y
! b, e @8 |& a W/ P, o技术参数:
9 n% l3 F" D8 x- |' B6 m( h96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
2 Y1 x8 D) g1 r1 i2 D; G* d1 x5 a性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。+ s; a$ v" g* ^, v( h; d
价格:
% J# T7 u- v; {! Q3 M& j+ e未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。& @5 j; F. v/ T9 F
结合国内报道:
, e2 |6 m; ]0 K2 w0 I! {2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
% H) L$ o2 F! [4 D6 L2 b# ^数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
7 w' M) O/ E, f9 j* `OPEX & 能效:- u' A- R- X+ ?4 e
7 L, b% A7 h2 H8 f6 h8 e
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
5 w1 Y0 r( j1 ?3 N在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
( b4 m- {# ]- {; Y% @六、综合比较与策略建议/ g4 {: Y }' z2 R2 A8 U3 ?6 ?# ?
6.1 区域维度:在哪里建 AI 数据中心?
2 |' p; K1 C$ [6 o纯经济性(TCO/tokens)排序(假设无政策/合规约束):
g7 F1 ?4 F" A) A0 H
. L# A3 [! y: n1 p% H1 C8 l% ~中国西部/北部(电价低、人力低、建设成本低)# F0 F' w# u8 ~; w6 q
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
$ S% [6 S" i: G e/ z& S0 u4 U美国电价低但人工高;东海岸/加州电价上涨压力大5 J! L/ m H: K% I$ H
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求& K0 Z7 v! i7 [/ e6 P9 A& c
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:$ B1 ~+ S! ]- Z6 ~. M+ i- P! } o
. t$ Z- ?, y5 ^- K纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
2 y% v0 v: x2 Q" T6 l' Y对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;0 Y. U& r- C( b D6 k
但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。 T/ B* E. X2 O: q
6.2 技术栈维度:选哪家芯片/云栈?9 Z5 o; Z% e& y4 l% W: @ q+ \
若目标是全球最优 tokens/$ 且不受出口管制:
& H1 R4 J0 \; h! s6 k/ g1 o: S& ^: a* o( {: D$ [
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。% s3 o9 v- Y8 f, d+ t# {. P8 `
若在美国/欧洲,能自由采购 NVIDIA:
2 d, F/ V1 Y# V$ I' P3 {4 W, z" N/ X7 S+ {$ c) i' w
短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践: M, Z: Q3 y- R
成熟的软件栈与生态,极高的 tokens/s/GPU;
& }3 s$ k& T! N在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;
: w8 Y3 j# S4 a G1 t4 l但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
% t8 W+ g) L A" K6 j若在中国或存在出口管制约束:
' \, b) X8 I7 w/ F7 G1 Y# `
8 I4 J1 }5 B) ?2 U! g* b5 [昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
7 V' W+ W* }+ T+ o9 B性能上已能覆盖大部分 GPT‑4 类推理需求;
& P, {; X5 b- y ]单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
& O. q/ y& w& I* M$ m' l软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;" }* b# c- @! m4 p
建议配合:
+ R5 x- M2 U7 @# z! f8 j: i高效液冷(PUE~1.1)、0 g0 \& L* V, }" j- t7 {
大 batch、路由(浅层任务走小模型/低成本芯片)、
/ |- ~( y% F9 s( Z6 R$ b5 M+ N- L强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。9 [1 j6 W9 z/ x' f- O1 U1 v
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:! M7 f6 h1 g. T3 p! E- p9 g' `
2 I; d# C6 T3 p0 F/ k数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
7 M% E$ ^# ~1 x8 i; t这意味着:% s' \) p. E% F8 y2 L+ Y3 _
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
1 f/ u2 k) Z1 p# F7 c精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。' E1 E% m/ E5 q0 o: s% r
6.3 针对你关心的具体问题的简要回答7 R, L! G3 g7 l% T
AI 数据中心建设 vs 运营成本的大体比例?; G) r* y2 v2 A9 a
2 f+ @# p \ O0 F. N$ L在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
3 m, R B+ |1 N; Y1 a3 I X其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
1 c |$ S( y2 s0 b2 C中国、美国、欧洲、中东的成本结构区别?
; J8 Y5 C8 h+ [' `) d1 v) V3 [' ^" R- {3 @% s) ^! n
建设期:
: `" u. z5 S% \9 Y3 r/ k& b7 H中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
, @# S5 U, j5 N+ f) @, p7 D运营期:; y3 E/ h* u0 P- C/ p* X
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
/ a* I: W; S, ?/ y" B# W5 V$ ~人工:中 国 ≪ 美 欧,中东居中。
8 I1 L' [" k4 W% o在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?9 |9 D" X X3 P. Y' }- p' i- w
- N' l2 v% ^: ^2 n6 |对于典型 1 J/token 推理负载:
4 b/ u# P; E0 I, F. L- _美国 $0.30/kWh:电费约 $0.083/M token
* i; i' u, [: p. q中国 0.3 元/kWh:电费约 $0.012/M token& p* Z( A- T$ v5 ?! D( ~4 t4 s) ~; P
对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。
7 N9 w: s" y& j不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?/ l! j1 c2 t8 z+ {( P- ]
# g3 i, A8 U# s在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;7 O/ C! S+ O$ ~: Y2 I7 `$ f
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
8 V3 j: M: g* G5 A" R. g中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|