TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:# {# ]$ Q/ `; @% P
8 e: G9 I5 M/ u. h! l, m4 H一、总体分析框架与核心结论
8 k" H$ } w0 w0 T1.1 分析框架概览
1 e8 w: x7 T4 d4 `& h$ {/ v+ L: w. W拆分维度# _6 w" z; ? b* _
& ^( i3 o: k4 w0 @/ {阶段:
; r" w3 i) U% S& c2 U! j8 A建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施2 {) G- k ]/ R
运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等! S n/ `) y9 f' J' Q5 @
区域:+ `% y4 w& U" e# Z5 z% H) r. ]
中国、美国、欧洲、中东(以海湾地区/UAE 为代表)2 }3 Z7 E! J' i0 p. I2 S$ a6 }
技术方案:/ i1 ~3 E- ^6 k. f2 h% W
NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)8 x2 v; z( Y: {) H9 p
Google TPU(v5e/v5p/Trillium 等)
: V7 l! g* X; s8 g中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)( k% a' k1 ]1 z4 h
算例基准0 @6 u) S6 j& ?1 ]5 b, Y' v
9 W( ~! J W; M4 c以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:6 r V- g2 }/ h) h
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
- A' ]4 r G" g" l q2 N' V) ]PUE 假设约 1.11(高效液冷场景)[1][29]5 M" W9 s6 j1 D5 f: | v
时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]
& N3 y7 x% |8 F3 k关键指标
$ Y' P% N% {0 r3 Y
: a* p4 r1 s( B. Z0 [# l$/MW 建设成本(含/不含 IT 硬件)' f$ _1 N) D( P9 F- \- `
$/kWh 电力成本、L/kWh 水耗& f$ d3 m7 r5 h2 m( A
$/token 或 $/百万 token 的综合成本
+ Q3 `0 e {* I8 G3 V9 n" D: GToken-per-watt / Joule-per-token 作为能效基准[17][18][26]
1 z+ Q; b* G2 p5 m项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
5 G) ]0 T. X/ w& B1.2 高层结论(供决策快速参考)
2 G; ^# c2 a# C* q( `) {建设成本:AI 数据中心相对传统云数据中心成本翻倍
1 |) m9 g K. M& E4 {, \
- j1 ~2 u$ M* Q/ r% H% m4 a传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。+ p9 s' y) ]2 G. P
AI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。
1 S: F! n$ E8 }' n" j5 k9 y4 Z按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。, C% I- ` D6 ]
区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区. E* ^ t, f4 ]6 T9 C
% A" t% F- A! P9 M中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]* t" V( o, j* l! w! Z
美国:$8–12M/MW,400 MW 约 $4.0B[1]
' d* j# w! Q# n4 C4 e欧洲:接近全球平均 $10.7–11.3M/MW[2][41]7 `6 X9 z& r6 T; z
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]5 L6 L8 v9 j8 C4 _
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。; z& L5 r+ T6 I9 q! a+ h3 k: j& P2 U
OPEX:电价与人工决定区域优势- h( V* ^1 R3 f, I
" `% w: Q* K" s. F
电价(2025–2026 工商业大致区间):# p5 D0 O' {! o3 V k& [
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
. K/ \/ r! y4 E. y# b$ o) `, D) g6 i美国:工业用电约 $0.085–0.09/kWh[44]3 t6 p8 V/ s5 b2 q- e5 B: }
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45]/ A9 t. ?# N9 ^: o; O
中东/UAE:工业用户 $0.07–0.13/kWh[47]3 Q8 z* }7 u" I4 d
人工:
; z5 ?8 ?+ p" P# |/ A, ~& e8 s中国数据中心运维:约 $22k/人/年# [6 O" N# N' B* L! k4 V
美国数据中心运维:约 $120k/人/年[1]
% b6 |1 ~$ W8 b' c结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。% R, p. f7 G/ v6 J7 k
能耗与每 token 能源成本:能效差异远大于电价差异 Z' z) `* q. |. d
9 G8 a5 E) h. n$ K7 w O) f: O% ~0 W+ vIEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。
- `/ s& }1 N: U+ c6 W# \8 |大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。
+ [% |1 k! L. [: M* s& P6 I- s将 token 能耗约化为统一口径:
3 Y" \! w" H- |- o7 `, I$ S粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:6 B! {3 ~/ ~- J
中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
% k4 ^# p7 D+ i& k* d9 J+ T美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token
, ~7 Q* p1 y& B& z i对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
) @/ J9 h8 ?5 ~. K0 {7 k7 r2 H不同芯片方案的核心差异
+ S9 p0 ?* o. P* l; T* G* e7 V7 _/ n1 c
5 p: I* Z0 T4 k. g- n3 V/ W# D$ LNVIDIA Blackwell/B200 & GB200 NVL72:/ O* _) F1 |4 W/ k1 ?# R" F
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。
! u2 [5 L" m. R! Y$ l, v XGB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。& {3 O; m4 G* s9 j) m
Google TPU v5e/v5p/Trillium:* M0 n a- S* g- B" ?
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。
) {0 E$ b6 Z+ w) o y; qGoogle 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
2 g6 a v% R% s, x华为昇腾 910B:
1 y$ T4 k, O( @. cFP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。
) r+ C b3 o: t* J. a2 n单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。& H7 W! ]! r5 O5 U* ?
阿里平头哥真武 810E(Zhenwu PPU):
' A4 D+ @( s+ _& n3 L8 l, R1 s96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。- w: h/ u& c: G- N7 m$ v
结论:
6 D& k: S: O) _+ P+ i: U1 b$ n能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。+ J" |1 n, S2 Q% x( }
单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
' c6 l( w% W$ e6 _) M6 L对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
6 B; c/ B* q# z. [" W0 @自建 vs 云租的 TCO 与 token 成本, y& K; N/ t7 M$ R
9 ^; L1 U4 ]) r: t# F9 \LenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
/ e# ~6 Q; n0 |8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
$ R! l$ L0 j( u, C$ {等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。# N. a. ~# J: N
8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
- ~- B7 s9 O6 gToken 成本对比示例(LenovoPress 场景)[28]:
5 _, t0 @: E2 L8 x* {) _2 CLlama‑70B 推理,8×H100 本地:约 $0.11/百万 token
3 \5 f% F0 V7 a$ T1 Z7 w; Zvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。 G9 z8 T h0 U+ g6 ~
同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。; u2 S1 \( {8 w* b1 B0 r
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。( g2 R5 [3 c9 [$ I7 G
结论:8 f5 l! m: [! b# J) X; }
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。- q! w" U- q. a3 h
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。
1 t ~8 n* F$ j/ S8 ~二、建设期成本分布:区域对比
( Q3 a# V. G$ t* y- E$ d( @- t" W# O以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。: g# t" ~& Z% M1 ~; U% r% ?
4 u$ u9 V* t# @) }+ F" F4 y- X2.1 全球/通用结构(以 1 MW 为单位)
! l! V1 o; c. j; @" l综合 JLL、ConstructElements 等[2][41][40]:" U7 u% q7 \9 c# w3 f @
6 J! E1 c# b' Z/ c( o {壳体+机电(Shell & Core)
0 Y" x* {- b! p3 U2 s7 t: X/ F7 C) \
全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]
5 E% D5 N) m! C. ~' @其中按成本构成[40]:4 X% X) `1 I5 m# P0 p* o
电力系统(变电、配电、UPS、母线等):40–50%, Q# |" J' a! ]8 ?
机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%2 S4 N2 O: |3 N2 \
建筑与土地、结构:约 15–20%" t0 v& \9 ]: L5 j) U
其他(消防、安防、楼宇管理等):约 10–15%
; q8 p+ P/ e+ B# ^+ PIT 内装与 AI 基础设施(不含芯片)" U" q) J) P% j2 u$ |
" Z/ H6 {1 e* u0 t2 @/ A
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。
9 a4 l/ K8 y4 Q, T! SGPU/加速卡硬件 CAPEX
% R/ i4 w1 \$ Q! ^6 g7 p% u' u x; I/ o; f3 k
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。% Y# u- H# w/ x
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX2 I }9 u7 [5 R, `* e
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):+ X9 [/ h5 Q9 G" `8 F7 y
' K, z# c7 ^+ N# z6 Q区域 典型建设成本(壳体+机电,$M/MW) 备注
# a, I9 d# l5 `中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]. T A: Y; j+ \3 k
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]/ V: X; }7 G; R; S
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
) G! G& q4 [& c* E7 E中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]. Y2 J9 Q5 J6 m+ f |
结论:8 O$ x: x( k1 k
$ @3 N) A' n2 Q& G5 e# r" a$ \单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。" C; d5 n9 s" P# G/ u" ^+ M* N) }
若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。* I" Q1 r* G {2 S% f" [
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)" S3 A$ s2 W& O, _ S, _3 A4 }: O
以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
& A3 E1 U% q# g! p- s0 C8 P# ]
; V; S# h) Z5 t! ^3 e p' l假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;
/ Y3 o$ w/ k* ~+ |+ HGPU 配置:
9 |' @" g( D4 p4 @" [; X+ [有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
5 O( K% U/ X- e ]6 i1 n6 m每 rack 成本 ≈ $3.0–3.35M[34][69]; c' u* K, ~- Y* z# L9 v2 r
GPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。/ n- q3 r3 ~ z- r' J
与不同区域壳体+机电组合:
1 R1 V) H- G9 d0 D2 x
& b a% ?4 z: k以中值估算:, q) _, b7 D+ T) \0 K7 B h, z
8 L) u: y6 e" @$ j ^$ ]- ^$ G中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B
0 W- V. q- ^) W' v: T/ y美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B
& K9 b1 }$ G- m; M2 k$ V% i欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B9 z* \$ o- F' h! l5 j
中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
8 ]1 ]3 C+ _4 W' Z7 c可见:
2 [' R+ A, v5 o( ?5 `4 Q; H/ I* A( G
GPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。
; ~% E9 V3 A" s! x1 f; `2 f相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。1 K4 P4 P& x7 s' `+ F( Z$ p
三、运营期成本结构与区域对比- n9 M, G% Q l F
3.1 通用 OPEX 结构(高密 AI DC)
* u+ K d4 F K2 y9 p结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:8 ^2 f, Z& W- o# q/ I0 g Z: D0 ]
: m B; F6 z( j1 d" g电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。 H. U, R; C" w) Q& T
冷却与水资源:) Q8 t7 V6 O/ `1 C3 F/ A
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。
& W0 n- E0 z# C6 d! @水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
C4 d8 m2 ^! K9 r& u" ^人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。- [, s$ L! l0 G9 S M
托管/物业与维护:
7 J$ y8 @% K0 B托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
! H- B1 }) A' a% D: f; f硬件维护:LenovoPress 模型中按设备价 12%/年[28]。 ~2 y, P, J* }+ j. c+ j' u! T
3.2 区域差异(以 400MW / 3 年期为例)
4 J! u7 W. F5 j+ j2 m5 C' {使用 ChinaTalk 的电费与人工估算[1]:
4 V% f0 L% U0 _( T3 X, k: A
: e9 p# T& b n7 K电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:" Y- {8 Y0 m% S% I
中国:约 $0.06/kWh → 3 年电费 ≈ $350M
' Z, g& e( j- W+ s4 o& A0 K% h美国:约 $0.09/kWh → 3 年电费 ≈ $600M
1 H- O* _' P. N8 B中东:约 $0.07–0.10/kWh → $400–550M
, K( r; b, o7 J H欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)1 `! t& R3 o9 {5 Y3 g
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:5 P$ [6 P; ~0 S& ~
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]+ P6 v9 ]" X1 I
三年水费级别:, T) i1 b L5 E
美国:$40k+: x+ U8 W# G6 v* Z/ W! r
中国:$20k+
- l, j+ X/ G6 s" s- ^: p+ H' f结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。2 v" Y9 Y% p1 g
人员成本(3 年) – 假设 500 名全职运维:
2 m: H. Y! b, P( u+ b5 K美国:500 × $120k × 3 = $180M+
1 p* P% i! ?' X, F+ h" [中国:500 × $22k × 3 = $33M+: B. n* E ?8 |3 x* B3 [
差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。 E6 k6 q0 d5 f5 Y t9 N
整体 OPEX 粗算(3 年) – 400MW 场景下:- k- B8 s7 G8 T* Z( O0 A3 ^# |
: O+ R% {7 p$ }8 ?6 ~项目 中国 美国0 d F4 V0 F. C4 [% i. _5 _- H
电费 $350M $600M
2 s! d( v) H$ F0 c4 |# b9 ]水费 <$0.05M <$0.05M
0 s* A# v3 S: J5 |: c* H人员 $33M $184M
# j" Q |, |1 b7 @. f4 ]其他维护/托管 同比例估算,地区差异主要体现在人工与地价 + _# C! q. B5 Z. C6 m& U
结论:4 r8 ?' w, [! |+ R0 _
. N/ T' N: l# H: J
就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。9 M" ?1 j6 g% X' j7 c
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
1 P; {; C8 X+ E- c6 v( ~! R四、基于 token 的成本与利润推演
' Z* C+ o9 Z: ~( V0 Y4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)
) c/ p* x8 |- {5 v! M8 Z3 O统一假设: D$ w. S4 g5 A! r' f. _- e: O5 \
9 t. [( `# O7 U* n典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18])
8 i6 v9 b% P( F5 W) D. }% U7 n1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh
; ^1 n: N& W8 e7 d1 百万 token:278 Wh = 0.278 kWh
2 I! m# @- w# D4 ]7 D3 X场景 A:美国电价 $0.30/kWh6 H1 e. l" _/ F. V. }- w
电费/百万 token = 0.278 kWh × $0.30/kWh2 p3 y* _2 Y: u8 u4 p
≈ $0.0834 / 百万 token' M- U% T* M0 o6 W q9 S
场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh
+ |- d; _7 {* ]! q1 Q( R电费/百万 token = 0.278 kWh × $0.0421 s2 g) V/ \7 d# A2 G' z. J
≈ $0.0117 / 百万 token
) \9 D: m1 n0 T4 p对比当前 API 价格(OpenAI 2026Q1)[62]' s$ ` u% B8 i# ]
以输出侧为主(成本最敏感):4 i1 u! @- g( _9 y& U- f9 j/ e
4 d+ U2 c* w6 c; W* d7 T
模型 输出价 ($/百万 token)
' M& f$ K/ ^7 \GPT‑5.2 $14
! T( ?& ~. l# j- ]; cGPT‑5.2 Pro $168$ V# Q1 x L, ^: o1 t) W) E
GPT‑4.1 $81 b, t7 H/ s4 z$ p& ^1 ^
GPT‑4o $10
+ q' D X0 R, C$ G: U6 @GPT‑4o mini $0.60. i5 h% z: ~: G. z3 L4 k' l5 R' e
则:# s* T. h' }; |4 ]3 u; U
% j* p2 {7 ]' u6 K! \( R& @
在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。1 ?# R" }9 n& `0 o! ~4 R1 W7 }
在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。# U9 ?6 t5 s: [
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。
9 N6 z. H4 @8 c% ~& U7 i) i结论:0 J4 E/ d7 ^" T2 B( X- c) e
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
" b- J z7 p6 t0 e q1 o
" |5 w9 B0 ~( Y+ p3 F4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO): J3 M- T# x* z; `; u' ]/ z
以 LenovoPress 的 8×H100 Config A 为例[28]:
0 Y9 v3 T# Z& E3 ]
" R7 E0 e* R1 E3 g8 d5 年摊销下,8×H100 本地推理 70B 模型:
* M2 w* j; R9 k$ m小时综合成本(CapEx摊销+Opex):$12.08/h4 n) r9 x9 [0 e& r
吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens0 W. @) U0 `* ]; t' m5 g
成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token
5 e7 A) k. {) P" `电费在其中的占比:
6 @( k9 } v% xOpex 6.37$/h 中电力+冷却约 $0.87/h[28]8 Z5 X) L& q3 b }7 C/ l* F
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token- n. n+ b0 {( C+ @% G- b
电费占 总 token 成本 ~7% 左右。
( r- x; I/ ^9 d! Q# a5 j1 D9 O若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。
2 A& A+ e3 V5 m4 U) |- [若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。8 I/ B9 X- p$ K/ u0 d% v4 J" h8 v
7 }* r' q; R9 S% b' V. z. J
因此:$ v F! f X( j9 d& L: _' `
. ~( r# v0 @: d在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。
# A0 ]+ T6 S; S" f0 \& k2 O在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。
) m! H1 A3 @. w( L五、不同芯片方案的建设与运营成本对比0 R; G, x& U/ L+ j
5.1 NVIDIA 方案(H100/H200/B200/GB200)) C, G5 H8 a1 i% l8 w
CAPEX:& @2 r n2 Z. J
4 J) j0 E/ }8 l' X
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。# F n1 O0 r- z
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。
4 y; y) i! ?1 [B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。
; |( p0 m& N7 m) d# S) b, U( n+ O. NGB200 NVL72:
2 k- |9 V2 Y O! [+ E; f每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。# \$ l/ K0 y, Y- ^
冷却系统每 rack 额外 $50–56k[35]。; `- Y. e) g0 m0 u" ^
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。2 f9 o: k s) h5 B/ K4 H. `
OPEX & 能效:
1 i4 }! q5 t) A ]
4 G1 z3 N1 F# L% V5 w+ I- F单 GPU 功耗: }5 g; }" J u3 G2 f( o! u
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
* L9 H2 ~2 m% RH200:功耗类似或稍高,但性能/W 提升[9][10]。+ ?, f4 X0 P$ H* Z) S; B' D" ^
B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。% R4 |6 z5 \ U- [6 W* r
Token 性能:
) R. H6 k0 z, @: e0 a7 `+ r# MB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
5 m; V, R2 a/ I* ^& d7 W% LNVIDIA 的优势:5 s c- w( C( e& J5 \; }
5 h! g7 I: {( q" y/ a- Y g+ q
软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。+ t9 O$ v W8 ?5 V$ \: V
但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。7 R+ r8 `6 X9 v. z0 C" R! F4 p
5.2 Google TPU 方案
: U Y; A9 x* O0 l0 }CAPEX:
+ g: M4 O" {4 `5 v2 c1 t7 a! ^6 c t
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。/ g. c. f, A% ~! R4 g7 s; x4 l+ C2 E
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。) E+ U' p) g! `5 I; u/ \7 Z
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
* L4 K( r% Z: J. }能效:
- W2 g: o+ q6 `2 q7 F
7 L; k7 p7 d; c8 v- V% hTPU v5e vs H100:
$ X" u% O8 D: B3 Y5 s# @同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
9 Y7 l$ g0 @1 o! ~. g" d) V" a测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
) W- U. q. r+ j C4 `) |3 o! T新一代 Trillium/TPU v7:. `; Z- E+ ~' B2 L
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。; z3 \6 E9 ^! S
Google 方案的特点:: P3 X% c. P; v4 n% a5 r' b* J
) [' }5 s3 h; X& I
自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;* k# r& u" } F6 Q5 _7 L% {
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
% k; S7 h: c* B5.3 华为昇腾 910B / 910C 方案0 v- e w0 l. G" z2 a
CAPEX:( k4 m& C0 d7 }
% p+ i$ n# L3 r3 N. h& f单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。
; ^) Y% B, [: r1 m4 @0 h7 [与 A100 对比:
$ ?2 Q) m8 i# ^& P! sFP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。
4 ^' n+ T4 r& j7 x$ R5 E: H# k( D V) c市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
- d5 n/ m5 F0 O y使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。3 B: I! O! Z4 d
OPEX & 能效:; b6 ]1 a1 J. ]# Y# b" {
* M* v& o! f- Z3 u# G910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。
7 |8 j% u( Y+ Z* W; H, T0 w6 a( b部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。
4 k% Q: ]2 S2 j6 E3 t. e: ~; B8 X. q4 N( q在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。
: X' U9 x. S4 M5.4 平头哥真武 810E(PPU)方案
9 t2 ~: s5 H% {3 i5 jCAPEX:5 b0 W9 |% @: @2 r t0 T) m
: h* Z' h5 H9 s+ ^6 N/ ]) i% G# L, b& a技术参数:: }8 U" X9 T5 n1 D
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。
9 r& e9 N& j. Q$ U3 [9 \) c8 Y, c性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。! I% y, I8 s5 O5 b1 x0 A
价格:/ ^, H, Z3 R6 e, B! T; B6 C
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。 w) C$ q& _6 D& \8 U D! h; T) D
结合国内报道:) D+ a( G- I# J$ \, Y) M! r
2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。$ ]5 A b$ U8 \8 o9 D4 W, |/ x$ b$ Y
数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
4 h+ j" h0 W/ d6 w+ GOPEX & 能效:
% L& M6 S, }: M1 [" D0 o3 c& }' S* N9 Z
400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;7 Y2 W3 a& Z: m" x; h: A
在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。7 R8 g, _5 n* P S+ g3 ?. b' [
六、综合比较与策略建议
/ w; r9 }6 a% j+ {4 ~6.1 区域维度:在哪里建 AI 数据中心?
* ^" B% Y5 n/ k% Q; C( [1 H/ ?纯经济性(TCO/tokens)排序(假设无政策/合规约束):
1 }# @9 Q# d) X4 }* a2 G' K2 I& Q4 S
中国西部/北部(电价低、人力低、建设成本低)
6 G, i N% n$ _2 x中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持)
1 _# k$ N4 a( e) w美国电价低但人工高;东海岸/加州电价上涨压力大. w4 e0 ]; [9 g
欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求# E5 M/ B- h: y* `
若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:" A+ l4 V+ W9 B. \ l
* |3 v3 C: L& ?( E( ^
纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;( _7 d; w# d9 ]
对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
. M! `2 W% k/ {; u但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
5 ~2 j$ N7 A& \; y5 J X$ A6.2 技术栈维度:选哪家芯片/云栈?$ R9 b# x1 r: h- q. d- ?" z
若目标是全球最优 tokens/$ 且不受出口管制:
! U, {* j# Z* `( K- |# K) S* I/ s; y6 N- s. z
Google TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。
d. e0 Q5 S; n) j+ e若在美国/欧洲,能自由采购 NVIDIA:
$ |' A( M4 ^. S6 _
" h1 z4 R, p* g. | N) k u短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:
, o9 z' w; d$ ?% y& B成熟的软件栈与生态,极高的 tokens/s/GPU;/ s' Q r8 `6 P
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;+ O; _& Y- \" `5 ?$ r
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。
& i2 ~% I" \- r若在中国或存在出口管制约束:/ g3 ^4 A- l7 P' E, N7 X
1 Y) {. ^+ w* o; H/ C/ _
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
% Y; o, G, p0 {6 O: I7 L0 j% c性能上已能覆盖大部分 GPT‑4 类推理需求;
9 F7 n6 q) p. s+ S# E2 F: p单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
6 ~' F% A/ s. m' y- h" r软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;" m5 g D# t$ B
建议配合:
; P4 Z, Z) f) ^高效液冷(PUE~1.1)、4 x! \* D. w3 C1 f R
大 batch、路由(浅层任务走小模型/低成本芯片)、
* Q0 j' M+ A; ]# l% N, F! E3 z8 R8 J/ L强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。# G3 k N( u Y- H J6 a4 z" v# g9 v7 l
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
# I% z; l& A+ b$ v5 ]. }8 _% T. c' l: }% H$ U2 r9 v$ H0 M
数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
" P \ l) N$ K9 x这意味着:) C% v: J5 @' X3 t% j) S2 O- r1 n
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);
% \, G& V* m6 C2 c; o5 G% @精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。
. g7 t; c! \5 E0 t" B6.3 针对你关心的具体问题的简要回答( ^ \* V1 W) z6 e
AI 数据中心建设 vs 运营成本的大体比例?6 {- e: m' S- R0 O# i8 j
! J7 E5 F5 G9 r: M
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。5 [& E) A& ?4 R" ~5 m
其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。/ V' b6 g7 W! @
中国、美国、欧洲、中东的成本结构区别?2 R$ c5 j' `$ z2 ?* x, o& Q
! J* ~$ E2 S9 k% G8 v9 V建设期:
: O# v3 K# S; C! e& e0 s5 R4 \中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。
4 p! p/ z+ \6 o- V运营期:) H7 X$ a; J% x( G9 O
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲7 M5 {- R& g) e. M! [) C9 H- M
人工:中 国 ≪ 美 欧,中东居中。
9 u; V& o |1 B+ L在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
0 Z; e% ^3 p; y7 U( M( f i& L" @
! ?' x- M. C/ z! \ @* {6 Z& }4 n6 ]对于典型 1 J/token 推理负载:! P4 u$ x% j/ z( W$ X
美国 $0.30/kWh:电费约 $0.083/M token
; E( u/ ]0 v- w; N1 z3 c2 p中国 0.3 元/kWh:电费约 $0.012/M token
- A/ f( V- ?4 e. E" N- X对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。: D% b, I; d+ d: Z8 `/ v
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?
# d. m( B: G1 ?
5 ~4 L& i. b' i' E在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;1 h' Q" ~2 I. _* q7 b
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;
}2 C% t- L5 E& |' V* {, d4 R: Z/ [% v' Q中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|