TA的每日心情 | 擦汗 2026-3-17 22:01 |
|---|
签到天数: 1133 天 [LV.10]大乘
|
沙发

楼主 |
发表于 2026-2-26 21:43:21
|
只看该作者
后来想了想,我让龙虾爬了一个分析全球AI数据中心建设和运营成本的报告,内容如下:
# D0 l2 v. L/ j) x0 Z2 D7 q! B% U/ g# l4 M. d* ^
一、总体分析框架与核心结论% ?5 C7 i, i; _2 Z
1.1 分析框架概览8 g. s0 O' S3 g j( o* C3 I) P1 x
拆分维度& _' x' s) G& n$ M4 M0 g
9 z' K# t: t- @# I0 S4 r阶段:
( F$ U/ A D9 v, l建设期(CAPEX):土地/建筑、供电与配电、制冷、IT 硬件(GPU/TPU/加速卡)、网络与其他基础设施
* i" K+ h1 q, z运营期(OPEX):电力、水、运维人员、场地/托管、维护与更新、网络带宽等$ k9 s; R4 \; d" c' l& h9 ?
区域:
+ H4 F1 X# j4 V中国、美国、欧洲、中东(以海湾地区/UAE 为代表)5 f) } v% q& ]) Z6 M$ Q% z- g' F
技术方案:
8 h$ ^7 ^$ M& Q9 W: {NVIDIA(H100 / H200 / B200 / GB200 NVL72 等)
! @4 g. L/ z6 ~/ Y4 e1 q3 S/ a, GGoogle TPU(v5e/v5p/Trillium 等)5 _# F W2 s0 s- D/ i
中国芯片:华为昇腾 910B / 910C 系列、阿里平头哥真武 810E(PPU)
2 X# P; ?0 G: E; b, p# N$ J( k算例基准% m$ Y- g6 d; x8 G7 R
1 _4 l9 l; L' r& O# E以400 MW 级 AI 数据中心为统一标尺(与 ChinaTalk BOTEC 分析保持一致)[1]:# Q9 s" L; A1 z9 M( H6 A
其中 IT 有效功率约 360 MW:GPU/AI 加速约 312 MW,CPU/存储约 48 MW
' q& T. M) [/ @/ ~9 uPUE 假设约 1.11(高效液冷场景)[1][29]
/ c9 h& T8 s. j7 R' F1 L8 ?时间窗口:3–5 年运营期(与行业 TCO 分析和硬件折旧相匹配)[28]+ E. T! d4 Y6 h0 a8 o
关键指标6 o+ g, s1 D) W: `0 n' R- |6 b
9 Y* K( \8 k b' m/ E: r
$/MW 建设成本(含/不含 IT 硬件)
; F% q/ S: T' R$/kWh 电力成本、L/kWh 水耗
; k' n' }# x) R @) d( Z0 M. ^$/token 或 $/百万 token 的综合成本
* C5 P. G$ o. j" gToken-per-watt / Joule-per-token 作为能效基准[17][18][26]
: Z! h S, @5 z项目 IRR/回收期、吨位级 TCO 对比(自建 vs. 云租)
7 m7 z# Y6 F6 O# T" v1 u- f1.2 高层结论(供决策快速参考)
6 V8 Y6 {2 E8 W5 O/ { E建设成本:AI 数据中心相对传统云数据中心成本翻倍4 j$ S+ A Q( L9 J) z2 X
& _2 W I5 s P K9 [. n) Z ~9 ~
传统云数据中心壳体+机电平均约 $10.7M/MW (2025),预计 2026 升至约 $11.3M/MW[2][41]。
, {- s! Q% X8 K. _+ `" _6 q: y/ wAI 优化数据中心(高功率密度 + 液冷)壳体+机电可高达 $20M/MW 甚至更高[41]。, V, N" s( ^6 {: D8 ?
按 Accenture/Soben 研究,传统云 DC 为 $8–10M/MW,而 GW 级 AI 数据中心可达 $17M/MW(仅壳体+机电,不含 GPU)[3]。
6 |6 c( ]; d& n5 z5 T! d5 y9 I区域 CAPEX:中东≈中国 < 美国≈欧洲 < 高端 AI 园区
- r/ x% {1 x/ U
1 w) k1 C' _7 K3 z$ W& P( b" y q中国:$5.5–6.5M/MW,400 MW 约 $2.4B[1][13]- q* l6 s8 s/ s$ {
美国:$8–12M/MW,400 MW 约 $4.0B[1]
+ j" z6 y F: l/ f3 O$ j2 ^3 M欧洲:接近全球平均 $10.7–11.3M/MW[2][41]( R7 Y" \) D L# v# d
中东(UAE Stargate 5 GW):总投资超 $30B,约 ≥$6M/MW[20]- ~; w3 I8 M7 Z+ E! L6 B
结论:中国与中东的壳体+机电 CAPEX 明显低于美国/欧洲,同等规模下节省约 30–40% 构筑成本。! U3 g; D1 s- F- C
OPEX:电价与人工决定区域优势! p+ y( `! B- D2 a
; L2 r n& z; t: r3 n( b电价(2025–2026 工商业大致区间):0 I% H8 i @- u" b' P) |
中国:约 0.8–1.1 元/kWh ≈ $0.08–0.11/kWh,部分算力基地可通过长协拿到 ≈3 美分/kWh[12][73]
; h. v! X5 r( e2 [" a6 _美国:工业用电约 $0.085–0.09/kWh[44]! Q* u" D \/ R* U7 ~
欧洲:非居民平均 €0.19/kWh ≈ $0.20+/kWh[45] ]- ^! q$ {& n8 K: h
中东/UAE:工业用户 $0.07–0.13/kWh[47], Q3 k/ R: u; Z3 @. {
人工:
1 N; k' U( @% d) u中国数据中心运维:约 $22k/人/年
+ n4 w: ^( S8 t! p9 ?美国数据中心运维:约 $120k/人/年[1]
- j2 ]' i/ S0 y2 ?, x/ D结论:电价上中国西部/北部与中东有显著优势,人工成本上中国远低于美欧。: T7 b/ }; K3 q" u' `9 R' D' g- i$ t
能耗与每 token 能源成本:能效差异远大于电价差异
( `! i* j$ O% {6 J, v4 u4 Z8 y2 d$ v/ s9 R* g
IEA:2022 全球 DC+AI+加密耗电 460TWh,2026 可能至 620–1050TWh[86][90];AI 专用服务器约 90TWh 量级[30][90]。3 u a/ \7 f) ?- {% Q
大规模 LLM 推理能耗估算:H100 集群训练 GPT-3 175B 约 2.46–3.63 J/token(训练)[10][16];经推理优化后,Inference 端典型可做到 0.4–1.0 J/token 级别[17][26]。' c' M: R! a! {5 \' L
将 token 能耗约化为统一口径:
" q' U# m3 M& W' d粗略取 1 J/token = 2.78×10⁻⁴ Wh/token。若电价为:
7 a6 x1 z( Z7 s7 D& B# s5 R中国 0.3 元/kWh ≈ $0.042/kWh:电费 ≈ 1.17×10⁻⁸ $/token ≈ $0.0117/百万 token
7 b; o2 B( u' l& E& i4 t美国 $0.30/kWh(题设):电费 ≈ 8.34×10⁻⁸ $/token ≈ $0.0834/百万 token1 [) X0 x" {; J' x# ?6 N
对比:OpenAI GPT‑4.1 / GPT‑5.2 系列对外 API 输出侧价格 $8–168/百万 token[62],电费占比 远低于 1%,真正决定成本差异的是硬件 TCO 和利用率,而非电价本身。
- Y: |, I$ Z; V6 k; x$ G不同芯片方案的核心差异% |, J; u& h. R @, a
& N3 N* J% h" k( |; n
NVIDIA Blackwell/B200 & GB200 NVL72:( t* F2 g% y! d- F
单 B200 GPU 峰值 ~4.5 PFLOPS FP4/FP8,功耗 600–1000W[68][69]。; o1 b6 K5 L4 W' C* h+ g
GB200 NVL72 整机架售价约 $3.0–3.35M,72 GPU[34][69],GPU 约占整个 AI 数据中心总 CAPEX 的 39% 左右[36]。
3 _' A" I& x9 [7 a2 XGoogle TPU v5e/v5p/Trillium:7 ^7 G l6 [2 K1 z3 n( F
TPU v5e 8 芯推理:约 2,175 tokens/s(Llama2‑70B,INT8)[67];功耗显著低于 H100,同负载下能耗可降约 5 倍[67][52]。9 |" u! j2 f4 ^" w
Google 内部披露 TPU v5 能效约为 H200 的 1.46×,Trillium/TPU v7 更高(约 2× 甚至以上)[52][65]。
% E" i0 Y- ?6 q% X华为昇腾 910B:# p" p- i2 y' g! ]# @5 W+ c& p, i
FP16 算力 320–376 TFLOPS,INT8 640 TOPS,TDP ≈ 310W[80][81][82];能效接近甚至超过 A100,在长序列推理上 token-per-watt 可超 H200[71]。6 ~3 [6 Y# s: [
单芯片成本约 5 万元人民币 ≈ $7k[60],显著低于受限版本 H20/H100。+ w% Y4 P7 }) D/ |4 _$ m6 C
阿里平头哥真武 810E(Zhenwu PPU):$ ^: X2 a/ F0 _' q( o1 T2 \7 c
96GB HBM2e、700 GB/s 互联带宽[59][111],功耗约 400W 级别[102],整体性能对标 NVIDIA H20/A800,并已形成万卡集群部署[59][111]。 R; I4 ^" N. E. v* r
结论:
9 b! [3 `6 E' w# w: b' e1 i3 S1 ~能效(tokens/J 或 tokens/W)排序大致为:Google TPU v7/Trillium > NVIDIA B200/GB200 > TPU v5e/H200 ≈ 华为 910B ≈ 阿里真武 > H100/A100。
7 [( a# J3 m1 m3 O2 f/ k& a单芯片/整机价格排序:华为/平头哥 < TPU 自用成本(Google 内部) < NVIDIA 公版(H100/B200/GB200)。
; b" `5 \: D. ^2 c# S9 N5 |对中国市场,在算力性能足够的前提下,昇腾 + 真武 方案的 CapEx/每 token 成本有 30–60% 的价格优势。
$ |. X3 D& w# n( u7 _自建 vs 云租的 TCO 与 token 成本( q+ o+ C z# ^8 D# R- G' b. y6 q
$ i" A- V! L6 p) _- E- _, sLenovoPress 对 8×H100/H200/B200/B300 本地 vs AWS/Azure/GCP 的 5 年 TCO 对比[28]:
! d+ ^0 C o! C2 n+ J+ B% h8×B300(Config D)自建 5 年 TCO ≈ $1.01M;
0 D7 c8 j% F7 _等价 AWS p6‑b300.48xlarge(24/7)5 年 ≈ $6.24M,节省 83.8%。
( z9 t& P( `+ z6 l3 |2 e9 [8×H100(Config A)自建对 Azure On‑Demand,回本点约 2,720 小时(~3.7 个月),对 1/3/5 年保留分别约 4,423/6,800/7,591 小时(~6/9.3/10.4 月)[28]。
1 g2 k- U5 k2 R( _8 o' H( o7 rToken 成本对比示例(LenovoPress 场景)[28]: L7 Z) t* x- U$ p" P- g
Llama‑70B 推理,8×H100 本地:约 $0.11/百万 token
; O g: K, Z. y! i+ A# Bvs Azure H100 On‑Demand:$0.89/百万 token → 自建 ~8× 便宜。
* w6 v7 g/ N0 a& k* b/ J* x同样 70B 模型,自建 vs GPT‑5 mini API(约 $2/百万 token):自建便宜约 18×。( q9 K o% c$ U+ y8 }- g
Llama‑405B,8×B300 自建:$4.74/百万 token,AWS B300 On‑Demand:$29.09/百万 token → 节省 ~84%。) z" E X3 i& I- V6 v- M
结论:+ E8 X8 K1 F4 P( N
高利用率、长周期推理负载下,自建 AI 数据中心的每百万 token 成本可比公有云或高端闭源 API 低 1–2 个数量级。# i" r& K2 ^4 i
Token 电费占比极低,自建 vs 云租的差异几乎全部来自 硬件折旧 + 云溢价 + 运维与利用率。9 ]" ^) Y5 N6 `" V! I& t
二、建设期成本分布:区域对比: A5 B1 h* G$ V6 X _
以下重点讨论 壳体+机电(不含 GPU) 与 全栈(含 GPU) 两层。- t; A1 h' }5 r' }6 a' |0 c
% {" F5 r2 v; w# I2.1 全球/通用结构(以 1 MW 为单位)
`( Q0 ?! G/ v综合 JLL、ConstructElements 等[2][41][40]:
6 T$ |! k; d: e S P1 e
R3 T$ F w3 }; J壳体+机电(Shell & Core)3 R$ I1 L$ V! J1 t/ h0 G7 R
! _ Q: D" @9 @' M全球传统 DC 平均(2025):$10.7M/MW,2026 约 $11.3M/MW[2][41]2 @/ v M/ H: M- @. R* B
其中按成本构成[40]:5 s7 K. n- [" a
电力系统(变电、配电、UPS、母线等):40–50%
5 }: K( |$ V# s1 s机械与冷却(冷机、冷却塔、管路、CRAC/液冷):15–20%
6 ?8 Q# D: J: v J9 F建筑与土地、结构:约 15–20%
" V. v# ~5 o6 {( L其他(消防、安防、楼宇管理等):约 10–15%
& M2 p2 F7 ]2 t# t5 @' H6 T- mIT 内装与 AI 基础设施(不含芯片)7 s1 x3 j/ D& s% _, W
% F9 S: e9 ^: y* M- K2 g8 x
高密 AI 集群内部装修(高密布线、机架、液冷板/浸没舱等)会在每 MW 额外增加 $25M/MW 量级[40],对 GW 级园区影响巨大。* o: i" b+ F3 c+ p3 E- N
GPU/加速卡硬件 CAPEX
6 r' {0 m* F' H- r1 g* d7 C; _! _$ Q! t1 @ j. b4 z- b
多数分析认为 GPU 占 AI 数据中心总 CAPEX 的 30–40%,其中 NVIDIA 单家毛利约等于整个行业 CAPEX 的近三成[36]。( x' E& ]0 s8 q# W* v
2.2 中国 vs 美国 vs 欧洲 vs 中东:1 MW 建设 CAPEX1 i. |* x w/ [3 r) B
结合 ChinaTalk、JLL、UAE Stargate 等[1][2][20][13](仅壳体+机电):' r& E+ X* W) m2 e' g( z8 k* G- G$ J6 l
* C$ M @0 o1 C8 |0 l
区域 典型建设成本(壳体+机电,$M/MW) 备注( a' u3 z+ t5 O$ K: [/ r
中国 $5.5–6.5M/MW 以西部算力基地为主,400MW ~ $2.4B[1][13]" U8 d. d4 c. |" M( i1 s' N
美国 $8–12M/MW 典型超大算力园区 400MW ~ $4.0B[1]/ z C/ {7 X* ]% a) i1 F
欧洲 $10.7–11.3M/MW 接近全球平均,部分核心城市更高[2][41]
* i% S1 x: _$ _* v4 Q中东 ≥$6M/MW UAE 5GW Stargate >$30B → ≥$6M/MW[20]- X, C2 Y1 n8 ]
结论:
! H; x" [: d x5 m- p- b- u/ a( k* r" J1 ?3 v4 y
单位 MW 壳体+机电 CAPEX:中国 ≈ 中东 < 美国 < 欧洲。
; P0 j8 b6 Y6 B) \若考虑土地、电网接入和许可周期,中东(特别是 UAE/沙特)在电力可得性和政府补贴方面往往优于欧洲,趋近美国甚至中国。; I' N! R4 |$ D9 ]- K( d# M" l
2.3 引入 GPU 后的全栈 CAPEX(以 400MW 集群为例)
8 C" O8 J! c7 c+ y0 E0 x以 ChinaTalk 的 400MW NVIDIA GB200 NVL72 集群为例[1]:
' j" `6 n7 z% \8 x5 H- A% N0 U( D6 \2 t' l1 ~4 C4 H
假设:PUE=1.11,电力侧 400MW,中约 360MW 投入 IT;9 T* ]% X+ b) u+ P/ O- ]5 U2 T9 V5 X% `
GPU 配置:
2 Q; W# {2 D1 B, V有效 312MW 用于 GB200 NVL72,约可容纳 2,154 racks(每 rack 144 GPUs,对应功耗 ~145kW/rack);
7 v% B, G2 y& Z7 g每 rack 成本 ≈ $3.0–3.35M[34][69];
9 q: a1 i# T/ e) EGPU 总 CAPEX ≈ $6.5–7.2B 量级(ChinaTalk 抽样约 $5.6B 略保守[1])。
' g' s* p% `- K B/ C与不同区域壳体+机电组合:
% }6 ]7 g. g5 \; S! n* K+ u
; k+ j% r1 I7 d) o以中值估算:
/ B _6 S3 P. S" G; _9 M; F4 M0 J# }0 J! ~
中国 400MW:壳体+机电 $2.4B + GPU $5.6B ≈ $8.0B+ O O, v( d- D
美国 400MW:壳体+机电 $4.0B + GPU $5.6B ≈ $9.6B+ U0 p3 L( L% O( Q
欧洲 400MW:壳体+机电 $4.5B + GPU $5.6B ≈ $10.1B
3 G+ o& h; R7 o) @, {& u! N0 Y4 E中东 400MW:壳体+机电 $2.4–2.8B + GPU $5.6B ≈ $8.0–8.4B
% I) o \3 l3 U5 u0 b2 y/ S可见:
5 \8 {, y4 y- y3 F) V
" l( [8 `& h/ {* g5 Y& v% bGPU 成本在各区域大致相同,决定区域 CAPEX 差异的主要是壳体+机电与土地/电力接入。9 k3 `1 m6 l+ @5 G8 `
相比美国/欧洲,中国和中东可在 400MW 级别节省约 $1.6–2.1B CAPEX,这对 IRR 有直接影响。1 B R1 j4 Y1 Q% W8 x2 u/ G
三、运营期成本结构与区域对比
( n3 _. h% i: [$ `( [" S3.1 通用 OPEX 结构(高密 AI DC)
; ^9 F% o! F8 k" u7 L+ w结合 ConstructElements、IEA、Microsoft/Google 披露[40][86][103][104]:
* q. R$ z" L* W& H# e+ a
/ V2 K* J; @: y" _: G* h; d# F电力:约占总 OPEX 的 20–30%(传统 DC),对于 AI DC 因 GPU 负载密度提升,可达 30–40%。$ q7 B& J* Q7 D) l
冷却与水资源:+ u: Z( @3 ~- n% z& i! C
能耗:传统风冷约占总功耗 30–40%[39];液体冷却可将 IT 与制冷合并大幅降 PUE 至 1.1 左右[29][115]。4 W6 k7 t( p! Q9 L) I
水耗:典型 DC 约 1.9 L/kWh 水用量[105],每日用水可达 300,000–5,000,000 加仑 规模[100][101]。
- y" }. P% f1 d# Y* O. p6 @$ S( f人工:视地区而定,在中国/印度/东南亚占比 5–10%,在美欧可达 15–20%。# O+ r5 N# X2 x5 d. h& a
托管/物业与维护:9 H* w/ i" B" n ~
托管:高密机架约 $1,500/机架/月,标准机架约 $600/月[40][28];
+ O" h- U+ v2 c- x硬件维护:LenovoPress 模型中按设备价 12%/年[28]。8 J; ]6 W( |( d3 f
3.2 区域差异(以 400MW / 3 年期为例)
" ?) C) I6 G, o; L使用 ChinaTalk 的电费与人工估算[1]:) o. V2 w$ ~8 m# P. B3 v
1 z! b$ e5 e1 `3 b2 P0 c
电费(3 年) – 假设 GPU 利用率 60%,IT 360MW,PUE=1.11:) k, }& ?8 m( N2 S
中国:约 $0.06/kWh → 3 年电费 ≈ $350M0 E q9 ^% k4 [( J. n. V2 l- ]2 c
美国:约 $0.09/kWh → 3 年电费 ≈ $600M
$ k) J3 E3 r) A中东:约 $0.07–0.10/kWh → $400–550M) ^+ E- E4 K% b2 O, o9 d
欧洲:约 $0.20/kWh 以上 → 电费 > $1B(显著劣势)6 O/ x0 @, I5 l1 Y% L
水费(3 年) – 以 MS Fairwater 站点 280 万加仑/年为参照[1][103]:% { \7 V( i$ E% K0 m; q* X9 h& ~
美国水价约 $5.18/千加仑,中国约 $2.57/千加仑[1]* Q9 ]/ y ~; g' k
三年水费级别:6 r, y& [$ Y6 t4 V/ Y3 b# P
美国:$40k+
+ k$ n9 I! b# R, q, r中国:$20k+; T$ D2 } L) d( z3 ~
结论:水费是数量级上可忽略的小项,真正的约束是水资源总量与选址,而非成本。
- U) z# p/ R8 j ~. ?% m人员成本(3 年) – 假设 500 名全职运维:
* A9 u( {6 R e) \; d4 h美国:500 × $120k × 3 = $180M+
# C" m$ P$ x) x- I9 x中国:500 × $22k × 3 = $33M+
/ X) j) e% \3 `, M7 ?4 h# n差异约 $150M,规模与 3 年电费差不多,是中美间第二大成本差异来源。 j5 |% @* q; a. ~2 f
整体 OPEX 粗算(3 年) – 400MW 场景下:
; @: k3 N- N6 T2 t
3 T5 ~ m5 ]3 B7 E0 K1 q: Q- X p4 ^项目 中国 美国
6 ]0 O+ N7 V' ^" J6 v% s电费 $350M $600M
' w' u' I4 E9 [3 b: D水费 <$0.05M <$0.05M
1 u- K! q/ ?6 P& [3 m人员 $33M $184M
1 B& J6 R* V, s. m4 }# D( N其他维护/托管 同比例估算,地区差异主要体现在人工与地价
; C& A2 t1 b% L结论:
0 [& f3 Q+ G% t* w* L+ w- m1 i
: c3 \4 z2 C, f) j( X, C就 3 年期而言,中国与中东在 电价+人工 两项合计可比美国/欧洲节省 数百百万美元级,与整体 CAPEX(数十亿美元)相比不算决定性,但对净现值和现金流有实质贡献。8 k' C) I' ~4 L
对大模型服务商而言,更核心的是 GPU TCO 与 token 单价之间的剪刀差,而电价更多影响“边际利润率”而非“能不能赚钱”。
- g D9 {' _+ x四、基于 token 的成本与利润推演( Z" J7 i$ m& c, a/ N
4.1 能源维度的 token 成本(题设 0.3 美元 vs 0.3 元)3 `# A: ^; Q6 a# S3 r* r& b
统一假设:7 w2 s( r9 Y* M
' U; x# F" T, m4 u2 z0 a, Z典型大模型推理能耗:约 1 J/token(考虑 FP8/BF16 优化、Batch=256–512 时的能耗甜点[26][17][18]). S% `/ U! |! y) Y% G' x
1J = 2.78×10⁻⁴ Wh → 每个 token 约 2.78×10⁻⁴ Wh' z% C; M9 l M0 n" }
1 百万 token:278 Wh = 0.278 kWh3 h& r+ C+ E* X1 ~ A. C) D
场景 A:美国电价 $0.30/kWh
0 p0 N8 ^$ U+ n- {4 [: b m Z( T电费/百万 token = 0.278 kWh × $0.30/kWh
9 Y9 {+ T, K- P% r& H≈ $0.0834 / 百万 token
# Z: p! d( B! ?/ o场景 B:中国电价 0.3 元/kWh ≈ $0.042/kWh4 n, k' n. g. v$ y1 W$ d+ |6 C
电费/百万 token = 0.278 kWh × $0.042
) R# }5 @$ G t5 T0 D X$ R≈ $0.0117 / 百万 token
4 K: H; \. h: f. U+ i. S" v对比当前 API 价格(OpenAI 2026Q1)[62]) H, h, R+ g7 e: K6 K( L( [8 B5 {$ @
以输出侧为主(成本最敏感):
3 m2 h( b% c( y6 Z% }' g3 w2 a. i, y3 \
模型 输出价 ($/百万 token)7 G5 f. U9 k1 s7 ~
GPT‑5.2 $14( k5 z) f9 A8 X# j5 ^/ D
GPT‑5.2 Pro $168
, f* |" b4 v( {GPT‑4.1 $8
5 g/ K1 E! w; ?; a- E6 v6 OGPT‑4o $10
N+ C" u2 }1 f" K. e. f! W ZGPT‑4o mini $0.60
9 n/ O2 S* T7 M( N则:+ a O- U6 ^ S) T: c/ K# ~1 n4 N
: w! u* _& K! t! k3 n8 T# I在美国 $0.30/kWh 的极端高电价下,电费占 GPT‑4o mini 收入的 ~14%(0.083/0.60),占 GPT‑4o 仅 0.8% 左右。
9 l% Y& ^+ G2 b9 q0 u在中国 0.3 元/kWh 下,电费占 GPT‑4o mini 收入的 ~2%,占 GPT‑4o 的约 0.1%。& t% K: P' x7 K' l( M+ b
相比之下,GPU 折旧+云溢价+开发/运维成本才是主导。) S3 B3 Q! `8 r- l6 Q, y. t
结论: s, L8 {6 l8 y" b
即便在“美国 $0.30/kWh vs 中国 0.3 元/kWh” 的极端对比下,每百万 token 电力成本差异约 $0.07,与主流 API 价格($0.6–$168/百万 token)相比仍属“小数点后两位”的影响。区域电价主要调节“利润率边际”,而不会改变“项目能否盈利”的结论。
8 V3 _. W' x9 X$ a. y/ W
3 `# E- c$ G7 F0 E* G) E) R4.2 全成本 per token:自建集群视角(基于 LenovoPress TCO)
' C! v7 ?- |; p1 I以 LenovoPress 的 8×H100 Config A 为例[28]:
5 ~" a3 q* w* w; o
6 ?* H# I6 [ Q! P2 F* Q i4 h) X. t5 年摊销下,8×H100 本地推理 70B 模型:
) X+ ~: _* D0 m3 C1 t小时综合成本(CapEx摊销+Opex):$12.08/h
# E4 K* `( i$ C, I吞吐:30,576 tokens/s → 每小时 ≈ 110M tokens
! G( o& T/ }4 v, C" C% z% P5 W2 r成本/百万 token ≈ 12.08 / 110 ≈ $0.11/M token0 I/ h# `4 p, a; B
电费在其中的占比:
4 e1 z W+ N) ?0 D' q+ |1 i$ YOpex 6.37$/h 中电力+冷却约 $0.87/h[28]/ C: E8 q }* Z$ g* f! W8 H1 K
电费/百万 token ≈ 0.87 / 110 ≈ $0.0079/M token
0 h9 {& h/ s; B- h( u$ R电费占 总 token 成本 ~7% 左右。7 z5 f% ]5 \- ?$ V
若将美国电价从 ~$0.12/kWh 提高到 $0.30/kWh,则电费约增 2.5 倍,对总 token 成本影响约 +10–15%。1 m w+ K5 t7 Q2 m- @6 \) v
若迁至中国西北 0.3 元/kWh 或中东低价长协,电费可再降 40–60%,总 token 成本再降低约 5–10%。- v5 ]3 n) ?8 [! `6 m( s
% Q, H/ k: S: {. d8 Z7 u( g4 f因此:3 w K2 t* q b
; x0 q) Q3 t5 ?
在自建集群场景下,电价对 token 成本有可见但非决定性的影响(变化量级在 ±10–20%)。' N |( M1 o4 q. Q- b. t$ B
在云租和 API 模式下,电价影响则被进一步摊薄,绝大多数利润被云厂商的溢价和 GPU 供应链吸走。% I% D7 n/ U6 q3 r& x' |' M# J
五、不同芯片方案的建设与运营成本对比
; v& n* h) a% \, y; |5 h6 Q5.1 NVIDIA 方案(H100/H200/B200/GB200)
2 [* B5 P) v3 Q6 T( G4 U4 I: a. ?CAPEX:
! F2 Y# k! ^7 a2 C7 b; g& T8 S. U+ L
H100:单卡市价 $25k–35k,8 卡服务器约 $250k+(Lenovo 配置价 $250k 左右)[9][28]。, _3 ?3 J, M( D+ B
H200:显存提升,单卡价更高,8 卡节点约 $280k[28]。6 P4 ]2 C. K8 |1 d, Z
B200:Blackwell 代 GPU,8 卡服务器约 $338k[28]。1 m& w$ E5 U$ R
GB200 NVL72:) @" o( i3 m, f
每 rack 带 72 GPU + 36 Grace CPU,售价约 $3.0–3.35M[34][69]。
# t# p3 T( J' B冷却系统每 rack 额外 $50–56k[35]。& y: t: q9 ^2 L& ~& P+ ~
在 400MW 场景中,GPU 总 CAPEX 约 $5.6–7B,占总体 CAPEX 近 40%。
( i0 K. O# h2 W) l6 C$ q, `: M/ oOPEX & 能效:1 L6 t& j2 x" O. w; R& o& j% a& w
" H, e) X- g4 q4 i4 v% U
单 GPU 功耗:! T) w" m, l, {0 P1 N' h/ e
H100:TDP 700W;集群实际单 GPU 含服务器/网络开销可到 ~1,500W[16]。
3 Z- n' [, z" f' s FH200:功耗类似或稍高,但性能/W 提升[9][10]。
4 P2 Q7 G# X9 \! ~9 ?B200:标称 1,000W TDP,但实测约 600W 左右[68][69]。
7 `9 @2 X8 q7 p" [0 R, D' A8 bToken 性能:
2 @9 e) _1 r6 l; p1 dB200:官方推理基准中,可达 60,000 tokens/s/GPU 级别(gpt‑类模型)[68]。
9 s0 Z G+ {' N: L# B, jNVIDIA 的优势:
* k* j3 Z Q" o$ H
" e7 d1 f+ v2 }% L$ V) b# p软件栈成熟(CUDA/TensorRT‑LLM),易于榨干硬件性能,batch 与多 GPU 并行调度成熟 → 在同等 PUE 与模型条件下可达更高 tokens per Watt。
) j; U- a5 g$ D& U但硬件价格与毛利极高,从 TCO 角度,“谁买单 GPU 溢价”是关键——云厂商多半将成本转嫁给 API 用户。; g) i a* j- h6 [* z1 E6 f
5.2 Google TPU 方案0 G/ \# u* Q. k* ?2 N, i- d& X
CAPEX:
4 L4 Y; v2 B, l' y; K; p9 `7 K# I2 K
单 TPU v4 定价约 $3.22/芯片小时,v5/v6 在云端按实例小时定价对外[52][54]。+ x& l; m" b' Z3 h; O7 O6 Y
GSR 估算:TPU 的出厂 ASP 约 $4,500–5,000/片(Google 内部成本)[54]。) {2 i) W0 _% a+ J
8 TPU v5e 实例约 $11/h,而 8×H100 云价可高达该数值的 5–10 倍[52][54]。
; O n4 B. x9 m' _) Y能效:
/ X3 [1 {9 `' ?# w6 B- U ^) U
D. D7 _8 d. QTPU v5e vs H100:, Z; S3 V- X5 Z8 ~& r$ E
同级推理场景下,8×TPU v5e ≈ 2,175 tokens/s(Llama2‑70B,INT8)[67],H100 需更高功耗才能匹配。
( T! A0 l6 C2 V; j测试表明 v5e 功耗约为 H100 的 1/5 左右[67][52]。
" r0 {3 ?, u& i新一代 Trillium/TPU v7:0 [* E6 `1 o) A1 q# A- k2 z& |1 a
能效比 TPU v5p 提升 ~67%,对 H200 或 B200 整体上能实现 2–3×性能/W 优势[52][65]。- R. n! x0 @1 V3 V2 F/ [
Google 方案的特点:# C$ P+ Q( a5 u9 _% X4 R
, K: A& M8 |. |* d% p1 A自用闭环——Google Cloud + TPU + Gemini,利润来自整体云栈,而非单个芯片;# K; V$ C) I5 v/ M6 w7 I
对外公布的 API 价格较为激进,TPU 方案在 tokens/W 与 tokens/$ 上具有显著优势,尤其在内部工作负载。
$ `: N& ]6 ]3 g5.3 华为昇腾 910B / 910C 方案
* b& l3 e; n5 T- X* v+ N' G F+ \CAPEX:& G( w% O6 L" c: |* ?! Y6 S ]
2 d' Q: J. C8 R% Q
单 910B 芯片成本约 50,000 元人民币 ≈ $7k[60];910C 约 110,000 元[60]。 F- R5 k2 T! F$ L
与 A100 对比:6 N5 K' @+ F# n) B
FP16 算力 320–376 TFLOPS,功耗 310W,性能接近甚至略高于 A100(400W)[80][81][82]。( _3 ^1 @% u+ a, g, f
市场报道中,NVIDIA H20 在中国售价约 10 万元/片,而 910B 更便宜 30–40%[61][72]。
5 t( e' N% S# f7 ^使用昇腾构建类似 400MW 级别集群,总 GPU CAPEX 相较 NVIDIA 可节省 30–60%,视集群规模与供货条件而定。# x3 P7 B n: D6 f% I; u
OPEX & 能效:+ d% d+ }9 F) S, |( t
# O8 a5 ? p* m1 g% F3 u; ^0 y910B 功耗 310W,FP16 320–376 TFLOPS → 性能/W 与 A100/H20 接近或更优[80][81][82]。* I& G/ w" L X! u1 v2 E
部分推理 benchmark 显示,长上下文(>4k token)推理时,910B 在 tokens-per-watt 上可超过 H200[71]。: E; |2 |/ u3 Z8 b6 d9 f
在中国电价(0.3–0.4 元/kWh)环境下,昇腾方案在 TCO/tokens 维度有明显优势,但生态与软件栈仍在追赶 CUDA。# z9 { e6 k L& m
5.4 平头哥真武 810E(PPU)方案
' e- h* y5 g) p) l: `CAPEX:8 [/ N; R- y4 O" t# m# }; c
$ q5 R. \8 ^3 E; a5 V
技术参数:, w4 i9 ^' h1 K( s
96GB HBM2e,片间互联带宽 700GB/s,自研 ICN 互联,PCIe 5.0 ×16,400W 功耗级别[59][102][111]。$ r- T3 g: L: f5 r( N5 Y& w. I
性能:官方宣称整体性能超过 A800 与主流国产 GPU,与 NVIDIA H20 大致相当,升级代际可逼近/超过 A100[59][110]。# @' W% C9 c( X) Z5 v
价格:4 o6 _' h* y4 e' L% B, f
未公开详细单价;多个媒体报道指出“单位算力成本可下降 ~40%”,与英伟达 H20 有 3–4 成价差[74][112]。; I/ o q% }/ S. x
结合国内报道:
7 _+ v1 t- }: j2 y) q2 d+ u- h2025 年出货量数十万片,已在阿里云实现多个万卡集群部署,服务 400+ 客户[59][111]。
2 e7 N Z* C4 s; P+ P* z4 k3 r数量规模与生态成熟度迅速提升,使得 真武+昇腾 成为中国公有云/算力租赁的主力基础。
9 G* Y. Y; T3 R8 f' F' b6 r* F& K5 `0 N% POPEX & 能效:" q9 l+ U" L! y4 A0 N
- Q4 k' a% x8 W8 I1 S400W TDP、96GB HBM2e,使其在 高上下文、RAG、大模型训练+推理一体化场景 中具有良好性能/能效平衡;
* q( j W; S1 @0 Q在中国低电价 + 低人工成本环境下,真武方案可将 AI 推理服务的综合 token 成本进一步压缩 —— 对标 NVIDIA H20,本地算力提供商可在保持 ~8–9 成性能的前提下降价 30–40% 仍保持毛利[74][112]。
, p; z" H" J1 U: V六、综合比较与策略建议
/ e+ Z4 t- P4 ~- D0 d/ a1 e6 [6.1 区域维度:在哪里建 AI 数据中心?6 @. X5 \" z; ]" p; { Z* M$ Z c
纯经济性(TCO/tokens)排序(假设无政策/合规约束):: \0 n( f. B, R7 A
+ a5 i D7 y' X: q7 ^; A1 h1 k, E8 c
中国西部/北部(电价低、人力低、建设成本低) Z$ M0 B8 D4 [
中东(UAE/沙特)(电价中等偏低、土地与电力可得性好、政策支持); s* O0 J) b# D$ _) X. t; E
美国电价低但人工高;东海岸/加州电价上涨压力大
# e' C" H. A/ Z# Y k欧洲电价高、审批严格,但接近高价值企业客户和数据主权要求
' [9 a/ }2 K7 [$ P! v; n; ]/ x若以“美国 $0.30/kWh vs 中国 0.3 元/kWh”极端场景比较:
4 F5 d) }* v* f! o
# R6 t1 y6 r& u纯电费/百万 token 差异:约 $0.083 vs $0.012 → 差别 ~$0.07/M tokens;
k* i0 n. x: w对比 API 价格:差异对整体利润率的影响远小于是否使用 NVIDIA vs 国产芯片、自建 vs 云租的差异;
0 ?$ B1 g# l9 ~4 V但在极高利用率的 自建超级集群 场景,电价仍然能在 5 年 TCO 上带来 10–20% 的边际优化,是选址决策的重要考虑。
3 o4 v8 n+ u5 r2 o1 C& ~" R6.2 技术栈维度:选哪家芯片/云栈?
; N' m& U4 t( v& F; q L6 e若目标是全球最优 tokens/$ 且不受出口管制:
* [7 g* a8 O6 q. R. u* z+ `: R
/ ?: j$ T, i) _& p# L) W& e7 KGoogle TPU v7/Trillium + 自建 on-prem:性能/能效与成本的综合最优,但前提是可以直接获得 TPU 硬件与软件栈授权(现实中仅限 Google 内部和极少数大客户)。- j* T9 z, F+ Z
若在美国/欧洲,能自由采购 NVIDIA:
+ V8 R) J8 X) e3 M3 S- L/ V
( Q2 {0 d" e1 @2 Z4 J5 \' N6 A, g. W短中期内,NVIDIA B200/GB200 NVL72 仍是最佳实践:! n* _% C% C. J# D
成熟的软件栈与生态,极高的 tokens/s/GPU;3 m2 j1 ]$ C5 B7 w1 ^( r
在云厂商/超大规模自建模式下,配合液冷与 PUE~1.1,可取得较低的 token 成本;5 X% M x- ~, `! L2 s2 H
但要谨慎评估 GPU CAPEX≈总投资 40% 的集中风险。: l) z$ X5 l7 _) r% B- Y; E |
若在中国或存在出口管制约束:3 y9 O h. B9 z6 s/ ^! n
$ i1 a8 V& h+ a* \, M, ]2 V
昇腾 910B/910C + 平头哥真武 810E 是现实可行的主力组合:
2 B: [/ z0 U$ x2 W: O! U性能上已能覆盖大部分 GPT‑4 类推理需求;
: R2 O& T) z- ^4 Z) t. p( f单片成本显著低于 H20/H100,集群 CAPEX 明显更友好;
; |- W1 f7 ?! O软硬件全栈国产(CANN + MindSpore + 通义/Qwen 等),可避免制裁风险;
# x9 ^$ H$ N3 N" X建议配合:& U# ^$ B$ P5 |( ?# Q
高效液冷(PUE~1.1)、
5 m5 w% ^+ m+ n- j2 W大 batch、路由(浅层任务走小模型/低成本芯片)、
; Y5 y) C5 R2 {9 Z4 f$ w# |/ q强量化(FP8/INT4)与分层缓存策略,进一步摊薄 token 成本。9 \' H% F& t: _3 ?7 B
长远看,“tokens-per-watt / PCE” 取代单纯 PUE/FLOPS 成为核心 KPI:
8 T1 g- g# {8 \1 F0 }9 |
- j! Y8 I3 {6 Q$ C; Z7 W, I* K数据中心运营者应从“PUE 1.5→1.1”的设施思维,转向“每瓦输出多少有价值 token”的AI 工厂思维[29][118];
- I* ^% [! C- n: F5 w4 \这意味着:: e! q" ^5 S- M4 x
优先选择 更高 tokens/J 的芯片架构(例如 TPU v7、B200、后续国产芯片);& G, U; ~9 ?2 d) Y8 N
精细化调优 batch size、路由策略、CoT 深度,将“energy-per-token”作为最优先指标来优化[17][26]。$ Q8 S4 |" ^) s/ r+ h; V/ M
6.3 针对你关心的具体问题的简要回答3 b8 T6 Z+ A. }/ q5 q* K2 w
AI 数据中心建设 vs 运营成本的大体比例?
! A- Q' c8 [, ^4 ?5 |/ F) b0 \7 u& z- M; W
在 5 年期 TCO 视角下,CAPEX(尤其 GPU)约占总成本 50–70%,运营成本(电力+冷却+人工+维护)约 30–50%。
+ I J- p( Z. R2 V6 N7 X! I其中 GPU 自身 CAPEX 占到总 CAPEX 的 30–40%[36]。
x8 H6 r9 h4 v7 d中国、美国、欧洲、中东的成本结构区别?) z, D; ~( k% V1 |6 a
- R) @! f# a. t
建设期:
' t% V9 L, w, a, p3 `6 R中国/中东的壳体+机电成本明显低于美欧(约 5–7 vs 8–12 vs 10–11M $/MW)[1][2][20]。5 A% f/ c3 u5 E0 M" D
运营期:. S6 v( @% ~, e- e+ w: L
电价:中东 ≈ 中国西部 < 美国平均 < 欧洲
7 g, B) e5 a0 X. R人工:中 国 ≪ 美 欧,中东居中。
, ^; J' p6 x x/ Z在美国 $0.3/kWh 与中国 0.3 元/kWh 下 token 成本与利润率?
9 ~/ Z7 R) \, I/ v$ N9 R( B; i# d
y5 p8 |4 u9 k7 x4 D对于典型 1 J/token 推理负载:
$ `" m0 F; A3 O7 B5 Q美国 $0.30/kWh:电费约 $0.083/M token
& z) Y) v8 R1 Y# ? u9 d6 t中国 0.3 元/kWh:电费约 $0.012/M token
* E1 n& d3 u: M+ `( @9 J对比 OpenAI 等对外价格($0.6–168/M token),电费无论在中国还是美国都只是利润表里的“小头”,主导因素是 GPU TCO 和平台溢价。# P( Y3 N( N% L/ N2 H
不同技术方案(NVIDIA / Google / 昇腾 / 平头哥)的建设与运营成本谁更有利?. ~" V( A( N1 t: V
" H$ |; R- x6 ~4 y8 N" T' t6 [2 J在可获得 TPU 的前提下:Google TPU v7 在 tokens/W 和 tokens/$ 上最优;2 g9 F6 E& M! P1 s; ?
全球通用方案:NVIDIA Blackwell 全家桶(B200/GB200)+ 液冷,但 CAPEX 巨大;. e. q" I% C8 \9 V9 E6 R
中国/被管制市场:昇腾 + 真武 是当前最有经济性与可持续性的路线,综合来看能把 token 成本压到 NVIDIA 方案的 40–70%。 |
评分
-
查看全部评分
|