目录
AI 用电是因为 AI 本质上是计算
AI 系统并不是从一张静态的已保存答案列表中作答。当用户发送提示词、上传图片或调用 AI API 时,系统会让训练好的模型执行数学运算,从而生成输出。
这些运算需要处理器、内存、网络和存储。单次请求可能很小,但现代 AI 产品会在聊天机器人、搜索助手、编程工具、图像生成器和企业应用中处理巨大的流量。
因此,能源使用与 AI 基础设施密不可分。用户看到的可能只是屏幕上的一句简短回答,但背后有芯片、服务器、数据中心、冷却设备和电力系统在进行真实的物理工作。
GPU 很强大,但也很耗能
现代 AI 高度依赖 GPU,因为神经网络包含大量可以并行执行的计算。GPU 正是为这种并行计算设计的,因此在许多训练和推理负载上比 CPU 更合适。
代价是高性能 GPU 服务器会消耗大量功率,尤其是在集群中高利用率运行时。大型 AI 部署可能通过高速网络连接大量加速器,让它们共享数据并保持计算同步。
这并不意味着 GPU 对 AI 来说低效。很多时候,GPU 是执行任务的高效选择。但由于任务规模大且持续运行,GPU 集群成为 AI 电力需求中最显眼的来源之一。
训练大型模型会集中消耗能源
训练是模型从数据中学习的阶段。大型训练任务可能会反复处理海量数据集,调整数十亿参数,直到模型能够用于预测、生成或分类。
这类工作可能让大型 GPU 集群连续运行数天、数周甚至更久。能源需求之所以集中,是因为许多加速器、存储系统和网络会在同一个训练任务中同时工作。
训练并不是 AI 能源消耗的唯一部分,但它很重要,因为前沿模型开发、实验和再训练可能需要密集的用电峰值和大量数据中心容量。
推理产生持续的能源需求
推理是使用训练好模型的阶段。每一次类似 ChatGPT 的回答、图像生成、翻译、推荐、摘要或代码建议都需要推理计算。
与训练不同,推理会在用户使用已部署 AI 系统时不断发生。如果一项服务处理数百万或数十亿次提示词、图像请求和 API 调用,单次请求的少量能耗也会累积成显著的每日需求。
这就是为什么 AI 能耗越来越与采用规模相关。AI 越多地嵌入搜索、办公工具、软件开发、客户支持、媒体制作和移动设备,推理基础设施就越需要持续运行。

数据中心会增加基础设施开销
AI 硬件运行在数据中心内,而 GPU 只是用电故事的一部分。服务器需要内存、存储、网络设备、电源和备用系统。数据还必须在机器、机架甚至不同地区之间移动。
冷却同样重要。高密度 AI 服务器会产生大量热量,因此设施会使用风冷、液冷、冷水机、泵、风扇或换热器,让设备保持在安全运行温度内。
数据中心效率通常用电力使用效率 PUE 来概括。较低的 PUE 表示更多电力用于计算设备,而不是设施开销,但大型数据中心不可能在没有辅助能源的情况下运行。
为什么 AI 用电估算差异很大
公开估算差异很大,是因为多数 AI 提供商不会按模型、产品或请求类型披露完整的实时能耗。研究人员和分析师通常只能结合公开采用信号、硬件假设、模型规模估计和数据中心效率区间。
结果取决于许多变量:模型大小、token 数量、图像分辨率、硬件代际、利用率、批处理、内存带宽、地理位置、电力结构,以及系统是在训练、提供推理还是处于空闲状态。
因此,AI 用电数字通常应被视为方向性估算,而不是精确的官方测量值。有用的问题往往不是一个单一数字,而是哪些因素会让能源使用上升或下降。
AI 能变得更节能吗?
在可比任务层面,AI 可以变得更高效。更好的芯片、改进的模型架构、量化、缓存、批处理、蒸馏以及路由到更小模型,都可以减少生成有用输出所需的计算。
数据中心也可以通过更好的冷却、更高的硬件利用率、更清洁的电力采购和更高效的供电来改进。这些改进能减少浪费,并降低每次请求的能耗。
更难的问题是总需求。如果效率提高,但 AI 使用增长得更快,总用电量仍可能增加。平衡的看法需要同时跟踪两方面:单个任务的效率,以及全球 AI 采用的规模。

