TheAIMeters Logo

什么是AI推理?

AI推理是指利用经过训练的模型来响应提示、生成内容、对数据进行分类,或根据新的输入进行预测的那个时刻。

Diagram showing a user input flowing into a trained AI model and returning an output
AI推理通过在实时数据上运行经过训练的模型,而非从头开始训练模型,将新的输入转换为输出。

今天处理的 AI 提示词(估算)

 提示

今天全球各人工智能系统处理的AI提示词估计数量。

关键要点

AI推理并非模型训练。它是利用已训练好的模型处理新输入,并生成答案、预测结果、分类结果或生成式输出的一阶段。

目录

推理是指使用人工智能模型时

AI推理发生在模型已经训练完成之后。用户、应用程序或自动化系统发送新的输入,经过训练的模型则利用其在训练过程中所学到的知识,生成有用的输出。

该输入可能是文字提示、搜索查询、产品图片、语音录音、一行代码或数据库中的一行数据。输出可能是答案、生成的图像、分类结果、推荐结果、翻译结果或预测结果。

这就是为什么每一条ChatGPT的回复、每一次AI图像生成、每一个搜索助手的结果、每一个推荐引擎的推荐以及每一项内容审核决策都涉及推理。模型并非每次都要重新构建,而是基于新数据进行运行。

训练用于构建模型,推理用于运行模型

训练和推理是同一个人工智能系统的两个不同阶段。训练通过处理海量数据集、将预测结果与实例进行对比,并在多次重复步骤中调整内部参数,从而创建或更新模型。

在完成上述训练工作并生成出可用的模型后,推理过程便开始了。训练好的模型部署在服务器上,接收新的输入,并应用其已学习的模式,而无需再次经历完整的训练过程。

记住两者区别的一个简单方法是:训练是指模型如何学习,而推理是指模型如何被使用。关于第一阶段的更深入解释,请参阅关于如何训练人工智能模型的指南。

Diagram comparing AI training and AI inference workflows
训练是根据数据和计算结果构建模型。推理则是将该训练好的模型应用于新的输入,从而生成输出结果。

AI推理过程中会发生什么?

具体步骤取决于模型的类型,但基本流程大致相同。输入数据到达后,系统将其转换为模型所期望的格式,模型根据其参数进行计算,最后系统将模型的输出结果转换为用户可以阅读、查看或使用的形式。

对于语言模型而言,提示词通常会被拆分为令牌。模型会逐个评估这些令牌,并一步一步地预测可能出现的下一个令牌。对于图像模型而言,输入可以是文本、图像或两者兼有,而模型会逐步生成与请求相匹配的像素或视觉特征。

其他系统可能用于对文档进行分类、对搜索结果进行排序、检测图像中的物体、进行语音转录或推荐产品。在每种情况下,推理都是将新输入转换为模型输出的实时执行步骤。

为什么推理需要计算能力

AI推理并非简单地在数据库中进行查询。一个大型模型可能包含数十亿个参数,使用它需要进行大量数学运算,才能将信息在模型中传递并计算出下一个输出结果。

这种计算通常必须快速完成。聊天机器人的回答、搜索助手的响应或实时翻译都应在几秒钟内甚至更短时间内呈现,因此推理系统特别关注延迟、内存带宽、批量处理、模型大小和硬件利用率。

GPU 和其他 AI 加速器之所以有用,是因为它们能够高效地执行大量并行操作。模型越大、上下文越长、同时在线的用户越多,就越需要精心设计推理基础设施。

日常人工智能中的推理示例

当聊天机器人回答问题时,它实际上是在进行推理。同样,当图像生成器根据提示生成图片、编程助手建议函数,或者翻译工具将句子转换成另一种语言时,也是如此。

推理也出现在一些不太引人注目的系统中。无论是对视频进行排序的推荐信息流、对交易发出预警的欺诈检测系统、突出显示感兴趣区域的医学影像模型,还是检测缺陷的工厂视觉系统,它们都利用经过训练的模型对新数据进行处理。

这些示例在用户看来虽然各不相同,但它们都遵循相同的基本模式:经过训练的模型接收输入,进行计算,并返回一个输出,该输出可作为决策、答案或生成结果的依据。

为什么推理对能源和基础设施至关重要

单次推理请求可能规模很小,但现代人工智能系统运行在庞大的规模上。数百万甚至数十亿条提示、图像请求、推荐和API调用,会在GPU、网络、存储和冷却系统中产生持续的需求。

这就是为什么推理是人工智能基础设施的核心。虽然训练可能是最引人注目的计算环节,但每当人们使用已部署的人工智能工具时,推理过程都会被重复执行。从全球范围来看,这种反复的使用可能会成为推动GPU需求和数据中心用电量增长的主要动力。

单次 AI 查询的确切能耗取决于模型规模、硬件、批量处理、利用率、数据中心能效以及输出类型。关键在于,推理将日常的 AI 使用与物理基础设施联系起来:芯片、服务器、电力、制冷和数据中心。

如何优化推理

AI 服务提供商投入了大量工程精力,致力于让推理过程更快、更经济、更高效。批量处理可以同时处理多个请求,缓存可以复用重复的工作,而路由则可以将更简单的任务分发给规模较小或专门化的模型。

其他技术则能减少所需的计算量。量化可以更紧凑地表示模型值,知识蒸馏可以将模型的行为转移到更小的模型中,而剪枝或架构调整则可以在保持有用质量的同时去除不必要的计算工作。

专用硬件同样至关重要。GPU、AI 加速器、高速网络和高带宽内存有助于部署的模型在大规模环境下可靠地响应。更高的推理效率可以降低延迟、成本和能耗,但这并不能让基础设施消失。

进一步阅读与参考文献

相关的人工智能基础设施指南

相关文章

相关问题

分享本页