TheAIMeters Logo

Что такое инференция ИИ?

ИНФЕРЕНЦИЯ ИИ — это момент, когда обученная модель используется для ответа на запрос, генерации контента, классификации данных или прогнозирования на основе новых входных данных.

Diagram showing a user input flowing into a trained AI model and returning an output
В процессе инференции ИИ новый входной сигнал преобразуется в выходной путём запуска обученной модели на текущих данных, а не путём обучения модели с нуля.

Промпты ИИ, обработанные сегодня (оценка)

 подсказывает

Приблизительное количество запросов к ИИ, обработанных сегодня в системах искусственного интеллекта по всему миру.

Главное

Инференция ИИ — это не обучение модели. Это этап, на котором обученная модель используется для обработки новых входных данных и получения ответа, прогноза, классификации или сгенерированного результата.

Содержание

Инференс начинается, когда используется модель ИИ

Вычисления с использованием искусственного интеллекта (ИИ) происходят после того, как модель уже прошла обучение. Пользователь, приложение или автоматизированная система отправляет новый входной сигнал, и обученная модель использует знания, полученные в ходе обучения, для формирования полезного выходного сигнала.

Входными данными могут быть письменное задание, поисковый запрос, изображение товара, голосовая запись, строка кода или строка в базе данных. Выходными данными могут быть ответ, сгенерированное изображение, классификация, рекомендация, перевод или прогноз.

Именно поэтому каждый ответ ChatGPT, каждое изображение, сгенерированное ИИ, каждый результат поискового помощника, каждый алгоритм рекомендаций и каждое решение по модерации контента включает инференс. Модель не перестраивается заново каждый раз. Она применяется к новым данным.

Обучение строит модель, а инференс запускает её

Обучение и инференс — два разных этапа работы одной и той же системы искусственного интеллекта. В ходе обучения создается или обновляется модель путем обработки больших наборов данных, сравнения прогнозов с примерами и корректировки внутренних параметров в ходе множества повторяющихся шагов.

Инференс начинается после того, как обучение дает пригодную к использованию модель. Обученная модель развертывается на серверах, принимает новые входные данные и применяет выученные закономерности, не проходя полный процесс обучения заново.

Вот простой способ запомнить разницу: обучение — это процесс, в ходе которого модель усваивает знания, а инференция — это процесс, в ходе которого модель применяется на практике. Более подробное объяснение первого этапа см. в руководстве по обучению моделей искусственного интеллекта.

Diagram comparing AI training and AI inference workflows
В процессе обучения на основе данных создается модель и выполняются вычисления. При инференсе эта обученная модель применяется к новому входному сигналу для получения выходного сигнала.

Что происходит во время инференса ИИ?

Конкретные шаги зависят от типа модели, но общий алгоритм действий остается схожим. Поступает входные данные, система подготавливает их в формате, ожидаемом моделью, модель выполняет вычисления по своим параметрам, а затем система преобразует выходные данные модели в форму, которую пользователь может прочитать, просмотреть или использовать.

В случае языковой модели запрос обычно разбивается на токены. Модель анализирует эти токены и шаг за шагом прогнозирует вероятные следующие токены. В случае модели обработки изображений входными данными могут быть текст, изображение или и то, и другое, и модель постепенно генерирует пиксели или визуальные характеристики, соответствующие запросу.

Другие системы могут классифицировать документ, ранжировать результаты поиска, распознавать объекты на изображении, распознавать речь или предлагать товары. В каждом из этих случаев инференс — это этап реального времени, на котором новые входные данные преобразуются в выходные данные модели.

Почему инференс требует вычислительных ресурсов

Вычисления с использованием искусственного интеллекта — это не просто поиск в базе данных. Крупная модель может содержать миллиарды параметров, и для её использования требуется множество математических операций, необходимых для передачи информации по модели и вычисления следующего результата.

Эти вычисления зачастую должны выполняться быстро. Ответ чат-бота, реакция поискового помощника или перевод в режиме реального времени должны поступать за считанные секунды или даже быстрее, поэтому в системах инференции особое внимание уделяется задержке, пропускной способности памяти, пакетной обработке, размеру модели и загрузке аппаратных ресурсов.

Графические процессоры (GPU) и другие ускорители искусственного интеллекта полезны тем, что позволяют эффективно выполнять множество параллельных операций. Чем больше размер модели, чем длиннее контекст и чем больше одновременных пользователей, тем тщательнее необходимо проектировать инфраструктуру для инференса.

Примеры инференса в повседневном ИИ

Когда чат-бот отвечает на вопрос, он выполняет инференс. То же самое происходит, когда генератор изображений создает картинку на основе prompt, помощник по программированию предлагает функцию или инструмент перевода преобразует предложение на другой язык.

Инференс также применяется в менее заметных системах: в ленте рекомендаций, системе обнаружения мошенничества, модели медицинской визуализации или системе машинного зрения на производстве.

Эти примеры выглядят по-разному для пользователей, но у них один и тот же базовый алгоритм: обученная модель принимает входные данные, выполняет вычисления и возвращает результат, на основе которого принимается решение, дается ответ или генерируется итоговый результат.

Почему инференс важен для энергетики и инфраструктуры

Один запрос на вычисление может быть небольшим, но современные системы искусственного интеллекта работают в огромных масштабах. Миллионы или миллиарды запросов на обработку текста, изображений, рекомендаций и вызовов API могут создавать постоянную нагрузку на графические процессоры, сетевые системы, системы хранения данных и системы охлаждения.

Именно поэтому инференс занимает центральное место в инфраструктуре ИИ. Обучение, возможно, и является наиболее заметным вычислительным процессом, но инференс повторяется каждый раз, когда люди используют развернутые инструменты ИИ. В глобальном масштабе такое повторяющееся использование может стать одной из основных движущих сил спроса на графические процессоры и потребления электроэнергии в центрах обработки данных.

Точные энергозатраты на один запрос к ИИ зависят от размера модели, аппаратного обеспечения, организации пакетной обработки, коэффициента загрузки, эффективности работы центра обработки данных и типа выходных данных. Важно то, что процесс инференса связывает повседневное использование ИИ с физической инфраструктурой: микросхемами, серверами, электропитанием, системами охлаждения и центрами обработки данных.

Как оптимизируется инференс

Поставщики ИИ затрачивают значительные инженерные ресурсы на то, чтобы сделать инференс быстрее, дешевле и эффективнее. Пакетная обработка позволяет обрабатывать несколько запросов одновременно, кэширование — повторно использовать результаты повторяющихся вычислений, а маршрутизация — направлять более простые задачи на меньшие или специализированные модели.

Существуют и другие методы, позволяющие сократить объем необходимых вычислений. Квантование позволяет представлять значения модели в более компактном виде, дистилляция — переносить поведение в более компактную модель, а прореживание или изменение архитектуры — устранять ненужные вычисления, сохраняя при этом полезное качество.

Немаловажную роль играет и специализированное оборудование. Графические процессоры, ускорители искусственного интеллекта, высокоскоростные сетевые соединения и память с высокой пропускной способностью помогают развернутым моделям надежно работать в масштабе. Повышение эффективности инференса позволяет сократить задержки, затраты и потребление электроэнергии, но не избавляет от необходимости инфраструктуры.

Дополнительная литература и источники

Связанные руководства по инфраструктуре искусственного интеллекта

Похожие статьи

Как обучаются модели искусственного интеллекта

Модели ИИ обучаются, находя закономерности в больших наборах данных, настраивая внутренние параметры и затем используя эти закономерности для ответа на новые входные данные. Этот процесс обучения лежит в основе работы моделей ИИ.

Шумовое загрязнение в центрах обработки данных

Центры обработки данных могут создавать постоянный шум, исходящий от систем охлаждения, силового оборудования, резервных генераторов и инфраструктуры высокой плотности. ИИ не делает каждый объект шумным, но объекты, рассчитанные на работу с ИИ, могут сделать эту проблему более заметной для близлежащих населенных пунктов.

Почему искусственный интеллект потребляет так много электроэнергии?

ИИ потребляет так много электроэнергии, потому что обучение, инференс и глобальное развертывание зависят от вычислительно интенсивной инфраструктуры.

Что такое MCP в ИИ? Объяснение Model Context Protocol

MCP, или Model Context Protocol, — открытый протокол для подключения AI-приложений к внешним инструментам, источникам данных и рабочим процессам через стандартный интерфейс.

Вредят ли центры обработки данных с ИИ окружающей среде?

Центры обработки данных для искусственного интеллекта не обязательно наносят вред окружающей среде, однако их воздействие зависит от спроса на электроэнергию, структуры энергобаланса, потребления воды, схемы охлаждения, местных ограничений и уровня прозрачности.

Почему в центрах обработки данных с ИИ потребляется так много воды?

В центрах обработки данных ИИ используется вода, поскольку серверы с графическими процессорами высокой плотности выделяют тепло, которое необходимо непрерывно отводить. Водяное охлаждение может быть эффективным, однако его локальное воздействие зависит от климатических условий, конструкции системы охлаждения, производства электроэнергии и доступности воды.

Связанные вопросы

Поделиться этой страницей