Съдържание
Говорим за извод, когато се използва модел на изкуствен интелект
Извършването на изводи чрез изкуствен интелект се осъществява, след като моделът вече е бил обучен. Потребител, приложение или автоматизирана система изпраща нов вход, а обученият модел използва наученото по време на обучението, за да генерира полезен резултат.
Този вход може да бъде писмена задача, търсена фраза, изображение на продукт, гласов запис, ред код или ред в база данни. Изходът може да бъде отговор, генерирано изображение, класификация, препоръка, превод или прогноза.
Ето защо всеки отговор на ChatGPT, генерирането на изображения чрез изкуствен интелект, резултатът от търсенето, механизмът за препоръки и всяко решение за модерация на съдържанието включват изводи. Моделът не се преизгражда всеки път. Той се прилага върху нови данни.
Обучението изгражда модела, а извличането на заключения го изпълнява
Обучението и извличането на заключения са две различни фази на една и съща система за изкуствен интелект. Обучението създава или актуализира модела чрез обработка на големи масиви от данни, сравняване на прогнозите с примери и коригиране на вътрешните параметри в рамките на многократни повторения.
Извличането на заключения започва, след като в резултат на това обучение е създаден годен за употреба модел. Обученият модел се внедрява на сървъри, получава нови входни данни и прилага научените модели, без да преминава отново през целия процес на обучение.
Един лесен начин да запомните разликата е следният: обучението е начинът, по който моделът се учи, докато извличането на заключения е начинът, по който моделът се използва. За по-подробно обяснение на първата фаза вижте ръководството за това как се обучават моделите за изкуствен интелект.

Какво се случва по време на извличането на изводи чрез изкуствен интелект?
Точните стъпки зависят от типа на модела, но основният процес е сходен. Получава се входяща информация, системата я подготвя във формат, който моделът очаква, моделът извършва изчисления върху своите параметри, а системата преобразува резултата от модела в нещо, което потребителят може да прочете, да види или да използва.
При езиковия модел подсказката обикновено се разделя на токени. Моделът анализира тези токени и предсказва вероятните следващи токени стъпка по стъпка. При модела за изображения входните данни могат да бъдат текст, изображение или и двете, а моделът постепенно генерира пиксели или визуални характеристики, които съответстват на заявката.
Други системи могат да класифицират документ, да подреждат резултатите от търсене, да разпознават обекти в изображение, да транскрибират реч или да препоръчват продукт. Във всеки от тези случаи извличането на заключения е стъпката на реално време, която преобразува новия вход в изход от модела.
Защо извличането на заключения изисква изчислителна мощност
Изчисленията с изкуствен интелект не се свеждат до просто търсене в база данни. Един голям модел може да съдържа милиарди параметри, а използването му изисква множество математически операции за преминаване на информацията през модела и изчисляване на следващия резултат.
Това изчисление често трябва да се извършва бързо. Отговорът на чатбот, реакцията на асистента за търсене или преводът в реално време трябва да се получат за секунди или дори по-бързо, затова при системите за извличане на заключения се обръща внимание на латентността, пропускателната способност на паметта, обработката на партиди, размера на модела и използването на хардуера.
Графичните процесори (GPU) и другите ускорители за изкуствен интелект са полезни, защото могат ефективно да изпълняват много паралелни операции. Колкото по-голям е моделът, колкото по-дълъг е контекстът и колкото повече са едновременните потребители, толкова по-внимателно трябва да бъде проектирана инфраструктурата за извличане на заключения.
Примери за изводи в ежедневната изкуствена интелигентност
Когато чатботът отговаря на въпрос, той извършва логическо заключение. Същото важи и когато генераторът на изображения създава картина въз основа на зададен промпт, асистентът по програмиране предлага функция или преводаческият инструмент превежда изречение на друг език.
Извличането на заключения се среща и в по-малко забележими системи. Каналът с препоръки, който подрежда видеоклипове по рейтинг, системата за откриване на измами, която сигнализира за дадена транзакция, моделът за медицинска визуализация, който подчертава област от интерес, или системата за машинно зрение във фабрика, която открива дефекти – всички те използват обучени модели върху нови данни.
Тези примери изглеждат по различен начин за потребителите, но следват един и същ основен модел: обучен модел получава входни данни, извършва изчисления и връща резултат, който служи за вземане на решение, даване на отговор или генериране на резултат.
Защо изводите са важни за енергетиката и инфраструктурата
Едно заявка за извличане на заключения може да е малка, но съвременните системи за изкуствен интелект работят в огромен мащаб. Милиони или милиарди команди, заявки за изображения, препоръки и API-извиквания могат да създадат непрекъснато натоварване върху графичните процесори, мрежовите, съхранението и охладителните системи.
Ето защо инференцията заема централно място в инфраструктурата на изкуствения интелект. Обучението може и да е най-забележимият изчислителен процес, но инференцията се повтаря всеки път, когато хората използват внедрените инструменти за изкуствен интелект. В глобален мащаб това повтарящо се използване може да се превърне в основен фактор за търсенето на графични процесори и за потреблението на електроенергия в центровете за данни.
Точните енергийни разходи за едно ИИ-запитване зависят от размера на модела, хардуера, групирането на заявките, степента на натоварване, ефективността на центъра за данни и вида на резултата. Важното е, че инференцията свързва ежедневното използване на ИИ с физическата инфраструктура: чипове, сървъри, електроенергия, охлаждане и центрове за данни.
Как се оптимизира извличането на заключения
Доставчиците на ИИ полагат значителни инженерни усилия, за да направят извличането на заключения по-бързо, по-евтино и по-ефективно. Обработката на партиди позволява едновременното обработване на множество заявки, кеширането дава възможност за повторно използване на вече извършена работа, а маршрутизирането позволява по-простите задачи да се препращат към по-малки или специализирани модели.
Други техники намаляват обема на необходимите изчисления. Квантизацията позволява по-компактно представяне на стойностите на модела, дистилацията позволява прехвърлянето на поведението в по-малък модел, а „подрязването“ или промените в архитектурата позволяват премахването на ненужната работа, като същевременно се запазва полезното качество.
Специализираният хардуер също има значение. Графичните процесори, ускорителите за изкуствен интелект, бързите мрежови връзки и паметта с висока пропускателна способност помагат на внедрените модели да реагират надеждно в голям мащаб. По-добрата ефективност при извличането на заключения може да намали латентността, разходите и потреблението на електроенергия, но това не означава, че инфраструктурата изчезва.

