Obsah
Inferencia nastáva vtedy, keď sa používa model umelej inteligencie
Inferencia umelej inteligencie prebieha po tom, čo bol model už vytrénovaný. Používateľ, aplikácia alebo automatizovaný systém pošle nový vstup a vytrénovaný model využije to, čo sa naučil počas trénovania, aby vygeneroval užitočný výstup.
Týmto vstupom môže byť písomná výzva, vyhľadávací dotaz, obrázok produktu, hlasová nahrávka, riadok kódu alebo riadok v databáze. Výstupom môže byť odpoveď, vygenerovaný obrázok, klasifikácia, odporúčanie, preklad alebo predpoveď.
Preto každá odpoveď ChatGPT, generovanie obrázkov pomocou umelej inteligencie, výsledok vyhľadávacieho asistenta, odporúčací systém a rozhodnutie o moderovaní obsahu zahŕňa inferenciu. Model sa pri každom použití neprebudováva. Spúšťa sa na nových údajoch.
Trénovanie vytvorí model, inferencia ho spustí
Trénovanie a inferencia sú dve odlišné fázy toho istého systému umelej inteligencie. Trénovanie vytvára alebo aktualizuje model spracovaním rozsiahlych dátových súborov, porovnávaním predikcií s príkladmi a úpravou vnútorných parametrov v priebehu mnohých opakovaných krokov.
Inferencia začína až vtedy, keď tento proces trénovania vygeneruje použiteľný model. Natrénovaný model sa nasadí na servery, prijíma nové vstupné údaje a uplatňuje naučené vzory bez toho, aby musel opäť prechádzať celým procesom trénovania.
Jednoduchý spôsob, ako si zapamätať tento rozdiel, je nasledovný: trénovanie je spôsob, akým sa model učí, zatiaľ čo inferencia je spôsob, akým sa model používa. Podrobnejšie vysvetlenie prvej fázy nájdete v sprievodcovi o tom, ako sa trénujú modely umelej inteligencie.

Čo sa deje počas inferencie umelej inteligencie?
Presné kroky závisia od typu modelu, ale základný postup je podobný. Príde vstup, systém ho pripraví vo formáte, ktorý model očakáva, model vykoná výpočty so svojimi parametrami a systém premení výstup modelu na formu, ktorú môže používateľ prečítať, zobraziť alebo použiť.
V prípade jazykového modelu sa zadanie zvyčajne rozdelí na tokeny. Model tieto tokeny vyhodnocuje a krok za krokom predpovedá pravdepodobné nasledujúce tokeny. V prípade obrazového modelu môže byť vstupom text, obrázok alebo oboje, a model postupne generuje pixely alebo vizuálne charakteristiky, ktoré zodpovedajú požiadavke.
Iné systémy môžu klasifikovať dokument, zoradiť výsledky vyhľadávania, rozpoznať objekty na obrázku, prepisovať reč alebo odporučiť produkt. V každom z týchto prípadov je inferencia krokom v reálnom čase, ktorý transformuje nový vstup na výstup modelu.
Prečo je na inferenciu potrebný výpočtový výkon
Inferencia umelej inteligencie nie je jednoduchým vyhľadávaním v databáze. Veľký model môže obsahovať miliardy parametrov a jeho použitie si vyžaduje množstvo matematických operácií na prenos informácií cez model a výpočet nasledujúceho výstupu.
Tento výpočet sa často musí uskutočniť rýchlo. Odpoveď chatbota, reakcia vyhľadávacieho asistenta alebo preklad v reálnom čase by mali prísť v priebehu niekoľkých sekúnd alebo ešte rýchlejšie, preto sa systémy na odvodzovanie zameriavajú na latenciu, šírku pásma pamäte, spracovanie v dávkach, veľkosť modelu a využitie hardvéru.
Grafické procesory (GPU) a iné akcelerátory umelej inteligencie sú užitočné, pretože dokážu efektívne vykonávať mnoho paralelných operácií. Čím je model väčší, čím je kontext dlhší a čím je viac súčasných používateľov, tým starostlivejšie je potrebné navrhnúť infraštruktúru na vyvodzovanie záverov.
Príklady inferencie v každodennej umelej inteligencii
Keď chatbot odpovie na otázku, vykonáva inferenciu. To isté platí aj vtedy, keď generátor obrázkov vytvorí obrázok na základe zadania, asistent pre programovanie navrhne funkciu alebo prekladateľský nástroj preloží vetu do iného jazyka.
Inferencia sa objavuje aj v menej viditeľných systémoch. Či už ide o odporúčací kanál, ktorý zoradí videá podľa dôležitosti, systém na odhaľovanie podvodov, ktorý označí podozrivú transakciu, model na spracovanie lekárskych snímok, ktorý zvýrazní oblasť záujmu, alebo systém strojového videnia vo výrobe, ktorý detekuje chyby – všetky tieto systémy využívajú vytrénované modely na nových dátach.
Tieto príklady sa používateľom javia odlišne, majú však spoločný základný vzor: vytrénovaný model prijme vstupné údaje, vykoná výpočet a vráti výstup, ktorý slúži ako podklad pre rozhodnutie, odpoveď alebo vygenerovaný výsledok.
Prečo je inferencia dôležitá pre energetiku a infraštruktúru
Jedna požiadavka na inferenciu môže byť malá, avšak moderné systémy umelej inteligencie fungujú vo veľkom meradle. Milióny či miliardy podnetov, požiadaviek na obrázky, odporúčaní a volaní API môžu vytvárať nepretržitý dopyt po grafických procesoroch, sieťových zariadeniach, úložiskách a chladiacich systémoch.
Preto je inferencia kľúčovou súčasťou infraštruktúry umelej inteligencie. Hoci je trénovanie možno najviditeľnejšou výpočtovou činnosťou, inferencia sa opakuje zakaždým, keď ľudia používajú nasadené nástroje umelej inteligencie. V globálnom meradle sa toto opakované používanie môže stať hlavným hnacím motorom dopytu po grafických procesoroch a spotreby elektrickej energie v dátových centrách.
Presné energetické náklady na jeden dotaz umelej inteligencie závisia od veľkosti modelu, hardvéru, spracovania v dávkach, vyťaženia, efektívnosti dátového centra a typu výstupu. Dôležité je, že inferencia spája každodenné využívanie umelej inteligencie s fyzickou infraštruktúrou: čipmi, servermi, napájaním, chladením a dátovými centrami.
Ako sa optimalizuje inferencia
Poskytovatelia umelej inteligencie vynakladajú značné technické úsilie na to, aby bol proces inferencie rýchlejší, lacnejší a efektívnejší. Vďaka dávkovému spracovaniu je možné spracovávať viacero požiadaviek naraz, ukladanie do vyrovnávacej pamäte umožňuje opätovné využitie opakovaných úloh a smerovanie umožňuje posielať jednoduchšie úlohy menším alebo špecializovaným modelom.
Iné techniky znižujú objem potrebných výpočtov. Kvantizácia umožňuje kompaktnejšie vyjadriť hodnoty modelu, destilácia dokáže preniesť správanie do menšieho modelu a pruning či zmeny architektúry môžu odstrániť zbytočnú prácu pri zachovaní užitočnej kvality.
Dôležitý je aj špecializovaný hardvér. Grafické procesory, akcelerátory umelej inteligencie, rýchle sieťové pripojenie a pamäť s vysokou šírkou pásma pomáhajú nasadeným modelom spoľahlivo reagovať vo veľkom meradle. Vyššia efektívnosť inferencie môže znížiť latenciu, náklady a spotrebu elektrickej energie, ale infraštruktúru to nezruší.

