TheAIMeters Logo

Čo je to inferencia umelej inteligencie?

Inferencia umelej inteligencie je moment, keď sa vytrénovaný model používa na odpoveď na zadanie, generovanie obsahu, klasifikáciu údajov alebo vytvorenie predpovede na základe nového vstupu.

Diagram showing a user input flowing into a trained AI model and returning an output
Inferencia umelej inteligencie premieňa nový vstup na výstup tak, že spustí vytrénovaný model na aktuálnych údajoch, namiesto toho, aby model trénovala od začiatku.

AI prompty spracované dnes (odhad)

 prompty

Odhadovaný počet AI podnetov spracovaných dnes v globálnych systémoch umelej inteligencie.

Hlavný záver

Inferencia umelej inteligencie nie je trénovanie modelu. Ide o fázu, v ktorej sa vytrénovaný model používa na spracovanie nového vstupu a na vytvorenie odpovede, predikcie, klasifikácie alebo generovaného výstupu.

Obsah

Inferencia nastáva vtedy, keď sa používa model umelej inteligencie

Inferencia umelej inteligencie prebieha po tom, čo bol model už vytrénovaný. Používateľ, aplikácia alebo automatizovaný systém pošle nový vstup a vytrénovaný model využije to, čo sa naučil počas trénovania, aby vygeneroval užitočný výstup.

Týmto vstupom môže byť písomná výzva, vyhľadávací dotaz, obrázok produktu, hlasová nahrávka, riadok kódu alebo riadok v databáze. Výstupom môže byť odpoveď, vygenerovaný obrázok, klasifikácia, odporúčanie, preklad alebo predpoveď.

Preto každá odpoveď ChatGPT, generovanie obrázkov pomocou umelej inteligencie, výsledok vyhľadávacieho asistenta, odporúčací systém a rozhodnutie o moderovaní obsahu zahŕňa inferenciu. Model sa pri každom použití neprebudováva. Spúšťa sa na nových údajoch.

Trénovanie vytvorí model, inferencia ho spustí

Trénovanie a inferencia sú dve odlišné fázy toho istého systému umelej inteligencie. Trénovanie vytvára alebo aktualizuje model spracovaním rozsiahlych dátových súborov, porovnávaním predikcií s príkladmi a úpravou vnútorných parametrov v priebehu mnohých opakovaných krokov.

Inferencia začína až vtedy, keď tento proces trénovania vygeneruje použiteľný model. Natrénovaný model sa nasadí na servery, prijíma nové vstupné údaje a uplatňuje naučené vzory bez toho, aby musel opäť prechádzať celým procesom trénovania.

Jednoduchý spôsob, ako si zapamätať tento rozdiel, je nasledovný: trénovanie je spôsob, akým sa model učí, zatiaľ čo inferencia je spôsob, akým sa model používa. Podrobnejšie vysvetlenie prvej fázy nájdete v sprievodcovi o tom, ako sa trénujú modely umelej inteligencie.

Diagram comparing AI training and AI inference workflows
Pri trénovaní sa z údajov vytvorí model a vykonajú sa výpočty. Pri inferencii sa tento vytrénovaný model použije na nový vstup s cieľom vygenerovať výstup.

Čo sa deje počas inferencie umelej inteligencie?

Presné kroky závisia od typu modelu, ale základný postup je podobný. Príde vstup, systém ho pripraví vo formáte, ktorý model očakáva, model vykoná výpočty so svojimi parametrami a systém premení výstup modelu na formu, ktorú môže používateľ prečítať, zobraziť alebo použiť.

V prípade jazykového modelu sa zadanie zvyčajne rozdelí na tokeny. Model tieto tokeny vyhodnocuje a krok za krokom predpovedá pravdepodobné nasledujúce tokeny. V prípade obrazového modelu môže byť vstupom text, obrázok alebo oboje, a model postupne generuje pixely alebo vizuálne charakteristiky, ktoré zodpovedajú požiadavke.

Iné systémy môžu klasifikovať dokument, zoradiť výsledky vyhľadávania, rozpoznať objekty na obrázku, prepisovať reč alebo odporučiť produkt. V každom z týchto prípadov je inferencia krokom v reálnom čase, ktorý transformuje nový vstup na výstup modelu.

Prečo je na inferenciu potrebný výpočtový výkon

Inferencia umelej inteligencie nie je jednoduchým vyhľadávaním v databáze. Veľký model môže obsahovať miliardy parametrov a jeho použitie si vyžaduje množstvo matematických operácií na prenos informácií cez model a výpočet nasledujúceho výstupu.

Tento výpočet sa často musí uskutočniť rýchlo. Odpoveď chatbota, reakcia vyhľadávacieho asistenta alebo preklad v reálnom čase by mali prísť v priebehu niekoľkých sekúnd alebo ešte rýchlejšie, preto sa systémy na odvodzovanie zameriavajú na latenciu, šírku pásma pamäte, spracovanie v dávkach, veľkosť modelu a využitie hardvéru.

Grafické procesory (GPU) a iné akcelerátory umelej inteligencie sú užitočné, pretože dokážu efektívne vykonávať mnoho paralelných operácií. Čím je model väčší, čím je kontext dlhší a čím je viac súčasných používateľov, tým starostlivejšie je potrebné navrhnúť infraštruktúru na vyvodzovanie záverov.

Príklady inferencie v každodennej umelej inteligencii

Keď chatbot odpovie na otázku, vykonáva inferenciu. To isté platí aj vtedy, keď generátor obrázkov vytvorí obrázok na základe zadania, asistent pre programovanie navrhne funkciu alebo prekladateľský nástroj preloží vetu do iného jazyka.

Inferencia sa objavuje aj v menej viditeľných systémoch. Či už ide o odporúčací kanál, ktorý zoradí videá podľa dôležitosti, systém na odhaľovanie podvodov, ktorý označí podozrivú transakciu, model na spracovanie lekárskych snímok, ktorý zvýrazní oblasť záujmu, alebo systém strojového videnia vo výrobe, ktorý detekuje chyby – všetky tieto systémy využívajú vytrénované modely na nových dátach.

Tieto príklady sa používateľom javia odlišne, majú však spoločný základný vzor: vytrénovaný model prijme vstupné údaje, vykoná výpočet a vráti výstup, ktorý slúži ako podklad pre rozhodnutie, odpoveď alebo vygenerovaný výsledok.

Prečo je inferencia dôležitá pre energetiku a infraštruktúru

Jedna požiadavka na inferenciu môže byť malá, avšak moderné systémy umelej inteligencie fungujú vo veľkom meradle. Milióny či miliardy podnetov, požiadaviek na obrázky, odporúčaní a volaní API môžu vytvárať nepretržitý dopyt po grafických procesoroch, sieťových zariadeniach, úložiskách a chladiacich systémoch.

Preto je inferencia kľúčovou súčasťou infraštruktúry umelej inteligencie. Hoci je trénovanie možno najviditeľnejšou výpočtovou činnosťou, inferencia sa opakuje zakaždým, keď ľudia používajú nasadené nástroje umelej inteligencie. V globálnom meradle sa toto opakované používanie môže stať hlavným hnacím motorom dopytu po grafických procesoroch a spotreby elektrickej energie v dátových centrách.

Presné energetické náklady na jeden dotaz umelej inteligencie závisia od veľkosti modelu, hardvéru, spracovania v dávkach, vyťaženia, efektívnosti dátového centra a typu výstupu. Dôležité je, že inferencia spája každodenné využívanie umelej inteligencie s fyzickou infraštruktúrou: čipmi, servermi, napájaním, chladením a dátovými centrami.

Ako sa optimalizuje inferencia

Poskytovatelia umelej inteligencie vynakladajú značné technické úsilie na to, aby bol proces inferencie rýchlejší, lacnejší a efektívnejší. Vďaka dávkovému spracovaniu je možné spracovávať viacero požiadaviek naraz, ukladanie do vyrovnávacej pamäte umožňuje opätovné využitie opakovaných úloh a smerovanie umožňuje posielať jednoduchšie úlohy menším alebo špecializovaným modelom.

Iné techniky znižujú objem potrebných výpočtov. Kvantizácia umožňuje kompaktnejšie vyjadriť hodnoty modelu, destilácia dokáže preniesť správanie do menšieho modelu a pruning či zmeny architektúry môžu odstrániť zbytočnú prácu pri zachovaní užitočnej kvality.

Dôležitý je aj špecializovaný hardvér. Grafické procesory, akcelerátory umelej inteligencie, rýchle sieťové pripojenie a pamäť s vysokou šírkou pásma pomáhajú nasadeným modelom spoľahlivo reagovať vo veľkom meradle. Vyššia efektívnosť inferencie môže znížiť latenciu, náklady a spotrebu elektrickej energie, ale infraštruktúru to nezruší.

Ďalšie zdroje a literatúra

Súvisiace príručky k infraštruktúre umelej inteligencie

Súvisiace články

Ako sa trénujú modely AI

Modely AI sa trénujú učením vzorov z veľkých dátových súborov, úpravou interných parametrov a následným používaním týchto vzorov na odpovede na nové vstupy. Tento proces trénovania je základom fungovania modelov AI.

Hlukové znečistenie v dátových centrách

Dátové centrá môžu byť zdrojom neustáleho hluku pochádzajúceho z chladiacich systémov, napájacích zariadení, záložných generátorov a infraštruktúry s vysokou hustotou. Umelá inteligencia síce nespôsobuje hluk na každom mieste, avšak zariadenia dimenzované na potreby umelej inteligencie môžu tento problém pre okolité komunity zviditeľniť.

Prečo umelá inteligencia spotrebúva toľko elektrickej energie?

AI spotrebúva toľko elektriny, pretože trénovanie, inferencia a globálne nasadenie závisia od výpočtovo náročnej infraštruktúry.

Čo je MCP v AI? Model Context Protocol vysvetlený

MCP, teda Model Context Protocol, je otvorený protokol na prepojenie aplikácií AI s externými nástrojmi, zdrojmi dát a workflowmi cez štandardné rozhranie.

Sú dátové centrá s umelou inteligenciou škodlivé pre životné prostredie?

Dátové centrá využívajúce umelú inteligenciu nie sú automaticky škodlivé pre životné prostredie, ich vplyv však závisí od spotreby elektrickej energie, zloženia energetickej siete, spotreby vody, spôsobu chladenia, miestnych obmedzení a transparentnosti.

Prečo dátové centrá s umelou inteligenciou spotrebúvajú toľko vody?

Dátové centrá umelej inteligencie využívajú vodu, pretože servery s vysokou hustotou grafických procesorov (GPU) produkujú teplo, ktoré je potrebné nepretržite odvádzať. Chladenie na báze vody môže byť efektívne, avšak jeho lokálny vplyv závisí od podnebia, konštrukcie chladiaceho systému, výroby elektrickej energie a dostupnosti vody.

Súvisiace otázky

Zdieľať túto stránku