Sisällysluettelo
Inferenssi alkaa, kun tekoälymallia käytetään
Tekoälyn päättely tapahtuu sen jälkeen, kun malli on jo koulutettu. Käyttäjä, sovellus tai automatisoitu järjestelmä lähettää uuden syötteen, ja koulutettu malli hyödyntää koulutuksen aikana oppimaansa tuottaakseen hyödyllisen tuloksen.
Syötteenä voi olla kirjallinen kehote, hakukysely, tuotekuva, äänitallenne, koodirivi tai tietokannan rivi. Tuloksena voi olla vastaus, luotu kuva, luokittelu, suositus, käännös tai ennuste.
Tämän vuoksi jokainen ChatGPT:n vastaus, tekoälyn tuottama kuva, hakukoneen tulos, suositusmoottorin tulos ja sisällön moderointipäätös perustuu päättelyyn. Mallia ei rakenneta uudelleen joka kerta, vaan sitä sovelletaan uusiin tietoihin.
Koulutus rakentaa mallin, inferenssi suorittaa sen
Koulutus ja päättely ovat saman tekoälyjärjestelmän kaksi eri vaihetta. Koulutuksessa luodaan tai päivitetään malli käsittelemällä suuria tietojoukkoja, vertaamalla ennusteita esimerkkeihin ja säätämällä sisäisiä parametreja lukuisissa toistuvissa vaiheissa.
Inferenssi alkaa sen jälkeen, kun koulutuksen tuloksena on saatu käyttökelpoinen malli. Koulutettu malli otetaan käyttöön palvelimilla, se vastaanottaa uusia syötteitä ja soveltaa oppimiaan malleja ilman, että koko koulutusprosessi käydään läpi uudelleen.
Eron voi muistaa helposti näin: koulutus tarkoittaa sitä, miten malli oppii, kun taas päättely tarkoittaa sitä, miten mallia käytetään. Jos haluat syvällisemmän selityksen ensimmäisestä vaiheesta, tutustu oppaaseen, jossa kerrotaan, miten tekoälymalleja koulutetaan.

Mitä tapahtuu tekoälyn päättelyvaiheessa?
Tarkat vaiheet riippuvat mallin tyypistä, mutta perusprosessi on samanlainen. Syöte saapuu, järjestelmä muokkaa sen mallin edellyttämään muotoon, malli suorittaa laskelmat parametreillaan, ja järjestelmä muuntaa mallin tuloksen muotoon, jota käyttäjä voi lukea, tarkastella tai käyttää.
Kielimallin tapauksessa syöte jaetaan yleensä merkkijonoihin. Malli analysoi nämä merkkijonot ja ennustaa todennäköiset seuraavat merkkijonot askel askeleelta. Kuvamallin tapauksessa syötteenä voi olla teksti, kuva tai molemmat, ja malli tuottaa vaiheittain pikseleitä tai visuaalisia piirteitä, jotka vastaavat pyyntöä.
Muut järjestelmät voivat luokitella asiakirjoja, järjestää hakutuloksia, tunnistaa kuvissa olevia kohteita, transkriboida puhetta tai suositella tuotteita. Kussakin tapauksessa päättely on se reaaliaikainen suoritusvaihe, joka muuntaa uuden syötteen mallin tuotokseksi.
Miksi inferenssi vaatii laskentatehoa
Tekoälyn päättely ei ole pelkkä tietokantahaku. Suuri malli voi sisältää miljardeja parametreja, ja sen käyttö vaatii lukuisia matemaattisia laskutoimituksia, joilla tietoa siirretään mallin läpi ja lasketaan seuraava tulos.
Tämä laskenta on usein suoritettava nopeasti. Chatbotin vastauksen, hakukoneen vastauksen tai reaaliaikaisen käännöksen tulisi saapua sekunneissa tai jopa nopeammin, joten päättelyjärjestelmissä kiinnitetään huomiota viiveeseen, muistin kaistanleveyteen, erien käsittelyyn, mallin kokoon ja laitteiston käyttöasteeseen.
Grafiikkaprosessorit (GPU) ja muut tekoälyn kiihdyttimet ovat hyödyllisiä, koska ne pystyvät suorittamaan tehokkaasti monia rinnakkaisia operaatioita. Mitä suurempi malli on, mitä pidempi konteksti on ja mitä enemmän samanaikaisia käyttäjiä on, sitä huolellisemmin päättelyinfrastruktuuri on suunniteltava.
Esimerkkejä päättelystä arkipäivän tekoälyssä
Kun chatbot vastaa kysymykseen, se suorittaa inferenssiä. Sama pätee, kun kuvageneraattori luo kuvan promptin perusteella, koodausavustaja ehdottaa funktiota tai käännöstyökalu muuntaa lauseen toiselle kielelle.
Inferenssiä tapahtuu myös vähemmän näkyvissä järjestelmissä. Videoita järjestävä suositusvirta, petosten havaitsemisjärjestelmä, lääketieteellinen kuvantamismalli tai tehtaan konenäköjärjestelmä käyttävät kaikki koulutettuja malleja uuteen dataan.
Nämä esimerkit näyttävät käyttäjille erilaisilta, mutta niillä on sama perusmalli: koulutettu malli vastaanottaa syötteen, suorittaa laskennan ja palauttaa tuloksen, joka tukee päätöstä, vastausta tai luotua tulosta.
Miksi päättely on tärkeää energia- ja infrastruktuurialalla
Yksittäinen päättelypyyntö voi olla pieni, mutta nykyaikaiset tekoälyjärjestelmät toimivat valtavassa mittakaavassa. Miljoonat tai miljardit syötteet, kuvapyynnöt, suositukset ja API-kutsut voivat luoda jatkuvaa kuormitusta grafiikkaprosessoreille, verkko-, tallennus- ja jäähdytysjärjestelmille.
Tämän vuoksi päättely on keskeinen osa tekoälyinfrastruktuuria. Koulutus saattaa olla näkyvin laskentaprosessi, mutta päättely toistuu joka kerta, kun ihmiset käyttävät käyttöönotettuja tekoälytyökaluja. Maailmanlaajuisesti tämä toistuva käyttö voi muodostua merkittäväksi tekijäksi GPU-kysynnän ja datakeskusten sähkönkulutuksen kasvussa.
Yhden tekoälykyselyn tarkat energiakustannukset riippuvat mallin koosta, laitteistosta, eräajosta, käyttöasteesta, datakeskuksen tehokkuudesta ja tulostyypistä. Tärkeää on, että päättely yhdistää tekoälyn jokapäiväisen käytön fyysiseen infrastruktuuriin: siruihin, palvelimiin, sähköön, jäähdytykseen ja datakeskuksiin.
Miten päättelyä optimoidaan
Tekoälyn tarjoajat panostavat paljon tekniseen kehitykseen, jotta päättelyprosessit olisivat nopeampia, edullisempia ja tehokkaampia. Eräajon avulla voidaan käsitellä useita pyyntöjä kerralla, välimuistin avulla voidaan hyödyntää toistuvia laskutoimituksia uudelleen, ja reitityksen avulla yksinkertaisemmat tehtävät voidaan ohjata pienemmille tai erikoistuneille malleille.
Muut tekniikat vähentävät tarvittavan laskennan määrää. Kvantisointi mahdollistaa mallin arvojen esittämisen tiiviimmin, distillaatio siirtää käyttäytymisen pienempään malliin, ja karsinta tai arkkitehtuurin muutokset voivat poistaa tarpeetonta työtä säilyttäen samalla hyödyllisen laadun.
Myös erikoistunut laitteisto on tärkeää. Grafiikkaprosessorit, tekoälykiihdyttimet, nopeat verkot ja suuren kaistanleveyden muisti auttavat käyttöönotettuja malleja toimimaan luotettavasti suuressa mittakaavassa. Parempi päättelytehokkuus voi vähentää viivettä, kustannuksia ja sähkönkulutusta, mutta se ei poista infrastruktuuria kokonaan.

