TheAIMeters Logo

Che cos’è l’inferenza AI?

L'inferenza AI è il momento in cui un modello addestrato viene utilizzato per rispondere a una richiesta, generare contenuti, classificare dati o formulare una previsione sulla base di un nuovo input.

Diagram showing a user input flowing into a trained AI model and returning an output
L'inferenza AI trasforma un nuovo input in un output eseguendo un modello già addestrato sui dati in tempo reale, anziché addestrare il modello da zero.

Prompt IA elaborati oggi (stima)

 suggerimenti

Stima del numero di prompt di IA elaborati oggi dai sistemi di IA a livello globale.

Punto chiave

L'inferenza AI non è l'addestramento del modello. È la fase in cui un modello già addestrato viene utilizzato per elaborare un nuovo input e produrre una risposta, una previsione, una classificazione o un output generato.

Indice

Si parla di inferenza quando si utilizza un modello di intelligenza artificiale

L'inferenza AI avviene dopo che un modello è già stato addestrato. Un utente, un'applicazione o un sistema automatizzato invia un nuovo input e il modello addestrato utilizza ciò che ha appreso durante l'addestramento per produrre un output utile.

L'input può essere un prompt scritto, una query di ricerca, l'immagine di un prodotto, una registrazione vocale, una riga di codice o una riga in un database. L'output può essere una risposta, un'immagine generata, una classificazione, un consiglio, una traduzione o una previsione.

Ecco perché ogni risposta di ChatGPT, ogni generazione di immagini tramite IA, ogni risultato dell’assistente di ricerca, ogni motore di raccomandazione e ogni decisione relativa alla moderazione dei contenuti comporta un processo di inferenza. Il modello non viene ricostruito ogni volta, ma viene applicato ai nuovi dati.

L'addestramento crea il modello, l'inferenza lo esegue

L'addestramento e l'inferenza sono due fasi distinte dello stesso sistema di intelligenza artificiale. L'addestramento crea o aggiorna il modello elaborando grandi insiemi di dati, confrontando le previsioni con gli esempi e regolando i parametri interni attraverso numerose iterazioni.

L'inferenza ha inizio una volta che tale processo di addestramento ha prodotto un modello utilizzabile. Il modello addestrato viene implementato sui server, riceve nuovi input e applica gli schemi appresi senza dover ripetere l'intero processo di addestramento.

Un modo semplice per ricordare la differenza è questo: l’addestramento è il processo attraverso cui il modello apprende, mentre l’inferenza è il modo in cui il modello viene utilizzato. Per una spiegazione più approfondita della prima fase, consulta la guida su come vengono addestrati i modelli di IA.

Diagram comparing AI training and AI inference workflows
Durante l'addestramento viene creato un modello a partire dai dati e dai calcoli. L'inferenza utilizza il modello addestrato con un nuovo input per produrre un output.

Cosa succede durante l'inferenza dell'IA?

I passaggi esatti dipendono dal tipo di modello, ma il flusso di base è simile. Arriva un dato in ingresso, il sistema lo prepara nel formato previsto dal modello, il modello esegue i calcoli sui propri parametri e il sistema trasforma l'output del modello in qualcosa che l'utente può leggere, visualizzare o utilizzare.

Nel caso di un modello linguistico, un prompt viene solitamente suddiviso in token. Il modello analizza tali token e prevede i token successivi più probabili, un passo alla volta. Nel caso di un modello di immagini, l’input può essere un testo, un’immagine o entrambi, e il modello genera gradualmente pixel o caratteristiche visive che corrispondono alla richiesta.

Altri sistemi possono classificare un documento, ordinare i risultati di ricerca, rilevare oggetti in un’immagine, trascrivere il parlato o consigliare un prodotto. In ogni caso, l’inferenza è la fase di esecuzione in tempo reale che trasforma un nuovo input nell’output del modello.

Perché l'inferenza richiede potenza di calcolo

L'inferenza dell'IA non consiste in una semplice ricerca in un database. Un modello di grandi dimensioni può contenere miliardi di parametri e il suo utilizzo richiede numerose operazioni matematiche per far circolare le informazioni all'interno del modello e calcolare l'output successivo.

Questo calcolo deve spesso avvenire rapidamente. La risposta di un chatbot, quella di un assistente di ricerca o una traduzione in tempo reale dovrebbero arrivare in pochi secondi o anche meno; pertanto, i sistemi di inferenza prestano particolare attenzione alla latenza, alla larghezza di banda della memoria, al batching, alle dimensioni del modello e all’utilizzo dell’hardware.

Le GPU e altri acceleratori di intelligenza artificiale sono utili perché consentono di eseguire in modo efficiente numerose operazioni in parallelo. Più il modello è grande, più il contesto è esteso e più è elevato il numero di utenti simultanei, più l’infrastruttura di inferenza deve essere progettata con cura.

Esempi di inferenza nell'IA di uso quotidiano

Quando un chatbot risponde a una domanda, sta effettuando un’inferenza. Lo stesso vale quando un generatore di immagini crea un’immagine a partire da un prompt, un assistente di programmazione suggerisce una funzione o uno strumento di traduzione converte una frase in un’altra lingua.

L'inferenza è presente anche in sistemi meno evidenti. Un feed di raccomandazioni che classifica i video, un sistema di rilevamento delle frodi che segnala una transazione, un modello di imaging medico che evidenzia un'area di interesse o un sistema di visione industriale che rileva i difetti: tutti questi sistemi utilizzano modelli addestrati su nuovi dati.

Questi esempi possono sembrare diversi agli occhi degli utenti, ma seguono tutti lo stesso schema di base: un modello addestrato riceve un input, esegue un calcolo e restituisce un output che supporta una decisione, una risposta o un risultato generato.

Perché l'inferenza è importante per il settore energetico e delle infrastrutture

Una singola richiesta di inferenza può essere di piccole dimensioni, ma i moderni sistemi di intelligenza artificiale operano su scala enorme. Milioni o miliardi di prompt, richieste di immagini, raccomandazioni e chiamate API possono generare una domanda continua che coinvolge GPU, reti, sistemi di archiviazione e sistemi di raffreddamento.

Ecco perché l’inferenza è fondamentale per l’infrastruttura dell’IA. L’addestramento può essere l’operazione di calcolo più visibile, ma l’inferenza si ripete ogni volta che gli utenti utilizzano gli strumenti di IA implementati. Su scala globale, tale utilizzo ripetuto può diventare uno dei principali fattori trainanti della domanda di GPU e del consumo energetico dei data center.

Il costo energetico esatto di una singola query di IA dipende dalle dimensioni del modello, dall’hardware, dal batching, dal grado di utilizzo, dall’efficienza del data center e dal tipo di output. Il punto fondamentale è che l’inferenza collega l’uso quotidiano dell’IA all’infrastruttura fisica: chip, server, alimentazione, raffreddamento e data center.

Come viene ottimizzata l'inferenza

I fornitori di IA dedicano notevoli risorse ingegneristiche per rendere l'inferenza più veloce, più economica e più efficiente. L'elaborazione in batch consente di trattare più richieste contemporaneamente, la cache permette di riutilizzare le operazioni ripetitive e l'instradamento consente di indirizzare le attività più semplici verso modelli più piccoli o specializzati.

Altre tecniche consentono di ridurre la quantità di calcoli necessari. La quantizzazione permette di rappresentare i valori del modello in modo più compatto, la distillazione consente di trasferire il comportamento in un modello più piccolo, mentre il pruning o le modifiche all'architettura possono eliminare operazioni superflue preservando al contempo la qualità utile.

Anche l’hardware specializzato è importante. Le GPU, gli acceleratori di intelligenza artificiale, le reti veloci e la memoria ad alta larghezza di banda aiutano i modelli implementati a rispondere in modo affidabile su larga scala. Una maggiore efficienza nell’inferenza può ridurre la latenza, i costi e il consumo di energia elettrica, ma non fa scomparire l’infrastruttura.

Ulteriori approfondimenti e riferimenti

Guide correlate sulle infrastrutture di intelligenza artificiale

Articoli correlati

Come vengono addestrati i modelli di intelligenza artificiale

I modelli di IA vengono addestrati imparando schemi da grandi dataset, regolando parametri interni e poi usando quegli schemi per rispondere a nuovi input. Questo processo di addestramento è alla base del funzionamento dei modelli di IA.

Inquinamento acustico nei data center

I data center possono generare rumore costante proveniente dai sistemi di raffreddamento, dalle apparecchiature di alimentazione, dai generatori di riserva e dalle infrastrutture ad alta densità. L’intelligenza artificiale non rende rumorosa ogni struttura, ma gli impianti su larga scala dedicati all’IA possono rendere il problema più evidente per le comunità vicine.

Perché l'intelligenza artificiale consuma così tanta elettricità?

L’IA usa così tanta elettricità perché addestramento, inferenza e distribuzione su scala globale dipendono da infrastrutture ad alta intensità di calcolo.

Che cos’è MCP nell’IA? Model Context Protocol spiegato

MCP, o Model Context Protocol, è un protocollo aperto progettato per collegare applicazioni IA a strumenti, fonti di dati e workflow esterni tramite un’interfaccia standard.

I data center basati sull'intelligenza artificiale sono dannosi per l'ambiente?

I data center dedicati all'intelligenza artificiale non sono di per sé dannosi per l'ambiente, ma il loro impatto dipende dal fabbisogno di energia elettrica, dal mix energetico della rete, dal consumo idrico, dal sistema di raffreddamento, dai vincoli locali e dalla trasparenza.

Perché i data center dedicati all'intelligenza artificiale consumano così tanta acqua?

I data center dedicati all'intelligenza artificiale utilizzano l'acqua perché i server con GPU ad alta densità generano calore che deve essere dissipato continuamente. Il raffreddamento ad acqua può essere efficiente, ma il suo impatto locale dipende dal clima, dal sistema di raffreddamento, dalla produzione di energia elettrica e dalla disponibilità di acqua.

Domande correlate

Condividi questa pagina