TheAIMeters Logo

O que é a inferência de IA?

A inferência de IA é o momento em que um modelo treinado é utilizado para responder a um prompt, gerar conteúdo, classificar dados ou fazer uma previsão a partir de uma nova entrada.

Diagram showing a user input flowing into a trained AI model and returning an output
A inferência de IA transforma uma nova entrada numa saída, executando um modelo treinado em dados em tempo real, em vez de treinar o modelo a partir do zero.

Prompts de IA processados hoje (estimativa)

 avisos

Estimativa do número de prompts de IA processados hoje em sistemas de IA a nível mundial.

Conclusão principal

A inferência de IA não é o treino de modelos. É a fase em que um modelo treinado é utilizado para processar uma nova entrada e produzir uma resposta, uma previsão, uma classificação ou um resultado gerado.

Índice

A inferência ocorre quando se utiliza um modelo de IA

A inferência de IA ocorre depois de um modelo já ter sido treinado. Um utilizador, uma aplicação ou um sistema automatizado envia uma nova entrada, e o modelo treinado utiliza o que aprendeu durante o treino para produzir uma saída útil.

Essa entrada pode ser um prompt escrito, uma consulta de pesquisa, uma imagem de um produto, uma gravação de voz, uma linha de código ou uma linha numa base de dados. A saída pode ser uma resposta, uma imagem gerada, uma classificação, uma recomendação, uma tradução ou uma previsão.

É por isso que todas as respostas do ChatGPT, a geração de imagens por IA, os resultados do assistente de pesquisa, o motor de recomendações e as decisões de moderação de conteúdos envolvem inferência. O modelo não é reconstruído de cada vez. É aplicado a novos dados.

O treino constrói o modelo, a inferência executa-o

O treino e a inferência são duas fases diferentes do mesmo sistema de IA. O treino cria ou atualiza o modelo através do processamento de grandes conjuntos de dados, comparando previsões com exemplos e ajustando parâmetros internos ao longo de muitas etapas repetidas.

A inferência tem início depois de esse trabalho de treino ter produzido um modelo utilizável. O modelo treinado é implementado em servidores, recebe novos dados de entrada e aplica os padrões que aprendeu sem ter de passar novamente por todo o processo de treino.

Uma forma simples de recordar a diferença é a seguinte: o treino é a forma como o modelo aprende, enquanto a inferência é a forma como o modelo é utilizado. Para uma explicação mais aprofundada da primeira fase, consulte o guia sobre como os modelos de IA são treinados.

Diagram comparing AI training and AI inference workflows
O treino cria um modelo a partir de dados e cálculos. A inferência utiliza esse modelo treinado com uma nova entrada para produzir uma saída.

O que acontece durante a inferência de IA?

Os passos exatos dependem do tipo de modelo, mas o fluxo básico é semelhante. Recebe-se uma entrada, o sistema prepara-a no formato esperado pelo modelo, o modelo realiza os cálculos com base nos seus parâmetros e o sistema transforma a saída do modelo em algo que o utilizador possa ler, visualizar ou utilizar.

No caso de um modelo de linguagem, um prompt é normalmente dividido em tokens. O modelo avalia esses tokens e prevê os tokens seguintes mais prováveis, um passo de cada vez. No caso de um modelo de imagem, a entrada pode ser texto, uma imagem ou ambos, e o modelo produz gradualmente píxeis ou características visuais que correspondem ao pedido.

Outros sistemas podem classificar um documento, ordenar resultados de pesquisa, detetar objetos numa imagem, transcrever discurso ou recomendar um produto. Em cada caso, a inferência é a etapa de execução em tempo real que transforma uma nova entrada numa saída do modelo.

Por que razão a inferência requer capacidade de computação

A inferência de IA não é uma simples consulta numa base de dados. Um modelo de grande dimensão pode conter milhares de milhões de parâmetros, e a sua utilização requer muitas operações matemáticas para processar a informação ao longo do modelo e calcular o resultado seguinte.

Este cálculo tem, muitas vezes, de ser realizado rapidamente. Uma resposta de um chatbot, de um assistente de pesquisa ou uma tradução em tempo real deve ser apresentada em segundos ou menos; por isso, os sistemas de inferência têm em conta a latência, a largura de banda da memória, o processamento em lotes, o tamanho do modelo e a utilização do hardware.

As GPUs e outros aceleradores de IA são úteis porque conseguem realizar muitas operações paralelas de forma eficiente. Quanto maior for o modelo, quanto mais extenso for o contexto e quanto mais utilizadores simultâneos houver, mais cuidadosamente terá de ser concebida a infraestrutura de inferência.

Exemplos de inferência na IA do dia-a-dia

Quando um chatbot responde a uma pergunta, está a realizar uma inferência. O mesmo se aplica quando um gerador de imagens cria uma imagem a partir de um prompt, um assistente de programação sugere uma função ou uma ferramenta de tradução converte uma frase para outro idioma.

A inferência também está presente em sistemas menos visíveis. Um feed de recomendações que classifica vídeos, um sistema de deteção de fraudes que sinaliza uma transação, um modelo de imagiologia médica que destaca uma região de interesse ou um sistema de visão industrial que deteta defeitos — todos utilizam modelos treinados com novos dados.

Estes exemplos parecem diferentes para os utilizadores, mas partilham o mesmo padrão básico: um modelo treinado recebe uma entrada, realiza cálculos e devolve uma saída que serve de base a uma decisão, resposta ou resultado gerado.

Por que razão a inferência é importante para os setores da energia e das infraestruturas

Um pedido de inferência pode ser pequeno, mas os sistemas modernos de IA operam em grande escala. Milhões ou milhares de milhões de prompts, pedidos de imagens, recomendações e chamadas à API podem criar uma procura contínua por parte das GPUs, das redes, dos sistemas de armazenamento e dos sistemas de refrigeração.

É por isso que a inferência é fundamental para a infraestrutura de IA. O treino pode ser o processo computacional mais visível, mas a inferência repete-se sempre que as pessoas utilizam ferramentas de IA implementadas. À escala global, essa utilização repetida pode tornar-se um dos principais fatores impulsionadores da procura de GPUs e do consumo de eletricidade nos centros de dados.

O custo energético exato de uma consulta de IA depende do tamanho do modelo, do hardware, do agrupamento em lotes, da utilização, da eficiência do centro de dados e do tipo de resultado. O que é importante é que a inferência liga a utilização quotidiana da IA à infraestrutura física: chips, servidores, energia, refrigeração e centros de dados.

Como é otimizada a inferência

Os fornecedores de IA dedicam um grande esforço de engenharia para tornar a inferência mais rápida, mais económica e mais eficiente. O processamento em lote permite tratar vários pedidos em simultâneo, o armazenamento em cache permite reutilizar trabalho repetido e o encaminhamento permite enviar tarefas mais simples para modelos mais pequenos ou especializados.

Outras técnicas reduzem a quantidade de cálculos necessários. A quantização permite representar os valores do modelo de forma mais compacta, a destilação permite transferir o comportamento para um modelo mais pequeno e a poda ou as alterações à arquitetura permitem eliminar trabalho desnecessário, preservando simultaneamente a qualidade útil.

O hardware especializado também é importante. As GPUs, os aceleradores de IA, as redes rápidas e a memória de elevada largura de banda ajudam os modelos implementados a responder de forma fiável em grande escala. Uma maior eficiência na inferência pode reduzir a latência, os custos e o consumo de eletricidade, mas não faz com que a infraestrutura desapareça.

Leituras complementares e referências

Guias relacionados sobre infraestruturas de IA

Artigos relacionados

Como são treinados os modelos de IA

Modelos de IA são treinados aprendendo padrões em grandes conjuntos de dados, ajustando parâmetros internos e depois usando esses padrões para responder a novas entradas. Esse processo de treinamento é a base de como os modelos de IA funcionam.

Poluição sonora nos centros de dados

Os centros de dados podem gerar ruído persistente proveniente dos sistemas de refrigeração, do equipamento de alimentação, dos geradores de reserva e da infraestrutura de alta densidade. A IA não torna todos os locais ruidosos, mas as instalações à escala da IA podem tornar o problema mais visível para as comunidades vizinhas.

Porque é que a IA consome tanta eletricidade?

A IA usa tanta eletricidade porque treinamento, inferência e implantação em escala global dependem de infraestrutura intensiva em computação.

O que é MCP em IA? Model Context Protocol explicado

MCP, ou Model Context Protocol, é um protocolo aberto concebido para ligar aplicações de IA a ferramentas, fontes de dados e workflows externos através de uma interface padrão.

Os centros de dados de IA são prejudiciais para o ambiente?

Os centros de dados de IA não são, por si só, prejudiciais para o ambiente, mas o seu impacto depende da procura de eletricidade, da composição da rede elétrica, do consumo de água, do sistema de refrigeração, das restrições locais e da transparência.

Por que é que os centros de dados de IA consomem tanta água?

Os centros de dados de IA utilizam água porque os servidores com GPUs de alta densidade geram calor que tem de ser dissipado continuamente. O arrefecimento à base de água pode ser eficiente, mas o seu impacto local depende do clima, do sistema de arrefecimento, da produção de eletricidade e da disponibilidade de água.

Questões relacionadas

Partilhar esta página