IA local: definição, funcionamento e exemplos concretos

Uma IA local é um modelo de linguagem que calcula as suas respostas numa máquina que o utilizador controla, sem enviar os seus textos para um fornecedor. Este guia explica o que contém esse modelo, o que significa executá-lo em casa e o que se pode razoavelmente esperar dele.

Um comando, uma transferência, e depois nada sai

A documentação do Ollama, um software livre disponível para macOS, Windows e Linux, resume o ponto de partida numa linha: um comando escrito num terminal, que transfere um modelo e abre uma conversa. Para o modelo tomado como exemplo, o Gemma 4 E2B, o ficheiro pesa cerca de 7,2 GB e a documentação recomenda 8 GB de memória gráfica, ou de memória unificada num Mac. Uma vez este ficheiro no disco, cada resposta é calculada pelos processadores da máquina. Pode desligar-se o cabo de rede e a conversa continua.

É a definição mais simples de uma IA local: um modelo de inteligência artificial executado num hardware que se possui ou controla, seja um computador portátil, um servidor arrumado num bastidor técnico ou uma caixa dedicada. O seu contrário é um serviço remoto. O ChatGPT, o Gemini ou o Le Chat recebem o seu texto nos seus servidores, tratam-no lá e devolvem-lhe o resultado.

Para compreender o que se passa nos dois casos, é preciso abrir a caixa: o que é um modelo de linguagem, o que contém o ficheiro transferido e o que faz exatamente a máquina quando produz uma resposta.

Um modelo de linguagem prevê a continuação de um texto

Um grande modelo de linguagem, muitas vezes abreviado LLM, de large language model, é um programa treinado para uma tarefa de aparência modesta: adivinhar o pedaço de texto que vem a seguir. O teclado do seu telemóvel, que propõe a palavra seguinte acima das teclas, faz o mesmo numa escala minúscula. O LLM fá-lo com tal finura que, encadeando as previsões, produz parágrafos, resumos, código ou traduções.

O modelo não manipula palavras mas tokens, fragmentos de texto que podem corresponder a uma palavra inteira, a uma sílaba ou a um sinal de pontuação. A documentação da OpenAI dá uma ordem de grandeza para o inglês: um token representa cerca de quatro caracteres, ou seja, três quartos de uma palavra. Esta unidade serve para medir tudo, desde o comprimento máximo de uma troca, chamado janela de contexto, até à velocidade de geração.

A arquitetura que tornou estes modelos possíveis chama-se Transformer. Foi descrita em 2017 num artigo de investigação intitulado «Attention Is All You Need». A sua ideia central, o mecanismo de atenção, permite ao modelo ponderar, para cada token, a importância de todos os outros tokens do texto. Na frase «o contrato que o cliente assinou ontem expira em março», é este mecanismo que liga «expira» a «contrato» apesar das palavras intercaladas.

É preciso ter presente o que esta mecânica implica. O modelo produz a continuação mais plausível à luz do que viu durante o treino. Plausível não quer dizer exato, e esta nuance explica a maior parte dos seus limites.

Os pesos: o que contém o ficheiro

O que se transfere quando se instala um modelo são os seus pesos, também chamados parâmetros. São números, milhares de milhões de números, ajustados um a um durante o treino para que as previsões se tornem boas. Podem comparar-se aos cursores de uma imensa mesa de mistura: nenhum cursor tomado isoladamente significa grande coisa, mas a sua posição de conjunto determina o som.

O tamanho de um modelo conta-se em parâmetros. O Mistral 7B, publicado pela empresa francesa Mistral AI a 27 de setembro de 2023, tem 7,3 mil milhões. Foi distribuído sob licença Apache 2.0, que autoriza a transferi-lo, a usá-lo e a instalá-lo onde se queira, incluindo para uso comercial. Fala-se de modelo de pesos abertos: a empresa publica o próprio ficheiro, e não apenas um acesso remoto.

Duas fases sucedem-se na vida de um modelo. O treino fabrica os pesos a partir de imensos volumes de texto; mobiliza meios de cálculo consideráveis e continua a ser assunto de alguns laboratórios. A inferência utiliza depois esses pesos fixos para responder a uma pergunta; é ela, e só ela, que se executa em local. A diferença assemelha-se à que separa a redação de um dicionário da sua consulta: a primeira leva anos, a segunda alguns segundos, e ninguém precisa de reescrever o dicionário para nele procurar uma palavra.

Executar um modelo: motor, formato e quantização

Para executar estes pesos, é preciso um motor de inferência, o programa que carrega o ficheiro em memória e encadeia os cálculos. O mais difundido no universo do local chama-se llama.cpp. Escrito em C e C++ sem dependências externas, visa executar modelos com uma instalação mínima numa vasta gama de hardware: chips Apple, processadores x86 clássicos, placas gráficas NVIDIA via CUDA, ou de outros fabricantes via Vulkan. Aplicações mais acessíveis, como o Ollama ou o LM Studio, sabem ler o mesmo formato de ficheiro.

Esse formato chama-se GGUF. Segundo a documentação da Hugging Face, a principal plataforma de partilha de modelos, um ficheiro GGUF reúne num único binário os pesos e um conjunto normalizado de metadados: a arquitetura, o vocabulário de tokens, as definições necessárias ao carregamento. Copia-se, carrega-se, funciona, um pouco como um PDF que incorpora os seus próprios tipos de letra.

O fator que decide quase tudo é a memória. Na sua forma original, cada parâmetro é armazenado em 16 bits, ou seja, dois bytes. Um modelo de 7,3 mil milhões de parâmetros ocupa então quase 15 GB, mais do que a memória da maioria dos computadores de secretária. A quantização resolve este problema arredondando os pesos para menos bits, como se reduz o número de cores de uma fotografia sem que o olho veja a diferença à primeira vista. O llama.cpp suporta quantizações de 1,5 a 8 bits. O tipo Q4_K, muito usado, equivale a 4,5 bits por peso segundo a documentação da Hugging Face: o mesmo modelo desce então para cerca de 4 GB.

Esta compressão tem um preço, uma ligeira perda de precisão que se acentua à medida que se desce em bits. E a memória não serve apenas para armazenar os pesos. A documentação do Ollama recorda que uma janela de contexto mais longa exige mais memória, uma vez que a máquina guarda o registo de todo o texto em tratamento. Se a memória gráfica faltar, o software pode recorrer à memória RAM normal, com respostas mais lentas. A escolha do hardware decorre de três parâmetros: o tamanho do modelo, o seu nível de quantização e o comprimento dos textos a tratar.

Por que se tornou realista em poucos anos

Há pouco tempo, executar um modelo competente numa única máquina era uma demonstração de laboratório. Três medições publicadas no AI Index 2025 da Universidade de Stanford mostram o que mudou.

A primeira diz respeito ao tamanho. Em 2022, o mais pequeno modelo a ultrapassar 60 % de respostas certas no MMLU, um teste de escolha múltipla que cobre muitas disciplinas, era o PaLM da Google, com 540 mil milhões de parâmetros. Em 2024, o Phi-3-mini da Microsoft ultrapassou o mesmo limiar com 3,8 mil milhões de parâmetros, ou seja, um modelo 142 vezes mais pequeno. Uma vez quantizado, um modelo desta dimensão cabe na memória de um computador portátil.

A segunda diz respeito à diferença entre modelos fechados e modelos de pesos abertos. No início de janeiro de 2024, na classificação Chatbot Arena, em que internautas comparam às cegas as respostas de dois modelos, o melhor modelo fechado superava o melhor modelo aberto em 8,04 %. Em fevereiro de 2025, a diferença era apenas de 1,70 %.

A terceira diz respeito ao custo. Ainda segundo Stanford, o custo de inferência de um sistema do nível do GPT-3.5 foi dividido por mais de 280 entre novembro de 2022 e outubro de 2024. Ao mesmo tempo, o custo do hardware baixou cerca de 30 % por ano e a sua eficiência energética progrediu 40 % por ano.

Estes números descrevem uma tendência, não uma igualdade. Os maiores modelos fechados mantêm a vantagem nas tarefas mais difíceis, e uma classificação baseada nas preferências de internautas não mede tudo. A fronteira do que se pode fazer sem centro de dados deslocou-se, ainda assim, nitidamente.

Local ou ChatGPT: a questão é por onde viaja o texto

Do ponto de vista do utilizador, as duas experiências assemelham-se: uma zona de escrita, uma resposta que aparece palavra a palavra. A diferença joga-se no trajeto. Com um serviço em linha, a pergunta, os documentos anexados e a resposta transitam pelos servidores do fornecedor. Com uma IA local, não saem da máquina.

Este trajeto tem consequências concretas. A OpenAI indica que as conversas das contas ChatGPT gratuitas e Plus podem servir para melhorar os seus modelos enquanto o utilizador não tiver desativado a opção, ao passo que os dados das suas ofertas profissionais e da sua API não são utilizados por omissão. A CNIL, nas suas perguntas e respostas sobre a IA generativa publicadas em julho de 2024, observa que, com uma utilização por API, o controlo do sistema está «quase exclusivamente» nas mãos do fornecedor. Recomenda uma implementação nas instalações quando são tratados dados pessoais ou sensíveis, a fim de limitar os riscos de extração por um terceiro.

A ANSSI, a agência nacional francesa de segurança dos sistemas de informação, vai no mesmo sentido nas suas recomendações de segurança para os sistemas de IA generativa, publicadas a 29 de abril de 2024. A sua recomendação R34 desaconselha as ferramentas de IA generativa acessíveis na internet para um uso profissional que envolva dados sensíveis: a organização não controla o serviço e não pode, portanto, garantir a confidencialidade do que lá envia.

O local tem outras propriedades. Funciona sem ligação. O seu custo não depende do número de perguntas feitas, pois trata-se de hardware comprado e não de um contador. Não muda de um dia para o outro porque um fornecedor substituiu ou retirou um modelo. Em contrapartida, a organização gere ela própria a máquina, as atualizações e as cópias de segurança, e não tem acesso aos maiores modelos fechados, que só são propostos em linha. Muitas organizações combinam os dois: o local para o que é confidencial ou repetitivo, um serviço remoto para necessidades pontuais e sem dados sensíveis.

O que se pode fazer concretamente com uma IA local

As utilizações que melhor funcionam são aquelas em que o modelo trabalha sobre um texto que lhe é fornecido, em vez de recorrer à sua memória. Resumir a ata de uma reunião de trinta páginas. Reformular uma carta num registo mais neutro. Extrair de uma fatura o fornecedor, a data e o montante para os arrumar numa tabela. Traduzir uma instrução técnica. Classificar os correios eletrónicos recebidos segundo o assunto antes de os encaminhar para o serviço certo.

O caso mais pedido nas empresas consiste em interrogar os próprios documentos: procedimentos internos, contratos, convenções, base de conhecimento do apoio ao cliente. A técnica empregue, chamada RAG, de geração aumentada por recuperação, encontra primeiro as passagens pertinentes e pede depois ao modelo que responda a partir delas citando as suas fontes. Dedicamos-lhe um artigo detalhado.

Seguem-se utilizações mais técnicas: apoio à escrita de código, transcrição de reuniões por um modelo de reconhecimento de voz também executado no local, análise de registos de erros. Estas utilizações difundem-se depressa. Segundo o Eurostat, 20 % das empresas europeias com pelo menos dez colaboradores utilizavam uma tecnologia de inteligência artificial em 2025, contra 13,5 % um ano antes.

Em todos estes casos, a máquina produz um primeiro rascunho ou uma triagem, e uma pessoa valida. É nesta configuração que a relação entre o tempo ganho e o risco assumido é mais favorável.

Os limites, sem os disfarçar

Um modelo de linguagem pode afirmar com aprumo uma coisa falsa. Este fenómeno, chamado alucinação, decorre diretamente do seu funcionamento: produz um texto plausível, e um texto plausível pode conter uma data inventada, uma referência jurídica inexistente ou um número mal copiado. Executar em local não muda nada neste ponto. A solução consiste em fornecer-lhe as fontes em vez de contar com a sua memória, e em fazer rever tudo o que vincula a organização.

Os seus conhecimentos terminam no fim do treino. Um modelo publicado há um ano ignora a última reforma, a última tabela, a última versão de um software. Não consulta a internet por si próprio: uma IA local isolada da rede só sabe o que aprendeu e o que lhe é dado a ler.

Um modelo pequeno continua a ser um modelo pequeno. Os progressos medidos por Stanford são reais, mas um modelo de alguns milhares de milhões de parâmetros engana-se mais vezes do que um modelo gigante num raciocínio em várias etapas, num cálculo ou numa pergunta muito especializada. A velocidade depende do hardware: num computador sem processador gráfico adequado, uma resposta longa pode fazer-se esperar.

Por fim, uma instalação local é um sistema informático como outro qualquer. É preciso administrá-la, aplicar as correções, controlar quem lhe acede. A ANSSI dedica uma parte das suas recomendações ao isolamento dos sistemas de IA, ao registo dos tratamentos e à gestão dos direitos. Local não quer dizer seguro por omissão; quer dizer que a segurança depende da organização que o explora.

Como começar

O mais simples é experimentar num computador recente com uma aplicação como o Ollama ou o LM Studio. Escolha um modelo pequeno de pesos abertos, de alguns milhares de milhões de parâmetros, quantizado em 4 bits. Teste-o em tarefas reais mas sem dados confidenciais: resumir um documento público, reformular um texto, extrair informações de um formulário em branco. Anote a qualidade, a velocidade e os erros.

Esta primeira etapa serve para delimitar as necessidades antes de qualquer despesa: as utilizações que se repetem todas as semanas, o volume de documentos a tratar, o número de pessoas que usarão o sistema ao mesmo tempo. Estes elementos determinam o tamanho do modelo, portanto a memória necessária, portanto o hardware.

Para uma utilização em equipa, o portátil de teste já não chega. É preciso uma máquina que fique ligada, acessível na rede interna, com gestão de contas, de direitos e de registos. É o papel de um servidor ou de uma caixa dedicada.

Na HOMN, é esta última configuração que construímos: o modelo, os documentos e os registos ficam numa máquina instalada em casa do utilizador, e o recurso a um serviço externo continua a ser uma escolha explícita. A abordagem vale seja qual for a ferramenta escolhida: saber onde corre o modelo, o que contém e para onde vão os dados.

O que é uma IA local?

Uma IA local é um modelo de inteligência artificial, na maioria das vezes um modelo de linguagem, que é executado num hardware que o utilizador controla: computador, servidor ou caixa instalada nas suas instalações. As perguntas e os documentos tratados não são enviados para os servidores de um fornecedor. O modelo é um ficheiro transferido uma vez e depois utilizado sem ligação.

É preciso ligação à internet para usar uma IA local?

Não, não para funcionar. A internet serve para transferir o modelo e as atualizações do software, mas o cálculo das respostas faz-se inteiramente na máquina. Uma IA local pode, portanto, funcionar numa rede isolada.

Uma IA local é tão eficaz como o ChatGPT?

Não em tudo: os maiores modelos fechados continuam à frente nas tarefas de raciocínio mais difíceis. A diferença reduziu-se, porém, fortemente, pois segundo o AI Index 2025 de Stanford passou de 8,04 % para 1,70 % na classificação Chatbot Arena entre janeiro de 2024 e fevereiro de 2025. Para resumir, reformular, extrair ou interrogar documentos, um bom modelo de pesos abertos basta na maioria dos casos.

Que hardware é preciso para executar um LLM em local?

Tudo depende do tamanho do modelo e da sua quantização. Um modelo de 7 mil milhões de parâmetros quantizado em 4 bits ocupa cerca de 4 GB, e a documentação do Ollama recomenda 8 GB de memória gráfica ou unificada para o seu modelo de exemplo. Para uma utilização partilhada por uma equipa, é preciso uma máquina dedicada com mais memória.