Modelos open source em 2026: pesos abertos face aos fechados
Em maio de 2023, 174 pontos separavam o melhor modelo de IA fechado do melhor modelo aberto na classificação Arena, onde utilizadores comparam às cegas as respostas de dois modelos. Em agosto de 2024, a diferença era de apenas 7 pontos. Em março de 2026, tinha voltado a subir para 49. Estes números, retirados do AI Index 2026 da Universidade de Stanford, mostram que os modelos que se podem transferir e executar em casa continuam próximos dos melhores sem os ultrapassar, e que a diferença varia ao ritmo dos lançamentos de algumas empresas.
Pesos abertos e open source: o que as palavras abrangem
Um modelo de linguagem é um programa que lê texto e produz texto, após um treino em imensos corpora. O que aprendeu está armazenado nos seus parâmetros, também chamados pesos: milhares de milhões de números ajustados durante o treino. Um modelo de pesos abertos é um modelo cujos números são publicados e transferíveis. Qualquer pessoa pode então executá-lo na sua própria máquina, adaptá-lo ou estudá-lo. Um modelo fechado, pelo contrário, só é acessível pela interface do seu editor: envia-se-lhe um pedido, devolve uma resposta, e os seus pesos permanecem nos servidores do editor.
A expressão «open source» é muitas vezes empregue para os dois primeiros casos, erradamente em sentido estrito. A Open Source Initiative, a organização de referência para as licenças de software livre, publicou no final de outubro de 2024 a versão 1.0 da sua definição de IA open source. Exige três elementos: uma informação suficientemente detalhada sobre os dados de treino para que uma pessoa competente possa reconstruir um sistema comparável, o código completo que serve para treinar e executar o modelo, e os próprios parâmetros.
A maioria dos modelos conhecidos publica o terceiro elemento, por vezes parte do segundo, quase nunca o primeiro. Os dados de treino permanecem secretos, por razões de concorrência e de direitos de autor. Alguns projetos de investigação, como o OLMo do Allen Institute for AI, publicam também os seus dados, mas não figuram entre os mais eficazes. O termo exato para o DeepSeek, o Qwen, o Mistral ou o gpt-oss é, portanto, «modelos de pesos abertos». Este artigo fala de modelos abertos por comodidade.
O que as licenças autorizam
A licença é o contrato que fixa o que o utilizador tem o direito de fazer com o modelo. As licenças Apache 2.0 e MIT, oriundas do software livre, são as mais permissivas: autorizam o uso comercial, a modificação e a redistribuição, desde que se conserve a menção do autor e o texto da licença. O Qwen3.5 da Alibaba, o gpt-oss da OpenAI e o Mistral Large 3 são publicados sob Apache 2.0. O DeepSeek V4 é publicado sob licença MIT.
A Meta escolheu uma licença própria para o Llama 4, datada de 5 de abril de 2025. Autoriza o uso comercial, com três condições notáveis. Uma empresa cujos produtos ultrapassem 700 milhões de utilizadores ativos por mês deve pedir uma licença à Meta, o que só diz respeito a um punhado de grupos no mundo. Qualquer empresa que distribua um produto baseado no Llama deve exibir a menção «Built with Llama». Por fim, qualquer modelo derivado distribuído deve ter um nome que comece por «Llama».
Estas condições continuam aceitáveis para a maioria das empresas, mas alteram o trabalho do serviço jurídico. Uma licença Apache 2.0 é um texto padrão, já conhecido dos juristas que validaram software livre. Uma licença própria de um editor tem de ser lida na íntegra, e pode mudar de uma versão do modelo para a seguinte.
Os principais modelos abertos disponíveis no outono de 2026
Os maiores modelos abertos assentam quase todos numa arquitetura dita de mistura de especialistas. O modelo é dividido em numerosas sub-redes e, para cada palavra produzida, um encaminhador solicita apenas algumas. Distinguem-se portanto dois números: o número total de parâmetros, que determina a memória necessária, e o número de parâmetros ativos, que determina o volume de cálculo a cada palavra.
A DeepSeek, laboratório chinês financiado pelo fundo de investimento High-Flyer, publicou no final de abril de 2026 uma pré-versão da sua família V4 sob licença MIT. Segundo a ficha publicada na Hugging Face, o V4-Pro tem 1 600 mil milhões de parâmetros, dos quais 49 mil milhões ativos, e o V4-Flash 284 mil milhões, dos quais 13 mil milhões ativos. Ambos aceitam um contexto de um milhão de tokens. O contexto é a quantidade de texto que o modelo pode ter em conta de uma só vez, e um token corresponde a um fragmento de palavra.
A Alibaba publicou o Qwen3.5 a 16 de fevereiro de 2026 sob Apache 2.0: 397 mil milhões de parâmetros, dos quais 17 mil milhões ativos, e suporte para 201 línguas e dialetos. Segundo uma análise publicada pela Summit School, que não pudemos confirmar junto da Alibaba, a série Qwen3.6, lançada em abril, inclui modelos mais fáceis de alojar, entre os quais um modelo de 35 mil milhões de parâmetros que ativa apenas 3 mil milhões. O modelo de topo seguinte, o Qwen3.7-Max, apresentado em maio de 2026, só é acessível por API, sem pesos transferíveis.
Na Europa, a empresa francesa Mistral AI publicou a 2 de dezembro de 2025 o Mistral Large 3, um modelo de 675 mil milhões de parâmetros dos quais 41 mil milhões ativos, acompanhado de três pequenos modelos de 3, 8 e 14 mil milhões de parâmetros, todos sob Apache 2.0. Nos Estados Unidos, a OpenAI publicou em agosto de 2025 o gpt-oss, o seu primeiro modelo aberto desde o GPT-2: a versão maior tem 117 mil milhões de parâmetros dos quais 5,1 mil milhões ativos, a mais pequena 21 mil milhões dos quais 3,6 mil milhões ativos.
A Meta, que carregava a abertura do lado americano com a sua família Llama, mudou de rumo. A 8 de abril de 2026, a empresa apresentou o Muse Spark, primeiro modelo do seu laboratório Meta Superintelligence Labs. É fechado: usa-se nas aplicações da Meta ou por uma API aberta a parceiros selecionados. A Meta escreveu esperar publicar em open source versões futuras, sem calendário. Os modelos Llama já publicados continuam transferíveis.
Medir a diferença: classificação independente e números dos editores
Um benchmark é uma bateria de perguntas padronizadas que serve para avaliar os modelos. Cada editor escolhe destacar aqueles em que obtém os melhores resultados, o que torna as comparações frágeis. A classificação Arena procede de outra forma: os utilizadores submetem uma pergunta, recebem duas respostas anónimas e votam na melhor. Os votos alimentam uma pontuação do tipo Elo, o sistema de classificação dos jogadores de xadrez.
O AI Index 2026, publicado pelo Institute for Human-Centered AI de Stanford, apoia-se nesta classificação. Em março de 2026, o melhor modelo fechado, o Claude Opus 4.6 da Anthropic, obtinha 1 503 pontos. O melhor modelo aberto, o GLM-5 da chinesa Zhipu AI, obtinha 1 454, ou seja, 49 pontos ou 3,4 % de diferença. Seis dos dez primeiros modelos da classificação eram fechados. O relatório nota também que as quatro primeiras empresas, Anthropic, xAI, Google e OpenAI, estavam separadas por menos de 25 pontos, seguidas da Alibaba com 1 449 e da DeepSeek com 1 424.
O relatório descreve um movimento de pêndulo. O Mixtral, o WizardLM e depois o Llama 3.1 405B tinham reduzido a diferença para 7 pontos em agosto de 2024. A chegada de novos modelos fechados, como o o1-preview da OpenAI e o Gemini 2.5 Pro da Google, voltou a aprofundá-la. A diferença diminui quando os laboratórios abertos publicam, e reabre-se quando os laboratórios fechados lançam uma nova geração.
Os editores dão as suas próprias estimativas, que é preciso ler como tal. A DeepSeek afirma que o V4-Pro acusa um atraso de três a seis meses em relação ao GPT-5.4 e ao Gemini 3.1 Pro em raciocínio, uma estimativa que o sítio WinBuzzer apresenta como não verificada por laboratórios independentes. Para o Qwen3.5, os números publicados pela Alibaba e retomados pelo The Decoder colocam-no à frente em testes de cumprimento de instruções, como o IFBench com 76,5, mas atrás do GPT-5.2 em matemática de competição, com 91,3 contra 96,7 no AIME26, e em programação, com 83,6 contra 87,7 no LiveCodeBench.
Tomados em conjunto, estes números indicam que um bom modelo aberto se situa a alguns meses dos melhores modelos fechados. Para a maioria das tarefas de escritório, o utilizador não vê a diferença. Nos problemas mais difíceis, como os raciocínios longos ou as tarefas que encadeiam muitas etapas sem supervisão, ela continua mensurável.
A memória necessária e o papel da quantização
Para funcionar, um modelo deve carregar todos os seus parâmetros em memória, incluindo os dos especialistas inativos num dado momento. A mistura de especialistas reduz o cálculo, não a memória. Na precisão standard de 16 bits, cada parâmetro ocupa dois bytes. Os 117 mil milhões de parâmetros do gpt-oss exigiriam, portanto, cerca de 234 gigabytes, quase três vezes a memória de uma placa Nvidia H100, que tem 80.
A quantização resolve parte do problema. Consiste em armazenar cada parâmetro com menos bits, 8 ou 4 em vez de 16. A documentação da biblioteca Transformers da Hugging Face descreve-a como uma forma de reduzir a memória necessária procurando preservar o mais possível a precisão do modelo. A analogia mais exata é a de uma fotografia comprimida: o ficheiro é muito mais leve e, se a compressão for bem feita, a diferença só se vê olhando de perto.
Os editores entregam agora modelos já quantizados. A OpenAI distribui o gpt-oss com os pesos dos seus especialistas no formato MXFP4, em cerca de 4 bits, o que permite que a versão grande caiba numa única placa de 80 gigabytes e que a pequena funcione com 16 gigabytes de memória. A DeepSeek publica o V4 num formato misto: 4 bits para os especialistas, 8 bits para a maioria dos outros parâmetros. Mesmo comprimido, o V4-Pro exige várias centenas de gigabytes e continua a ser um modelo de cluster de servidores.
Na prática, desenham-se três patamares. Os modelos de 3 a 20 mil milhões de parâmetros funcionam num posto de trabalho equipado com uma placa gráfica recente. Os de 30 a 120 mil milhões exigem uma máquina dedicada com uma ou duas placas de grande capacidade, o que continua ao alcance de uma PME. Para lá de algumas centenas de milhares de milhões, é preciso um servidor de cálculo completo. A compressão tem um custo: em código, cálculo ou textos muito técnicos, uma quantização demasiado forte degrada os resultados. O único método fiável consiste em testá-la nos próprios documentos.
As tarefas em que bastam, aquelas em que têm dificuldades
Os modelos abertos de tamanho médio dão bons resultados no trabalho delimitado e repetitivo: resumir atas, classificar correios eletrónicos, extrair campos de uma fatura, responder a perguntas a partir de uma base de documentos internos, redigir um primeiro rascunho, traduzir. Para estas utilizações, um modelo de 20 a 120 mil milhões de parâmetros bem configurado produz respostas que a maioria dos utilizadores não distingue das de um modelo fechado. Alojado nas instalações, oferece além disso um custo previsível e um comportamento que não muda sem decisão interna.
São mais frágeis em três situações. A primeira diz respeito às tarefas longas em que o modelo age sozinho, encadeando dezenas de ações: uma pequena probabilidade de erro em cada etapa acaba por se acumular. A segunda diz respeito aos conhecimentos recentes, pois um modelo só sabe o que leu antes do fim do seu treino, a menos que lhe sejam fornecidos documentos atualizados. A terceira diz respeito às línguas e aos jargões menos representados nos dados de treino, que são sobretudo ingleses e chineses. O francês jurídico ou técnico exige, portanto, testes específicos antes de qualquer implementação.
Um modelo aberto é um ficheiro, não um serviço. As atualizações de segurança, a supervisão, o registo dos acessos e a gestão dos direitos ficam a cargo de quem o aloja. É o trabalho que os editores de modelos fechados faturam com a sua API, e que é preciso prever quando se escolhe alojar por conta própria.
Estados Unidos, China, Europa: três formas de publicar
Os laboratórios americanos mais avançados, Anthropic, Google e OpenAI, mantêm os seus melhores modelos fechados e vendem-nos por API. A OpenAI faz uma exceção parcial com o gpt-oss, que fica aquém dos seus modelos de topo. A Meta alinhou-se com os seus concorrentes com o Muse Spark.
Os laboratórios chineses, como a DeepSeek, a Alibaba ou a Zhipu AI, publicam muitos pesos abertos sob licenças permissivas. O AI Index 2026 constata que a diferença entre modelos americanos e chineses quase se fechou: em março de 2026, o melhor modelo americano superava o melhor modelo chinês, o Dola-Seed-2.0 Preview da ByteDance, em 39 pontos, ou seja, 2,7 %. Segundo o WinBuzzer, a Huawei confirmou que os seus clusters de cálculo baseados nos processadores Ascend podiam executar o DeepSeek V4, que foi, no entanto, treinado em chips Nvidia. A abertura chinesa não é por isso uma doutrina: a Alibaba mantém agora o seu modelo mais potente atrás de uma API, e o melhor modelo chinês da classificação, o da ByteDance, é fechado.
A Europa conta com poucos laboratórios de primeira linha, com a Mistral AI à cabeça, e pesa sobretudo pela regulamentação. As obrigações do AI Act para os modelos de IA de uso geral aplicam-se desde 2 de agosto de 2025, e a Comissão pode fazê-las respeitar desde 2 de agosto de 2026. Os modelos publicados sob licença livre, exceto os classificados como de risco sistémico, estão dispensados de parte das obrigações de documentação técnica, mas devem continuar a publicar um resumo dos seus dados de treino e uma política de respeito pelos direitos de autor. O código de boas práticas que acompanha estas regras, publicado a 10 de julho de 2025, contava 26 signatários em meados de agosto de 2025, entre os quais a OpenAI, a Google, a Microsoft, a Amazon e a Anthropic. A Meta e as empresas chinesas não figuravam.
Para um comprador francês, a consequência é prática: antes de implementar um modelo, é preciso saber qual funciona realmente, sob que licença, com que documentação e quem é o seu editor.
Mudar de modelo sem refazer as ferramentas
A classificação de hoje não será a do próximo ano. Em doze meses, a DeepSeek publicou uma nova geração, a Alibaba apresentou três e reservou a última para a sua API, a Meta lançou o seu primeiro grande modelo fechado. Uma empresa que liga diretamente o seu software a um modelo preciso aposta num estado do mercado que terá mudado antes do fim do ano.
A resposta é de ordem técnica. As aplicações não se dirigem diretamente ao modelo, mas a uma camada intermédia que escolhe o modelo consoante a tarefa. Um conjunto de testes interno, constituído pelos documentos e pelas perguntas reais da empresa, verifica que um novo modelo faz pelo menos tão bem como o antigo antes de o substituir. Mudar de modelo torna-se então uma operação de manutenção, planeada e verificável.
Esta disciplina protege contra vários riscos ao mesmo tempo: um editor que deixa de publicar os seus pesos, uma licença que se endurece, uma tarifa que aumenta, um modelo retirado. Um artigo do sítio alemão Digital Chiefs, dedicado à viragem da Meta, recomenda às direções informáticas a mesma abordagem: várias famílias de modelos em vez de um fornecedor único, entre as quais pelo menos um modelo aberto para as utilizações regulamentadas ou offline, um inventário das aplicações e dos modelos que utilizam, e cláusulas de saída nos contratos.
O que o estado dos modelos abertos muda para uma empresa
No outono de 2026, os melhores modelos abertos situam-se a alguns pontos dos melhores modelos fechados segundo a medição independente mais seguida. As suas licenças vão da Apache 2.0, que quase não impõe condições, a textos próprios que é preciso fazer rever. A sua disponibilidade depende da estratégia dos seus autores, que pode mudar de uma versão para outra. Para a maioria das utilizações correntes, bastam, e permitem tratar os documentos da empresa sem os enviar a um terceiro.
O critério que conta a prazo é a capacidade de substituir um modelo por outro sem tocar no resto. É a escolha de arquitetura da HOMN: o modelo é uma peça intercambiável, testada nos documentos do cliente antes de cada substituição, e a infraestrutura que o rodeia permanece no lugar de uma geração para a outra.
Qual é a diferença entre um modelo open source e um modelo de pesos abertos?
Um modelo de pesos abertos publica os seus parâmetros, o que permite transferi-lo e executá-lo na própria máquina. Segundo a definição da Open Source Initiative, um modelo open source deve publicar além disso o código de treino e uma informação detalhada sobre os seus dados de treino. A maioria dos modelos conhecidos, como o DeepSeek, o Qwen ou o Mistral, são de pesos abertos.
Qual é o melhor modelo de IA open source em 2026?
Segundo o AI Index 2026 de Stanford, o melhor modelo aberto da classificação Arena em março de 2026 era o GLM-5 da Zhipu AI, com 1 454 pontos. O DeepSeek V4, o Qwen3.5 e o Mistral Large 3 figuram entre os maiores modelos abertos publicados desde então. A boa escolha depende do hardware disponível, da licença e dos testes nas próprias tarefas.
Os modelos open source são tão bons como o ChatGPT ou o Claude?
Estão próximos. Em março de 2026, o melhor modelo aberto estava 49 pontos, ou seja, 3,4 %, atrás do melhor modelo fechado da classificação Arena. Para as tarefas de escritório correntes, a diferença é pouco visível, mas continua mensurável nos raciocínios longos e nas tarefas autónomas complexas.
Que hardware é preciso para executar um LLM open source em local?
Um modelo de 3 a 20 mil milhões de parâmetros funciona num posto equipado com uma placa gráfica recente, e o gpt-oss-20b funciona com 16 gigabytes de memória. Um modelo de cerca de 120 mil milhões de parâmetros quantizado em 4 bits, como o gpt-oss-120b, cabe numa placa de 80 gigabytes. Os modelos de várias centenas de milhares de milhões de parâmetros exigem um servidor completo.