Modelos open source: pesos abiertos frente a cerrados en 2026

En mayo de 2023, 174 puntos separaban al mejor modelo de IA cerrado del mejor modelo abierto en la clasificación Arena, donde los usuarios comparan a ciegas las respuestas de dos modelos. En agosto de 2024, la diferencia era de solo 7 puntos. En marzo de 2026, había vuelto a subir a 49. Estas cifras, extraídas del AI Index 2026 de la Universidad de Stanford, muestran que los modelos que se pueden descargar y ejecutar en casa siguen cerca de los mejores sin superarlos, y que la diferencia varía al ritmo de los lanzamientos de unas pocas empresas.

Pesos abiertos y open source: lo que abarcan las palabras

Un modelo de lenguaje es un programa que lee texto y lo produce, tras un entrenamiento con inmensos corpus. Lo que ha aprendido se almacena en sus parámetros, también llamados pesos: miles de millones de números ajustados durante el entrenamiento. Un modelo de pesos abiertos es un modelo cuyos números se publican y pueden descargarse. Cualquiera puede entonces ejecutarlo en su propia máquina, adaptarlo o estudiarlo. Un modelo cerrado, en cambio, solo es accesible mediante la interfaz de su editor: se le envía una solicitud, devuelve una respuesta, y sus pesos permanecen en los servidores del editor.

La expresión «open source» se emplea a menudo para los dos primeros casos, incorrectamente en sentido estricto. La Open Source Initiative, la organización de referencia para las licencias de software libre, publicó a finales de octubre de 2024 la versión 1.0 de su definición de IA open source. Exige tres elementos: una información suficientemente detallada sobre los datos de entrenamiento para que una persona competente pueda reconstruir un sistema comparable, el código completo que sirve para entrenar y ejecutar el modelo, y los propios parámetros.

La mayoría de los modelos conocidos publica el tercer elemento, a veces una parte del segundo, casi nunca el primero. Los datos de entrenamiento siguen siendo secretos, por razones de competencia y de derechos de autor. Algunos proyectos de investigación, como OLMo del Allen Institute for AI, publican también sus datos, pero no figuran entre los más eficaces. El término exacto para DeepSeek, Qwen, Mistral o gpt-oss es, por tanto, «modelos de pesos abiertos». Este artículo habla de modelos abiertos por comodidad.

Lo que permiten las licencias

La licencia es el contrato que fija lo que el usuario tiene derecho a hacer con el modelo. Las licencias Apache 2.0 y MIT, procedentes del software libre, son las más permisivas: autorizan el uso comercial, la modificación y la redistribución, a condición de conservar la mención del autor y el texto de la licencia. Qwen3.5 de Alibaba, gpt-oss de OpenAI y Mistral Large 3 se publican bajo Apache 2.0. DeepSeek V4 se publica bajo licencia MIT.

Meta eligió una licencia propia para Llama 4, fechada el 5 de abril de 2025. Autoriza el uso comercial, con tres condiciones notables. Una empresa cuyos productos superen los 700 millones de usuarios activos al mes debe solicitar una licencia a Meta, lo que solo afecta a un puñado de grupos en el mundo. Toda empresa que distribuya un producto basado en Llama debe mostrar la mención «Built with Llama». Por último, todo modelo derivado que se distribuya debe llevar un nombre que empiece por «Llama».

Estas condiciones siguen siendo aceptables para la mayoría de las empresas, pero cambian el trabajo del departamento jurídico. Una licencia Apache 2.0 es un texto estándar, ya conocido por los juristas que han validado software libre. Una licencia propia de un editor debe leerse entera, y puede cambiar de una versión del modelo a la siguiente.

Los principales modelos abiertos disponibles en el otoño de 2026

Los mayores modelos abiertos se basan casi todos en una arquitectura llamada de mezcla de expertos. El modelo se divide en numerosas subredes y, para cada palabra producida, un enrutador solicita solo unas pocas. Se distinguen, por tanto, dos cifras: el número total de parámetros, que determina la memoria necesaria, y el número de parámetros activos, que determina el volumen de cálculo en cada palabra.

DeepSeek, laboratorio chino financiado por el fondo de inversión High-Flyer, publicó a finales de abril de 2026 una versión preliminar de su familia V4 bajo licencia MIT. Según la ficha publicada en Hugging Face, V4-Pro cuenta con 1,6 billones de parámetros, de los cuales 49 mil millones están activos, y V4-Flash con 284 mil millones, de los cuales 13 mil millones están activos. Ambos aceptan un contexto de un millón de tokens. El contexto es la cantidad de texto que el modelo puede tener en cuenta de una sola vez, y un token corresponde a un fragmento de palabra.

Alibaba publicó Qwen3.5 el 16 de febrero de 2026 bajo Apache 2.0: 397 mil millones de parámetros, de los cuales 17 mil millones están activos, y compatibilidad con 201 idiomas y dialectos. Según un análisis publicado por Summit School, que no hemos podido contrastar con Alibaba, la serie Qwen3.6, aparecida en abril, incluye modelos más fáciles de alojar, entre ellos un modelo de 35 mil millones de parámetros que solo activa 3 mil millones. El modelo insignia siguiente, Qwen3.7-Max, presentado en mayo de 2026, solo es accesible mediante API, sin pesos descargables.

En Europa, la empresa francesa Mistral AI publicó el 2 de diciembre de 2025 Mistral Large 3, un modelo de 675 mil millones de parámetros, de los cuales 41 mil millones están activos, acompañado de tres modelos pequeños de 3, 8 y 14 mil millones de parámetros, todos bajo Apache 2.0. En Estados Unidos, OpenAI publicó en agosto de 2025 gpt-oss, su primer modelo abierto desde GPT-2: la versión más grande cuenta con 117 mil millones de parámetros, de los cuales 5,1 mil millones están activos, y la más pequeña con 21 mil millones, de los cuales 3,6 mil millones están activos.

Meta, que encabezaba la apertura en el lado estadounidense con su familia Llama, ha cambiado de rumbo. El 8 de abril de 2026, la empresa presentó Muse Spark, primer modelo de su laboratorio Meta Superintelligence Labs. Es cerrado: se utiliza en las aplicaciones de Meta o mediante una API abierta a socios seleccionados. Meta escribió que espera publicar como open source futuras versiones, sin calendario. Los modelos Llama ya publicados siguen siendo descargables.

Medir la diferencia: clasificación independiente y cifras de los editores

Un benchmark es una batería de preguntas estandarizadas que sirve para puntuar los modelos. Cada editor elige destacar aquellos en los que obtiene sus mejores resultados, lo que hace frágiles las comparaciones. La clasificación Arena procede de otra manera: los usuarios plantean una pregunta, reciben dos respuestas anónimas y votan por la mejor. Los votos alimentan una puntuación de tipo Elo, el sistema de clasificación de los jugadores de ajedrez.

El AI Index 2026, publicado por el Institute for Human-Centered AI de Stanford, se apoya en esta clasificación. En marzo de 2026, el mejor modelo cerrado, Claude Opus 4.6 de Anthropic, obtenía 1503 puntos. El mejor modelo abierto, GLM-5 de la china Zhipu AI, obtenía 1454, es decir, 49 puntos o un 3,4 % de diferencia. Seis de los diez primeros modelos de la clasificación eran cerrados. El informe señala también que las cuatro primeras empresas, Anthropic, xAI, Google y OpenAI, se mantenían en menos de 25 puntos, seguidas de Alibaba con 1449 y de DeepSeek con 1424.

El informe describe un movimiento de péndulo. Mixtral, WizardLM y luego Llama 3.1 405B habían reducido la diferencia a 7 puntos en agosto de 2024. La llegada de nuevos modelos cerrados, como o1-preview de OpenAI y Gemini 2.5 Pro de Google, la ha ampliado de nuevo. La diferencia se reduce cuando los laboratorios abiertos publican y se reabre cuando los laboratorios cerrados lanzan una nueva generación.

Los editores dan sus propias estimaciones, que hay que leer como tales. DeepSeek afirma que V4-Pro lleva un retraso de tres a seis meses respecto a GPT-5.4 y Gemini 3.1 Pro en razonamiento, una estimación que el sitio WinBuzzer presenta como no verificada por laboratorios independientes. Para Qwen3.5, las cifras publicadas por Alibaba y recogidas por The Decoder lo sitúan por delante en pruebas de seguimiento de instrucciones, como IFBench con 76,5, pero por detrás de GPT-5.2 en matemáticas de competición, con 91,3 frente a 96,7 en AIME26, y en programación, con 83,6 frente a 87,7 en LiveCodeBench.

En conjunto, estas cifras indican que un buen modelo abierto se sitúa a pocos meses de los mejores modelos cerrados. Para la mayoría de las tareas de oficina, el usuario no ve la diferencia. En los problemas más difíciles, como los razonamientos largos o las tareas que encadenan numerosos pasos sin supervisión, sigue siendo medible.

La memoria necesaria y el papel de la cuantización

Para funcionar, un modelo debe cargar todos sus parámetros en memoria, incluidos los de los expertos inactivos en un momento dado. La mezcla de expertos reduce el cálculo, no la memoria. En precisión estándar de 16 bits, cada parámetro ocupa dos bytes. Los 117 mil millones de parámetros de gpt-oss requerirían, por tanto, unos 234 gigabytes, casi tres veces la memoria de una tarjeta Nvidia H100, que tiene 80.

La cuantización resuelve una parte del problema. Consiste en almacenar cada parámetro con menos bits, 8 o 4 en lugar de 16. La documentación de la biblioteca Transformers de Hugging Face la describe como una forma de reducir la memoria necesaria procurando preservar lo más posible la precisión del modelo. La analogía más acertada es la de una fotografía comprimida: el archivo es mucho más ligero y, si la compresión está bien hecha, la diferencia solo se ve mirando de cerca.

Los editores entregan ya modelos cuantizados. OpenAI distribuye gpt-oss con los pesos de sus expertos en formato MXFP4, en torno a 4 bits, lo que permite que la versión grande quepa en una sola tarjeta de 80 gigabytes y que la pequeña funcione con 16 gigabytes de memoria. DeepSeek publica V4 en un formato mixto: 4 bits para los expertos, 8 bits para la mayoría de los demás parámetros. Incluso comprimido, V4-Pro requiere varios cientos de gigabytes y sigue siendo un modelo de clúster de servidores.

En la práctica se dibujan tres niveles. Los modelos de 3 a 20 mil millones de parámetros funcionan en un puesto de trabajo equipado con una tarjeta gráfica reciente. Los de 30 a 120 mil millones requieren una máquina dedicada con una o dos tarjetas de gran capacidad, lo que sigue al alcance de una pyme. Por encima de unos cientos de miles de millones, hace falta un servidor de cálculo completo. La compresión tiene un coste: en código, cálculo o textos muy técnicos, una cuantización demasiado fuerte degrada los resultados. El único método fiable consiste en probarla con los propios documentos.

Las tareas en las que bastan y aquellas en las que flaquean

Los modelos abiertos de tamaño medio dan buenos resultados en el trabajo acotado y repetitivo: resumir actas, clasificar correos, extraer campos de una factura, responder preguntas a partir de una base de documentos internos, redactar un primer borrador, traducir. Para estos usos, un modelo de 20 a 120 mil millones de parámetros bien configurado produce respuestas que la mayoría de los usuarios no distingue de las de un modelo cerrado. Alojado en el sitio, ofrece además un coste previsible y un comportamiento que no cambia sin una decisión interna.

Son más frágiles en tres situaciones. La primera concierne a las tareas largas en las que el modelo actúa solo, encadenando decenas de acciones: una pequeña probabilidad de error en cada paso acaba acumulándose. La segunda concierne a los conocimientos recientes, puesto que un modelo solo sabe lo que ha leído antes del final de su entrenamiento, salvo que se le faciliten documentos actualizados. La tercera concierne a los idiomas y jergas menos representados en los datos de entrenamiento, que son sobre todo ingleses y chinos. El francés jurídico o técnico requiere, por tanto, pruebas específicas antes de cualquier despliegue.

Un modelo abierto es un archivo, no un servicio. Las actualizaciones de seguridad, la supervisión, el registro de accesos y la gestión de derechos quedan a cargo de quien lo aloja. Es el trabajo que los editores de modelos cerrados facturan con su API, y hay que preverlo cuando se elige alojar por cuenta propia.

Estados Unidos, China, Europa: tres formas de publicar

Los laboratorios estadounidenses más avanzados, Anthropic, Google y OpenAI, mantienen cerrados sus mejores modelos y los venden mediante API. OpenAI es una excepción parcial con gpt-oss, que queda por debajo de sus modelos insignia. Meta se ha alineado con sus competidores con Muse Spark.

Los laboratorios chinos, como DeepSeek, Alibaba o Zhipu AI, publican muchos pesos abiertos bajo licencias permisivas. El AI Index 2026 constata que la diferencia entre modelos estadounidenses y chinos se ha cerrado casi por completo: en marzo de 2026, el mejor modelo estadounidense superaba al mejor modelo chino, Dola-Seed-2.0 Preview de ByteDance, en 39 puntos, un 2,7 %. Según WinBuzzer, Huawei confirmó que sus clústeres de cálculo basados en sus procesadores Ascend podían ejecutar DeepSeek V4, que sin embargo fue entrenado con chips de Nvidia. La apertura china no es por ello una doctrina: Alibaba mantiene ahora su modelo más potente tras una API, y el mejor modelo chino de la clasificación, el de ByteDance, es cerrado.

Europa cuenta con pocos laboratorios de primer nivel, con Mistral AI a la cabeza, y pesa sobre todo por la regulación. Las obligaciones del AI Act para los modelos de IA de uso general se aplican desde el 2 de agosto de 2025, y la Comisión puede hacerlas cumplir desde el 2 de agosto de 2026. Los modelos publicados bajo una licencia libre, salvo los clasificados como de riesgo sistémico, están dispensados de una parte de las obligaciones de documentación técnica, pero siguen debiendo publicar un resumen de sus datos de entrenamiento y una política de respeto de los derechos de autor. El código de buenas prácticas que acompaña a estas normas, publicado el 10 de julio de 2025, contaba con 26 firmantes a mediados de agosto de 2025, entre ellos OpenAI, Google, Microsoft, Amazon y Anthropic. Meta y las empresas chinas no figuraban entre ellos.

Para un comprador francés, la consecuencia es práctica: antes de desplegar un modelo, hay que saber cuál se ejecuta realmente, bajo qué licencia, con qué documentación y quién es su editor.

Cambiar de modelo sin rehacer las herramientas

La clasificación de hoy no será la del año próximo. En doce meses, DeepSeek ha publicado una nueva generación, Alibaba ha presentado tres y ha reservado la última para su API, Meta ha lanzado su primer gran modelo cerrado. Una empresa que conecta directamente su software a un modelo concreto apuesta por un estado del mercado que habrá cambiado antes de que acabe el año.

La respuesta es de orden técnico. Las aplicaciones no se dirigen directamente al modelo, sino a una capa intermedia que elige el modelo según la tarea. Un conjunto de pruebas interno, formado por los documentos y las preguntas reales de la empresa, comprueba que un nuevo modelo rinde al menos tan bien como el anterior antes de sustituirlo. Cambiar de modelo se convierte entonces en una operación de mantenimiento, planificada y verificable.

Esta disciplina protege frente a varios riesgos a la vez: un editor que deja de publicar sus pesos, una licencia que se endurece, una tarifa que sube, un modelo retirado. Un artículo del sitio alemán Digital Chiefs, dedicado al giro de Meta, recomienda a las direcciones de informática el mismo enfoque: varias familias de modelos en lugar de un proveedor único, con al menos un modelo abierto para los usos regulados o sin conexión, un inventario de las aplicaciones y de los modelos que utilizan, y cláusulas de salida en los contratos.

Lo que el estado de los modelos abiertos cambia para una empresa

En el otoño de 2026, los mejores modelos abiertos se sitúan a pocos puntos de los mejores modelos cerrados según la medición independiente más seguida. Sus licencias van de Apache 2.0, que casi no impone condiciones, a textos propios que hay que hacer revisar. Su disponibilidad depende de la estrategia de sus autores, que puede cambiar de una versión a otra. Para la mayoría de los usos corrientes, bastan, y permiten tratar los documentos de la empresa sin enviarlos a un tercero.

El criterio que cuenta a largo plazo es la capacidad de sustituir un modelo por otro sin tocar el resto. Es la elección de arquitectura de HOMN: el modelo es una pieza intercambiable, probada con los documentos del cliente antes de cada sustitución, y la infraestructura que lo rodea permanece en su sitio de una generación a otra.

¿Cuál es la diferencia entre un modelo open source y un modelo de pesos abiertos?

Un modelo de pesos abiertos publica sus parámetros, lo que permite descargarlo y ejecutarlo en la propia máquina. Según la definición de la Open Source Initiative, un modelo open source debe publicar además el código de entrenamiento y una información detallada sobre sus datos de entrenamiento. La mayoría de los modelos conocidos, como DeepSeek, Qwen o Mistral, son de pesos abiertos.

¿Cuál es el mejor modelo de IA open source en 2026?

Según el AI Index 2026 de Stanford, el mejor modelo abierto de la clasificación Arena en marzo de 2026 era GLM-5 de Zhipu AI, con 1454 puntos. DeepSeek V4, Qwen3.5 y Mistral Large 3 figuran entre los mayores modelos abiertos publicados desde entonces. La elección adecuada depende del hardware disponible, de la licencia y de las pruebas con las propias tareas.

¿Son los modelos open source tan buenos como ChatGPT o Claude?

Se acercan. En marzo de 2026, el mejor modelo abierto llevaba 49 puntos, un 3,4 %, de retraso respecto al mejor modelo cerrado de la clasificación Arena. Para las tareas de oficina corrientes, la diferencia apenas se aprecia, pero sigue siendo medible en los razonamientos largos y en las tareas autónomas complejas.

¿Qué hardware se necesita para ejecutar un LLM open source en local?

Un modelo de 3 a 20 mil millones de parámetros funciona en un equipo con una tarjeta gráfica reciente, y gpt-oss-20b funciona con 16 gigabytes de memoria. Un modelo de unos 120 mil millones de parámetros cuantizado a 4 bits, como gpt-oss-120b, cabe en una tarjeta de 80 gigabytes. Los modelos de varios cientos de miles de millones de parámetros requieren un servidor completo.