IA local: definición, funcionamiento y ejemplos concretos

Una IA local es un modelo de lenguaje que calcula sus respuestas en una máquina que usted controla, sin enviar sus textos a un proveedor. Esta guía explica qué contiene ese modelo, qué significa ejecutarlo en casa y qué se puede esperar razonablemente de él.

Un comando, una descarga y luego nada sale de la máquina

La documentación de Ollama, un software libre disponible para macOS, Windows y Linux, resume el punto de partida en una línea: un comando escrito en un terminal, que descarga un modelo y abre una conversación. Para el modelo tomado como ejemplo, Gemma 4 E2B, el archivo pesa unos 7,2 GB y la documentación recomienda 8 GB de memoria gráfica, o de memoria unificada en un Mac. Una vez que ese archivo está en el disco, cada respuesta la calculan los procesadores de la máquina. Se puede desconectar el cable de red y la conversación continúa.

Esa es la definición más simple de una IA local: un modelo de inteligencia artificial ejecutado en un hardware que se posee o se controla, ya sea un ordenador portátil, un servidor guardado en un armario técnico o un equipo dedicado. Su contrario es un servicio remoto. ChatGPT, Gemini o Le Chat reciben su texto en sus servidores, lo procesan allí y le devuelven el resultado.

Para entender lo que ocurre en ambos casos hay que abrir la caja: qué es un modelo de lenguaje, qué contiene el archivo descargado y qué hace exactamente la máquina cuando produce una respuesta.

Un modelo de lenguaje predice la continuación de un texto

Un gran modelo de lenguaje, a menudo abreviado LLM por large language model, es un programa entrenado para una tarea de apariencia modesta: adivinar el fragmento de texto que viene a continuación. El teclado de su teléfono, que propone la palabra siguiente sobre las teclas, hace lo mismo a escala minúscula. El LLM lo hace con tanta finura que, encadenando las predicciones, produce párrafos, resúmenes, código o traducciones.

El modelo no manipula palabras sino tokens, fragmentos de texto que pueden corresponder a una palabra entera, a una sílaba o a un signo de puntuación. La documentación de OpenAI da un orden de magnitud para el inglés: un token representa aproximadamente cuatro caracteres, es decir, las tres cuartas partes de una palabra. Esta unidad sirve para medirlo todo, desde la longitud máxima de un intercambio, llamada ventana de contexto, hasta la velocidad de generación.

La arquitectura que ha hecho posibles estos modelos se llama Transformer. Se describió en 2017 en un artículo de investigación titulado «Attention Is All You Need». Su idea central, el mecanismo de atención, permite al modelo ponderar, para cada token, la importancia de todos los demás tokens del texto. En la frase «el contrato que el cliente firmó ayer vence en marzo», este mecanismo es el que conecta «vence» con «contrato» a pesar de las palabras intercaladas.

Hay que tener presente lo que implica esta mecánica. El modelo produce la continuación más plausible a la vista de lo que ha visto durante su entrenamiento. Plausible no significa exacto, y este matiz explica la mayoría de sus límites.

Los pesos: lo que contiene el archivo

Lo que se descarga al instalar un modelo son sus pesos, también llamados parámetros. Son números, miles de millones de números, ajustados uno a uno durante el entrenamiento para que las predicciones resulten buenas. Pueden compararse con los deslizadores de una inmensa mesa de mezclas: ningún deslizador aislado significa gran cosa, pero su posición de conjunto determina el sonido.

El tamaño de un modelo se cuenta en parámetros. Mistral 7B, publicado por la empresa francesa Mistral AI el 27 de septiembre de 2023, tiene 7300 millones de parámetros. Se difundió bajo licencia Apache 2.0, que autoriza a descargarlo, usarlo e instalarlo donde se quiera, incluso para un uso comercial. Se habla de modelo de pesos abiertos: la empresa publica el propio archivo, y no solo un acceso remoto.

En la vida de un modelo se suceden dos fases. El entrenamiento fabrica los pesos a partir de inmensos volúmenes de texto; moviliza medios de cálculo considerables y sigue siendo cosa de unos pocos laboratorios. La inferencia utiliza después esos pesos fijados para responder a una pregunta; es ella, y solo ella, la que se ejecuta en local. La diferencia se parece a la que separa la redacción de un diccionario de su consulta: la primera lleva años, la segunda unos segundos, y nadie necesita reescribir el diccionario para buscar una palabra.

Ejecutar un modelo: motor, formato y cuantización

Para ejecutar estos pesos hace falta un motor de inferencia, el programa que carga el archivo en memoria y encadena los cálculos. El más extendido en el universo local se llama llama.cpp. Escrito en C y C++ sin dependencias externas, busca ejecutar modelos con una instalación mínima en una amplia gama de hardware: chips de Apple, procesadores x86 clásicos, tarjetas gráficas NVIDIA mediante CUDA u otros fabricantes mediante Vulkan. Aplicaciones de acceso más fácil, como Ollama o LM Studio, saben leer el mismo formato de archivo.

Ese formato se llama GGUF. Según la documentación de Hugging Face, la principal plataforma de intercambio de modelos, un archivo GGUF reúne en un único binario los pesos y un conjunto normalizado de metadatos: la arquitectura, el vocabulario de tokens, los ajustes necesarios para la carga. Se copia, se carga y funciona, un poco como un PDF que incorpora sus propias fuentes.

El factor que lo decide casi todo es la memoria. En su forma original, cada parámetro se almacena en 16 bits, es decir, dos bytes. Un modelo de 7300 millones de parámetros ocupa entonces casi 15 GB, más que la memoria de la mayoría de los ordenadores de sobremesa. La cuantización resuelve este problema redondeando los pesos a menos bits, como se reduce el número de colores de una foto sin que el ojo vea la diferencia a primera vista. llama.cpp admite cuantizaciones de 1,5 a 8 bits. El tipo Q4_K, muy utilizado, equivale a 4,5 bits por peso según la documentación de Hugging Face: el mismo modelo baja entonces a unos 4 GB.

Esta compresión tiene un precio, una ligera pérdida de precisión que se acentúa a medida que se reducen los bits. Y la memoria no sirve solo para almacenar los pesos. La documentación de Ollama recuerda que una ventana de contexto más larga requiere más memoria, puesto que la máquina conserva el rastro de todo el texto que se está procesando. Si falta memoria gráfica, el software puede recurrir a la memoria RAM ordinaria, con respuestas más lentas. La elección del hardware se deriva de tres parámetros: el tamaño del modelo, su nivel de cuantización y la longitud de los textos que hay que procesar.

Por qué se ha vuelto realista en pocos años

Hace poco, ejecutar un modelo competente en una sola máquina era una demostración de laboratorio. Tres mediciones publicadas en el AI Index 2025 de la Universidad de Stanford muestran lo que ha cambiado.

La primera se refiere al tamaño. En 2022, el modelo más pequeño que superaba el 60 % de respuestas correctas en MMLU, una prueba de opción múltiple que abarca numerosas disciplinas, era PaLM de Google, con 540 000 millones de parámetros. En 2024, Phi-3-mini de Microsoft superó el mismo umbral con 3800 millones de parámetros, es decir, un modelo 142 veces más pequeño. Una vez cuantizado, un modelo de ese tamaño cabe en la memoria de un ordenador portátil.

La segunda se refiere a la diferencia entre modelos cerrados y modelos de pesos abiertos. A principios de enero de 2024, en la clasificación Chatbot Arena, donde los internautas comparan a ciegas las respuestas de dos modelos, el mejor modelo cerrado superaba al mejor modelo abierto en un 8,04 %. En febrero de 2025, la diferencia era solo del 1,70 %.

La tercera se refiere al coste. Según Stanford, el coste de inferencia de un sistema del nivel de GPT-3.5 se dividió por más de 280 entre noviembre de 2022 y octubre de 2024. Al mismo tiempo, el coste del hardware bajó alrededor de un 30 % anual y su eficiencia energética mejoró un 40 % anual.

Estas cifras describen una tendencia, no una igualdad. Los mayores modelos cerrados mantienen la ventaja en las tareas más difíciles, y una clasificación basada en las preferencias de los internautas no lo mide todo. Aun así, la frontera de lo que se puede hacer sin un centro de datos se ha desplazado de forma notable.

Local o ChatGPT: la cuestión es por dónde viaja el texto

Desde el punto de vista del usuario, las dos experiencias se parecen: una zona de entrada y una respuesta que se muestra palabra tras palabra. La diferencia está en el recorrido. Con un servicio en línea, la pregunta, los documentos adjuntos y la respuesta pasan por los servidores del proveedor. Con una IA local, no salen de la máquina.

Este recorrido tiene consecuencias concretas. OpenAI indica que las conversaciones de las cuentas gratuitas y Plus de ChatGPT pueden servir para mejorar sus modelos mientras el usuario no haya desactivado la opción, mientras que los datos de sus ofertas profesionales y de su API no se utilizan por defecto. La CNIL, en sus preguntas y respuestas sobre la IA generativa publicadas en julio de 2024, observa que con un uso mediante API el control del sistema está «casi exclusivamente» en manos del proveedor. Recomienda un despliegue en las propias instalaciones cuando se tratan datos personales o sensibles, con el fin de limitar los riesgos de extracción por un tercero.

La ANSSI, la agencia nacional francesa de seguridad de los sistemas de información, va en la misma dirección en sus recomendaciones de seguridad para los sistemas de IA generativa, publicadas el 29 de abril de 2024. Su recomendación R34 desaconseja las herramientas de IA generativa accesibles en internet para un uso profesional que implique datos sensibles: la organización no controla el servicio y, por tanto, no puede garantizar la confidencialidad de lo que envía a él.

Lo local tiene otras propiedades. Funciona sin conexión. Su coste no depende del número de preguntas formuladas, puesto que se trata de un hardware comprado y no de un contador. No cambia de un día para otro porque un proveedor haya sustituido o retirado un modelo. A cambio, la organización gestiona por sí misma la máquina, las actualizaciones y las copias de seguridad, y no tiene acceso a los mayores modelos cerrados, que solo se ofrecen en línea. Muchas organizaciones combinan ambos: lo local para lo confidencial o repetitivo, un servicio remoto para necesidades puntuales y sin datos sensibles.

Qué se puede hacer en concreto con una IA local

Los usos que mejor funcionan son aquellos en los que el modelo trabaja sobre un texto que se le proporciona, en lugar de recurrir a su memoria. Resumir un acta de reunión de treinta páginas. Reformular una carta en un registro más neutro. Extraer de una factura el proveedor, la fecha y el importe para ordenarlos en una tabla. Traducir un manual técnico. Clasificar los correos entrantes según su asunto antes de dirigirlos al departamento adecuado.

El caso más solicitado en la empresa consiste en consultar los propios documentos: procedimientos internos, contratos, convenios, base de conocimientos del soporte. La técnica empleada, llamada RAG por generación aumentada por recuperación, encuentra primero los pasajes pertinentes y pide después al modelo que responda a partir de ellos citando sus fuentes. Le dedicamos un artículo detallado.

Vienen después usos más técnicos: ayuda a la escritura de código, transcripción de reuniones mediante un modelo de reconocimiento de voz también ejecutado en el lugar, análisis de registros de errores. Estos usos se difunden rápido. Según Eurostat, el 20 % de las empresas europeas de al menos diez empleados utilizaba una tecnología de inteligencia artificial en 2025, frente al 13,5 % un año antes.

En todos estos casos, la máquina produce un primer borrador o una clasificación, y una persona valida. Es en esta configuración donde la relación entre el tiempo ganado y el riesgo asumido es más favorable.

Los límites, sin maquillarlos

Un modelo de lenguaje puede afirmar con aplomo algo falso. Este fenómeno, llamado alucinación, se deriva directamente de su funcionamiento: produce un texto plausible, y un texto plausible puede contener una fecha inventada, una referencia jurídica inexistente o una cifra mal copiada. Ejecutarlo en local no cambia nada en este punto. La solución consiste en proporcionarle las fuentes en lugar de confiar en su memoria, y en hacer revisar todo lo que comprometa a la organización.

Sus conocimientos terminan donde acabó su entrenamiento. Un modelo publicado hace un año ignora la última reforma, el último baremo, la última versión de un software. No consulta internet por sí mismo: una IA local aislada de la red solo sabe lo que ha aprendido y lo que se le da a leer.

Un modelo pequeño sigue siendo un modelo pequeño. Los avances medidos por Stanford son reales, pero un modelo de unos pocos miles de millones de parámetros se equivoca más a menudo que un modelo gigante en un razonamiento de varios pasos, un cálculo o una pregunta muy especializada. La velocidad depende del hardware: en un ordenador sin procesador gráfico adecuado, una respuesta larga puede hacerse esperar.

Por último, una instalación local es un sistema informático como cualquier otro. Hay que administrarlo, aplicar los parches, controlar quién accede a él. La ANSSI dedica una parte de sus recomendaciones al aislamiento de los sistemas de IA, al registro de los tratamientos y a la gestión de los derechos. Local no significa seguro por defecto; significa que la seguridad depende de la organización que lo explota.

Cómo empezar

Lo más sencillo es probar en un ordenador reciente con una aplicación como Ollama o LM Studio. Elija un modelo pequeño de pesos abiertos, de unos pocos miles de millones de parámetros, cuantizado a 4 bits. Pruébelo con tareas reales pero sin datos confidenciales: resumir un documento público, reformular un texto, extraer información de un formulario en blanco. Anote la calidad, la velocidad y los errores.

Esta primera etapa sirve para delimitar las necesidades antes de cualquier gasto: los usos que se repiten cada semana, el volumen de documentos que procesar, el número de personas que utilizarán el sistema al mismo tiempo. Estos elementos determinan el tamaño del modelo, por tanto la memoria necesaria, por tanto el hardware.

Para un uso de equipo, el portátil de pruebas ya no basta. Hace falta una máquina que permanezca encendida, accesible en la red interna, con gestión de cuentas, de derechos y de registros. Es la función de un servidor o de un equipo dedicado.

En HOMN construimos precisamente esta última configuración: el modelo, los documentos y los registros permanecen en una máquina instalada en las instalaciones del usuario, y el recurso a un servicio externo sigue siendo una elección explícita. El enfoque vale sea cual sea la herramienta elegida: saber dónde se ejecuta el modelo, qué contiene y adónde van los datos.

¿Qué es una IA local?

Una IA local es un modelo de inteligencia artificial, casi siempre un modelo de lenguaje, que se ejecuta en un hardware que el usuario controla: ordenador, servidor o equipo instalado en sus instalaciones. Las preguntas y los documentos procesados no se envían a los servidores de un proveedor. El modelo es un archivo que se descarga una vez y se utiliza después sin conexión.

¿Se necesita conexión a internet para usar una IA local?

No, no para funcionar. Internet sirve para descargar el modelo y las actualizaciones del software, pero el cálculo de las respuestas se hace íntegramente en la máquina. Una IA local puede, por tanto, funcionar en una red aislada.

¿Es una IA local tan potente como ChatGPT?

No en todo: los mayores modelos cerrados siguen por delante en las tareas de razonamiento más difíciles. Sin embargo, la diferencia se ha reducido mucho, ya que según el AI Index 2025 de Stanford pasó del 8,04 % al 1,70 % en la clasificación Chatbot Arena entre enero de 2024 y febrero de 2025. Para resumir, reformular, extraer o consultar documentos, un buen modelo de pesos abiertos basta en la mayoría de los casos.

¿Qué hardware se necesita para ejecutar un LLM en local?

Todo depende del tamaño del modelo y de su cuantización. Un modelo de 7000 millones de parámetros cuantizado a 4 bits ocupa unos 4 GB, y la documentación de Ollama recomienda 8 GB de memoria gráfica o unificada para su modelo de ejemplo. Para un uso compartido por un equipo, hace falta una máquina dedicada con más memoria.