Edge AI: la IA embarcada sobre el terreno, de la colmena al taller

Jersey, verano de 2023. En una estación colocada junto a los colmenares, una cámara permanece en reposo hasta que un insecto del tamaño de un avispón entra en su campo. Una Raspberry Pi 4, el ordenador del tamaño de una tarjeta de crédito, analiza la imagen en el sitio y decide: avispón europeo, especie local, o Vespa velutina, el avispón asiático que diezma las colonias de abejas. Solo en el segundo caso se envía un SMS a un teléfono. Este dispositivo, bautizado VespAI por la Universidad de Exeter, es un buen punto de partida para entender qué abarca la edge AI y por qué una parte de la inteligencia artificial abandona los centros de datos para instalarse junto a los sensores.

Qué designa la edge AI

El término inglés edge AI, que se traduce como IA embarcada o IA de periferia, designa un modelo de aprendizaje automático que se ejecuta allí donde se produce el dato: en una cámara, en una caja fijada al pie de una máquina, en un tractor, en un aparato médico. El «borde» en cuestión es el de la red, por oposición al centro que constituyen los servidores de un proveedor de nube.

Hay que distinguir dos momentos en la vida de un modelo. El entrenamiento, que consiste en ajustar sus parámetros con miles o millones de ejemplos, requiere mucho cálculo y se realiza casi siempre en servidores. La inferencia, que consiste en aplicar el modelo ya entrenado a una imagen o a una señal nuevas, es mucho más ligera. Esta segunda etapa es la que la edge AI acerca al terreno.

El cambio está en lo que circula por la red. En una arquitectura centralizada, el flujo de vídeo o la serie de mediciones parte hacia el servidor. Con un tratamiento local, solo viaja la conclusión, en unos pocos bytes: un avispón asiático detectado a las 14:12, una puerta de ascensor cuya firma vibratoria se desvía.

Ancho de banda y latencia: lo que cuesta el trayecto

Las cifras más elocuentes proceden de la videovigilancia, donde el volumen de datos es masivo. En una comparativa publicada el 2 de septiembre de 2026, la empresa estadounidense Lumana estima que una cámara cuyo flujo se analiza en la nube consume de forma continua de 1 a 2 megabits por segundo de subida, frente a unos pocos kilobits por segundo cuando solo transmite alertas y metadatos. Referida a una empresa de más de cien sedes, la diferencia se cuenta, según ella, en gigabits por segundo de ancho de banda sostenido. Lumana plantea una reducción del consumo que puede alcanzar el 70 %. La cifra procede de un vendedor que comercializa este tipo de solución, y el orden de magnitud depende evidentemente del número de cámaras y de la frecuencia de los eventos.

El mismo documento cuantifica el retraso añadido por un análisis remoto entre uno y cinco segundos, frente a unos milisegundos para un tratamiento local. Para un informe semanal, esta diferencia no cuenta. Para una alerta de seguridad en un almacén por donde circulan carretillas elevadoras, determina si la alerta llega antes o después del incidente.

El deporte profesional muestra lo que significa el tiempo real. Hawk-Eye, filial de Sony, sigue 29 puntos del esqueleto de cada jugador durante el partido; según su sitio web, su fuera de juego semiautomatizado se ha utilizado en más de 900 encuentros. El cálculo se hace en servidores instalados en el estadio y no en las cámaras, pero la restricción es la misma: una decisión que llega después de que se reanude el juego no sirve de nada.

Queda la cuestión de la continuidad. Un sistema que depende de una conexión se detiene cuando esta cae. Lumana subraya que una arquitectura local, respaldada por un almacenamiento en el sitio, sigue funcionando durante un corte. En una obra o en un taller mal conectado, esta propiedad suele pesar más que la latencia.

Lo que dice la CNIL sobre el tratamiento local

Para una organización francesa, el argumento decisivo suele ser jurídico. En julio de 2022, la CNIL publicó su posición sobre las cámaras llamadas «inteligentes» o «aumentadas» en los espacios públicos. El documento no se pronuncia a favor ni en contra de una arquitectura. En cambio, enumera garantías que reducen los riesgos para las personas filmadas y que pesan en la apreciación de la proporcionalidad de un dispositivo.

Entre ellas figuran la reducción de la definición de las imágenes, el difuminado, un enfoque «frugal» que limita el número de imágenes procesadas y el tratamiento local de los datos, que la Comisión describe como realizado «en dispositivos físicamente acoplados a las cámaras». También cita los mecanismos que suprimen casi de inmediato las imágenes de origen o que solo producen información anónima, por ejemplo un simple recuento de pasos.

Estas medidas no eximen del RGPD ni de una evaluación de impacto cuando es exigible. Traducen un principio de diseño que los ingenieros conocen como privacy by design: un dato que nunca abandona el sitio no tiene que protegerse durante su transferencia ni en un subcontratista. Un artículo técnico dedicado a la seguridad industrial, publicado por PowerGen Advancement, describe la misma lógica en el lado de la fábrica: difuminado, anonimización, cifrado y envío selectivo antes de que nada salga del recinto.

VespAI, anatomía de un detector autónomo

Volvamos al avispón, porque el proyecto VespAI está documentado con una precisión poco habitual. El artículo de referencia, firmado por Thomas O'Shea-Wheller, Peter Kennedy y sus colegas de la Universidad de Exeter, apareció en Communications Biology el 3 de abril de 2024.

El punto de partida es un problema de clasificación. Vespa velutina se instaló en Europa a partir de 2004, por Francia, y su depredación sobre las colonias de abejas melíferas reduce su actividad de pecoreo y sus posibilidades de supervivencia. En el Reino Unido, la vigilancia se basa en los avisos de los apicultores y del público. Pero la mayoría de esos avisos se refieren en realidad a especies locales: los autores evalúan su exactitud media en un 0,06 %. Cada año, miles de fotos deben verificarse a mano.

El dispositivo responde a este problema con un hardware corriente. Una estación con cebo atrae a los insectos bajo una cámara de 16 megapíxeles. Un primer filtro de detección de movimiento evita ejecutar el modelo de forma permanente. El propio modelo es un YOLOv5s, una arquitectura de detección de objetos muy extendida, que cuenta con unos siete millones de parámetros. Los parámetros son los valores numéricos que ajusta el entrenamiento; a modo de comparación, los grandes modelos de lenguaje tienen decenas o cientos de miles de millones. El conjunto funciona en una Raspberry Pi 4, alimentada por una batería de 12 000 mAh y, opcionalmente, por un panel solar de 40 vatios. Un módulo 4G permite enviar una alerta por SMS donde no hay wifi.

Los resultados se miden con dos indicadores clásicos. La precisión indica la parte de las alertas que son correctas; la exhaustividad, la parte de los avispones realmente presentes que han sido detectados. La puntuación F1 combina ambas. En condiciones de prueba, el modelo supera 0,99 en esta puntuación. En 55 ensayos realizados en dos emplazamientos de Jersey en 2023, sobre más de 5500 imágenes, la precisión media se mantuvo igual o superior a 0,99 y la exhaustividad media por encima de 0,93. Dicho de otro modo, el sistema se equivoca muy raramente cuando da la alerta y deja pasar algunos individuos.

El modelo no decide solo lo que sigue. La alerta llega con una imagen, un humano la confirma y el insecto puede capturarse vivo y seguirse hasta su nido. La destrucción del nido sigue siendo, según el equipo, el único medio eficaz de eliminar una colonia.

La estructura de este proyecto se traslada bien más allá de la apicultura: un sensor barato, un modelo compacto entrenado para una sola tarea, una alimentación autónoma y un mensaje corto enviado únicamente cuando hay algo que señalar.

En los campos y los talleres, la decisión se toma en la máquina

La agricultura ha adoptado la IA embarcada por una razón sencilla: un pulverizador en movimiento no puede esperar a un servidor. El sistema See & Spray de John Deere, descrito por Vision Systems Design en agosto de 2025, alinea 36 cámaras industriales espaciadas un metro en una barra de 120 pies, unos 36 metros. Unidades de procesamiento equipadas con procesadores gráficos analizan más de 2000 pies cuadrados por segundo, unos 185 metros cuadrados, para distinguir una mala hierba de una planta cultivada y abrir la boquilla solo sobre la primera.

El mismo artículo describe el LaserWeeder G2 de Carbon Robotics, que destruye las malas hierbas con láser. Cada módulo incorpora tres cámaras, dos procesadores gráficos NVIDIA y dos láseres de 240 vatios; la máquina procesa 4,7 millones de imágenes por hora, con redes neuronales entrenadas con más de 40 millones de plantas anotadas. A este ritmo, enviar las imágenes a un centro de datos no tendría sentido: el tractor habría rebasado la planta antes de que volviera la respuesta.

En la fábrica, la lógica se aplica a la escucha de las máquinas. Un motor, una bomba o una puerta automática producen de forma permanente vibraciones, calor y variaciones de corriente. Un sensor pegado a la carcasa basta para medirlos, incluso en un equipo de veinte años que ningún fabricante había previsto conectar. Los ingenieros hablan de retrofit: equipar un parque existente en lugar de sustituirlo.

Un estudio de caso publicado por TDK SensEI, y recogido en abril de 2026 por la Edge AI and Vision Alliance, ilustra el enfoque. Un fabricante mundial de ascensores, cuyo nombre no se comunica, equipó las puertas de cabina con sensores de vibración cuyas señales se analizan localmente con la solución edgeRX. Según el documento, las intervenciones no planificadas pasaron de 1,8 días a 1 día al año, con un ahorro anual anunciado de 192 millones de dólares, y el despliegue requirió una semana de formación en el sitio. Estas cifras proceden del proveedor y no han sido objeto de una auditoría independiente publicada. El mecanismo, en cambio, es claro: un modelo aprende la firma de una puerta que funciona bien y señala la desviación antes de la avería.

Trasladado a una empresa más pequeña, el razonamiento sigue siendo el mismo. Cabe imaginar una panadería que coloca un sensor de temperatura y de corriente en su horno y en su cámara de fermentación, con un modelo que aprende su funcionamiento normal y avisa el viernes por la noche en lugar del sábado por la mañana. Es una posibilidad, no un caso documentado, y no requiere ninguna conexión permanente.

Un implante auditivo que clasifica los sonidos sin red

La salud lleva la restricción al máximo. Un artículo de AI News publicado el 27 de noviembre de 2025 detalla la arquitectura del sistema Nucleus Nexa de la australiana Cochlear. En el procesador externo, un clasificador llamado SCAN 2, basado en un árbol de decisión, ordena el entorno sonoro en cinco categorías: voz, voz con ruido, ruido, música y silencio. El ajuste de la estimulación se adapta en consecuencia.

Tres restricciones explican que este cálculo se haga en el propio aparato. La latencia debe seguir siendo imperceptible entre el sonido y la señal enviada al nervio auditivo. El implante debe durar más de cuarenta años con un consumo mínimo. Y los datos conciernen a la salud de una persona. Cochlear indica que aplica una desidentificación estricta antes de que los datos alimenten su programa de datos de la vida real, que abarca a más de 500 000 pacientes. Las actualizaciones del firmware pasan por un enlace de radio de corto alcance, y el implante conserva hasta cuatro ajustes personalizados en memoria.

Jan Janssen, director técnico de la empresa, menciona la llegada futura de redes neuronales profundas para entornos ruidosos. Mientras tanto, un simple árbol de decisión basta para una tarea bien delimitada.

Los documentos también tienen su terreno

Una gran parte de la actividad económica se desarrolla sobre texto: contratos, facturas, cartas, actas. La cuestión de la ubicación se plantea allí en los mismos términos, y ha cambiado de naturaleza con la llegada de modelos de lenguaje pequeños capaces de funcionar en un ordenador de sobremesa.

El 16 de octubre de 2024, Mistral AI presentó Ministral 3B y Ministral 8B, dos modelos de 3000 y 8000 millones de parámetros diseñados explícitamente para un uso local. La empresa francesa cita la traducción en el dispositivo, los asistentes que funcionan sin internet y el análisis local entre los casos de uso previstos, y afirma que el más pequeño de los dos supera en la mayoría de sus pruebas a su propio modelo de 7000 millones de parámetros aparecido un año antes. Modelos de este tamaño saben extraer fechas e importes de una factura, resumir un acta o responder a una pregunta sobre un reglamento interno. Siguen estando claramente por debajo de los mayores modelos en razonamiento largo o en documentos muy complejos.

Los usos siguientes son proyecciones, no despliegues observados. Un despacho de abogados podría comparar las cláusulas de un centenar de contratos de arrendamiento sin que los documentos salgan del despacho. Un auditor de cuentas podría conciliar facturas, extractos bancarios y asientos en una máquina situada en sus instalaciones, lo que simplifica la discusión sobre el secreto profesional. Un ayuntamiento podría preparar la instrucción previa de solicitudes corrientes sin transmitir expedientes de registro civil a un proveedor extranjero. En defensa, donde la propia circulación de ciertos documentos está regulada, un tratamiento en un puesto aislado de la red es a menudo la única opción concebible. Un panadero, por último, podría hacer revisar los presupuestos de sus proveedores o mantener al día sus fichas de alérgenos.

En todos estos casos, la pregunta pertinente se refiere menos a la capacidad del modelo para leer un documento que al trayecto de ese documento durante el análisis. Una máquina instalada en las instalaciones aporta una respuesta verificable: el archivo entra, el resultado sale, nada atraviesa el cortafuegos.

Local por defecto, nube por decisión

El todo local tiene sus límites, y los propios proveedores los reconocen. Lumana señala que la gestión de un parque de equipos repartidos en decenas de sedes se vuelve rápidamente pesada: configuración, vigilancia, mantenimiento y, sobre todo, actualización de los modelos, que puede llevar semanas o meses a escala de una flota. Defiende una arquitectura híbrida, donde la detección se hace en el sitio y la supervisión en el centro. El artículo de PowerGen Advancement propone el mismo reparto: el sitio gestiona la detección, la confidencialidad y la reacción rápida; la nube se encarga de los paneles multisede, del análisis de tendencias y de la gestión de los modelos.

La investigación describe esquemas más finos. Una revisión publicada en arXiv en julio de 2025 por Senyao Li y sus coautores recoge las formas de hacer colaborar a un modelo pequeño local con un gran modelo remoto: enrutar cada solicitud hacia uno u otro según su dificultad, confiar al local el preprocesamiento y al remoto la parte más exigente, o dejar que el modelo pequeño proponga una secuencia de palabras que el grande verifica.

Para una empresa, esto se traduce en una regla de uso sencilla. El tratamiento local es el régimen por defecto: los datos permanecen en el sitio, la respuesta es rápida, el servicio continúa sin red. El envío a un modelo remoto pasa a ser una elección explícita, hecha tarea por tarea, cuando un modelo más potente aporta una ganancia real, y la organización sabe exactamente qué sale y por qué.

Esta regla supone una disciplina previa. Hay que haber definido las categorías de información que nunca salen, el nivel de confianza por debajo del cual una respuesta local debe verificarse o escalarse, la persona que valida un envío y la manera en que se registra cada envío. Estas decisiones corresponden a la organización más que a la técnica, y conviene tomarlas antes del despliegue y no después del primer incidente.

Cómo elegir un primer caso de uso

Los proyectos citados en este artículo comparten un rasgo: un perímetro estrecho. Un insecto, una mala hierba, una puerta de ascensor, cinco categorías de sonidos. VespAI no pretende reconocer todos los insectos de Europa, y el implante de Cochlear no transcribe las conversaciones. La precisión de la necesidad explica buena parte de la calidad del resultado.

Tres preguntas permiten después saber si se impone un tratamiento local. ¿Tiene el dato producido derecho a salir de la empresa? ¿Qué plazo de respuesta es aceptable? ¿Qué ocurre si cae la conexión? Una respuesta negativa a la primera, un plazo del orden de un segundo o menos para la segunda, o una actividad que no puede interrumpirse para la tercera, orientan hacia la edge AI.

El último punto concierne a la decisión final. En VespAI, un humano confirma la alerta antes de cualquier acción. En el mantenimiento predictivo, el sensor avisa y el técnico decide intervenir. Este reparto entre una máquina que propone y un profesional que valida hace aceptable la herramienta en un taller, un despacho o un servicio público, y permite medir sus errores en lugar de sufrirlos.

HOMN SYSTEMS diseña equipos de IA local para las empresas francesas sobre este principio: los modelos funcionan en las instalaciones del cliente, con sus datos, y un envío a un servicio externo solo se produce cuando la empresa lo ha decidido y puede rastrearlo. El enfoque de HOMN parte de la misma constatación que los ingenieros de Exeter: una parte creciente de las decisiones útiles puede tomarse en el lugar donde aparece el dato.

¿Qué es la edge AI, o IA embarcada?

La edge AI designa la ejecución de un modelo de inteligencia artificial directamente donde se produce el dato, en una cámara, una caja, una máquina o un aparato, en lugar de en los servidores de un proveedor de nube. El modelo suele entrenarse en otro lugar y solo la inferencia, es decir, su aplicación a datos nuevos, se realiza en el sitio. Lo que circula por la red es entonces una conclusión corta y no el dato en bruto.

¿Cuáles son las ventajas de la IA de campo frente a la nube?

Un tratamiento local reduce la latencia a unos milisegundos, mientras que un análisis remoto puede añadir de uno a cinco segundos según una comparativa de Lumana publicada en 2026. Limita fuertemente el ancho de banda, puesto que solo se transmiten las alertas y los metadatos, y sigue funcionando durante un corte de red. También permite mantener los datos sensibles en el sitio, una garantía que la CNIL cita entre las medidas de protección de la vida privada.

¿Es compatible la IA embarcada con el RGPD?

El tratamiento local no exime del RGPD, pero facilita el cumplimiento de sus principios de minimización y de protección desde el diseño. En su posición de julio de 2022 sobre las cámaras aumentadas, la CNIL menciona el tratamiento en dispositivos acoplados a las cámaras, la supresión casi inmediata de las imágenes de origen y la producción de información anónima como garantías útiles. Sigue siendo necesaria una evaluación de impacto cuando el tratamiento presenta un riesgo elevado para las personas.

¿Hay que elegir entre IA local y nube?

La mayoría de las arquitecturas recientes combinan ambas: la detección y el tratamiento de los datos sensibles se hacen en el sitio, mientras que la supervisión, los paneles multisede y la actualización de los modelos pasan por un servicio central. Para los modelos de lenguaje, la investigación describe esquemas en los que un modelo pequeño local trata la mayoría de las solicitudes y solo transmite algunas a un gran modelo remoto cuando está justificado. En todos los casos, cada envío al exterior debería ser una decisión explícita y trazable.