Edge AI : comment l'IA embarquée travaille sur le terrain, de la ruche à l'atelier

Jersey, été 2023. Sur une station posée près des ruchers, une caméra reste en veille jusqu'à ce qu'un insecte de la taille d'un frelon entre dans le champ. Un Raspberry Pi 4, l'ordinateur de la taille d'une carte de crédit, analyse l'image sur place et tranche : frelon européen, espèce locale, ou Vespa velutina, le frelon asiatique qui décime les colonies d'abeilles. Dans le second cas seulement, un SMS part vers un téléphone. Ce dispositif, baptisé VespAI par l'université d'Exeter, est un bon point de départ pour comprendre ce que recouvre l'edge AI, et pourquoi une partie de l'intelligence artificielle quitte les centres de données pour s'installer à côté des capteurs.

Ce que désigne l'edge AI

Le terme anglais edge AI, que l'on traduit par IA embarquée ou IA de périphérie, désigne un modèle d'apprentissage automatique qui s'exécute là où la donnée est produite : dans une caméra, dans un boîtier fixé au pied d'une machine, dans un tracteur, dans un appareil médical. Le « bord » en question est celui du réseau, par opposition au centre que constituent les serveurs d'un fournisseur de cloud.

Il faut distinguer deux temps dans la vie d'un modèle. L'entraînement, qui consiste à ajuster ses paramètres sur des milliers ou des millions d'exemples, demande beaucoup de calcul et se fait le plus souvent sur des serveurs. L'inférence, qui consiste à appliquer le modèle déjà entraîné à une nouvelle image ou à un nouveau signal, est bien plus légère. C'est cette seconde étape que l'edge AI rapproche du terrain.

Le changement tient à ce qui circule sur le réseau. Dans une architecture centralisée, le flux vidéo ou la série de mesures part vers le serveur. Avec un traitement local, seule la conclusion voyage, en quelques octets : un frelon asiatique détecté à 14 h 12, une porte d'ascenseur dont la signature vibratoire dérive.

Bande passante et latence : ce que coûte le trajet

Les chiffres les plus parlants viennent de la vidéosurveillance, où le volume de données est massif. Dans un comparatif publié le 2 septembre 2026, l'éditeur américain Lumana estime qu'une caméra dont le flux est analysé dans le cloud consomme en continu 1 à 2 mégabits par seconde en envoi, contre quelques kilobits par seconde lorsqu'elle ne transmet que des alertes et des métadonnées. Rapporté à une entreprise de plus de cent sites, l'écart se compte selon lui en gigabits par seconde de bande passante soutenue. Lumana avance une réduction de consommation pouvant atteindre 70 %. Le chiffre vient d'un vendeur qui commercialise ce type de solution, et l'ordre de grandeur dépend évidemment du nombre de caméras et de la fréquence des événements.

Le même document chiffre le délai ajouté par une analyse distante à une à cinq secondes, contre quelques millisecondes pour un traitement local. Pour un rapport hebdomadaire, cette différence ne compte pas. Pour une alerte de sécurité dans un entrepôt où circulent des chariots élévateurs, elle détermine si l'alerte arrive avant ou après l'incident.

Le sport professionnel montre ce que signifie le temps réel. Hawk-Eye, filiale de Sony, suit 29 points du squelette de chaque joueur pendant le match ; selon son site, son hors-jeu semi-automatisé a servi sur plus de 900 rencontres. Le calcul se fait sur des serveurs installés au stade plutôt que dans les caméras, mais la contrainte est la même : une décision qui arrive après la reprise du jeu ne sert à rien.

Reste la question de la continuité. Un système qui dépend d'une connexion s'arrête quand elle tombe. Lumana souligne qu'une architecture locale, adossée à un stockage sur site, continue de fonctionner pendant une coupure. Sur un chantier ou dans un atelier mal desservi, cette propriété pèse souvent plus lourd que la latence.

Ce que la CNIL dit du traitement local

Pour une organisation française, l'argument décisif est souvent juridique. En juillet 2022, la CNIL a publié sa position sur les caméras dites « intelligentes » ou « augmentées » dans les espaces publics. Le document ne se prononce pas pour ou contre une architecture. Il énumère en revanche des garanties qui réduisent les risques pour les personnes filmées et qui pèsent dans l'appréciation de la proportionnalité d'un dispositif.

Parmi elles figurent l'abaissement de la définition des images, le floutage, une approche « frugale » qui limite le nombre d'images traitées, et le traitement local des données, que la Commission décrit comme réalisé « dans des dispositifs physiquement accolés aux caméras ». Elle cite aussi les mécanismes qui suppriment presque immédiatement les images sources ou qui ne produisent que des informations anonymes, par exemple un simple comptage de passages.

Ces mesures ne dispensent pas du RGPD, ni d'une analyse d'impact quand elle est requise. Elles traduisent un principe de conception que les ingénieurs connaissent sous le nom de privacy by design : une donnée qui ne quitte jamais le site n'a pas à être protégée pendant son transfert, ni chez un sous-traitant. Un article technique consacré à la sécurité industrielle, publié par PowerGen Advancement, décrit la même logique côté usine : floutage, anonymisation, chiffrement et envoi sélectif avant que quoi que ce soit ne sorte de l'enceinte.

VespAI, anatomie d'un détecteur autonome

Revenons au frelon, parce que le projet VespAI est documenté avec une précision rare. L'article de référence, signé par Thomas O'Shea-Wheller, Peter Kennedy et leurs collègues de l'université d'Exeter, a paru dans Communications Biology le 3 avril 2024.

Le point de départ est un problème de tri. Vespa velutina s'est installé en Europe à partir de 2004, par la France, et sa prédation sur les colonies d'abeilles mellifères réduit leur activité de butinage et leurs chances de survie. Au Royaume-Uni, la surveillance repose sur les signalements des apiculteurs et du public. Or la plupart de ces signalements concernent en réalité des espèces locales : les auteurs évaluent leur exactitude moyenne à 0,06 %. Chaque année, des milliers de photos doivent être vérifiées à la main.

Le dispositif répond à ce problème avec un matériel ordinaire. Une station appâtée attire les insectes sous une caméra de 16 mégapixels. Un premier filtre de détection de mouvement évite de faire tourner le modèle en permanence. Le modèle lui-même est un YOLOv5s, une architecture de détection d'objets très répandue, qui compte environ sept millions de paramètres. Les paramètres sont les valeurs numériques que l'entraînement ajuste ; à titre de comparaison, les grands modèles de langage en comptent des dizaines ou des centaines de milliards. L'ensemble tourne sur un Raspberry Pi 4, alimenté par une batterie de 12 000 mAh et, en option, par un panneau solaire de 40 watts. Un module 4G permet d'envoyer une alerte par SMS là où il n'y a pas de Wi-Fi.

Les résultats sont mesurés avec deux indicateurs classiques. La précision indique la part des alertes qui sont justes ; le rappel, la part des frelons réellement présents qui ont été détectés. Le score F1 combine les deux. En conditions de test, le modèle dépasse 0,99 sur ce score. Lors de 55 essais menés sur deux sites de Jersey en 2023, sur plus de 5 500 images, la précision moyenne est restée supérieure ou égale à 0,99 et le rappel moyen au-dessus de 0,93. Autrement dit, le système se trompe très rarement quand il donne l'alerte, et il laisse passer quelques individus.

Le modèle ne décide pas seul de la suite. L'alerte arrive avec une image, un humain la confirme, et l'insecte peut être capturé vivant puis suivi jusqu'à son nid. La destruction du nid reste, selon l'équipe, le seul moyen efficace d'éliminer une colonie.

La structure de ce projet se transpose bien au-delà de l'apiculture : un capteur bon marché, un modèle compact entraîné pour une seule tâche, une alimentation autonome, et un message court envoyé uniquement quand il y a quelque chose à signaler.

Dans les champs et les ateliers, la décision se prend sur la machine

L'agriculture a adopté l'IA embarquée pour une raison simple : un pulvérisateur en mouvement ne peut pas attendre un serveur. Le système See & Spray de John Deere, décrit par Vision Systems Design en août 2025, aligne 36 caméras industrielles espacées d'un mètre sur une rampe de 120 pieds, soit environ 36 mètres. Des unités de traitement équipées de processeurs graphiques analysent plus de 2 000 pieds carrés par seconde, environ 185 mètres carrés, pour distinguer une adventice d'une plante cultivée et n'ouvrir la buse qu'au-dessus de la première.

Le même article décrit le LaserWeeder G2 de Carbon Robotics, qui détruit les mauvaises herbes au laser. Chaque module embarque trois caméras, deux processeurs graphiques NVIDIA et deux lasers de 240 watts ; la machine traite 4,7 millions d'images par heure, avec des réseaux de neurones entraînés sur plus de 40 millions de plantes annotées. À cette cadence, l'envoi des images vers un centre de données n'aurait pas de sens : le tracteur aurait dépassé la plante avant le retour de la réponse.

À l'usine, la logique s'applique à l'écoute des machines. Un moteur, une pompe ou une porte automatique produisent en permanence des vibrations, de la chaleur et des variations de courant. Un capteur collé sur le carter suffit à les mesurer, y compris sur un équipement de vingt ans qu'aucun fabricant n'avait prévu de connecter. Les ingénieurs parlent de retrofit : équiper un parc existant plutôt que le remplacer.

Une étude de cas publiée par TDK SensEI, et reprise en avril 2026 par l'Edge AI and Vision Alliance, illustre l'approche. Un fabricant mondial d'ascenseurs, dont le nom n'est pas communiqué, a équipé les portes de cabine de capteurs de vibration dont les signaux sont analysés localement par la solution edgeRX. Selon le document, les interventions non planifiées sont passées de 1,8 jour à 1 jour par an, pour une économie annuelle annoncée de 192 millions de dollars, et le déploiement a demandé une semaine de formation sur site. Ces chiffres proviennent du fournisseur et n'ont pas fait l'objet d'un audit indépendant publié. Le mécanisme, lui, est clair : un modèle apprend la signature d'une porte qui fonctionne bien et signale l'écart avant la panne.

Transposé à une entreprise plus petite, le raisonnement reste le même. On peut imaginer une boulangerie qui pose un capteur de température et de courant sur son four et sa chambre de pousse, avec un modèle qui apprend leur fonctionnement normal et prévient le vendredi soir plutôt que le samedi matin. C'est une possibilité, pas un cas documenté, et elle ne demande aucune connexion permanente.

Un implant auditif qui classe les sons sans réseau

La santé pousse la contrainte à son maximum. Un article d'AI News publié le 27 novembre 2025 détaille l'architecture du système Nucleus Nexa de l'australien Cochlear. Dans le processeur externe, un classifieur nommé SCAN 2, fondé sur un arbre de décision, range l'environnement sonore en cinq catégories : parole, parole dans le bruit, bruit, musique et silence. Le réglage de la stimulation s'adapte en conséquence.

Trois contraintes expliquent que ce calcul se fasse sur l'appareil. La latence doit rester imperceptible entre le son et le signal envoyé au nerf auditif. L'implant doit durer plus de quarante ans avec une consommation minimale. Et les données concernent la santé d'une personne. Cochlear indique appliquer une désidentification stricte avant que les données n'alimentent son programme de données de vie réelle, qui porte sur plus de 500 000 patients. Les mises à jour du micrologiciel passent par une liaison radio de courte portée, et l'implant conserve jusqu'à quatre réglages personnalisés en mémoire.

Jan Janssen, directeur technique de l'entreprise, évoque l'arrivée future de réseaux de neurones profonds pour les environnements bruyants. En attendant, un simple arbre de décision suffit pour une tâche bien délimitée.

Les documents aussi ont un terrain

Une grande partie de l'activité économique se joue sur du texte : contrats, factures, courriers, procès-verbaux. La question de la localisation s'y pose dans les mêmes termes, et elle a changé de nature avec l'arrivée de petits modèles de langage capables de tourner sur un ordinateur de bureau.

Le 16 octobre 2024, Mistral AI a présenté Ministral 3B et Ministral 8B, deux modèles de 3 et 8 milliards de paramètres conçus explicitement pour un usage local. L'éditeur français cite la traduction sur l'appareil, les assistants fonctionnant sans internet et l'analyse locale parmi les cas d'usage visés, et affirme que le plus petit des deux dépasse sur la plupart de ses tests son propre modèle de 7 milliards de paramètres sorti un an plus tôt. Des modèles de cette taille savent extraire des dates et des montants d'une facture, résumer un compte rendu ou répondre à une question sur un règlement intérieur. Ils restent nettement en dessous des plus grands modèles sur le raisonnement long ou les documents très complexes.

Les usages suivants sont des projections, pas des déploiements observés. Un cabinet d'avocats pourrait comparer les clauses d'une centaine de baux sans que les pièces sortent du cabinet. Un commissaire aux comptes pourrait rapprocher factures, relevés bancaires et écritures sur une machine placée dans ses locaux, ce qui simplifie la discussion sur le secret professionnel. Une mairie pourrait préparer la pré-instruction de demandes courantes sans transmettre de dossiers d'état civil à un prestataire étranger. Dans la défense, où la circulation même de certains documents est encadrée, un traitement sur un poste isolé du réseau est souvent la seule option envisageable. Un boulanger, enfin, pourrait faire relire ses devis fournisseurs ou tenir à jour ses fiches allergènes.

Dans tous ces cas, la question pertinente porte moins sur la capacité du modèle à lire un document que sur le trajet de ce document pendant l'analyse. Une machine installée dans les locaux apporte une réponse vérifiable : le fichier entre, le résultat sort, rien ne franchit le pare-feu.

Local par défaut, cloud sur décision

Le tout local a ses limites, et les fournisseurs eux-mêmes les reconnaissent. Lumana note que la gestion d'un parc d'équipements répartis sur des dizaines de sites devient vite lourde : configuration, surveillance, maintenance, et surtout mise à jour des modèles, qui peut prendre des semaines ou des mois à l'échelle d'une flotte. Il défend une architecture hybride, où la détection se fait sur place et la supervision au centre. L'article de PowerGen Advancement propose la même répartition : le site gère la détection, la confidentialité et la réaction rapide ; le cloud se charge des tableaux de bord multisites, de l'analyse de tendance et de la gestion des modèles.

La recherche décrit des schémas plus fins. Une revue publiée sur arXiv en juillet 2025 par Senyao Li et ses coauteurs recense les façons de faire collaborer un petit modèle local et un grand modèle distant : router chaque requête vers l'un ou l'autre selon sa difficulté, confier au local le prétraitement et au distant la partie la plus exigeante, ou laisser le petit modèle proposer une suite de mots que le grand vérifie.

Pour une entreprise, cela se traduit par une règle d'usage simple. Le traitement local est le régime par défaut : les données restent sur place, la réponse est rapide, le service continue sans réseau. L'envoi vers un modèle distant devient un choix explicite, fait tâche par tâche, quand un modèle plus puissant apporte un gain réel, et l'organisation sait exactement ce qui part et pourquoi.

Cette règle suppose une discipline préalable. Il faut avoir défini les catégories d'informations qui ne sortent jamais, le niveau de confiance en dessous duquel une réponse locale doit être vérifiée ou escaladée, la personne qui valide un envoi, et la manière dont chaque envoi est journalisé. Ces décisions relèvent de l'organisation plus que de la technique, et il vaut mieux les prendre avant le déploiement qu'après le premier incident.

Comment choisir un premier cas d'usage

Les projets cités dans cet article partagent un trait : un périmètre étroit. Un insecte, une mauvaise herbe, une porte d'ascenseur, cinq catégories de sons. VespAI ne cherche pas à reconnaître tous les insectes d'Europe, et l'implant Cochlear ne transcrit pas les conversations. La précision du besoin explique une bonne part de la qualité du résultat.

Trois questions permettent ensuite de savoir si un traitement local s'impose. La donnée produite a-t-elle le droit de quitter l'entreprise ? Quel délai de réponse est acceptable ? Que se passe-t-il si la connexion tombe ? Une réponse négative à la première, un délai de l'ordre de la seconde ou moins pour la deuxième, ou une activité qui ne peut pas s'interrompre pour la troisième orientent vers l'edge AI.

Le dernier point concerne la décision finale. Dans VespAI, un humain confirme l'alerte avant toute action. Dans la maintenance prédictive, le capteur prévient et le technicien décide d'intervenir. Ce partage entre une machine qui propose et un professionnel qui valide rend l'outil acceptable dans un atelier, un cabinet ou un service public, et il permet de mesurer ses erreurs au lieu de les subir.

HOMN SYSTEMS conçoit des boîtiers d'IA locale pour les entreprises françaises sur ce principe : les modèles tournent dans les locaux du client, sur ses données, et un envoi vers un service extérieur n'a lieu que lorsque l'entreprise l'a décidé et peut le retracer. L'approche de HOMN part du même constat que les ingénieurs d'Exeter : une partie croissante des décisions utiles peut se prendre à l'endroit où la donnée apparaît.

Qu'est-ce que l'edge AI, ou IA embarquée ?

L'edge AI désigne l'exécution d'un modèle d'intelligence artificielle directement là où la donnée est produite, dans une caméra, un boîtier, une machine ou un appareil, plutôt que sur les serveurs d'un fournisseur de cloud. Le modèle est généralement entraîné ailleurs, puis seule l'inférence, c'est-à-dire son application à de nouvelles données, se fait sur place. Ce qui circule sur le réseau est alors une conclusion courte plutôt que la donnée brute.

Quels sont les avantages de l'IA de terrain par rapport au cloud ?

Un traitement local réduit la latence à quelques millisecondes, là où une analyse distante peut ajouter une à cinq secondes selon un comparatif de Lumana publié en 2026. Il limite fortement la bande passante, puisque seules les alertes et métadonnées sont transmises, et il continue de fonctionner pendant une coupure réseau. Il permet aussi de garder les données sensibles sur le site, une garantie que la CNIL cite parmi les mesures de protection de la vie privée.

L'IA embarquée est-elle compatible avec le RGPD ?

Le traitement local ne dispense pas du RGPD, mais il facilite le respect de ses principes de minimisation et de protection dès la conception. Dans sa position de juillet 2022 sur les caméras augmentées, la CNIL mentionne le traitement dans des dispositifs accolés aux caméras, la suppression quasi immédiate des images sources et la production d'informations anonymes comme garanties utiles. Une analyse d'impact reste nécessaire lorsque le traitement présente un risque élevé pour les personnes.

Faut-il choisir entre IA locale et cloud ?

La plupart des architectures récentes combinent les deux : la détection et le traitement des données sensibles se font sur place, tandis que la supervision, les tableaux de bord multisites et la mise à jour des modèles passent par un service central. Pour les modèles de langage, la recherche décrit des schémas où un petit modèle local traite la majorité des requêtes et n'en transmet certaines à un grand modèle distant que lorsque c'est justifié. Dans tous les cas, chaque envoi vers l'extérieur devrait être une décision explicite et traçable.