Edge AI im Einsatz: vom Bienenstock bis zur Werkstatt

Jersey, Sommer 2023. An einer Station neben den Bienenständen bleibt eine Kamera im Ruhezustand, bis ein Insekt von der Größe einer Hornisse ins Bild fliegt. Ein Raspberry Pi 4, der Computer in der Größe einer Kreditkarte, analysiert das Bild vor Ort und entscheidet: Europäische Hornisse, heimische Art, oder Vespa velutina, die Asiatische Hornisse, die Bienenvölker dezimiert. Nur im zweiten Fall geht eine SMS an ein Telefon. Dieses von der University of Exeter VespAI getaufte System ist ein guter Ausgangspunkt, um zu verstehen, was hinter Edge AI steckt und warum ein Teil der künstlichen Intelligenz die Rechenzentren verlässt und sich neben die Sensoren setzt.

Was Edge AI bezeichnet

Der englische Begriff Edge AI, auf Deutsch eingebettete KI oder KI am Netzwerkrand, bezeichnet ein Modell des maschinellen Lernens, das dort ausgeführt wird, wo die Daten entstehen: in einer Kamera, in einem Gehäuse am Fuß einer Maschine, in einem Traktor, in einem medizinischen Gerät. Der „Rand“ ist der des Netzwerks, im Gegensatz zum Zentrum, das die Server eines Cloud-Anbieters bilden.

Im Leben eines Modells muss man zwei Phasen unterscheiden. Das Training, das darin besteht, seine Parameter an Tausenden oder Millionen von Beispielen anzupassen, erfordert viel Rechenleistung und findet meist auf Servern statt. Die Inferenz, bei der das bereits trainierte Modell auf ein neues Bild oder ein neues Signal angewendet wird, ist wesentlich leichter. Diese zweite Phase rückt Edge AI näher an das Feld.

Die Veränderung liegt in dem, was im Netzwerk zirkuliert. In einer zentralisierten Architektur geht der Videostrom oder die Messreihe zum Server. Bei lokaler Verarbeitung wandert nur der Befund, in wenigen Byte: eine um 14:12 Uhr erkannte Asiatische Hornisse, eine Aufzugstür, deren Schwingungssignatur abdriftet.

Bandbreite und Latenz: was der Weg kostet

Die aussagekräftigsten Zahlen stammen aus der Videoüberwachung, wo das Datenvolumen gewaltig ist. In einem am 2. September 2026 veröffentlichten Vergleich schätzt der US-Anbieter Lumana, dass eine Kamera, deren Strom in der Cloud analysiert wird, dauerhaft 1 bis 2 Megabit pro Sekunde im Upload verbraucht, gegenüber einigen Kilobit pro Sekunde, wenn sie nur Alarme und Metadaten überträgt. Auf ein Unternehmen mit mehr als hundert Standorten umgerechnet, bemisst sich der Unterschied seiner Aussage nach in Gigabit pro Sekunde dauerhafter Bandbreite. Lumana nennt eine Verbrauchssenkung von bis zu 70 %. Die Zahl stammt von einem Anbieter, der solche Lösungen vertreibt, und die Größenordnung hängt naturgemäß von der Zahl der Kameras und der Häufigkeit der Ereignisse ab.

Dasselbe Dokument beziffert die durch eine entfernte Analyse hinzukommende Verzögerung auf eine bis fünf Sekunden, gegenüber einigen Millisekunden bei lokaler Verarbeitung. Für einen Wochenbericht spielt dieser Unterschied keine Rolle. Für einen Sicherheitsalarm in einem Lager, in dem Gabelstapler verkehren, entscheidet er darüber, ob der Alarm vor oder nach dem Vorfall eintrifft.

Der Profisport zeigt, was Echtzeit bedeutet. Hawk-Eye, eine Tochter von Sony, verfolgt während des Spiels 29 Punkte des Skeletts jedes Spielers; laut seiner Website kam seine halbautomatische Abseitsentscheidung bei mehr als 900 Spielen zum Einsatz. Die Berechnung erfolgt auf im Stadion installierten Servern und nicht in den Kameras, doch die Anforderung ist dieselbe: Eine Entscheidung, die nach der Wiederaufnahme des Spiels eintrifft, ist nutzlos.

Bleibt die Frage der Kontinuität. Ein System, das von einer Verbindung abhängt, steht still, wenn sie ausfällt. Lumana betont, dass eine lokale Architektur mit Speicher vor Ort während eines Ausfalls weiterläuft. Auf einer Baustelle oder in einer schlecht angebundenen Werkstatt wiegt diese Eigenschaft oft schwerer als die Latenz.

Was die CNIL zur lokalen Verarbeitung sagt

Für eine französische Organisation ist das entscheidende Argument oft ein rechtliches. Im Juli 2022 hat die CNIL ihre Position zu den sogenannten „intelligenten“ oder „augmentierten“ Kameras im öffentlichen Raum veröffentlicht. Das Dokument spricht sich weder für noch gegen eine Architektur aus. Es zählt jedoch Garantien auf, die die Risiken für gefilmte Personen verringern und bei der Beurteilung der Verhältnismäßigkeit einer Anlage ins Gewicht fallen.

Dazu gehören die Verringerung der Bildauflösung, die Verpixelung, ein „sparsamer“ Ansatz, der die Zahl der verarbeiteten Bilder begrenzt, und die lokale Verarbeitung der Daten, die die Kommission als „in physisch an die Kameras angeschlossenen Geräten“ erfolgend beschreibt. Sie nennt auch Mechanismen, die die Quellbilder fast sofort löschen oder nur anonyme Informationen erzeugen, etwa eine einfache Zählung von Durchgängen.

Diese Maßnahmen befreien weder von der DSGVO noch von einer Datenschutz-Folgenabschätzung, wenn sie erforderlich ist. Sie spiegeln ein Konstruktionsprinzip, das Ingenieure als Privacy by Design kennen: Daten, die den Standort nie verlassen, müssen weder bei der Übertragung noch bei einem Auftragsverarbeiter geschützt werden. Ein technischer Artikel zur Industriesicherheit, veröffentlicht von PowerGen Advancement, beschreibt dieselbe Logik auf Seiten der Fabrik: Verpixelung, Anonymisierung, Verschlüsselung und selektive Übertragung, bevor irgendetwas das Gelände verlässt.

VespAI, Anatomie eines autonomen Detektors

Kehren wir zur Hornisse zurück, denn das Projekt VespAI ist mit seltener Präzision dokumentiert. Der maßgebliche Artikel von Thomas O'Shea-Wheller, Peter Kennedy und ihren Kollegen von der University of Exeter erschien am 3. April 2024 in Communications Biology.

Der Ausgangspunkt ist ein Sortierproblem. Vespa velutina hat sich ab 2004 von Frankreich aus in Europa etabliert, und ihre Jagd auf Honigbienenvölker verringert deren Sammelaktivität und Überlebenschancen. Im Vereinigten Königreich beruht die Überwachung auf Meldungen von Imkern und der Öffentlichkeit. Die meisten dieser Meldungen betreffen jedoch in Wirklichkeit heimische Arten: Die Autoren beziffern ihre durchschnittliche Genauigkeit auf 0,06 %. Jedes Jahr müssen Tausende Fotos von Hand geprüft werden.

Das System begegnet diesem Problem mit gewöhnlicher Hardware. Eine Station mit Köder lockt Insekten unter eine Kamera mit 16 Megapixeln. Ein erster Bewegungserkennungsfilter verhindert, dass das Modell dauerhaft läuft. Das Modell selbst ist ein YOLOv5s, eine weit verbreitete Architektur zur Objekterkennung mit rund sieben Millionen Parametern. Parameter sind die Zahlenwerte, die das Training anpasst; zum Vergleich: Große Sprachmodelle haben Dutzende oder Hunderte Milliarden. Das Ganze läuft auf einem Raspberry Pi 4, versorgt von einem Akku mit 12.000 mAh und optional von einem 40-Watt-Solarpanel. Ein 4G-Modul erlaubt es, eine Warnung per SMS zu senden, wo es kein WLAN gibt.

Die Ergebnisse werden mit zwei klassischen Kennzahlen gemessen. Die Präzision gibt den Anteil der Alarme an, die richtig sind; der Recall den Anteil der tatsächlich vorhandenen Hornissen, die erkannt wurden. Der F1-Wert kombiniert beide. Unter Testbedingungen übersteigt das Modell bei diesem Wert 0,99. Bei 55 Versuchen an zwei Standorten auf Jersey im Jahr 2023, mit mehr als 5.500 Bildern, blieb die durchschnittliche Präzision größer oder gleich 0,99 und der durchschnittliche Recall über 0,93. Anders gesagt: Das System irrt sich sehr selten, wenn es Alarm gibt, und lässt einige Exemplare durch.

Das Modell entscheidet nicht allein über das weitere Vorgehen. Der Alarm kommt mit einem Bild, ein Mensch bestätigt ihn, und das Insekt kann lebend gefangen und bis zu seinem Nest verfolgt werden. Die Zerstörung des Nestes bleibt laut dem Team das einzige wirksame Mittel, ein Volk zu beseitigen.

Die Struktur dieses Projekts lässt sich weit über die Imkerei hinaus übertragen: ein günstiger Sensor, ein kompaktes, für eine einzige Aufgabe trainiertes Modell, eine autonome Stromversorgung und eine kurze Nachricht, die nur gesendet wird, wenn es etwas zu melden gibt.

Auf Feldern und in Werkstätten fällt die Entscheidung an der Maschine

Die Landwirtschaft hat eingebettete KI aus einem einfachen Grund übernommen: Eine fahrende Spritze kann nicht auf einen Server warten. Das System See & Spray von John Deere, von Vision Systems Design im August 2025 beschrieben, reiht 36 Industriekameras im Abstand von einem Meter an einem Gestänge von 120 Fuß, also rund 36 Metern. Mit Grafikprozessoren ausgestattete Recheneinheiten analysieren mehr als 2.000 Quadratfuß pro Sekunde, etwa 185 Quadratmeter, um ein Unkraut von einer Nutzpflanze zu unterscheiden und die Düse nur über Ersterem zu öffnen.

Derselbe Artikel beschreibt den LaserWeeder G2 von Carbon Robotics, der Unkraut mit dem Laser zerstört. Jedes Modul trägt drei Kameras, zwei NVIDIA-Grafikprozessoren und zwei Laser mit 240 Watt; die Maschine verarbeitet 4,7 Millionen Bilder pro Stunde, mit neuronalen Netzen, die an mehr als 40 Millionen annotierten Pflanzen trainiert wurden. Bei dieser Taktung hätte das Senden der Bilder an ein Rechenzentrum keinen Sinn: Der Traktor wäre an der Pflanze vorbei, bevor die Antwort zurückkommt.

In der Fabrik gilt die Logik für das Abhören der Maschinen. Ein Motor, eine Pumpe oder eine automatische Tür erzeugen dauerhaft Schwingungen, Wärme und Stromschwankungen. Ein auf das Gehäuse geklebter Sensor genügt, um sie zu messen, auch an einer zwanzig Jahre alten Anlage, die kein Hersteller zum Vernetzen vorgesehen hatte. Ingenieure sprechen von Retrofit: einen vorhandenen Maschinenpark ausrüsten, statt ihn zu ersetzen.

Eine von TDK SensEI veröffentlichte und im April 2026 von der Edge AI and Vision Alliance übernommene Fallstudie veranschaulicht den Ansatz. Ein weltweit tätiger Aufzughersteller, dessen Name nicht genannt wird, hat die Kabinentüren mit Schwingungssensoren ausgestattet, deren Signale lokal von der Lösung edgeRX analysiert werden. Laut dem Dokument gingen die ungeplanten Einsätze von 1,8 Tagen auf 1 Tag pro Jahr zurück, bei einer angegebenen jährlichen Einsparung von 192 Millionen Dollar, und die Einführung erforderte eine Woche Schulung vor Ort. Diese Zahlen stammen vom Anbieter und wurden nicht in einem veröffentlichten, unabhängigen Audit geprüft. Der Mechanismus dagegen ist klar: Ein Modell lernt die Signatur einer gut funktionierenden Tür und meldet die Abweichung vor dem Ausfall.

Auf ein kleineres Unternehmen übertragen, bleibt die Überlegung dieselbe. Man kann sich eine Bäckerei vorstellen, die an ihrem Ofen und ihrer Gärkammer einen Temperatur- und Stromsensor anbringt, mit einem Modell, das deren Normalbetrieb lernt und am Freitagabend warnt statt am Samstagmorgen. Das ist eine Möglichkeit, kein dokumentierter Fall, und sie erfordert keine dauerhafte Verbindung.

Ein Hörimplantat, das Geräusche ohne Netz klassifiziert

Das Gesundheitswesen treibt die Anforderung auf die Spitze. Ein am 27. November 2025 veröffentlichter Artikel von AI News beschreibt die Architektur des Systems Nucleus Nexa des australischen Unternehmens Cochlear. Im externen Prozessor ordnet ein SCAN 2 genannter, auf einem Entscheidungsbaum beruhender Klassifikator die Klangumgebung fünf Kategorien zu: Sprache, Sprache im Lärm, Lärm, Musik und Stille. Die Einstellung der Stimulation passt sich entsprechend an.

Drei Anforderungen erklären, warum diese Berechnung im Gerät erfolgt. Die Latenz zwischen Schall und dem an den Hörnerv gesendeten Signal muss unmerklich bleiben. Das Implantat muss bei minimalem Verbrauch mehr als vierzig Jahre halten. Und die Daten betreffen die Gesundheit einer Person. Cochlear gibt an, eine strikte Deidentifizierung anzuwenden, bevor die Daten sein Programm für Real-World-Daten speisen, das mehr als 500.000 Patienten umfasst. Firmware-Updates laufen über eine Funkverbindung kurzer Reichweite, und das Implantat speichert bis zu vier personalisierte Einstellungen.

Jan Janssen, technischer Leiter des Unternehmens, spricht von der künftigen Einführung tiefer neuronaler Netze für laute Umgebungen. Bis dahin genügt für eine klar abgegrenzte Aufgabe ein einfacher Entscheidungsbaum.

Auch Dokumente haben ihr Feld

Ein großer Teil der wirtschaftlichen Tätigkeit spielt sich an Text ab: Verträge, Rechnungen, Schreiben, Protokolle. Die Frage des Ortes stellt sich dort in denselben Begriffen, und sie hat sich mit dem Aufkommen kleiner Sprachmodelle, die auf einem Büro-Rechner laufen können, verändert.

Am 16. Oktober 2024 hat Mistral AI Ministral 3B und Ministral 8B vorgestellt, zwei Modelle mit 3 und 8 Milliarden Parametern, ausdrücklich für den lokalen Einsatz konzipiert. Der französische Anbieter nennt Übersetzung auf dem Gerät, Assistenten ohne Internet und lokale Analyse unter den angestrebten Einsatzfällen und behauptet, das kleinere der beiden übertreffe in den meisten Tests sein eigenes, ein Jahr zuvor erschienenes Modell mit 7 Milliarden Parametern. Modelle dieser Größe können Daten und Beträge aus einer Rechnung extrahieren, ein Protokoll zusammenfassen oder eine Frage zu einer Hausordnung beantworten. Sie bleiben bei langem Schlussfolgern oder sehr komplexen Dokumenten deutlich hinter den größten Modellen zurück.

Die folgenden Einsätze sind Projektionen, keine beobachteten Einführungen. Eine Anwaltskanzlei könnte die Klauseln von hundert Mietverträgen vergleichen, ohne dass die Unterlagen die Kanzlei verlassen. Ein Wirtschaftsprüfer könnte Rechnungen, Kontoauszüge und Buchungen auf einer Maschine in seinen Räumen abgleichen, was die Diskussion über das Berufsgeheimnis vereinfacht. Eine Gemeindeverwaltung könnte die Vorprüfung gängiger Anträge vorbereiten, ohne Personenstandsakten an einen ausländischen Dienstleister zu übermitteln. In der Verteidigung, wo schon die Weitergabe bestimmter Dokumente geregelt ist, ist eine Verarbeitung auf einem vom Netz isolierten Rechner oft die einzig denkbare Option. Ein Bäcker schließlich könnte seine Lieferantenangebote prüfen lassen oder seine Allergenblätter aktuell halten.

In all diesen Fällen betrifft die entscheidende Frage weniger die Fähigkeit des Modells, ein Dokument zu lesen, als den Weg dieses Dokuments während der Analyse. Eine in den Räumen installierte Maschine liefert eine überprüfbare Antwort: Die Datei geht hinein, das Ergebnis kommt heraus, nichts überschreitet die Firewall.

Lokal als Standard, Cloud auf Entscheidung

Rein lokal hat seine Grenzen, und die Anbieter selbst räumen sie ein. Lumana merkt an, dass die Verwaltung eines auf Dutzende Standorte verteilten Gerätebestands schnell aufwendig wird: Konfiguration, Überwachung, Wartung und vor allem die Aktualisierung der Modelle, die im Maßstab einer Flotte Wochen oder Monate dauern kann. Es plädiert für eine hybride Architektur, in der die Erkennung vor Ort und die Überwachung zentral erfolgt. Der Artikel von PowerGen Advancement schlägt dieselbe Aufteilung vor: Der Standort übernimmt Erkennung, Vertraulichkeit und schnelle Reaktion; die Cloud kümmert sich um standortübergreifende Dashboards, Trendanalyse und Modellverwaltung.

Die Forschung beschreibt feinere Schemata. Eine im Juli 2025 auf arXiv von Senyao Li und seinen Koautoren veröffentlichte Übersicht erfasst die Möglichkeiten, ein kleines lokales und ein großes entferntes Modell zusammenarbeiten zu lassen: jede Anfrage je nach Schwierigkeit an das eine oder das andere leiten, dem lokalen Modell die Vorverarbeitung und dem entfernten den anspruchsvollsten Teil überlassen oder das kleine Modell eine Wortfolge vorschlagen lassen, die das große überprüft.

Für ein Unternehmen ergibt sich daraus eine einfache Nutzungsregel. Die lokale Verarbeitung ist der Standardbetrieb: Die Daten bleiben vor Ort, die Antwort ist schnell, der Dienst läuft ohne Netz weiter. Das Senden an ein entferntes Modell wird zur ausdrücklichen Entscheidung, aufgabenweise getroffen, wenn ein leistungsfähigeres Modell einen echten Gewinn bringt, und die Organisation weiß genau, was hinausgeht und warum.

Diese Regel setzt eine vorherige Disziplin voraus. Man muss festgelegt haben, welche Informationskategorien nie hinausgehen, ab welchem Vertrauensniveau eine lokale Antwort geprüft oder eskaliert werden muss, wer einen Versand freigibt und wie jeder Versand protokolliert wird. Diese Entscheidungen gehören mehr zur Organisation als zur Technik, und man trifft sie besser vor der Einführung als nach dem ersten Vorfall.

Wie man einen ersten Anwendungsfall auswählt

Die in diesem Artikel genannten Projekte teilen ein Merkmal: einen engen Zuschnitt. Ein Insekt, ein Unkraut, eine Aufzugstür, fünf Klangkategorien. VespAI versucht nicht, alle Insekten Europas zu erkennen, und das Cochlear-Implantat transkribiert keine Gespräche. Die Präzision des Bedarfs erklärt einen guten Teil der Qualität des Ergebnisses.

Drei Fragen zeigen dann, ob eine lokale Verarbeitung geboten ist. Darf das erzeugte Datum das Unternehmen verlassen? Welche Antwortzeit ist akzeptabel? Was geschieht, wenn die Verbindung ausfällt? Ein Nein auf die erste, eine Antwortzeit im Bereich einer Sekunde oder darunter bei der zweiten oder eine Tätigkeit, die bei der dritten nicht unterbrochen werden darf, sprechen für Edge AI.

Der letzte Punkt betrifft die endgültige Entscheidung. Bei VespAI bestätigt ein Mensch den Alarm vor jeder Maßnahme. Bei der vorausschauenden Wartung meldet der Sensor, und der Techniker entscheidet über den Einsatz. Diese Aufteilung zwischen einer Maschine, die vorschlägt, und einer Fachkraft, die bestätigt, macht das Werkzeug in einer Werkstatt, einer Kanzlei oder einer Behörde akzeptabel, und sie erlaubt es, seine Fehler zu messen, statt sie zu erleiden.

HOMN SYSTEMS entwickelt nach diesem Prinzip Geräte für lokale KI für französische Unternehmen: Die Modelle laufen in den Räumen des Kunden, auf seinen Daten, und ein Versand an einen externen Dienst findet nur statt, wenn das Unternehmen ihn beschlossen hat und nachvollziehen kann. Der Ansatz von HOMN geht von derselben Feststellung aus wie die Ingenieure aus Exeter: Ein wachsender Teil der nützlichen Entscheidungen kann dort fallen, wo die Daten entstehen.

Was ist Edge AI, also eingebettete KI?

Edge AI bezeichnet die Ausführung eines Modells der künstlichen Intelligenz direkt dort, wo die Daten entstehen, in einer Kamera, einem Gerät, einer Maschine oder einem Apparat, statt auf den Servern eines Cloud-Anbieters. Das Modell wird in der Regel anderswo trainiert, danach erfolgt nur die Inferenz, also seine Anwendung auf neue Daten, vor Ort. Im Netzwerk zirkuliert dann ein kurzer Befund statt der Rohdaten.

Welche Vorteile hat KI im Feld gegenüber der Cloud?

Eine lokale Verarbeitung senkt die Latenz auf wenige Millisekunden, während eine entfernte Analyse laut einem 2026 veröffentlichten Vergleich von Lumana eine bis fünf Sekunden hinzufügen kann. Sie begrenzt die Bandbreite stark, da nur Alarme und Metadaten übertragen werden, und sie läuft bei einem Netzausfall weiter. Sie erlaubt es außerdem, sensible Daten am Standort zu behalten, eine Garantie, die die CNIL unter den Maßnahmen zum Schutz der Privatsphäre nennt.

Ist eingebettete KI mit der DSGVO vereinbar?

Lokale Verarbeitung befreit nicht von der DSGVO, erleichtert aber die Einhaltung ihrer Grundsätze der Datenminimierung und des Datenschutzes durch Technikgestaltung. In ihrer Position vom Juli 2022 zu augmentierten Kameras nennt die CNIL die Verarbeitung in an die Kameras angeschlossenen Geräten, die fast sofortige Löschung der Quellbilder und die Erzeugung anonymer Informationen als nützliche Garantien. Eine Datenschutz-Folgenabschätzung bleibt erforderlich, wenn die Verarbeitung ein hohes Risiko für die Personen birgt.

Muss man zwischen lokaler KI und Cloud wählen?

Die meisten neueren Architekturen kombinieren beides: Erkennung und Verarbeitung sensibler Daten erfolgen vor Ort, während Überwachung, standortübergreifende Dashboards und Modellaktualisierung über einen zentralen Dienst laufen. Für Sprachmodelle beschreibt die Forschung Schemata, in denen ein kleines lokales Modell die Mehrheit der Anfragen bearbeitet und nur einige an ein großes entferntes Modell weitergibt, wenn das gerechtfertigt ist. In jedem Fall sollte jeder Versand nach außen eine ausdrückliche und nachvollziehbare Entscheidung sein.