边缘AI:嵌入式AI如何在现场工作,从蜂箱到车间
泽西岛,2023年夏。在蜂场旁的一个监测站上,摄像头一直处于待机,直到一只大小如大黄蜂的昆虫进入视野。一台Raspberry Pi 4,那种信用卡大小的计算机,在现场分析图像并作出判断:是本地物种欧洲大黄蜂,还是正在毁灭蜂群的亚洲大黄蜂(Vespa velutina)。只有在后一种情况下,才会向手机发出一条短信。这套由埃克塞特大学命名为VespAI的装置,是理解边缘AI含义的好起点,也说明了为什么一部分人工智能正离开数据中心,转而安装在传感器旁边。
边缘AI指什么
英文术语edge AI,译为边缘AI或嵌入式AI,指在数据产生的地方运行的机器学习模型:在摄像头里,在固定于机器脚下的设备里,在拖拉机里,在医疗器械里。这里的“边缘”是网络的边缘,与云服务商服务器构成的中心相对。
要区分模型生命中的两个阶段。训练,即用成千上万乃至数百万个样本调整模型的参数,需要大量计算,通常在服务器上完成。推理,即把已经训练好的模型应用于新的图像或新的信号,则轻得多。边缘AI把后一阶段拉近到了现场。
变化在于网络上传输的是什么。在集中式架构中,视频流或测量序列被送往服务器。采用本地处理时,只有结论在网络中传输,只有几个字节:下午2点12分检测到一只亚洲大黄蜂,或一扇电梯门的振动特征出现漂移。
带宽与延迟:传输路径的代价
最有说服力的数字来自视频监控,那里的数据量极大。美国厂商Lumana在2026年9月2日发布的一份对比中估计,视频流在云端分析的摄像头,上传时持续占用每秒1至2兆比特,而只传输告警和元数据时,仅为每秒几千比特。该公司称,对于拥有一百多个站点的企业,两者的差距以持续带宽的每秒吉比特计。Lumana提出,消耗最多可降低70%。这个数字来自销售此类方案的厂商,其数量级显然取决于摄像头数量和事件发生的频率。
同一份文件估计,远程分析增加的延迟为一至五秒,而本地处理只需几毫秒。对于每周一次的报告,这个差别无关紧要。对于有叉车往来的仓库中的安全告警,它决定了告警是在事故之前还是之后到达。
职业体育展示了实时的含义。索尼旗下的Hawk-Eye在比赛期间跟踪每名球员骨架上的29个点;据其网站,其半自动越位判罚已用于900多场比赛。计算在球场内的服务器上而不是摄像头里完成,但约束是一样的:在比赛恢复之后才到达的判决毫无用处。
还有连续性的问题。依赖网络连接的系统,在连接中断时就停止工作。Lumana强调,依托现场存储的本地架构,在断网期间仍能继续运行。在工地或网络覆盖差的车间,这一特性往往比延迟更重要。
CNIL对本地处理的说法
对法国的组织来说,决定性的论据往往是法律方面的。2022年7月,CNIL发布了关于公共空间中所谓“智能”或“增强”摄像头的立场文件。该文件并不赞成或反对某种架构。但它列举了若干能降低被拍摄者风险、并在评估一套装置是否相称时有分量的保障措施。
其中包括降低图像清晰度、模糊处理、限制所处理图像数量的“节制”做法,以及本地处理数据,委员会将其描述为在“与摄像头物理相连的设备中”进行。它还列举了几乎立即删除源图像的机制,或只产生匿名信息的机制,例如单纯的通行计数。
这些措施并不免除GDPR的适用,在需要时也不免除影响评估。它们体现的是工程师们称为隐私设计(privacy by design)的设计原则:永远不离开现场的数据,既不必在传输中被保护,也不必在分包商那里被保护。PowerGen Advancement发表的一篇工业安全技术文章,描述了工厂一侧的同样逻辑:在任何东西离开厂区之前,先做模糊处理、匿名化、加密和选择性发送。
VespAI,一台自主探测器的剖析
回到大黄蜂,因为VespAI项目的记录精确得少见。参考论文由埃克塞特大学的Thomas O'Shea-Wheller、Peter Kennedy及其同事署名,于2024年4月3日发表在《Communications Biology》上。
出发点是一个筛选问题。Vespa velutina自2004年起经由法国在欧洲落脚,它对蜜蜂群的捕食降低了蜜蜂的采集活动和存活机会。在英国,监测依靠养蜂人和公众的报告。而这些报告大多其实涉及本地物种:作者估计其平均准确率为0.06%。每年都必须用人工核查成千上万张照片。
这套装置用普通硬件回应了这个问题。一个带诱饵的监测站把昆虫吸引到一台1 600万像素的摄像头下。第一道运动检测过滤,避免了模型持续运行。模型本身是YOLOv5s,一种非常普及的目标检测架构,约有七百万个参数。参数是训练所调整的数值;作为对比,大型语言模型有几百亿甚至几千亿个。整套设备运行在一台Raspberry Pi 4上,由12 000 mAh的电池供电,可选配40瓦的太阳能板。在没有Wi-Fi的地方,通过4G模块以短信发送告警。
结果用两个经典指标衡量。精确率表示告警中正确的比例;召回率表示实际存在的大黄蜂中被检测到的比例。F1分数将两者合并。在测试条件下,模型在该分数上超过0.99。2023年在泽西岛两个站点进行的55次试验中,涉及5 500多张图像,平均精确率始终不低于0.99,平均召回率高于0.93。也就是说,系统发出告警时很少出错,但会漏掉少数个体。
模型并不独自决定后续行动。告警附带一张图像,由人确认,昆虫可以被活捉并追踪到蜂巢。据团队称,摧毁蜂巢仍是消灭一个蜂群的唯一有效方法。
这个项目的结构远远可以推广到养蜂之外:一个廉价的传感器,一个只为单一任务训练的紧凑模型,独立的供电,以及只在有事可报时才发出的简短消息。
在田间和车间,决定在机器上作出
农业采用嵌入式AI的原因很简单:一台移动中的喷雾机不能等待服务器。Vision Systems Design在2025年8月描述的John Deere See & Spray系统,在一根120英尺(约36米)的喷杆上排列了36台工业摄像头,间距一米。配备图形处理器的处理单元每秒分析2 000多平方英尺(约185平方米),以区分杂草和作物,只在前者上方打开喷嘴。
同一篇文章还描述了Carbon Robotics的LaserWeeder G2,它用激光消灭杂草。每个模块搭载三台摄像头、两块NVIDIA图形处理器和两个240瓦的激光器;这台机器每小时处理470万张图像,所用神经网络在4 000多万株带标注的植物上训练而成。以这样的节奏,把图像发往数据中心毫无意义:回复还没回来,拖拉机已经驶过了那株植物。
在工厂里,这种逻辑适用于倾听机器。电机、水泵或自动门不断产生振动、热量和电流变化。一个贴在外壳上的传感器就足以测量它们,即使是没有厂商为联网做过任何设计的二十年老设备。工程师称之为改造(retrofit):为现有设备配备传感能力,而不是更换它们。
TDK SensEI发布、并于2026年4月被Edge AI and Vision Alliance转载的一个案例研究,说明了这种做法。一家全球电梯制造商(名称未公开)在轿厢门上安装了振动传感器,信号由edgeRX方案在本地分析。据该文件,非计划性维修由每年1.8天减少到1天,宣称每年节省1.92亿美元,部署只需要一周的现场培训。这些数字来自供应商,没有公开的独立审计。但机制是清楚的:模型学习一扇运行良好的门的特征,并在故障之前发出偏差信号。
换到较小的企业,道理依然相同。可以设想一家面包店在烤炉和发酵间上装一个温度和电流传感器,由模型学习它们的正常运行状态,在周五晚上而不是周六早上发出预警。这是一种可能,而不是有记录的案例,而且它不需要任何持续的网络连接。
一枚不联网就能对声音分类的听觉植入体
医疗把约束推到了极致。AI News于2025年11月27日发表的一篇文章,详细介绍了澳大利亚公司Cochlear的Nucleus Nexa系统的架构。在外置处理器中,一个名为SCAN 2、基于决策树的分类器,把声音环境分为五类:语音、噪声中的语音、噪声、音乐和静音。刺激的设置随之调整。
三项约束解释了为什么这项计算在设备上完成。从声音到发送给听神经的信号之间,延迟必须察觉不到。植入体必须以极低的功耗使用四十多年。而且这些数据关系到一个人的健康。Cochlear表示,在数据进入其涉及50多万名患者的真实世界数据项目之前,会进行严格的去标识化。固件更新通过短距离无线链路完成,植入体在内存中最多保存四组个性化设置。
该公司技术总监Jan Janssen谈到,未来会为嘈杂环境引入深度神经网络。在此之前,对于范围明确的任务,一棵简单的决策树就够了。
文档同样有它的现场
大部分经济活动发生在文本之上:合同、发票、信函、会议纪要。位置问题在那里以同样的方式出现,而随着能在台式电脑上运行的小型语言模型的出现,它的性质已经改变。
2024年10月16日,Mistral AI发布了Ministral 3B和Ministral 8B,这两个分别有30亿和80亿参数的模型,专门为本地使用而设计。这家法国公司把设备端翻译、无需互联网的助手和本地分析列为目标用例,并称其中较小的那个,在大多数测试中超过了该公司一年前发布的70亿参数模型。这种规模的模型能从发票中提取日期和金额,总结会议纪要,或回答关于内部规章的问题。在长推理或非常复杂的文档上,它们仍明显低于最大的模型。
以下用法是设想,而不是已观察到的部署。律师事务所可以在文件不离开事务所的情况下,比对上百份租约的条款。审计师可以在自己场所内的一台机器上,对账发票、银行对账单和会计分录,这简化了关于职业保密的讨论。市政府可以对常规申请做预审,而无需把户籍档案交给境外服务商。在国防领域,某些文件的流转本身就受到管制,在与网络隔离的工作站上处理,往往是唯一可行的选择。最后,面包师可以让系统复核供应商报价,或更新过敏原清单。
在所有这些情形中,相关的问题与其说是模型阅读文档的能力,不如说是文档在分析期间走过的路径。安装在场所内的机器给出了可验证的回答:文件进去,结果出来,没有任何东西越过防火墙。
默认本地,云端由决定而定
完全本地有其局限,供应商自己也承认这一点。Lumana指出,管理分布在几十个站点的设备群很快会变得繁重:配置、监控、维护,尤其是模型更新,在整个设备群的规模上可能需要数周乃至数月。它主张混合架构,检测在现场进行,监管在中心进行。PowerGen Advancement的文章提出了同样的分工:现场负责检测、保密和快速反应;云端负责多站点仪表盘、趋势分析和模型管理。
研究描述了更精细的方案。Senyao Li及其合著者于2025年7月在arXiv上发表的一篇综述,梳理了让本地小模型与远程大模型协作的方式:根据难度把每个请求路由到其中之一;把预处理交给本地,把最苛刻的部分交给远程;或者让小模型提出一串词,由大模型来验证。
对企业来说,这转化为一条简单的使用规则。本地处理是默认状态:数据留在现场,回答迅速,没有网络时服务也不中断。发送到远程模型是一项明确的选择,逐项任务作出,只在更强的模型带来实际收益时才这样做,组织也确切知道发出了什么、为什么。
这条规则需要事先的纪律。必须已经定义了永远不外传的信息类别,本地回答低于哪一信任度就必须核实或上报,由谁批准一次发送,以及每次发送如何记入日志。这些决定更多属于组织,而不是技术,最好在部署之前作出,而不是在第一次事故之后。
如何选择第一个用例
本文提到的项目有一个共同特点:范围狭窄。一种昆虫,一种杂草,一扇电梯门,五类声音。VespAI并不试图识别欧洲所有的昆虫,Cochlear的植入体也不转录对话。需求的精确,在很大程度上解释了结果的质量。
随后有三个问题可以判断是否必须本地处理。所产生的数据有权离开企业吗?可接受的响应时间是多少?连接中断会怎样?第一个问题的答案为否,第二个问题要求秒级或更短的响应,或者第三个问题涉及不能中断的业务,就指向边缘AI。
最后一点涉及最终决定。在VespAI中,人在任何行动之前确认告警。在预测性维护中,传感器发出预警,由技术人员决定是否介入。这种由机器提出、由专业人员确认的分工,使该工具在车间、事务所或公共部门都能被接受,也使人可以衡量它的错误,而不是被动承受。
HOMN SYSTEMS正是基于这一原则,为法国企业设计本地AI设备:模型在客户的场所内、在其数据上运行,只有企业决定并能追溯时,才会向外部服务发送内容。HOMN的做法出自与埃克塞特的工程师们相同的认识:越来越多有用的决定,可以在数据出现的地方作出。
什么是边缘AI,即嵌入式AI?
边缘AI指直接在数据产生的地方运行人工智能模型,例如在摄像头、设备、机器里,而不是在云服务商的服务器上。模型通常在别处训练,然后只有推理,即把模型应用于新数据,在现场完成。网络上传输的是简短的结论,而不是原始数据。
与云相比,现场AI有哪些优势?
本地处理把延迟降到几毫秒,而据Lumana 2026年发布的对比,远程分析可能增加一至五秒。它大幅减少带宽,因为只传输告警和元数据,并且在断网时仍能继续运行。它还能把敏感数据留在现场,CNIL把这一保障列为隐私保护措施之一。
嵌入式AI符合GDPR吗?
本地处理并不免除GDPR,但它有助于遵守数据最小化和设计即保护的原则。CNIL在2022年7月关于增强摄像头的立场文件中,把在与摄像头相连的设备中处理、几乎立即删除源图像以及只产生匿名信息,列为有益的保障。当处理对个人存在高风险时,仍需进行影响评估。
必须在本地AI和云之间二选一吗?
近期大多数架构把两者结合:检测和敏感数据处理在现场进行,而监管、多站点仪表盘和模型更新通过中央服务完成。对于语言模型,研究描述了这样的方案:本地小模型处理大部分请求,只在有正当理由时才把部分请求转给远程大模型。无论哪种情形,每一次向外发送都应当是明确且可追溯的决定。