本地AI:定义、原理与具体示例
本地AI是一种语言模型,在您掌控的机器上计算回答,不会把您的文本发送给任何供应商。本指南说明这个模型里有什么,在自己这里运行意味着什么,以及可以合理期待什么。
一条命令,一次下载,此后数据不再外传
Ollama是一款可用于macOS、Windows和Linux的开源软件,其文档用一行就说明了起点:在终端里输入一条命令,下载一个模型并开启对话。以文档中作为示例的模型Gemma 4 E2B为例,文件约为7.2 GB,文档建议配备8 GB显存,在Mac上则是统一内存。文件存到磁盘之后,每个回答都由机器的处理器计算。即使拔掉网线,对话照常继续。
这就是本地AI最简单的定义:一个在自己拥有或掌控的硬件上运行的人工智能模型,无论是笔记本电脑、放在机柜里的服务器,还是专用的设备。它的反面是远程服务。ChatGPT、Gemini或Le Chat在它们的服务器上接收您的文本,在那里处理,再把结果返回给您。
要理解这两种情况各发生了什么,就得打开这个盒子:语言模型是什么,下载的文件里有什么,机器在生成回答时究竟做了什么。
语言模型预测文本的下一段
大型语言模型,常缩写为LLM(large language model),是一种为看似平淡的任务而训练的程序:猜出接下来的那段文本。手机键盘在按键上方提示下一个词,做的是同一件事,只是规模很小。LLM做得如此细致,以至于把预测一个接一个串起来,就能产生段落、摘要、代码或翻译。
模型处理的不是词,而是token,即文本片段,可以对应一个完整的词、一个音节或一个标点。OpenAI的文档给出了英文的数量级:一个token约为四个字符,即一个词的四分之三。这个单位用来衡量一切,从一次交流的最大长度(称为上下文窗口),到生成速度。
使这些模型成为可能的架构称为Transformer。它在2017年一篇题为“Attention Is All You Need”的研究论文中被提出。其核心思想是注意力机制,使模型能为每个token衡量文本中所有其他token的重要性。在“客户昨天签署的合同将于三月到期”这句话里,正是这一机制把“到期”与“合同”联系起来,尽管中间隔着其他词。
要记住这种机制意味着什么。模型给出的是根据训练期间所见内容最可能的后续文本。可能并不等于准确,这一细微差别解释了它的大部分局限。
权重:文件里装的是什么
安装一个模型时下载的,是它的权重,也称参数。它们是数字,几十亿个数字,在训练期间被逐个调整,使预测变得准确。可以把它们比作一台巨大调音台上的滑块:单独一个滑块几乎没有意义,但它们整体的位置决定了声音。
模型的规模以参数数量计。法国公司Mistral AI于2023年9月27日发布的Mistral 7B有73亿个参数。它以Apache 2.0许可证发布,允许下载、使用,并安装在任何地方,包括商业用途。这称为开放权重模型:公司发布的是文件本身,而不仅仅是远程访问。
模型的生命周期里有两个相继的阶段。训练用海量文本生成权重;它需要大量的算力,只有少数实验室能做到。推理则使用这些固定的权重来回答问题;在本地运行的,只是推理,也仅限于推理。这类似于编写词典与查阅词典的区别:前者要花几年,后者只要几秒,没有人需要为了查一个词而重写词典。
运行模型:引擎、格式与量化
要执行这些权重,需要一个推理引擎,即把文件加载到内存并串联各项计算的程序。本地领域最普及的叫llama.cpp。它用C和C++编写,没有外部依赖,目标是以最简安装在各类硬件上运行模型:苹果芯片、常规x86处理器、通过CUDA使用的NVIDIA显卡,或通过Vulkan使用的其他厂商显卡。更易上手的应用,如Ollama或LM Studio,能够读取同一种文件格式。
这种格式称为GGUF。据主要的模型共享平台Hugging Face的文档,GGUF文件把权重和一组标准化的元数据合在一个二进制文件中:架构、token词表、加载所需的设置。复制、加载,就能运行,有点像一份自带字体的PDF。
几乎决定一切的因素是内存。在原始形态下,每个参数以16位即两个字节存储。一个73亿参数的模型因此占用近15 GB,比大多数台式电脑的内存还多。量化通过把权重四舍五入到更少的位数来解决这个问题,就像减少一张照片的颜色数,而眼睛乍看并不觉得差别。llama.cpp支持1.5位到8位的量化。常用的Q4_K类型,据Hugging Face的文档,相当于每个权重4.5位:同一个模型随之降到约4 GB。
这种压缩是有代价的,即精度略有损失,位数越低损失越明显。而且内存不只用来存储权重。Ollama的文档提醒,更长的上下文窗口需要更多内存,因为机器要保留正在处理的全部文本的记录。显存不足时,软件可以退而使用普通内存,回答会变慢。硬件的选择取决于三个参数:模型的大小、量化的级别,以及要处理的文本长度。
为什么几年之间它变得现实可行
不久前,在单台机器上运行一个称职的模型还只是实验室的演示。斯坦福大学《AI Index 2025》公布的三项测量显示了发生了什么变化。
第一项涉及规模。2022年,在MMLU(一项涵盖众多学科的选择题测试)上正确率超过60%的最小模型是谷歌的PaLM,拥有5 400亿个参数。2024年,微软的Phi-3-mini以38亿个参数越过了同一门槛,模型缩小了142倍。量化之后,这个量级的模型可以放进一台笔记本电脑的内存。
第二项涉及闭源模型与开放权重模型之间的差距。2024年1月初,在Chatbot Arena排行榜上(网民对两个模型的回答进行盲测比较),最好的闭源模型领先最好的开放模型8.04%。到2025年2月,差距仅为1.70%。
第三项涉及成本。同样据斯坦福,GPT-3.5水平的系统,其推理成本在2022年11月至2024年10月间下降了280多倍。同期,硬件成本每年下降约30%,能效每年提升40%。
这些数字描述的是一种趋势,而不是持平。最大的闭源模型在最困难的任务上仍保持优势,而基于网民偏好的排行榜也并不能衡量一切。尽管如此,不依赖数据中心所能做到的事情,其边界已明显移动。
本地还是ChatGPT:问题在于文本走过的路径
从用户的角度看,两种体验相似:一个输入框,回答逐字显示。区别在于路径。使用在线服务时,问题、附带文档和回答都要经过供应商的服务器。使用本地AI时,它们不离开这台机器。
这条路径有具体的后果。OpenAI表示,免费版和Plus版ChatGPT账户的对话可用于改进其模型,除非用户关闭了该选项,而其企业方案和API的数据默认不会被使用。CNIL在2024年7月发布的生成式AI问答中指出,通过API使用时,对系统的掌控“几乎完全”掌握在供应商手中。它建议在处理个人数据或敏感数据时采用本地部署,以限制被第三方提取的风险。
法国国家信息系统安全局ANSSI在2024年4月29日发布的生成式AI系统安全建议中,持相同立场。其建议R34不建议在涉及敏感数据的职业用途中使用可通过互联网访问的生成式AI工具:组织无法控制该服务,因此无法保证发送到那里的内容保密。
本地还有其他特点。它无需联网即可运行。它的成本不取决于提问的数量,因为这是购入的硬件,而不是一个计数器。它不会因为供应商更换或撤下某个模型而一夜之间改变。作为代价,组织要自己管理机器、更新和备份,也无法使用只在线上提供的最大的闭源模型。许多组织把两者结合起来:机密或重复性的事务用本地,临时且不含敏感数据的需求用远程服务。
本地AI具体能做什么
效果最好的用法,是让模型处理您提供给它的文本,而不是从自己的记忆里取材。总结一份三十页的会议纪要。把一封信改写成更中性的语气。从发票中提取供应商、日期和金额,填入表格。翻译一份技术说明。在把来信分派到相应部门之前,按主题对它们分类。
企业里需求最多的情形,是查询自己的文档:内部流程、合同、协议、客服知识库。所用的技术称为RAG,即检索增强生成,先找出相关段落,再让模型依据这些段落作答并注明来源。我们为此专门写了一篇详细的文章。
接着是更偏技术的用法:辅助编写代码,由同样在本地运行的语音识别模型转录会议,分析错误日志。这些用法传播得很快。据欧盟统计局,2025年有20%的十人以上欧洲企业使用了人工智能技术,一年前为13.5%。
在所有这些情形中,机器给出初稿或初步分类,由人来确认。在这种配置下,节省的时间与所承担的风险之间的比例最为有利。
局限,不加掩饰
语言模型可能言之凿凿地说出错误的内容。这种现象称为幻觉,直接源于它的工作方式:它生成的是看似合理的文本,而看似合理的文本里可能有编造的日期、不存在的法律引用或抄错的数字。在本地运行并不会改变这一点。应对办法是向它提供来源,而不是指望它的记忆,并对一切涉及组织责任的内容安排人工复核。
它的知识止于训练结束的时候。一年前发布的模型,不知道最新的改革、最新的费率表、软件的最新版本。它不会自己去查询互联网:与网络隔离的本地AI,只知道它学到的和交给它阅读的内容。
小模型终究是小模型。斯坦福测得的进步是真实的,但几十亿参数的模型在多步推理、计算或非常专门的问题上,比巨型模型更容易出错。速度取决于硬件:在没有合适图形处理器的电脑上,长回答可能需要等待。
最后,本地安装与其他任何信息系统一样。需要管理、打补丁、控制谁能访问。ANSSI在其建议中用一部分篇幅讨论AI系统的隔离、处理过程的日志记录和权限管理。本地不意味着默认安全;它意味着安全取决于运营它的组织。
如何开始
最简单的办法是在一台较新的电脑上,用Ollama或LM Studio这样的应用试一试。选择一个参数为几十亿的小型开放权重模型,量化到4位。用真实的任务测试,但不使用机密数据:总结一份公开文档,改写一段文字,从空白表单中提取信息。记录质量、速度和错误。
这第一步是为了在任何支出之前弄清需求:每周反复出现的用法,需要处理的文档量,同时使用系统的人数。这些因素决定模型的大小,进而决定所需内存,再决定硬件。
用于团队时,测试用的笔记本就不够了。需要一台持续开机、可在内部网络访问的机器,配有账户、权限和日志管理。这是服务器或专用设备的作用。
在HOMN,我们构建的正是后一种配置:模型、文档和日志留在安装于用户处的机器上,使用外部服务则是一项明确的选择。无论选用什么工具,这个思路都成立:知道模型在哪里运行,里面有什么,数据去了哪里。
什么是本地AI?
本地AI是一种在用户掌控的硬件上运行的人工智能模型,通常是语言模型,硬件可以是电脑、服务器或安装在自己场所内的设备。所处理的问题和文档不会发送到供应商的服务器。模型是一次性下载的文件,之后无需联网即可使用。
使用本地AI需要联网吗?
运行时不需要。互联网用于下载模型和软件更新,但回答的计算完全在机器上进行。因此本地AI可以在隔离的网络上运行。
本地AI的表现和ChatGPT一样好吗?
并非所有方面:最大的闭源模型在最困难的推理任务上仍然领先。不过差距已大幅缩小,据斯坦福《AI Index 2025》,在Chatbot Arena排行榜上,2024年1月至2025年2月间差距从8.04%降到1.70%。对于总结、改写、提取或查询文档,一个好的开放权重模型在大多数情况下已经足够。
在本地运行LLM需要什么硬件?
取决于模型的大小和量化方式。一个70亿参数、量化到4位的模型约占4 GB,Ollama的文档为其示例模型建议8 GB的显存或统一内存。若要供团队共同使用,则需要一台配备更多内存的专用机器。