开源模型:2026年开放权重AI与闭源模型的差距
2023年5月,在Arena排行榜上(用户对两个模型的回答进行盲测比较),最好的闭源AI模型与最好的开放模型相差174分。2024年8月,差距只有7分。2026年3月,又回升到49分。这些数字来自斯坦福大学的《AI Index 2026》,说明可以下载并在自己这里运行的模型,始终接近最好的模型而没有超越,而且差距随着少数几家公司的发布节奏而变化。
开放权重与开源:这些词指的是什么
语言模型是一种程序,在海量语料上训练之后,读取文本并生成文本。它学到的东西存储在它的参数里,也称为权重:训练期间调整出的数十亿个数字。开放权重模型指这些数字被公布并可下载的模型。这样任何人都可以在自己的机器上运行它、调整它或研究它。相反,闭源模型只能通过其发布者的界面访问:向它发送请求,它返回回答,它的权重留在发布者的服务器上。
“开源”这个说法常被用于前两种情形,严格来说并不恰当。开源促进会(Open Source Initiative)是自由软件许可证领域的权威组织,在2024年10月底发布了其开源AI定义的1.0版。它要求三个要素:关于训练数据的足够详细的信息,使有能力的人可以重建一个类似的系统;用于训练和运行模型的完整代码;以及参数本身。
大多数知名模型公布第三项,有时公布第二项的一部分,几乎从不公布第一项。训练数据出于竞争和版权原因保持保密。一些研究项目,如艾伦人工智能研究所的OLMo,也公布其数据,但它们并不在性能最好的模型之列。因此,对DeepSeek、Qwen、Mistral或gpt-oss来说,准确的术语是“开放权重模型”。本文为方便起见称之为开放模型。
许可证允许什么
许可证是规定用户可以如何使用模型的合同。源于自由软件的Apache 2.0和MIT许可证最为宽松:只要保留作者署名和许可证文本,就允许商业使用、修改和再分发。阿里巴巴的Qwen3.5、OpenAI的gpt-oss和Mistral Large 3以Apache 2.0发布。DeepSeek V4以MIT许可证发布。
Meta为Llama 4选择了自家的许可证,日期为2025年4月5日。它允许商业使用,但有三个值得注意的条件。产品月活跃用户超过7亿的公司,必须向Meta申请许可,这只涉及全球少数几家集团。任何分发基于Llama的产品的公司,必须显示“Built with Llama”字样。最后,任何分发的衍生模型,名称必须以“Llama”开头。
这些条件对大多数企业仍可接受,但会改变法务部门的工作。Apache 2.0许可证是标准文本,已经为审核过自由软件的法律人员所熟悉。发布者自己的许可证则必须通读全文,而且可能在模型的不同版本之间发生变化。
2026年秋季可用的主要开放模型
最大的开放模型几乎都基于所谓的混合专家架构。模型被切分成许多子网络,对于生成的每个词,一个路由只调用其中几个。因此要区分两个数字:总参数数量,决定所需的内存;以及激活参数数量,决定每个词的计算量。
DeepSeek是由对冲基金High-Flyer出资的中国实验室,于2026年4月底以MIT许可证发布了V4系列的预览版。据Hugging Face上发布的说明,V4-Pro有1.6万亿个参数,其中490亿个被激活,V4-Flash有2 840亿个,其中130亿个被激活。两者都支持一百万token的上下文。上下文是模型一次可以考虑的文本量,一个token对应一个词的片段。
阿里巴巴于2026年2月16日以Apache 2.0发布了Qwen3.5:3 970亿个参数,其中170亿个被激活,支持201种语言和方言。据Summit School发布的一项分析(我们未能向阿里巴巴核实),4月推出的Qwen3.6系列包含更易于托管的模型,其中有一个350亿参数的模型,只激活30亿个。而随后的旗舰模型Qwen3.7-Max,于2026年5月发布,只能通过API访问,没有可下载的权重。
在欧洲,法国公司Mistral AI于2025年12月2日发布了Mistral Large 3,一个6 750亿参数、410亿激活的模型,同时发布了三个参数分别为30亿、80亿和140亿的小模型,全部采用Apache 2.0。在美国,OpenAI于2025年8月发布了gpt-oss,这是自GPT-2以来的第一个开放模型:较大的版本有1 170亿个参数,其中51亿被激活,较小的有210亿个,其中36亿被激活。
Meta曾以Llama系列在美国一侧推动开放,现已改变方向。2026年4月8日,该公司推出了Muse Spark,这是其Meta Superintelligence Labs实验室的首个模型。它是闭源的:在Meta的应用中使用,或通过向选定合作伙伴开放的API使用。Meta写道,希望未来的版本能开源,但没有时间表。已经发布的Llama模型仍可下载。
衡量差距:独立排行榜与发布者的数字
基准测试是一组用来给模型打分的标准化问题。每个发布者都会选择突出自己成绩最好的那些,这使比较变得脆弱。Arena排行榜的做法不同:用户提交一个问题,收到两个匿名的回答,并为更好的那个投票。投票形成类似Elo的分数,也就是国际象棋选手的排名系统。
斯坦福以人为本人工智能研究所发布的《AI Index 2026》依据的就是这个排行榜。2026年3月,最好的闭源模型,Anthropic的Claude Opus 4.6,得到1 503分。最好的开放模型,中国智谱AI的GLM-5,得到1 454分,差距49分,即3.4%。排行榜前十名中有六个是闭源模型。报告还指出,前四家公司Anthropic、xAI、Google和OpenAI,彼此相差不到25分,其后是阿里巴巴的1 449分和DeepSeek的1 424分。
报告描述了一种钟摆式的运动。Mixtral、WizardLM,然后是Llama 3.1 405B,在2024年8月把差距缩小到7分。OpenAI的o1-preview和Google的Gemini 2.5 Pro等新的闭源模型的出现,又使差距拉大。开放实验室发布时差距缩小,闭源实验室推出新一代时差距重新拉开。
发布者给出了他们自己的估计,应当当作估计来读。DeepSeek称V4-Pro在推理上落后GPT-5.4和Gemini 3.1 Pro三到六个月,WinBuzzer网站指出这一估计未经独立实验室验证。至于Qwen3.5,阿里巴巴公布并被The Decoder转载的数字显示,它在遵循指令的测试上领先,如IFBench为76.5,但在竞赛数学上落后于GPT-5.2,AIME26为91.3对96.7,在编程上也落后,LiveCodeBench为83.6对87.7。
综合来看,这些数字表明,一个好的开放模型落后于最好的闭源模型几个月。对于大多数办公任务,用户看不出差别。在最困难的问题上,如长推理,或无人监督、串联多个步骤的任务,差距仍然可以测量。
所需内存与量化的作用
要运行,模型必须把所有参数加载进内存,包括某一时刻不活跃的专家的参数。混合专家减少的是计算,而不是内存。在标准的16位精度下,每个参数占两个字节。因此gpt-oss的1 170亿个参数需要约234 GB,接近80 GB的Nvidia H100显卡内存的三倍。
量化解决了一部分问题。它是用更少的位存储每个参数,用8位或4位而不是16位。Hugging Face的Transformers库文档把它描述为一种降低所需内存的方式,同时尽可能保持模型的精度。最贴切的类比是压缩过的照片:文件轻得多,如果压缩得好,只有仔细看才能看出差别。
发布者现在直接提供已量化的模型。OpenAI发布gpt-oss时,其专家的权重采用MXFP4格式,约为4位,这使大版本能放进一块80 GB的显卡,小版本只需16 GB内存即可运行。DeepSeek以混合格式发布V4:专家用4位,其余大部分参数用8位。即使经过压缩,V4-Pro仍需要几百GB,依然是服务器集群级别的模型。
实际上形成了三个档次。30亿至200亿参数的模型,可在配备较新显卡的工作站上运行。300亿至1 200亿的模型,需要配备一两块大容量显卡的专用机器,这仍在中小企业的承受范围内。超过几千亿之后,就需要一台完整的计算服务器。压缩是有代价的:在代码、计算或高度专业的文本上,过强的量化会使结果变差。唯一可靠的方法是在自己的文档上测试。
够用的任务,吃力的任务
中等规模的开放模型在有界且重复的工作上表现良好:总结会议纪要,分类邮件,从发票中提取字段,依据内部文档库回答问题,起草初稿,翻译。对这些用途,一个配置得当的200亿至1 200亿参数的模型,给出的回答,大多数用户无法与闭源模型区分。在本地托管,它还带来可预测的成本,以及不经内部决定就不会改变的行为。
它们在三种情形下更脆弱。第一种是模型独立行动、串联几十个动作的长任务:每一步微小的出错概率,最终会累积起来。第二种是较新的知识,因为模型只知道训练结束前读到的内容,除非向它提供最新文档。第三种是在训练数据中占比较少的语言和行话,训练数据主要是英文和中文。因此,法律或技术类的法语,在任何部署之前都需要专门测试。
开放模型是一个文件,而不是一项服务。安全更新、监控、访问日志和权限管理,仍由托管者负责。这正是闭源模型发布者通过API收费所提供的工作,选择自行托管时必须把它考虑在内。
美国、中国、欧洲:三种发布方式
美国最先进的实验室,Anthropic、Google和OpenAI,把最好的模型保持闭源,通过API销售。OpenAI通过gpt-oss部分例外,该模型仍低于其旗舰模型。Meta随Muse Spark而与竞争对手一致。
中国的实验室,如DeepSeek、阿里巴巴或智谱AI,以宽松的许可证发布了大量开放权重。《AI Index 2026》指出,美国模型与中国模型之间的差距几乎已经消弭:2026年3月,最好的美国模型领先最好的中国模型,即字节跳动的Dola-Seed-2.0 Preview,39分,即2.7%。据WinBuzzer,华为确认其基于昇腾处理器的计算集群可以运行DeepSeek V4,而该模型其实是在Nvidia芯片上训练的。不过,中国的开放并不是一种教条:阿里巴巴如今把最强大的模型放在API之后,而排行榜上最好的中国模型,即字节跳动的那个,是闭源的。
欧洲顶级实验室不多,以Mistral AI为首,更多是凭借监管发挥分量。《AI Act》对通用AI模型的义务自2025年8月2日起适用,委员会自2026年8月2日起可以强制执行。以自由许可证发布的模型,被归为系统性风险的除外,可以免除一部分技术文档义务,但仍必须公布训练数据摘要和版权合规政策。伴随这些规则的行为准则于2025年7月10日发布,到2025年8月中旬有26家签署方,包括OpenAI、Google、Microsoft、Amazon和Anthropic。Meta和中国企业不在其列。
对法国的买家来说,结论很实际:在部署模型之前,必须知道实际运行的是哪一个,采用什么许可证,附带什么文档,发布者是谁。
更换模型而不必重建工具
今天的排名不会是明年的排名。十二个月里,DeepSeek发布了新一代,阿里巴巴推出了三代并把最新一代留给了自己的API,Meta推出了它的第一个大型闭源模型。一家把软件直接接到某个特定模型上的企业,是在押注一种在年底前就会改变的市场状态。
应对办法是技术性的。应用不直接与模型对话,而是与一个中间层对话,由它按任务选择模型。一套由企业真实文档和问题组成的内部测试集,用来在替换之前验证新模型至少不输于旧模型。这样,更换模型就成了一项有计划、可验证的维护工作。
这种做法同时防范多种风险:发布者停止公布权重,许可证收紧,价格上涨,模型被撤下。德国网站Digital Chiefs一篇谈Meta转向的文章,向IT部门推荐同样的做法:采用多个模型系列而不是单一供应商,其中至少有一个开放模型用于受监管或离线的场景,建立应用及其所用模型的清单,并在合同中写入退出条款。
开放模型的现状对企业意味着什么
2026年秋季,据最受关注的独立衡量,最好的开放模型与最好的闭源模型只相差几分。它们的许可证从几乎不设条件的Apache 2.0,到需要请人审阅的自家文本不等。它们的可得性取决于作者的战略,这可能在版本之间改变。对于大多数常见用途,它们已经够用,并且可以在不把企业文档发给第三方的情况下处理这些文档。
长期来看,重要的标准是能否在不动其余部分的前提下,用一个模型替换另一个。这就是HOMN的架构选择:模型是可互换的部件,每次替换前都在客户的文档上测试,而围绕它的基础设施在各代之间保持不变。
开源模型与开放权重模型有什么区别?
开放权重模型公布其参数,因此可以下载并在自己的机器上运行。按开源促进会的定义,开源模型还必须公布训练代码和关于训练数据的详细信息。大多数知名模型,如DeepSeek、Qwen或Mistral,都是开放权重的。
2026年最好的开源AI模型是什么?
据斯坦福《AI Index 2026》,2026年3月Arena排行榜上最好的开放模型是智谱AI的GLM-5,1 454分。DeepSeek V4、Qwen3.5和Mistral Large 3,属于此后发布的最大的开放模型之列。合适的选择取决于可用硬件、许可证以及在自己任务上的测试。
开源模型和ChatGPT或Claude一样好吗?
接近。2026年3月,最好的开放模型落后于Arena排行榜上最好的闭源模型49分,即3.4%。对于常见的办公任务,差别不明显,但在长推理和复杂的自主任务上仍可测量。
在本地运行开源LLM需要什么硬件?
一个30亿至200亿参数的模型,可在配备较新显卡的工作站上运行,gpt-oss-20b只需16 GB内存即可运行。一个约1 200亿参数、量化到4位的模型,如gpt-oss-120b,可放进一块80 GB的显卡。数千亿参数的模型则需要一台完整的服务器。