DeepSeek V4-Flash-Vision-Exp开源:305B参数+MIT许可,中国AI开源运动正式进入多模态时代
DeepSeek V4-Flash-Vision-Exp开源:305B参数+MIT许可,中国AI开源运动正式进入多模态时代
2026年,中美AI竞争有一个越来越清晰的格局:美国的前沿模型能力领先,但中国的开源策略更激进。OpenAI Astra只对美国政府和受信任合作伙伴开放,Claude Fable 5.1虽然商业化但有数据保留要求——这些模型的控制权留在公司手中。
DeepSeek和Z.AI选择了另一条路:把大模型的权重免费开放给全世界。
2026年8月31日,DeepSeek在Hugging Face发布了V4-Flash-Vision-Exp的开源权重。这是V4家族推出以来第一个视觉模型,305B参数,稀疏MoE架构,MIT许可——全球开发者可以自行下载、微调、部署,不需要支付任何许可费。
从时间线来看,这个发布有一些特别的背景:一周前(8月25日),中国另一家AI实验室Z.AI发布了GLM-5.3-Flash,同样是MIT许可的开源多模态MoE模型,参数规模相近。这是全球历史上第一次,同一周内有两家中国AI实验室同时推出300B+参数量级的MIT许可多模态开源检查点。
这个细节值得关停下来想一想。
技术规格:V4-Flash-Vision-Exp的实际构成
了解这个模型到底在技术上做了什么,需要先理解V4家族的架构背景。
DeepSeek V4的文本骨干是一个284B参数的稀疏MoE Transformer:每次前向传递只激活约13B参数(6个路由专家+1个始终激活的共享专家,从256个路由专家中选择),43层,4096隐藏维度,1M Token上下文窗口。这个架构设计让V4在维持超大参数规模的同时,推理成本被压缩到远低于同等规模Dense模型的水平。
V4-Flash-Vision-Exp在这个文本骨干上增加了两个视觉模块:
一个32层的视觉编码器(1024维度,16个注意力头),按照ViT(Vision Transformer)方式把输入图像切成14×14像素的patch进行处理。
一个对齐层(aligner),把视觉编码器输出的特征映射到语言骨干的4096维隐空间,作为token序列与文本输入一起处理。
每张图片最多384个token预算——这个数字来自API计费规范(每张图最多收384个token的费用),也反映了视觉编码器的实际输出容量上限。这两个数字相同不是偶然,而是架构决策直接决定了定价策略。
视觉模块的加入让总参数量从~284B增加到~305B,就是这两个模块的参数贡献。
开源策略的时间差:DeepSeek在8月31日发布权重之前,已经有一个”API only”窗口期(约10天)——这与7月31日的V4-Flash-0731文本模型(同日发布权重)策略不同。这个变化暗示DeepSeek在视觉模型上比文本模型更谨慎,可能是因为多模态能力增加了安全审查的复杂度,也可能是在等待一个更有利的发布时机。
基准测试数据:需要独立验证的数字
DeepSeek报告V4-Flash-Vision-Exp在11项基准测试中赢了3项(对比Anthropic Opus-4.8),其余8项落后。
这个数字本身不重要——重要的是它来自哪里。
根据TechTimes的报道,截至报道发布时,DeepSeek发布的基准测试数据均来自DeepSeek自己的评测框架,没有独立的第三方实验室复现结果。Hugging Face的模型仓库中包含这些数据,但数据来源标注为DeepSeek内部。
这不是DeepSeek特有的问题——几乎所有模型发布时都有”自评分通胀”的倾向,因为你可以选择最有利于自己模型的基准测试版本、系统提示词和评测参数。但在这个案例里,独立验证的缺失值得在报道中明确标注。
8月31日至9月2日,Shanghai NYU RITS AI实验室(上海纽约大学)发布了一篇分析确认了384 token图像预算的技术细节,但这是对架构的技术核实,不是对性能基准的独立复现。
TechTimes的标题本身就是诚实的:“Benchmark Claims Need Independent Proof”(基准测试声明需要独立证明)——在报道这个发布时,这个保留立场是正确的。
以下是目前的状态:
- 技术架构参数(参数量、层数、维度):✅ Hugging Face仓库元数据可核实
- API计费规范(384 token/图):✅ 独立机构(NYU RITS)核实
- 性能基准测试:⚠️ 仅DeepSeek自评,尚待独立复现
同一周,两家中国AI实验室:竞争格局在加速
一周前,Z.AI(智谱AI)发布了GLM-5.3-Flash。
GLM-5.3-Flash同样是开源、MIT许可、多模态、MoE架构,参数规模在相近量级。两款模型的同期发布不是偶然——这是中国AI实验室之间竞争压力的直接体现。
Z.AI在8月27日已经发布了Ox Alpha(一个能力基准超过DeepSeek V4 Pro的新旗舰模型),同时在8月25日发布了GLM-5.3-Flash的开源权重。DeepSeek选择在一周后跟进,发布V4视觉版的开源权重——这个时间间隔看起来很像”不能让对手占据开源多模态赛道太久”的竞争性跟进。
这种中国AI实验室之间的内部竞争,在2026年已经形成了清晰的模式:旗舰模型竞争(谁的能力更强)+ 开源生态竞争(谁的开源模型被更多开发者使用)。
开源生态的竞争逻辑不同于闭源能力竞争:开源模型一旦建立了开发者社区,就形成了一种不依赖API收入的影响力护城河——开发者的微调模型、应用生态、技术积累,会持续围绕开源基础模型积累,这个生态不会因为下一个闭源旗舰发布而立即消失。
DeepSeek V4的文本模型系列已经在全球开发者社区建立了相当的影响力,现在它需要把这种影响力延伸到多模态领域。V4-Flash-Vision-Exp的发布,不只是一个新模型,而是一个声称”我们的开源生态可以做多模态了”的宣言。
MIT许可的真正含义
“MIT许可”在AI开源领域的意义需要仔细说明,因为它被广泛误解。
MIT许可意味着:可以自由使用、复制、修改、分发、甚至商业使用,只需要保留版权声明。它不限制商业用途,也不要求开源衍生作品。
这与Meta的Llama许可(Llama Community License,有用户数量限制)、或Google的Gemma许可(同样有商业限制)不同。DeepSeek的MIT许可让V4-Flash-Vision-Exp成为目前真正意义上”无限制开源”的最大规模多模态模型之一。
对于全球开发者,这意味着:
可以自托管:不需要通过DeepSeek的API,可以完全在自己的基础设施上运行,数据不离开自己的控制范围。对于医疗、法律、金融等对数据主权敏感的行业,这是关键优势。
可以微调:可以用自己的数据对模型进行领域专项微调,而不是依赖提示词工程在通用模型上取得次优效果。
可以商用:可以基于这个模型构建商业产品,收费给客户,不需要向DeepSeek支付版税或许可费。
可以再分发:可以发布基于V4-Flash-Vision-Exp的衍生模型,甚至比DeepSeek原始权重更小、更快、更专门化的版本。
当然,305B参数的模型自托管需要相当的GPU算力——不是每个开发者或公司都能负担。但对于有算力的企业客户,MIT许可带来的灵活性是付费云API无法替代的。
与美国开源多模态模型的比较
在美国市场,同等规模的MIT许可开源多模态模型有限。主要对比:
Meta的Llama 3.3(最大版本约700B)有多模态能力但使用Llama Community License,商业限制更多;Google的Gemma系列参数量小得多,最大Gemma 2约27B;Mistral的大型多模态模型权重访问门槛较高。
DeepSeek V4-Flash-Vision-Exp的305B参数+MIT许可,在这个组合上目前没有直接的美国竞争对手。这是一个刻意选择的差异化定位——在能力上可能不是最顶尖,但在”开放性+规模”的组合上,填补了一个空缺。
这也是为什么部分AI安全研究人员对中国开源AI持保留态度:当一个能力足够强大的模型以MIT许可发布,并不存在控制其全球部署和使用的机制——它可以被任何人在任何地方用于任何目的(合法和非法)。这是开源精神的本质,也是关于是否应该开源前沿AI能力的永恒争论的具体案例。
全球多模态AI的新起点
如果把这次发布放在更大的背景下看,2026年8月末到9月初,有几件事同时发生:
DeepSeek V4-Flash-Vision-Exp(8月31日,305B, MIT)、Z.AI GLM-5.3-Flash(8月25日,相近规模,MIT)、Anthropic Claude Fable 5.1(9月1日,最新闭源旗舰)、以及OpenAI Astra(受限发布,能力最强但只对少数机构开放)——
这是多模态AI竞争的一个历史截面:中国开源、美国闭源的格局正在成为2026年全球AI格局的主旋律之一。
不是所有的”开源”都一样,不是所有的”闭源”都更强——但这种格局的存在,正在迫使全球开发者、企业客户、监管者重新思考:在多模态AI时代,”谁控制着模型权重”这个问题变得越来越政治性,而不只是技术性。
DeepSeek V4-Flash-Vision-Exp的发布,是这个更大故事里的一个数据点。重要的是它指向的方向,而不只是305B这个数字。
对开发者的实际含义
如果你是一个需要在自己的应用中集成视觉理解能力的开发者,这个发布的实际价值可以这样评估:
适合的场景:需要数据主权(数据不出自己的基础设施)、需要定制微调(在特定垂直领域的视觉任务上提升精度)、有足够GPU算力(至少需要几块A100/H100才能高效运行305B模型)、对MIT许可的法律灵活性有需求的商业场景。
不太适合的场景:个人开发者或小型团队(算力成本太高)、需要最高视觉理解能力的场景(基准测试数据尚待独立验证,闭源旗舰模型可能性能更好)、需要现成生产级支持的场景(开源意味着维护和调试由使用者承担)。
从实用角度,305B参数的全量推理在单节点上需要约8张80GB H100显卡(或更多),这对大多数中小开发者来说是不现实的。但量化版本(INT4/INT8)可以在更少的显卡上运行——DeepSeek的开源传统通常包括官方量化权重,或者社区会很快提供。
MoE架构的另一个优势是:尽管总参数305B,但每次前向传递只激活约13B参数,这意味着推理的实际计算量接近13B Dense模型,而不是305B。这让V4-Flash-Vision-Exp在同等GPU算力下,比305B的Dense模型快很多。
对于2026年想建立多模态AI产品的企业,V4-Flash-Vision-Exp代表了一个新的参照点:你可以免费拥有一个300B+规模的多模态基础模型,在自己的硬件上运行。这个选择的存在,会改变企业和云API供应商之间的谈判筹码。
参考资料
-
TechTimes - “DeepSeek Open-Sources First V4 Vision Model: Benchmark Claims Need Independent Proof”(2026-09-01): https://www.techtimes.com/articles/326132/20260901/deepseek-open-sources-first-v4-vision-model-benchmark-claims-need-independent-proof.htm
-
Hugging Face DeepSeek-V4-Flash-Vision-Exp model repository: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
-
Shanghai NYU RITS AI analysis: https://rits.shanghai.nyu.edu/ai/deepseek-v4-flash-vision-exp-open-weights