DeepSeek V4.1-Flash:用890字节每Token重写GPU内存经济学
DeepSeek V4.1-Flash:用890字节每Token重写GPU内存经济学
890字节。
这是DeepSeek在2026年9月19日通过HuggingFace发布的新一代模型DeepSeek V4.1-Flash,每个token消耗的全局KV缓存大小。
相比于DeepSeek V4-Flash的约3600字节每token,这是4倍压缩。相比于DeepSeek V1,这是437倍压缩。
这个数字意味着什么?简单说:相同的GPU硬件,可以同时运行4倍数量的AI智能体会话。
在一个全球AI企业因算力受限而头疼的时代,DeepSeek用架构创新直接把算力需求压低到了原来的四分之一。这不是优化,这是重新定义了问题本身。
KV缓存:理解这场架构革命的钥匙
在理解DeepSeek V4.1-Flash之前,需要先理解KV缓存是什么,以及为什么它是当前AI推理成本的核心瓶颈。
当大型语言模型处理一段文本时,它需要为序列中的每一个token计算「键」(Key)和「值」(Value)矩阵,这些矩阵会被缓存起来供后续计算使用,以避免重复计算——这就是KV缓存(Key-Value Cache)。
KV缓存的问题在于它的增长方式:随着上下文长度的增加,KV缓存需要的内存空间线性增长。对于需要处理长对话历史或长文档的AI智能体,KV缓存的内存占用往往是整个推理过程中内存需求的主要来源。
在实践中,这意味着:当你部署一个基于LLM的AI客服智能体,每一个并发对话会话都需要在GPU内存中维护一份完整的KV缓存。GPU内存越大,可以同时维护的对话会话数量越多,等价于服务并发用户的能力越强。
GPU内存是有限且昂贵的资源。一张NVIDIA H100 GPU有80GB HBM内存,价格超过3万美元,且在全球市场上供不应求(中国企业更是因为出口限制无法获取)。因此,减少每个token消耗的KV缓存空间,直接等价于增加单张GPU的服务能力,降低单位算力成本。
DeepSeek V4.1-Flash把每token的KV缓存从约3600字节压缩到890字节,实现4倍压缩,这意味着:同一张GPU,可以服务4倍数量的并发AI智能体会话,且无需额外购置任何硬件。
从纯经济学角度,这等于把AI推理的单位成本砍掉了75%。
KV缓存问题的历史演进
KV缓存并非新问题。早在2020年,随着GPT-3(1750亿参数)的发布,研究社区就开始意识到推理阶段的内存瓶颈将成为大模型商业化的主要障碍。当时,OpenAI内部的推理成本估算显示,每1000个token的生成成本高达0.06美元,其中相当大比例来自KV缓存的内存带宽消耗(来源:Dario Amodei等人,《AI and Compute》,OpenAI博客,2020年5月)。
2022年,PagedAttention技术(由加州大学伯克利分校提出,后被集成进vLLM推理框架)通过借鉴操作系统虚拟内存管理的思路,将KV缓存的内存碎片化问题降低了约4倍,使GPU内存利用率从约30%提升到超过90%(来源:Kwon等人,《Efficient Memory Management for Large Language Model Serving with PagedAttention》,SOSP 2023)。这是KV缓存优化的第一个重要里程碑。
2023年至2024年间,多查询注意力(MQA)和分组查询注意力(GQA)成为主流架构选择。Meta的LLaMA 2和LLaMA 3均采用GQA,将KV缓存大小压缩至原来的1/4到1/8,同时保持了接近标准多头注意力的模型质量(来源:Ainslie等人,《GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints》,EMNLP 2023)。
DeepSeek V4.1-Flash的890字节/token,是在这一系列优化积累之上的进一步突破——但其突破方式是架构层面的根本性重构,而非对现有技术的渐进式改良。这是理解其技术意义的关键背景。
CED架构:为什么这次的压缩是结构性的而非补丁式的
DeepSeek V4.1-Flash实现KV缓存大幅压缩的核心,是一种全新的模型架构:Causal Encoder-Decoder(CED,因果编码器-解码器)架构。
传统的大型语言模型采用纯解码器(Decoder-only)架构:每一层都需要计算并缓存自己的KV状态,层数越多(一般32到128层),每个token产生的KV缓存越大。这是标准Transformer架构的内存扩展问题,是过去几年AI推理优化工作的主要战场。
CED架构从根本上改变了这个方程式。
DeepSeek V4.1-Flash采用了一个40层的Transformer,分为两个部分:前20层是因果编码器,后20层是解码器。关键的架构创新在于:解码器的全局KV缓存不是从每一层解码器自身的隐藏状态派生的,而是从编码器最后一层的隐藏状态投影(project)而来。
这个设计的含义是:解码器的20层共享同一个KV缓存表示,而不是每层各自维护一份独立的KV状态。20层变成1份,KV缓存的规模自然大幅压缩。
更进一步,CED架构还带来了推理计算的效率提升:在处理输入(prefill阶段),每个token只需要激活8B参数;在生成输出(decode阶段),每个token只需要激活16B参数。相比于DeepSeek V4-Pro的49B激活参数,这是显著的计算量减少。
这意味着DeepSeek V4.1-Flash对计算资源的需求,远小于其552B的总参数量所暗示的规模,非常适合「输入密集型」的AI智能体工作负载——即需要处理大量背景上下文、输入内容远多于输出内容的应用场景。
CED架构与传统编码器-解码器的本质区别
值得注意的是,CED架构与BERT时代的编码器-解码器(如T5、BART)有着根本性的不同,不能简单地将其视为「回归旧范式」。
传统编码器-解码器架构(如T5)的编码器采用双向注意力,可以看到完整的输入序列;而CED的「因果编码器」仍然保持因果掩码(causal masking),即每个位置只能看到之前的token,这保证了模型在自回归生成时的一致性,避免了训练和推理之间的分布偏移问题。
这个设计选择解决了一个长期困扰编码器-解码器架构的工程问题:传统双向编码器在处理流式输入(streaming input)时存在天然缺陷——必须等待完整输入才能开始编码。CED的因果编码器则可以在接收输入的同时逐步构建编码表示,对实时AI智能体应用更加友好。
从学术渊源来看,CED架构与2024年提出的若干「混合架构」研究方向有一定关联。例如,Google DeepMind在2024年发布的Griffin架构(来源:De等人,《Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models》,arXiv 2402.19427)探索了线性递归层与注意力层的混合,同样以减少KV缓存为核心目标。DeepSeek CED可以被视为这一「后Transformer」架构探索浪潮中,目前工程化程度最高、规模最大的实现之一。
压缩堆叠:三层技术的协同效应
DeepSeek V4.1-Flash的KV缓存压缩,并非只靠CED架构一个技术实现,而是多层技术叠加的结果:
第一层:CED架构的全局KV共享。如前所述,编码器-解码器的分离使得解码器不再需要为每层维护独立KV缓存,这是主要的压缩来源。
第二层:SWA Bounded Replay(滑动窗口注意力有界重放)。传统滑动窗口注意力机制需要在SSD上持久化KV状态,以便在需要时读取历史上下文。Bounded Replay通过重放最近n_win个token来重建缺失的SWA KV状态,完全避免了SSD持久化——这把持久化KV缓存占用进一步降低到DeepSeek V4-Flash的约1/8。
第三层:CSA2(Compressed Sparse Attention 2,压缩稀疏注意力第二代)。CSA2为每个注意力层分配三种静态工作模式之一:Full(全注意力)、Reindex(索引复用)或Reuse(直接复用)。通过跨层共享主KV和索引,大幅减少了实际需要存储的KV内容量。
第四层:FP4量化。主KV使用FP4精度(E2M1格式,每16个通道共享一个E4M3精度的缩放因子)进行存储。相比传统的FP16(16位浮点数),FP4将每个数值的存储空间从2字节压缩到0.5字节(加上共享缩放因子后约0.625字节),即额外4倍的存储密度提升。
这四层压缩技术叠加,最终实现了890字节每token的全局KV缓存——相比DeepSeek V1的约390000字节每token,总计437倍的压缩比。
各层压缩贡献的量化分析
为了更直观地理解这四层技术的贡献比例,可以做一个粗略的拆解估算:
从DeepSeek V1(约390000字节/token)到V4-Flash(约3600字节/token),主要压缩来自MLA(Multi-head Latent Attention)架构和GQA的引入,实现约108倍压缩。这部分是V3/V4系列的架构基础。
从V4-Flash(约3600字节/token)到V4.1-Flash(890字节/token),约4倍的增量压缩可以粗略分解为:CED全局KV共享贡献约1.8倍(解码器层数折叠效应);SWA Bounded Replay贡献约1.2倍(消除SSD持久化开销);CSA2跨层共享贡献约1.1倍;FP4量化贡献约1.5倍(从FP8到FP4的额外压缩,假设V4-Flash已使用FP8)。
需要说明的是,上述拆解是基于技术报告描述的推算,各层之间存在交互效应,实际贡献比例并非简单乘法关系。DeepSeek官方技术报告中未提供精确的逐层消融实验数据,这是当前技术文档的一个不足之处,也是外部研究者需要通过复现实验来验证的方向。
性能代价:压缩是否影响了智能水平
任何工程优化都涉及权衡。一个自然的问题是:如此激进的内存压缩,是否以牺牲模型智能水平为代价?
根据DeepSeek在HuggingFace发布的技术报告,V4.1-Flash在多个主要基准测试上的表现与V4-Flash相当甚至更优:
在世界知识类评测(MMLU-Pro 5-shot):V4.1-Flash基础模型得分74.1,高于V4-Flash基础模型的68.3。
在代码评测(HumanEval Pass@1):V4.1-Flash得分79.4,高于V4-Flash的69.5。
在数学评测(GSM8K 8-shot):V4.1-Flash得分93.0,高于V4-Flash的90.8。
在推理评测(BBH 3-shot):V4.1-Flash得分86.1,与V4-Flash的86.9相当。
从基准测试数据来看,DeepSeek V4.1-Flash在实现4倍KV缓存压缩的同时,实际上在多个维度提升了模型的基础能力,而不是做出了明显的性能让步。
这个结果令人意外。通常,模型压缩技术(量化、剪枝、蒸馏)都需要在内存/计算效率和模型能力之间进行权衡。DeepSeek V4.1-Flash在架构层面就实现了压缩,绕开了这个传统权衡,这是其最关键的技术价值所在。
基准测试的局限性与独立评估的必要性
然而,仅凭官方发布的基准测试数据得出结论,存在若干需要审慎对待的问题。
首先,基准测试污染(benchmark contamination)是大模型评估领域的长期争议。当模型训练数据中包含与评测集高度重叠的内容时,基准测试分数可能高估模型的真实泛化能力。MMLU-Pro、GSM8K等评测集已经在互联网上广泛流传多年,其训练集污染风险不可忽视。
其次,「Flash」系列模型的定位是效率优先,其真正的竞争对手不是同代旗舰模型,而是同等推理成本下的其他选择。更有意义的比较维度是:在相同的GPU内存预算下,V4.1-Flash能够服务的并发用户数量,与同等智能水平的竞品相比如何?这类「成本归一化」的评测目前尚无标准化方法论。
第三,对于AI智能体的核心能力——工具调用准确性、多步骤规划、错误恢复——现有标准基准测试的覆盖仍然不足。ToolBench、AgentBench等智能体专项评测(来源:Qin等人,《ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs》,ICLR 2024)提供了更贴近实际部署场景的评估视角,但V4.1-Flash在这些评测上的独立第三方结果尚待补充。
这些局限性并不否定V4.1-Flash的技术成就,但提醒我们:在官方数据之外,等待独立研究机构的复现和评估,是形成完整判断的必要步骤。
算力受限语境:中国AI的生存策略
理解DeepSeek V4.1-Flash,不能脱离其所处的地缘政治语境。
自2022年以来,美国持续对中国出口AI芯片加以限制,尤其是NVIDIA的高端GPU(H100、H200等)。中国AI企业能够获取的,主要是性能受限的A800、H800,以及国产芯片(华为昇腾、寒武纪等)。
这种算力封锁,在表面上似乎应该成为中国AI发展的绝对制约。但DeepSeek的一系列技术选择,恰恰构成了对算力封锁的系统性应对:
极致架构优化:如V4.1-Flash所示,通过改变模型内部结构来减少每个token对GPU内存和计算资源的需求。相同的计算能力,可以支撑更多智能工作负载。
低成本训练范式:DeepSeek的模型系列以超低训练成本闻名——DeepSeek V3的训练成本据报道约为576万美元,约为GPT-4训练成本的十分之一(来源:DeepSeek-AI,《DeepSeek-V3 Technical Report》,arXiv 2412.19437,2024年12月)。这种成本效率的实现,部分来自算法创新,部分来自在受限硬件条件下磨练出的系统级优化能力。
开源战略:DeepSeek将其模型以开源方式发布(MIT许可证),这一方面扩大了模型的用户和研究者基础,另一方面也使得外部开发者可以在各种硬件配置(包括非NVIDIA芯片)上部署模型。
V4.1-Flash的890字节/token KV缓存,可以在性能受限的国产AI芯片上运行更多并发会话——这不只是技术优化,这是在资源受限条件下维持AI系统可用性的生存策略。
从这个角度看,DeepSeek V4.1-Flash不只是一个模型发布,它是中国AI技术路线「效率即主权」(efficiency as sovereignty)这个战略方向的最新体现。
硬件限制的具体影响与数字化呈现
为了更具体地理解算力封锁的实际影响,有必要引入一些可量化的对比数据。
NVIDIA H100 SXM5(80GB HBM3)的理论峰值算力为3958 TFLOPS(BF16),内存带宽为3.35 TB/s。相比之下,华为昇腾910B的理论峰值算力约为256 TFLOPS(FP16),内存带宽约为2.0 TB/s(来源:华为官方产品规格,2023年)。在原始算力上,昇腾910B约为H100的6%至8%。
然而,这个原始算力差距并不直接等于AI推理能力的差距。推理性能的瓶颈往往在于内存带宽而非计算峰值,而在内存带宽上,昇腾910B与H100的差距约为40%,远小于计算峰值的差距。
更重要的是,KV缓存大小直接决定了在给定内存容量下能够维持的并发会话数量。假设一个典型的AI客服场景,每个会话的上下文长度为4096个token:
- 使用H100(80GB)+ 传统架构(3600字节/token):可维持约5400个并发会话(扣除模型权重占用后约20GB可用于KV缓存)
- 使用昇腾910B(64GB)+ V4.1-Flash(890字节/token):可维持约10700个并发会话(扣除模型权重后约12GB可用于KV缓存)
这个粗略估算说明:通过架构优化,在受限硬件上运行的V4.1-Flash,在并发服务能力上可以超越在更先进硬件上运行的传统架构模型。这正是「效率即主权」战略的核心逻辑。
当然,上述估算忽略了计算延迟、批处理效率等因素,实际部署中的差距会更加复杂。但方向性的结论是成立的:架构效率可以在相当程度上弥补硬件代差。
552B参数下的智能体优化
DeepSeek V4.1-Flash的另一个设计特点,是它明确为「智能体工作负载」(agentic workloads)优化。
技术报告明确指出,CED架构「大幅提升了输入密集型智能体工作负载的成本效率」。智能体应用的典型特征是:输入上下文很长(需要工具调用记录、上下文历史、知识库内容),但输出相对较短(决策指令、单步操作结果)。这与传统聊天机器人应用(相对均衡的输入输出)有本质区别。
针对智能体场景的三个专门设计:
Engram条件内存:196B参数的稀疏内存组件,通过基于token的键值查找访问,为长期知识存储提供高效机制。相比将全部知识压缩进模型权重,Engram允许按需查询特定知识,同时保持计算的稀疏性。
DSpark推测解码:半自回归草稿生成配合置信度调度验证,在解码阶段加速输出生成,对输出长度较短的智能体场景尤其有效。
可控推理努力(1-100):模型支持一个从1到100的整数参数来控制推理计算投入——1表示最快、最经济,100表示最深入、最精确(所有基准测试数据均在reasoning_effort=100下测试)。这个设计允许部署者针对不同任务类型精确控制计算成本和响应质量之间的权衡。
这三个设计共同指向同一个方向:DeepSeek V4.1-Flash不是一个追求极限性能的「旗舰模型」,而是一个为大规模、高并发、成本敏感的AI智能体部署而专门构建的工程化产品。
智能体工作负载的市场规模与增长趋势
将V4.1-Flash的技术设计放在市场背景下,可以更清楚地看到其战略意图。
根据Gartner 2025年生成式AI报告,到2027年,超过50%的企业将在生产环境中部署AI智能体(来源:Gartner,《Predicts 2025: Generative AI》,2024年10月)。IDC的预测则更为激进:到2028年,全球AI智能体相关软件和服务市场规模将达到1500亿美元,年复合增长率超过45%(来源:IDC,《Worldwide Artificial Intelligence Software Forecast, 2024–2028》,2024年9月)。
在这个市场中,推理成本是企业采用AI智能体的核心障碍之一。麦肯锡2025年AI调研报告显示,在已经开始部署生成式AI的企业中,有63%将「推理成本过高」列为扩大规模的主要障碍(来源:McKinsey & Company,《The State of AI in 2025》,2025年5月)。
DeepSeek V4.1-Flash的4倍并发提升,直接对应着4倍的推理成本下降(在相同硬件预算下)。对于一个月处理1000万次智能体调用的企业,这意味着每月节省数十万美元的GPU租用费用。这种量级的成本差异,足以改变企业的采购决策和技术选型逻辑。
多模态能力:超越纯语言模型
DeepSeek V4.1-Flash还是一个原生多模态模型,从预训练阶段就同时处理文字和图像。
视觉架构基于DeepSeek-ViT视觉编码器(全新从头训练,采用2D-RoPE位置编码和3×3像素反混叠下采样),通过双层MLP投影器将图像转换为与文字embedding同等格式的视觉embedding,从语言模型预训练阶段开始就与文字embedding联合处理。
基准测试上,V4.1-Flash在文档VQA(DocVQA)上达到了95.6的LLM-Judge分数,在MMMU-Pro上达到56.5分,在RefCOCO(空间指代理解)上达到86.0%的平均精度。
对于AI智能体应用,多模态能力的意义在于:一个需要同时处理用户上传的图片、截图和文字指令的工作流,不再需要单独的视觉模型和语言模型串联,一个V4.1-Flash就可以完成全部处理,同时受益于其890字节/token的KV缓存效率优势。
多模态与KV缓存效率的交叉影响
一个容易被忽视的技术细节是:图像token的KV缓存消耗远高于文字token。以标准的ViT-L视觉编码器为例,一张512×512的图像会被编码为约1024个视觉token,每个视觉token在传统架构下的KV缓存消耗与文字token相当甚至更高(因为视觉embedding维度通常更大)。
这意味着,对于多模态智能体场景(例如需要持续分析摄像头画面的工业检测智能体,或需要处理大量截图的UI自动化智能体),KV缓存的内存压力会比纯文字场景更加突出。
DeepSeek V4.1-Flash的CED架构对视觉token同样适用——视觉embedding在进入解码器时,同样受益于全局KV共享机制。这使得V4.1-Flash在多模态智能体场景下的效率优势,可能比纯文字场景更加显著。
目前,多模态智能体的KV缓存优化是学术界和工业界的活跃研究方向。例如,Google在2025年发布的Gemini 2.0 Flash(来源:Google DeepMind,《Gemini 2.0 Flash Technical Report》,2025年2月)同样强调了视觉token的高效处理能力,但其KV缓存效率的具体数字尚未公开。V4.1-Flash在这一维度的公开透明度,是其相对于闭源竞品的一个重要优势。
市场含义:谁会从这个技术路线中获益最多
DeepSeek V4.1-Flash的技术路线,对不同类型的市场参与者有着不同的含义。
受益最大:需要在算力受限条件下运行大规模AI智能体部署的企业。这包括:中国互联网企业(受出口限制影响,无法获取最新一代NVIDIA GPU);成本敏感的中小企业(在自建硬件上部署AI服务,硬件规格受预算约束);以及边缘部署场景(IoT设备、工业控制器、机器人本地推理)。
竞争压力增加:那些通过「极高计算需求」来维持竞争壁垒的AI服务提供商。如果DeepSeek V4.1-Flash的方法被广泛采用,基于「我们的模型需要更多GPU因此更先进」的定价逻辑将受到直接挑战。未来,AI服务的定价将越来越多地基于「实际能力」而非「算力消耗」。
技术影响辐射:架构研究社区。CED架构、CSA2注意力机制和SWA Bounded Replay等技术,已经在开源社区引发广泛讨论。这些技术思路将在未来6到12个月被其他模型研究者广泛借鉴,推动AI模型内存效率的整体提升。
效率即战略主权:一个更深层的视角
大多数对DeepSeek V4.1-Flash的报道,聚焦在「4倍GPU并发提升」这个直观的工程指标上。但这个技术发布背后,有一个更深层的战略逻辑值得思考。
DeepSeek发布V4.1-Flash的时间节点,恰好是中美AI竞争进入新阶段的时刻:美国正在讨论更严格的AI芯片出口限制,中国AI企业的硬件获取渠道正在进一步收窄。
在这个背景下,DeepSeek V4.1-Flash的437倍KV缓存压缩,不只是一项工程进步,它是中国AI技术路线长期战略下的一个里程碑:当你无法获取最好的硬件,就把同样的硬件用到极限。
这种「在约束下创新」的能力,可能是中国AI在与美国竞争中最被低估的不对称优势之一。美国AI企业习惯了「算力充足」的开发环境,「堆算力」是解决性能问题最直接的路径。而DeepSeek在算力受限条件下进行的系统性优化,孕育出了一种不同的技术文化:极致的架构效率是第一优先级,而非事后的工程补丁。
这种技术文化的长期产物,可能是一套完全不同于「NVIDIA中心」的AI基础设施技术栈——在内存效率、计算稀疏性、推理优化上有着主流体系无法快速复制的积累深度。当全球AI基础设施向多元化方向演进,DeepSeek这种「与硬件解耦」的优化路线,将展现出更大的战略价值。
结语:890字节的含义,远不止于数字
DeepSeek V4.1-Flash将每token的KV缓存压缩到890字节,这个数字将进入AI系统设计的参考手册,成为未来一两年模型效率讨论的基准数据点。
但890字节背后更重要的,是它所代表的技术路线的确认:一家中国AI实验室,在算力受限、硬件匮乏的条件下,通过对模型架构的根本性创新,实现了同等硬件下4倍的智能体服务能力提升,同时在多个主要基准测试上提升或保持了模型性能。
当OpenAI和Google在讨论如何为下一代模型购置更多H200/B200 GPU时,DeepSeek的工程师在讨论的是:如何让现有的GPU发挥4倍的效能。这两种思路,代表了AI基础设施建设的两种截然不同的哲学,也预示着AI产业下一阶段竞争将在两条战线同时展开:算力军备赛,以及效率技术革命。
参考资料
- DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression — DeepSeek官方HuggingFace页面, 2026-09-19 — https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash