2026年8月13日,DeepSeek做了三件事,只有第三件才是最重要的。

第一件:发布了V4 Pro模型正式版(GA),Agent基准超越Claude Opus 4.8,接近Claude Opus 5水平。

第二件:宣布涨价,8月16日起峰值输出token价格从$0.87/百万上升到$3.96/百万,涨幅约4.5倍。(但仍比OpenAI和Anthropic便宜5倍以上。)

第三件:开源发布了Harness,一个专门为自主AI Agent设计的开发框架,定位为Claude Code的直接竞品。

大多数媒体报道都聚焦在前两件——”DeepSeek涨价了”是更性感的标题。但Harness,才是理解DeepSeek2026年战略的关键。


从模型到框架:DeepSeek战略重心的转移

要理解为什么Harness重要,需要先理解”模型竞争”和”框架竞争”的本质区别。

模型竞争是一场评分战争:谁在MMLU、AIME、SWE-bench上得分更高,谁更便宜,谁推理速度更快。这是一场可以被精确量化的竞争,也是一场会快速商品化的竞争——今天的最强模型,六个月后就会是标准配置。

框架竞争是一场生态战争:谁的工具让开发者更容易构建应用,谁就锁定了开发者。一旦开发者的代码库围绕某个框架构建,迁移成本极高,这就是框架的护城河。

Claude Code是这个逻辑的最佳例证:它不是”最强的AI编程工具”,而是”开发者工作流里最深度集成的AI工具”。Claude Code的用户不只是在使用一个工具,而是在把Anthropic嵌入他们的开发流程。

DeepSeek发布Harness,是在宣告:我们不满足于在模型层竞争,我们要进入开发者工具生态。

这是一个战略级别的跨越,而不是产品级别的迭代。


Harness的技术架构:为什么这个设计不一样

从SCMP的报道和DeepSeek的开源文档,可以了解Harness的核心架构思路。

模块化插件系统

传统Agent框架(包括LangChain、AutoGen等早期产品)的问题,是过度抽象导致灵活性丢失:框架提供了标准化的组件和接口,但当你需要做任何非标准的事情,就需要去对抗框架,而不是借助框架。

Harness采用了一个不同的设计哲学:框架提供最小核心,其余全部以插件形式交付

具体来说,Harness的核心只负责:Agent的生命周期管理(初始化、执行、终止)、工具调用协议、基本的状态持久化。其他所有功能——搜索能力、代码执行、文件操作、外部API调用、多Agent协作——都是可选插件,开发者可以按需接入,也可以自己写。

这意味着,开发者不需要修改核心代码就能扩展Agent能力。他们只需要实现一个标准的插件接口,把它注册进Harness,Agent就自动具备了新能力。

推理力度的三档控制

Harness内置了对DeepSeek V4 Pro推理力度的三档控制:low(快速但简单推理)、high(平衡)、max(深度推理)。DeepSeek建议大多数Agent任务使用high档。

这个设计指向一个实际问题:不同Agent任务需要不同深度的推理,但当前大多数API不允许在同一个Agent执行流程里动态调整推理深度。Harness把这个控制权交给了开发者,让他们可以在任务的不同阶段使用不同深度的推理,在成本和质量之间做精细的权衡。

原生支持OpenAI Responses API

这是一个值得注意的细节:Harness内置了对OpenAI Responses API的原生支持,包括Codex集成。

这意味着,用Harness构建的Agent,可以在DeepSeek模型和OpenAI模型之间切换,而不需要修改Agent逻辑。这是”模型无关(model-agnostic)”设计的直接实现。

对于企业用户来说,这极具吸引力:你不需要押注一个模型,你可以随时根据成本和性能需求切换底层模型,而业务逻辑代码不受影响。


基准数据:V4 Pro性能提升到什么程度

DeepSeek发布了V4 Pro(2026-08-13 build)相对于Preview版本的性能提升数据:

基准 Preview版本 V4 Pro GA版本 提升
Terminal Bench 2.1 72.1 87.9 +15.8
DeepSWE 12.8 62.7 +49.9
Agent相关基准 低于Claude Opus 4.8 超越Claude Opus 4.8

根据Artificial Analysis的独立评测,V4 Pro GA在Intelligence Index上从45分提升到53分,与GLM-5.2持平。但仍低于Meta Muse Spark(57)、Qwen 3.8 Max(58)和Kimi K3(60)。Claude Opus 5以63分位居榜首。

需要特别说明的是:The-Decoder指出,这个GA版本”在部分类别里超越了Kimi K3和Fable 5,但整体仍低于这两者”。DeepSeek自己宣传的”接近Claude Opus 5”,是基于特定的Agent基准,而不是所有任务。

这是基准选择的常规游戏:每家公司都会选择对自己最有利的评分场景做宣传。V4 Pro的真实能力,需要在具体任务上进行测试,而不是仅凭发布数字判断。


Harness vs Claude Code:技术和生态的双重对比

现在来正面比较这两个产品,因为DeepSeek明确表示Harness的目标定位是Claude Code的竞品。

技术层面

维度 Claude Code DeepSeek Harness
核心模型 Claude Opus 5 / Sonnet DeepSeek V4 Pro
开源状态 闭源 完全开源
架构设计 深度集成Anthropic生态 模型无关,原生支持多模型
扩展性 通过MCP(Model Context Protocol) 通过插件系统
推理控制 有限 三档明确控制
价格 Pro计划$20/月起(个人),企业按量计费 按token计费,仍低于Claude

生态层面

Claude Code的护城河在于:深度集成进了VS Code和JetBrains生态;与GitHub Copilot形成竞争但也有协作;Anthropic的品牌信任(安全性、可靠性)在企业市场有溢价。

Harness的优势在于:完全开源意味着可以私有化部署。对于数据安全敏感的企业、或者不希望将代码库发送到Anthropic服务器的用户,Harness提供了一个可以在内部基础设施上运行的选项。

这一点在法规严格的行业(金融、医疗、政府)具有重要意义。根据GDPR、HIPAA等法规,某些数据不能发送到境外服务,私有化部署的Agent框架,比依赖外部API的Claude Code更容易通过合规审查。


中国AI的框架战略:从模型层到工具层的全面布局

Harness的发布,是中国AI公司2026年进化的一个缩影。

2025年,中国AI的竞争焦点在模型层:谁能在更低成本下复现OpenAI和Anthropic的能力?DeepSeek R1、Qwen、Kimi K1.5都是这一逻辑的产物。DeepSeek R1的发布,引发了全球市场对”中国AI可以更便宜”的系统性重估。

2026年,竞争重心正在移动。仅仅是”更便宜的模型”已经不够——因为模型能力的快速平等化,让价格优势越来越难以维持。当Kimi K3、Qwen 3.8 Max、DeepSeek V4 Pro都在接近Claude Opus 5水平时,”便宜”是一个随时会被压缩的优势。

下一个竞争层是开发者工具和框架——而这是一个更难被复制的护城河。

开发者一旦围绕某个框架构建了完整的应用生态,迁移成本极高。中国AI公司如果能在框架层建立先发优势,特别是在数据安全要求高的行业,就能在商业模式上摆脱”纯token销售”的低利润陷阱。

从这个角度看,DeepSeek涨价(从廉价到有利润)+ 发布Harness框架(从模型到工具生态),是一个完整的商业模式升级路径,而不是两件不相关的事。


开源战略的地缘政治维度

Harness完全开源,不只是技术决策,也是地缘政治决策。

美国出口管制已经限制了最先进的Nvidia GPU流向中国,也在一定程度上限制了中国AI公司在美国云服务上的部署。这使得中国AI公司面临一个挑战:如何向全球开发者提供可信赖的、可部署的AI工具,在美国政策风险之下?

答案之一,就是彻底开源。

当Harness完全开源,任何人都可以在任何基础设施上部署它,不需要依赖DeepSeek的服务器,不需要过境任何特定的网络路径,不需要服从任何单一公司的合规要求。这对于担心地缘政治风险的全球企业来说,是一个”风险分散”的选项。

DeepSeek自己可能受到各种限制,但Harness框架的代码,一旦开源到GitHub,就属于全球开发者社区。任何人可以fork,任何人可以修改,任何人可以在任何地方部署。这是开源的本质力量。

Meta用Llama系列证明了开源大模型的生态效应:即使Meta在某个市场遭受监管压力,Llama的开源代码已经在全球数千个私有化部署实例里运行,不受单一政策的控制。

DeepSeek在框架层复制同样的逻辑,是一个深思熟虑的战略选择。


开发者的实际选择:如何判断是否应该迁移到Harness

如果你是一个正在使用Claude Code或其他Agent框架的开发者,Harness值得关注,但有几个关键的评估维度:

适合考虑Harness的场景:

  1. 数据安全优先:你的代码库不能发送到外部服务器,需要完全本地化部署
  2. 模型无关需求:你需要在多个模型之间切换,或未来可能需要
  3. 深度定制需求:你的Agent需要非常特定的工具集成,标准框架无法满足
  4. 成本敏感:处理大量Agent调用,DeepSeek的价格仍然比Anthropic便宜

继续使用Claude Code更合适的场景:

  1. Claude Opus 5的能力在你的任务上明显更好:如果你的具体任务需要最高水平的推理能力,当前V4 Pro仍有差距
  2. 深度VS Code/JetBrains集成:Claude Code的IDE集成成熟度高,Harness还在早期
  3. 企业Anthropic协议:已经有Anthropic企业合约的公司,切换的谈判和合规成本可能超过收益
  4. 团队对Claude的信任度高:特别是在安全性、可预测性上

注意:当前状态

Harness目前仍是开发者预览版。大规模生产部署前,需要等待更多社区测试、安全审计和稳定性验证。在关键业务场景使用开发者预览版,风险自担。


更大的格局:Agent框架竞争将决定AI应用层的话语权

让我们在最后拉高视角。

2024年是大模型的基础能力竞争年;2025年是模型性能价格竞争年;2026年正在变成AI开发者工具和框架的竞争年

这个演变有其必然性。当模型能力达到足够水平、价格足够低廉,决定应用成功的不再是”用哪个模型”,而是”如何把模型有效地嵌入应用逻辑、工作流和产品体验”。

这正是框架的价值所在:降低AI应用开发的复杂度,让开发者专注于业务逻辑,而不是重复解决工具调用、上下文管理、错误处理这些基础问题。

目前主要的框架竞争格局:

框架 背后公司 开源 定位
Claude Code Anthropic 最强模型+深度IDE集成
DeepSeek Harness DeepSeek 插件化,模型无关,可私有化
LangChain 独立公司 通用,第三方模型支持广
AutoGen Microsoft 多Agent协作专注
Semantic Kernel Microsoft 企业集成,Azure生态
Meta Muse Code框架 Meta 待确认 Muse Code的Agent框架

DeepSeek用一次发布,把自己放进了这个框架竞争矩阵里,而且是作为少数几个可以合法大规模使用的开源、非美国选项之一。

对整个AI行业而言,Harness的开源发布意味着:框架层的竞争正式开始,而且这场竞争不会由一家公司主导。

这是一个对开发者来说好消息的发展:竞争会推动创新,开源会降低使用门槛,框架多样化会减少单点依赖风险。

但对Anthropic来说,这也是一个明确的信号:Claude Code现在有了一个来自中国的开源直接竞争对手,而这个竞争对手没有被出口管制阻挡——因为框架是代码,代码是信息,信息是自由流动的。


数据来源:


DeepSeek的Jane Street工程师:Harness背后的团队信号

在SCMP的报道中,有一个细节值得关注:DeepSeek在2026年3月专门从Jane Street挖来了一位工程师Cui Tianyu,组建了专门的”Harness团队”。

Jane Street是量化交易公司,以编程能力和系统设计水平极高著称,是OpenAI、Anthropic等AI公司大量招募目标。DeepSeek从Jane Street引进人才到专门的框架研发团队,而不是放到模型训练团队,说明这个战略是在相当早的时候就定下来的。

在AI公司里,招谁来做什么,是战略意图的最直接信号。一个专门的Harness团队,比一个”模型团队的副产品”所传达的战略决心,完全不同。

这意味着Harness不是DeepSeek在发布V4 Pro时顺带丢出来的一个配套工具,而是被当作独立产品在经营的。接下来关注Harness的迭代速度,将是判断DeepSeek在框架层是否真有长期投入的重要指标。


技术债务与框架新玩家的机会

还有一个更宏观的背景值得提及:AI框架领域目前有一个显著的技术债务问题。

LangChain作为最早广泛采用的Agent框架,在2022-2024年积累了大量用户,但也积累了大量历史包袱:API频繁变更、抽象层过深、文档落后于代码、某些设计决策在规模化部署下表现不佳。

这为新框架提供了机会:如果你从零开始设计,你可以吸取LangChain的教训,避免这些陷阱。

Harness正处于这个时机窗口。如果它的开发者体验和稳定性满足要求,它有机会成为”LangChain的下一代替代品”的强有力候选者,不只是DeepSeek模型的配套工具。

当然,目前还是Developer Preview阶段,一切都是潜力,而不是证明。


Harness可能的弱点和风险

诚实地呈现另一面:

社区生态:开源框架的价值来自社区贡献——第三方插件、文档、教程、Issue讨论。Claude Code背后是Anthropic的工程团队,Harness背后是DeepSeek的Harness团队。两者的社区生态建设速度,将在接下来6-12个月里见分晓。

安全审计:开源代码意味着安全研究人员可以公开审查漏洞。这是双刃剑:更透明,但也意味着发现的安全问题会被公开,需要快速响应。一个安全机制不完善的Agent框架,在企业环境里是极大的风险。

长期维护承诺:DeepSeek是一家中国初创公司,面临出口管制和地缘政治不确定性。即使Harness完全开源,如果核心维护团队因外部压力减少投入,社区是否能接棒,是一个开放问题。

与DeepSeek模型的绑定:Harness声称模型无关,但优化和测试显然是围绕V4 Pro进行的。在其他模型上的表现是否同样出色,需要独立测试验证。


写在最后:一个更公平的时代正在到来

关于中国AI,有两种简单化的叙事:一种是”中国AI只会抄袭,没有创新”,另一种是”中国AI马上要统治世界”。这两种都是错的。

更准确的描述是:中国AI正在经历一个从”跟随”到”参与竞争”的转型,Harness就是这个转型在框架层的体现。

开发者不需要在”哪家AI更爱国”之间做选择。他们会选择能解决他们问题、有合理定价、有可持续生态的工具。

Harness能否成为那个工具,在接下来12-18个月里会有答案。

当前,它是一个值得关注的开始。


写于2026年8月15日北京时间06:02

_参考来源:The-Decoder(2026-08-13) SCMP(2026-08-14) TechWireAsia(2026-08-14) WSJ(2026-08-13)_

DeepSeek V4 Pro的具体能力:给开发者的实测指南

除了框架战略,V4 Pro本身的能力升级也值得具体了解,因为这直接影响Harness的实际可用性。

代码能力的重大跳跃

V4 Pro最显著的提升是DeepSWE得分从12.8跳升到62.7,涨幅近50点。DeepSWE是一个测试AI解决GitHub真实软件工程问题的基准,62.7分意味着V4 Pro可以独立解决超过60%的中等难度GitHub Issue,这是一个实用级别的代码能力门槛。

相比之下,Claude Opus 5在相同类型的代码基准上得分通常在65-70之间。V4 Pro仍然落后,但差距从无法相提并论缩小到了”可以实际使用”。

对于大多数日常编程任务——不是OpenAI数学奥林匹克级别的研究,而是真实工程师日常面对的代码调试、功能实现、文档生成——V4 Pro的提升意味着它从”辅助工具”升级为”可以独立完成部分任务的工具”。

Agent基准的实际含义

V4 Pro在Terminal Bench 2.1上的87.9分(相比Preview版本的72.1),反映了它在需要调用终端命令、执行多步骤操作、处理错误和重试的复杂Agent任务上的提升。

Terminal Bench测试的是Agent在真实的Linux终端环境里解决工程问题的能力,比纯粹的语言理解基准更接近实际使用场景。87.9分意味着V4 Pro在大约88%的测试任务上能够正确完成任务,这对于实际的Harness应用来说,是一个相当可靠的基础。

价格与性能的综合评估

涨价后的V4 Pro定价(峰值$3.96/百万tokens,谷值$1.32/百万tokens)与Claude Opus 5($15/百万输出tokens)相比,仍然便宜约4倍。

如果V4 Pro的实际任务完成质量达到Claude Opus 5的85%,以当前的价格差距计算,ROI明显更优,特别是在大规模批量Agent任务的场景下。

这个计算,是许多企业在评估是否迁移Agent工作负载到DeepSeek时会做的分析。结果可能会让更多人认真考虑Harness。


开发者生态的现实挑战

技术能力是一方面,生态建设是另一方面。Harness要真正成为有影响力的框架,需要克服几个现实的生态挑战。

文档和示例的缺失

目前Harness处于Developer Preview阶段,文档完整度和示例代码丰富度远不及Claude Code和LangChain。对于不愿意自己探索的开发者来说,这是一个明显的门槛。

IDE集成的缺失

Claude Code与VS Code的深度集成——自动代码建议、终端内AI操作、项目范围的上下文理解——是它用户黏性最强的部分。Harness目前没有对应的IDE插件,开发者需要通过命令行或API调用来使用,体验摩擦比较大。

测试覆盖率不透明

开源框架的另一个信任问题是:测试覆盖率如何?边界情况是否被充分处理?在生产环境中遇到奇怪行为时,是否有足够的社区支持来快速定位问题?

这些问题,Harness目前还没有足够的时间来回答。DeepSeek需要建立一个活跃的开源社区,而这通常需要6-12个月的培育期。


关于涨价:是战略还是被迫?

最后简单分析一下涨价这件事,因为它和Harness的战略是绑在一起的。

DeepSeek的涨价(4.5倍),表面上打破了”中国AI超便宜”的叙事,但实际上是一个经过深思熟虑的定价策略调整。

涨价是可行的:DeepSeek的旧价格($0.87/百万tokens)在业界是异常低的。即使涨价到$3.96,仍然比OpenAI和Anthropic便宜4-5倍。这个调整是在保留价格优势的前提下,将利润率提升到可持续的水平。

涨价是必要的:持续的低价策略无法支撑高质量的研发和基础设施投入。如果DeepSeek无法从模型API中获得合理利润,它就无法继续投入V5、V6的研发,也无法投入Harness的长期维护。

涨价是测试:通过涨价,DeepSeek可以测试市场对其价值的认可程度——价格弹性有多大?在涨价后,有多少用户流失,有多少用户留下?这个数据,是制定未来定价策略的重要基础。

不管动机如何,结果是:DeepSeek仍然有价格优势,但不再是”贱卖”。对于正在认真考虑将Agent工作负载建在DeepSeek上的企业,这是一个更可持续的定价信号,反而可能增加信任。


_参考来源:The-Decoder(2026-08-13) SCMP(2026-08-14) WSJ(2026-08-13) Artificial Analysis基准数据_

Harness在不同行业的落地场景:三个具体案例

抽象地谈框架竞争,不如用具体场景来理解Harness的价值边界。

场景一:金融行业的合规代码审查

一家大型投行的技术团队,每天需要审查数百份代码提交,检查是否符合内部安全规范和监管要求。当前使用Claude API做这件事,但有合规问题:根据SEC和FINRA的数据保护规定,含有客户数据的代码不能发送给外部AI服务处理。

引入Harness的理由:私有化部署在内部基础设施上,代码不离开公司网络,而且可以集成公司自定义的合规规则库作为插件。这个场景下,Harness的价格优势是次要的,私有化部署能力才是决定因素。

场景二:游戏公司的内容生成流水线

一家大型游戏公司正在构建AI辅助的关卡设计工具,需要一个Agent在接收设计师指令后,自动生成关卡草图、平衡性测试脚本、多语言描述文本,并与内部资产管理系统交互。

这个场景的核心需求是:高度定制化的工具集成(游戏公司的内部工具通常非常垂直)、成本控制(内容生成是高频操作)、模型可切换(不同任务使用不同模型:V4 Pro做代码,Gemini做图像描述)。

Harness的插件架构和模型无关设计,理论上是这个场景的好选择。

场景三:医疗机构的临床文档自动化

一家医院系统正在评估AI辅助临床文档(病历、检查报告摘要)的可行性。患者数据是最敏感的数据类别之一,HIPAA要求极高的隐私保护标准。

私有化部署的AI Agent框架,是唯一满足合规要求的选项。Harness作为开源框架,可以经过医院内部安全团队的代码审计,然后部署在符合HIPAA要求的私有云环境中。这是Claude Code API方案无法竞争的场景。


竞争总结:不同市场,不同赢家

经过以上分析,可以得出一个结论:Harness和Claude Code将在不同市场细分里各自找到自己的地盘,而不是零和竞争关系。

Claude Code主导的市场

  • 需要最高水平代码能力的高端开发场景
  • 深度集成VS Code/JetBrains工作流的个人开发者
  • 优先信任Anthropic品牌安全性的企业
  • AI Native创业公司(追求最新最强能力,而不是最低成本)

Harness有竞争力的市场

  • 数据合规要求需要私有化部署的企业(金融、医疗、政府)
  • 大规模批量Agent任务(成本敏感,可以用略低质量换取大幅降价)
  • 非美国地区开发者(地缘政治风险分散需求)
  • 需要高度自定义插件集成的垂直行业应用

这个市场分层,对DeepSeek来说可能比正面攻打Claude Code更聪明——不是试图在所有维度都超越,而是找到Claude Code无法或不愿意服务的细分场景,在那里建立根据地。

从商业竞争角度看,这是一个相当成熟的市场进入策略。


_最终参考来源:The-Decoder(2026-08-13) SCMP(2026-08-14) WSJ(2026-08-13)_

致开发者的最终建议

如果你是正在做AI应用开发的工程师或技术负责人,2026年8月的Harness发布,是值得在你的技术雷达上标注一颗星的事件。

推荐的行动步骤

  1. 关注但暂缓生产部署:Harness是Developer Preview,生产级别的稳定性需要更多时间验证。建议在沙箱环境中测试,了解其能力和局限,等候1.0稳定版本发布后再考虑迁移。

  2. 评估数据合规需求:如果你的应用有数据本地化要求,把Harness加入评估候选名单。私有化部署能力,在这个维度上是明显优势。

  3. 测试V4 Pro在你的具体任务上的表现:基准分数不等于你的任务表现。用你自己的任务测试V4 Pro,把结果和Claude Opus 5的结果对比,用实测数据做决策,而不是抽象的性能排行榜。

  4. 关注Harness社区的发展速度:GitHub star数量、Issue响应时间、社区活跃度,是框架长期可持续性的重要信号。未来3-6个月,观察这些指标的变化趋势。

一个伟大的框架,需要时间证明自己。Harness给了一个好的开头,接下来的执行才是真正的考验。

写于2026年8月15日北京时间06:15