DeepSeek Harness vs Claude Code:中国开源Agent框架的真正野心,不只是「更便宜」
2026年8月13日,DeepSeek做了三件事,只有第三件才是最重要的。
第一件:发布了V4 Pro模型正式版(GA),Agent基准超越Claude Opus 4.8,接近Claude Opus 5水平。
第二件:宣布涨价,8月16日起峰值输出token价格从$0.87/百万上升到$3.96/百万,涨幅约4.5倍。(但仍比OpenAI和Anthropic便宜5倍以上。)
第三件:开源发布了Harness,一个专门为自主AI Agent设计的开发框架,定位为Claude Code的直接竞品。
大多数媒体报道都聚焦在前两件——”DeepSeek涨价了”是更性感的标题。但Harness,才是理解DeepSeek2026年战略的关键。
从模型到框架:DeepSeek战略重心的转移
要理解为什么Harness重要,需要先理解”模型竞争”和”框架竞争”的本质区别。
模型竞争是一场评分战争:谁在MMLU、AIME、SWE-bench上得分更高,谁更便宜,谁推理速度更快。这是一场可以被精确量化的竞争,也是一场会快速商品化的竞争——今天的最强模型,六个月后就会是标准配置。
框架竞争是一场生态战争:谁的工具让开发者更容易构建应用,谁就锁定了开发者。一旦开发者的代码库围绕某个框架构建,迁移成本极高,这就是框架的护城河。
Claude Code是这个逻辑的最佳例证:它不是”最强的AI编程工具”,而是”开发者工作流里最深度集成的AI工具”。Claude Code的用户不只是在使用一个工具,而是在把Anthropic嵌入他们的开发流程。
DeepSeek发布Harness,是在宣告:我们不满足于在模型层竞争,我们要进入开发者工具生态。
这是一个战略级别的跨越,而不是产品级别的迭代。
Harness的技术架构:为什么这个设计不一样
从SCMP的报道和DeepSeek的开源文档,可以了解Harness的核心架构思路。
模块化插件系统
传统Agent框架(包括LangChain、AutoGen等早期产品)的问题,是过度抽象导致灵活性丢失:框架提供了标准化的组件和接口,但当你需要做任何非标准的事情,就需要去对抗框架,而不是借助框架。
Harness采用了一个不同的设计哲学:框架提供最小核心,其余全部以插件形式交付。
具体来说,Harness的核心只负责:Agent的生命周期管理(初始化、执行、终止)、工具调用协议、基本的状态持久化。其他所有功能——搜索能力、代码执行、文件操作、外部API调用、多Agent协作——都是可选插件,开发者可以按需接入,也可以自己写。
这意味着,开发者不需要修改核心代码就能扩展Agent能力。他们只需要实现一个标准的插件接口,把它注册进Harness,Agent就自动具备了新能力。
推理力度的三档控制
Harness内置了对DeepSeek V4 Pro推理力度的三档控制:low(快速但简单推理)、high(平衡)、max(深度推理)。DeepSeek建议大多数Agent任务使用high档。
这个设计指向一个实际问题:不同Agent任务需要不同深度的推理,但当前大多数API不允许在同一个Agent执行流程里动态调整推理深度。Harness把这个控制权交给了开发者,让他们可以在任务的不同阶段使用不同深度的推理,在成本和质量之间做精细的权衡。
原生支持OpenAI Responses API
这是一个值得注意的细节:Harness内置了对OpenAI Responses API的原生支持,包括Codex集成。
这意味着,用Harness构建的Agent,可以在DeepSeek模型和OpenAI模型之间切换,而不需要修改Agent逻辑。这是”模型无关(model-agnostic)”设计的直接实现。
对于企业用户来说,这极具吸引力:你不需要押注一个模型,你可以随时根据成本和性能需求切换底层模型,而业务逻辑代码不受影响。
基准数据:V4 Pro性能提升到什么程度
DeepSeek发布了V4 Pro(2026-08-13 build)相对于Preview版本的性能提升数据:
| 基准 | Preview版本 | V4 Pro GA版本 | 提升 |
|---|---|---|---|
| Terminal Bench 2.1 | 72.1 | 87.9 | +15.8 |
| DeepSWE | 12.8 | 62.7 | +49.9 |
| Agent相关基准 | 低于Claude Opus 4.8 | 超越Claude Opus 4.8 | — |
根据Artificial Analysis的独立评测,V4 Pro GA在Intelligence Index上从45分提升到53分,与GLM-5.2持平。但仍低于Meta Muse Spark(57)、Qwen 3.8 Max(58)和Kimi K3(60)。Claude Opus 5以63分位居榜首。
需要特别说明的是:The-Decoder指出,这个GA版本”在部分类别里超越了Kimi K3和Fable 5,但整体仍低于这两者”。DeepSeek自己宣传的”接近Claude Opus 5”,是基于特定的Agent基准,而不是所有任务。
这是基准选择的常规游戏:每家公司都会选择对自己最有利的评分场景做宣传。V4 Pro的真实能力,需要在具体任务上进行测试,而不是仅凭发布数字判断。
Harness vs Claude Code:技术和生态的双重对比
现在来正面比较这两个产品,因为DeepSeek明确表示Harness的目标定位是Claude Code的竞品。
技术层面
| 维度 | Claude Code | DeepSeek Harness |
|---|---|---|
| 核心模型 | Claude Opus 5 / Sonnet | DeepSeek V4 Pro |
| 开源状态 | 闭源 | 完全开源 |
| 架构设计 | 深度集成Anthropic生态 | 模型无关,原生支持多模型 |
| 扩展性 | 通过MCP(Model Context Protocol) | 通过插件系统 |
| 推理控制 | 有限 | 三档明确控制 |
| 价格 | Pro计划$20/月起(个人),企业按量计费 | 按token计费,仍低于Claude |
生态层面
Claude Code的护城河在于:深度集成进了VS Code和JetBrains生态;与GitHub Copilot形成竞争但也有协作;Anthropic的品牌信任(安全性、可靠性)在企业市场有溢价。
Harness的优势在于:完全开源意味着可以私有化部署。对于数据安全敏感的企业、或者不希望将代码库发送到Anthropic服务器的用户,Harness提供了一个可以在内部基础设施上运行的选项。
这一点在法规严格的行业(金融、医疗、政府)具有重要意义。根据GDPR、HIPAA等法规,某些数据不能发送到境外服务,私有化部署的Agent框架,比依赖外部API的Claude Code更容易通过合规审查。
中国AI的框架战略:从模型层到工具层的全面布局
Harness的发布,是中国AI公司2026年进化的一个缩影。
2025年,中国AI的竞争焦点在模型层:谁能在更低成本下复现OpenAI和Anthropic的能力?DeepSeek R1、Qwen、Kimi K1.5都是这一逻辑的产物。DeepSeek R1的发布,引发了全球市场对”中国AI可以更便宜”的系统性重估。
2026年,竞争重心正在移动。仅仅是”更便宜的模型”已经不够——因为模型能力的快速平等化,让价格优势越来越难以维持。当Kimi K3、Qwen 3.8 Max、DeepSeek V4 Pro都在接近Claude Opus 5水平时,”便宜”是一个随时会被压缩的优势。
下一个竞争层是开发者工具和框架——而这是一个更难被复制的护城河。
开发者一旦围绕某个框架构建了完整的应用生态,迁移成本极高。中国AI公司如果能在框架层建立先发优势,特别是在数据安全要求高的行业,就能在商业模式上摆脱”纯token销售”的低利润陷阱。
从这个角度看,DeepSeek涨价(从廉价到有利润)+ 发布Harness框架(从模型到工具生态),是一个完整的商业模式升级路径,而不是两件不相关的事。
开源战略的地缘政治维度
Harness完全开源,不只是技术决策,也是地缘政治决策。
美国出口管制已经限制了最先进的Nvidia GPU流向中国,也在一定程度上限制了中国AI公司在美国云服务上的部署。这使得中国AI公司面临一个挑战:如何向全球开发者提供可信赖的、可部署的AI工具,在美国政策风险之下?
答案之一,就是彻底开源。
当Harness完全开源,任何人都可以在任何基础设施上部署它,不需要依赖DeepSeek的服务器,不需要过境任何特定的网络路径,不需要服从任何单一公司的合规要求。这对于担心地缘政治风险的全球企业来说,是一个”风险分散”的选项。
DeepSeek自己可能受到各种限制,但Harness框架的代码,一旦开源到GitHub,就属于全球开发者社区。任何人可以fork,任何人可以修改,任何人可以在任何地方部署。这是开源的本质力量。
Meta用Llama系列证明了开源大模型的生态效应:即使Meta在某个市场遭受监管压力,Llama的开源代码已经在全球数千个私有化部署实例里运行,不受单一政策的控制。
DeepSeek在框架层复制同样的逻辑,是一个深思熟虑的战略选择。
开发者的实际选择:如何判断是否应该迁移到Harness
如果你是一个正在使用Claude Code或其他Agent框架的开发者,Harness值得关注,但有几个关键的评估维度:
适合考虑Harness的场景:
- 数据安全优先:你的代码库不能发送到外部服务器,需要完全本地化部署
- 模型无关需求:你需要在多个模型之间切换,或未来可能需要
- 深度定制需求:你的Agent需要非常特定的工具集成,标准框架无法满足
- 成本敏感:处理大量Agent调用,DeepSeek的价格仍然比Anthropic便宜
继续使用Claude Code更合适的场景:
- Claude Opus 5的能力在你的任务上明显更好:如果你的具体任务需要最高水平的推理能力,当前V4 Pro仍有差距
- 深度VS Code/JetBrains集成:Claude Code的IDE集成成熟度高,Harness还在早期
- 企业Anthropic协议:已经有Anthropic企业合约的公司,切换的谈判和合规成本可能超过收益
- 团队对Claude的信任度高:特别是在安全性、可预测性上
注意:当前状态
Harness目前仍是开发者预览版。大规模生产部署前,需要等待更多社区测试、安全审计和稳定性验证。在关键业务场景使用开发者预览版,风险自担。
更大的格局:Agent框架竞争将决定AI应用层的话语权
让我们在最后拉高视角。
2024年是大模型的基础能力竞争年;2025年是模型性能价格竞争年;2026年正在变成AI开发者工具和框架的竞争年。
这个演变有其必然性。当模型能力达到足够水平、价格足够低廉,决定应用成功的不再是”用哪个模型”,而是”如何把模型有效地嵌入应用逻辑、工作流和产品体验”。
这正是框架的价值所在:降低AI应用开发的复杂度,让开发者专注于业务逻辑,而不是重复解决工具调用、上下文管理、错误处理这些基础问题。
目前主要的框架竞争格局:
| 框架 | 背后公司 | 开源 | 定位 |
|---|---|---|---|
| Claude Code | Anthropic | 否 | 最强模型+深度IDE集成 |
| DeepSeek Harness | DeepSeek | 是 | 插件化,模型无关,可私有化 |
| LangChain | 独立公司 | 是 | 通用,第三方模型支持广 |
| AutoGen | Microsoft | 是 | 多Agent协作专注 |
| Semantic Kernel | Microsoft | 是 | 企业集成,Azure生态 |
| Meta Muse Code框架 | Meta | 待确认 | Muse Code的Agent框架 |
DeepSeek用一次发布,把自己放进了这个框架竞争矩阵里,而且是作为少数几个可以合法大规模使用的开源、非美国选项之一。
对整个AI行业而言,Harness的开源发布意味着:框架层的竞争正式开始,而且这场竞争不会由一家公司主导。
这是一个对开发者来说好消息的发展:竞争会推动创新,开源会降低使用门槛,框架多样化会减少单点依赖风险。
但对Anthropic来说,这也是一个明确的信号:Claude Code现在有了一个来自中国的开源直接竞争对手,而这个竞争对手没有被出口管制阻挡——因为框架是代码,代码是信息,信息是自由流动的。
数据来源:
- The-Decoder:DeepSeek ships improved V4 Pro, open-sources its agent software, and raises API prices(2026-08-13)
- South China Morning Post:Launch of DeepSeek’s Harness marks its strategic pivot towards autonomous agentic AI(2026-08-14)
- TechWireAsia:DeepSeek V4 Pro launches as US-China open AI model race intensifies(2026-08-14)
- Artificial Analysis: V4 Pro Intelligence Index benchmark data
- WSJ: DeepSeek Lifts AI Model Prices Fourfold(2026-08-13)
DeepSeek的Jane Street工程师:Harness背后的团队信号
在SCMP的报道中,有一个细节值得关注:DeepSeek在2026年3月专门从Jane Street挖来了一位工程师Cui Tianyu,组建了专门的”Harness团队”。
Jane Street是量化交易公司,以编程能力和系统设计水平极高著称,是OpenAI、Anthropic等AI公司大量招募目标。DeepSeek从Jane Street引进人才到专门的框架研发团队,而不是放到模型训练团队,说明这个战略是在相当早的时候就定下来的。
在AI公司里,招谁来做什么,是战略意图的最直接信号。一个专门的Harness团队,比一个”模型团队的副产品”所传达的战略决心,完全不同。
这意味着Harness不是DeepSeek在发布V4 Pro时顺带丢出来的一个配套工具,而是被当作独立产品在经营的。接下来关注Harness的迭代速度,将是判断DeepSeek在框架层是否真有长期投入的重要指标。
技术债务与框架新玩家的机会
还有一个更宏观的背景值得提及:AI框架领域目前有一个显著的技术债务问题。
LangChain作为最早广泛采用的Agent框架,在2022-2024年积累了大量用户,但也积累了大量历史包袱:API频繁变更、抽象层过深、文档落后于代码、某些设计决策在规模化部署下表现不佳。
这为新框架提供了机会:如果你从零开始设计,你可以吸取LangChain的教训,避免这些陷阱。
Harness正处于这个时机窗口。如果它的开发者体验和稳定性满足要求,它有机会成为”LangChain的下一代替代品”的强有力候选者,不只是DeepSeek模型的配套工具。
当然,目前还是Developer Preview阶段,一切都是潜力,而不是证明。
Harness可能的弱点和风险
诚实地呈现另一面:
社区生态:开源框架的价值来自社区贡献——第三方插件、文档、教程、Issue讨论。Claude Code背后是Anthropic的工程团队,Harness背后是DeepSeek的Harness团队。两者的社区生态建设速度,将在接下来6-12个月里见分晓。
安全审计:开源代码意味着安全研究人员可以公开审查漏洞。这是双刃剑:更透明,但也意味着发现的安全问题会被公开,需要快速响应。一个安全机制不完善的Agent框架,在企业环境里是极大的风险。
长期维护承诺:DeepSeek是一家中国初创公司,面临出口管制和地缘政治不确定性。即使Harness完全开源,如果核心维护团队因外部压力减少投入,社区是否能接棒,是一个开放问题。
与DeepSeek模型的绑定:Harness声称模型无关,但优化和测试显然是围绕V4 Pro进行的。在其他模型上的表现是否同样出色,需要独立测试验证。
写在最后:一个更公平的时代正在到来
关于中国AI,有两种简单化的叙事:一种是”中国AI只会抄袭,没有创新”,另一种是”中国AI马上要统治世界”。这两种都是错的。
更准确的描述是:中国AI正在经历一个从”跟随”到”参与竞争”的转型,Harness就是这个转型在框架层的体现。
开发者不需要在”哪家AI更爱国”之间做选择。他们会选择能解决他们问题、有合理定价、有可持续生态的工具。
Harness能否成为那个工具,在接下来12-18个月里会有答案。
当前,它是一个值得关注的开始。
写于2026年8月15日北京时间06:02
| _参考来源:The-Decoder(2026-08-13) | SCMP(2026-08-14) | TechWireAsia(2026-08-14) | WSJ(2026-08-13)_ |
DeepSeek V4 Pro的具体能力:给开发者的实测指南
除了框架战略,V4 Pro本身的能力升级也值得具体了解,因为这直接影响Harness的实际可用性。
代码能力的重大跳跃
V4 Pro最显著的提升是DeepSWE得分从12.8跳升到62.7,涨幅近50点。DeepSWE是一个测试AI解决GitHub真实软件工程问题的基准,62.7分意味着V4 Pro可以独立解决超过60%的中等难度GitHub Issue,这是一个实用级别的代码能力门槛。
相比之下,Claude Opus 5在相同类型的代码基准上得分通常在65-70之间。V4 Pro仍然落后,但差距从无法相提并论缩小到了”可以实际使用”。
对于大多数日常编程任务——不是OpenAI数学奥林匹克级别的研究,而是真实工程师日常面对的代码调试、功能实现、文档生成——V4 Pro的提升意味着它从”辅助工具”升级为”可以独立完成部分任务的工具”。
Agent基准的实际含义
V4 Pro在Terminal Bench 2.1上的87.9分(相比Preview版本的72.1),反映了它在需要调用终端命令、执行多步骤操作、处理错误和重试的复杂Agent任务上的提升。
Terminal Bench测试的是Agent在真实的Linux终端环境里解决工程问题的能力,比纯粹的语言理解基准更接近实际使用场景。87.9分意味着V4 Pro在大约88%的测试任务上能够正确完成任务,这对于实际的Harness应用来说,是一个相当可靠的基础。
价格与性能的综合评估
涨价后的V4 Pro定价(峰值$3.96/百万tokens,谷值$1.32/百万tokens)与Claude Opus 5($15/百万输出tokens)相比,仍然便宜约4倍。
如果V4 Pro的实际任务完成质量达到Claude Opus 5的85%,以当前的价格差距计算,ROI明显更优,特别是在大规模批量Agent任务的场景下。
这个计算,是许多企业在评估是否迁移Agent工作负载到DeepSeek时会做的分析。结果可能会让更多人认真考虑Harness。
开发者生态的现实挑战
技术能力是一方面,生态建设是另一方面。Harness要真正成为有影响力的框架,需要克服几个现实的生态挑战。
文档和示例的缺失
目前Harness处于Developer Preview阶段,文档完整度和示例代码丰富度远不及Claude Code和LangChain。对于不愿意自己探索的开发者来说,这是一个明显的门槛。
IDE集成的缺失
Claude Code与VS Code的深度集成——自动代码建议、终端内AI操作、项目范围的上下文理解——是它用户黏性最强的部分。Harness目前没有对应的IDE插件,开发者需要通过命令行或API调用来使用,体验摩擦比较大。
测试覆盖率不透明
开源框架的另一个信任问题是:测试覆盖率如何?边界情况是否被充分处理?在生产环境中遇到奇怪行为时,是否有足够的社区支持来快速定位问题?
这些问题,Harness目前还没有足够的时间来回答。DeepSeek需要建立一个活跃的开源社区,而这通常需要6-12个月的培育期。
关于涨价:是战略还是被迫?
最后简单分析一下涨价这件事,因为它和Harness的战略是绑在一起的。
DeepSeek的涨价(4.5倍),表面上打破了”中国AI超便宜”的叙事,但实际上是一个经过深思熟虑的定价策略调整。
涨价是可行的:DeepSeek的旧价格($0.87/百万tokens)在业界是异常低的。即使涨价到$3.96,仍然比OpenAI和Anthropic便宜4-5倍。这个调整是在保留价格优势的前提下,将利润率提升到可持续的水平。
涨价是必要的:持续的低价策略无法支撑高质量的研发和基础设施投入。如果DeepSeek无法从模型API中获得合理利润,它就无法继续投入V5、V6的研发,也无法投入Harness的长期维护。
涨价是测试:通过涨价,DeepSeek可以测试市场对其价值的认可程度——价格弹性有多大?在涨价后,有多少用户流失,有多少用户留下?这个数据,是制定未来定价策略的重要基础。
不管动机如何,结果是:DeepSeek仍然有价格优势,但不再是”贱卖”。对于正在认真考虑将Agent工作负载建在DeepSeek上的企业,这是一个更可持续的定价信号,反而可能增加信任。
| _参考来源:The-Decoder(2026-08-13) | SCMP(2026-08-14) | WSJ(2026-08-13) | Artificial Analysis基准数据_ |
Harness在不同行业的落地场景:三个具体案例
抽象地谈框架竞争,不如用具体场景来理解Harness的价值边界。
场景一:金融行业的合规代码审查
一家大型投行的技术团队,每天需要审查数百份代码提交,检查是否符合内部安全规范和监管要求。当前使用Claude API做这件事,但有合规问题:根据SEC和FINRA的数据保护规定,含有客户数据的代码不能发送给外部AI服务处理。
引入Harness的理由:私有化部署在内部基础设施上,代码不离开公司网络,而且可以集成公司自定义的合规规则库作为插件。这个场景下,Harness的价格优势是次要的,私有化部署能力才是决定因素。
场景二:游戏公司的内容生成流水线
一家大型游戏公司正在构建AI辅助的关卡设计工具,需要一个Agent在接收设计师指令后,自动生成关卡草图、平衡性测试脚本、多语言描述文本,并与内部资产管理系统交互。
这个场景的核心需求是:高度定制化的工具集成(游戏公司的内部工具通常非常垂直)、成本控制(内容生成是高频操作)、模型可切换(不同任务使用不同模型:V4 Pro做代码,Gemini做图像描述)。
Harness的插件架构和模型无关设计,理论上是这个场景的好选择。
场景三:医疗机构的临床文档自动化
一家医院系统正在评估AI辅助临床文档(病历、检查报告摘要)的可行性。患者数据是最敏感的数据类别之一,HIPAA要求极高的隐私保护标准。
私有化部署的AI Agent框架,是唯一满足合规要求的选项。Harness作为开源框架,可以经过医院内部安全团队的代码审计,然后部署在符合HIPAA要求的私有云环境中。这是Claude Code API方案无法竞争的场景。
竞争总结:不同市场,不同赢家
经过以上分析,可以得出一个结论:Harness和Claude Code将在不同市场细分里各自找到自己的地盘,而不是零和竞争关系。
Claude Code主导的市场:
- 需要最高水平代码能力的高端开发场景
- 深度集成VS Code/JetBrains工作流的个人开发者
- 优先信任Anthropic品牌安全性的企业
- AI Native创业公司(追求最新最强能力,而不是最低成本)
Harness有竞争力的市场:
- 数据合规要求需要私有化部署的企业(金融、医疗、政府)
- 大规模批量Agent任务(成本敏感,可以用略低质量换取大幅降价)
- 非美国地区开发者(地缘政治风险分散需求)
- 需要高度自定义插件集成的垂直行业应用
这个市场分层,对DeepSeek来说可能比正面攻打Claude Code更聪明——不是试图在所有维度都超越,而是找到Claude Code无法或不愿意服务的细分场景,在那里建立根据地。
从商业竞争角度看,这是一个相当成熟的市场进入策略。
| _最终参考来源:The-Decoder(2026-08-13) | SCMP(2026-08-14) | WSJ(2026-08-13)_ |
致开发者的最终建议
如果你是正在做AI应用开发的工程师或技术负责人,2026年8月的Harness发布,是值得在你的技术雷达上标注一颗星的事件。
推荐的行动步骤:
-
关注但暂缓生产部署:Harness是Developer Preview,生产级别的稳定性需要更多时间验证。建议在沙箱环境中测试,了解其能力和局限,等候1.0稳定版本发布后再考虑迁移。
-
评估数据合规需求:如果你的应用有数据本地化要求,把Harness加入评估候选名单。私有化部署能力,在这个维度上是明显优势。
-
测试V4 Pro在你的具体任务上的表现:基准分数不等于你的任务表现。用你自己的任务测试V4 Pro,把结果和Claude Opus 5的结果对比,用实测数据做决策,而不是抽象的性能排行榜。
-
关注Harness社区的发展速度:GitHub star数量、Issue响应时间、社区活跃度,是框架长期可持续性的重要信号。未来3-6个月,观察这些指标的变化趋势。
一个伟大的框架,需要时间证明自己。Harness给了一个好的开头,接下来的执行才是真正的考验。
写于2026年8月15日北京时间06:15