2025年8月,一个数字让整个AI行业陷入沉思:NVIDIA的AVO框架在ARC-AGI-3基准测试上达到了100%的满分。这本身不算什么新鲜事——基准测试满分的新闻已经多到让人麻木。真正让人停下来思考的,是另一个对照数字:同样的底层模型Claude Opus 5,在没有AVO框架的情况下,ARC-AGI-3得分为30%。

同一个模型,70个百分点的差距,差别只在于外面套了什么。

这不是模型能力的提升,这是框架工程的胜利。而这个事实所揭示的产业逻辑转变,远比任何一次模型发布更值得深究。


第一章:满分冲击——70个百分点的差距意味着什么

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)基准测试由François Chollet设计,其核心目标是测量AI系统的真实推理和泛化能力,而非记忆和模式匹配。ARC-AGI-3作为最新版本,被设计为专门对抗”刷榜”行为——它要求系统在极少样本下完成视觉推理任务,每个任务对于训练数据来说都是全新的。

在这个语境下,100%满分的意义不同寻常。

根据TechCrunch 2025年8月21日的报道,NVIDIA AVO(Autonomous Visual Operations)框架在ARC-AGI-3上达到100%满分,同时比对照组少使用了12%的操作步骤。后者这个细节尤为关键:不仅做到了,还做得更高效。这说明AVO框架的优势不是暴力穷举,而是结构性的推理路径优化。

但真正让这个数字产生冲击力的,是它的对照组。TechCrunch的同一篇报道明确指出,同一底层模型Claude Opus 5在缺乏AVO框架编排的情况下,得分仅为30%——与满分之间存在70个百分点的巨大落差。这意味着:Claude Opus 5本身具备的”原始智能”,在没有正确框架的情况下,只能释放出不到三分之一的潜力。

关于ARC-AGI-3基准测试本身的局限性,有必要在此做出说明。 首先,ARC-AGI系列测试的题目规模相对有限(通常为数百道题),这意味着满分的统计显著性需要谨慎解读。其次,尽管ARC-AGI-3被设计为抗过拟合,但框架层面的”格式适配”——即针对测试的输入输出格式进行工程优化——是否构成某种形式的”过拟合”,在基准测试社区中仍有争议。François Chollet本人在社交媒体上对AVO的结果表示了谨慎的肯定,但也指出需要在更广泛的任务集上验证这一结果的泛化性。截至本文发布时,尚无其他独立团队公开复现AVO在ARC-AGI-3上的满分成绩,这一点读者应当注意。

从工程角度理解这个现象,需要先厘清一个基本问题:ARC-AGI-3测试的不是单次问答能力,而是长时程、多步骤的推理链条。一个模型在单步推理上可能表现优秀,但当任务需要跨越数十个决策节点、在每一步都需要根据上下文调整策略时,没有框架支撑的模型会因为上下文漂移、错误累积、工具调用失序等问题而快速退化。

换句话说,30%到100%的跳跃,揭示的是一个此前被行业严重低估的事实:模型的”天花板”不是参数规模决定的,而是框架能否让模型在长时程任务中保持连贯性和正确性

这个洞察的商业含义是爆炸性的。如果框架层可以把同一个模型的性能提升3倍以上,那么整个AI产业链中,谁掌握了最好的框架,谁就掌握了最大的价值杠杆——无论底层模型来自谁。


第二章:Harness工程的技术解剖——AVO框架如何重构AI代理的行为边界

要理解AVO框架为何能产生如此显著的性能差异,需要先理解”Harness工程”(Harness Engineering)的技术本质。

2025年4月,arXiv上发表了一篇题为《A Step Towards General-Purpose Personal AI Agents through Harness Engineering》的论文(arXiv: 2604.11548v1),系统性地提出了Harness Engineering作为独立工程学科的理论框架。论文的核心论断是:AI代理的通用性瓶颈不在于模型本身,而在于模型与外部世界之间的接口层——即Harness层——的工程质量。

论文将Harness定义为:围绕基础模型构建的、负责任务分解、工具编排、状态管理、记忆调用和错误恢复的完整工程系统。这个定义的关键词是”完整”——Harness不是单一模块,而是一套协同运作的子系统集合。

重要说明: 以下对AVO框架具体技术架构的描述,部分基于arXiv论文中提出的通用Harness Engineering理论框架,部分基于TechCrunch报道中的有限公开信息。截至本文发布时,NVIDIA尚未发布AVO框架的完整技术白皮书。因此,以下内容中标注为”推测性分析”的部分,是作者基于公开信息和通用理论所做的合理推断,而非经过NVIDIA官方确认的技术细节。

任务分解与规划层

长时程任务的核心挑战是:如何将一个高层次目标(如”完成ARC-AGI-3的第47题”)分解为可执行的子任务序列,同时保持对全局目标的追踪。朴素的做法是让模型自己规划,但这会导致”规划漂移”——模型在执行过程中逐渐偏离原始目标,尤其在遇到障碍时容易陷入局部循环。

根据Harness Engineering论文的理论框架,高质量的任务分解层应引入显式的规划图结构,将任务分解为有向无环图(DAG),每个节点代表一个子任务,边代表依赖关系。这种结构化表示使得框架可以在任何执行节点追溯到全局目标,并在检测到偏离时触发重规划。推测性分析: AVO框架大概率采用了类似的结构化规划机制,这是其能够在多步推理任务中保持一致性的关键。

工具编排与调用管理

现代AI代理的能力很大程度上来自工具调用——代码执行、网络搜索、文件操作、API调用等。但工具调用本身是有代价的:每次调用都消耗时间和算力,错误的工具调用会引入噪声,过度调用会导致上下文窗口被无效信息填满。

AVO框架”比对照组少使用12%的操作步骤”这一公开数据点,暗示其在工具编排层实现了某种形式的调用优化。基于Harness Engineering论文的理论,这可能包括两个关键机制:工具选择的预测性过滤(在调用前预判工具是否会返回有效信息)和调用结果的语义压缩(将工具返回的原始数据压缩为语义摘要再注入上下文)。12%的步骤减少正好与”通过更精准的工具选择消除冗余调用”这一假设吻合。

记忆管理与上下文控制

这是Harness工程中最被低估、也最技术密集的部分。大型语言模型的上下文窗口是有限的,而长时程任务产生的信息量往往超出这个限制。朴素的滑动窗口策略会丢失早期的关键信息,而全量保留则会导致模型在海量上下文中”迷失”,注意力分散。

arXiv论文中明确描述的Harness记忆架构采用了分层记忆模型:工作记忆(当前任务的即时状态)、情节记忆(近期操作的压缩摘要)和语义记忆(跨任务的长期知识积累)。这三层记忆在不同时间粒度上运作,由框架统一调度,确保模型在任何时刻都能访问最相关的信息,而不是最近的信息。这一架构设计在学术上有据可查,AVO是否完整采用了这一设计尚待NVIDIA官方确认。

错误检测与恢复机制

这是30%到100%跳跃中最可能的关键工程贡献。在没有错误恢复机制的情况下,代理在第N步犯的错误会在第N+1步被放大,在第N+K步形成不可逆的偏差。ARC-AGI-3这类需要精确推理的任务对错误累积极为敏感。

基于Harness Engineering论文的理论框架,高质量的错误恢复应实现多层错误检测:语法层面的工具调用格式验证、语义层面的输出一致性检查、以及逻辑层面的目标对齐验证。当错误被检测到时,框架不是简单地重试,而是触发局部回滚——将执行状态回退到最后一个已验证的正确节点,然后从该节点重新规划后续路径。

这种”检查点+回滚”的机制,本质上是把软件工程中的事务性保证(transactional guarantee)引入了AI代理的执行流程。这个思路并不新颖——数据库领域几十年前就在用——但将其系统性地应用于AI代理框架,是Harness Engineering领域的重要工程突破。

协同效应:为什么整体大于部分之和

上述各个模块单独存在时,每一个都能带来一定的性能提升。但高质量Harness框架的真正价值在于这些模块的协同设计:任务分解层的输出直接驱动工具编排层的预测过滤;工具调用的结果经过语义压缩后写入情节记忆;错误恢复触发的回滚操作会更新规划图中的节点状态。

这种紧耦合的模块协同,使得整体系统的性能远超各模块简单叠加的预期。这也解释了为什么”把几个现有框架拼接在一起”无法复现AVO的效果——Harness工程的价值不在于模块的堆砌,而在于模块间接口的精心设计。


第三章:范式转移——从”更大的模型”到”更聪明的系统”

理解了Harness工程的技术本质,我们可以更清晰地看待一个更宏观的产业转变。

CNBC在2025年7月10日的报道中指出:AI竞赛正从追求更大的模型转向构建更便宜、更智能的系统。这个转变不是偶然的,而是由多重结构性力量共同驱动的。

模型同质化的加速

过去两年,大型语言模型的能力提升速度令人叹为观止,但这种提升正在呈现出明显的收益递减。OpenAI、Anthropic、Google、Meta等主要玩家的旗舰模型在标准基准测试上的差距正在收窄。当顶级模型之间的性能差异从”数量级”缩小到”百分比”时,选择哪个底层模型对最终应用性能的影响也在相应缩小。

这种同质化有其内在逻辑:所有主要模型都在使用相似的训练数据(互联网文本的主体部分是有限的)、相似的架构(Transformer及其变体主导)、相似的训练范式(预训练+RLHF/RLAIF)。当这些核心要素趋同时,模型能力的天花板也在趋同。

框架层的差异化空间

与此形成对比的是,Harness工程领域目前仍处于早期阶段,优质框架与劣质框架之间的性能差距可以是数量级的。这种差距来自几个方面:

首先是设计哲学的差异。一些框架将模型视为”黑盒”,只在输入输出层面进行操作;另一些框架(如AVO)深度理解模型的内部行为模式,并据此设计针对性的编排策略。前者的天花板远低于后者。

其次是工程积累的护城河。Harness工程的核心挑战是处理边缘情况——那些占总任务量不到5%但足以让整体成功率从95%降至70%的异常场景。处理这些边缘情况需要大量的工程迭代和真实世界测试数据,这种积累形成了难以快速复制的技术壁垒。

第三是生态系统的锁定效应。2025年的框架生态正在经历快速的生态位分化,不同框架在不同应用场景下形成了差异化的工具生态和开发者社区。LangChain在2025年已拥有超过8万GitHub星标和数千个社区贡献的集成插件,CrewAI和AutoGen等框架也在各自的细分场景中建立了开发者忠诚度。这种生态锁定一旦形成,将比技术优势更持久。

两种对立视角的碰撞

在这个范式转移的叙事中,存在两种值得认真对待的对立观点。

视角一(Harness-first论):框架层是AI应用的真正价值所在。模型是商品,框架是差异化。未来的AI竞争将主要在框架层展开,模型提供商将面临商品化压力,而框架提供商将捕获更大的价值份额。AVO的满分成绩是这个论断的有力证据。

视角二(Model-first论):框架层的优势是暂时的。当底层模型足够强大时,它将内化框架的功能——更强的模型天然具备更好的任务分解能力、更精准的工具调用判断、更强的错误自我修正能力。OpenAI的o3系列已经展示了这个趋势:更强的推理能力使得外部框架的必要性降低。Anthropic的Claude在2025年的多次更新中也展示了越来越强的内置代理能力,包括计算机使用(Computer Use)功能的持续改进。

我的判断:这两种视角都抓住了部分真相,但Model-first论低估了一个关键变量——任务复杂度的上限在不断提升。当模型能力提升时,人们期望AI系统完成的任务也在变得更复杂。今天需要框架才能完成的任务,明天可能被更强的模型内化;但明天的框架将处理今天根本无法想象的任务复杂度。这是一场永恒的追逐,框架工程的价值不会消失,只会在更高的复杂度层次上重新定义自身。

更重要的是,框架层的价值不仅仅是性能提升,还包括可控性、可审计性和可维护性——这些是企业级AI部署的核心需求,而这些需求无法仅靠更强的模型来满足。一个能够解释”为什么做了这个决策”的框架,比一个做出了正确决策但无法解释的模型,对企业客户更有价值。


第四章:产业影响与NVIDIA的战略布局——从芯片到框架的全栈野心

理解NVIDIA为何要在AVO框架上投入如此大的资源,需要先理解NVIDIA当前的战略处境。

根据NVIDIA 2026财年第四季度及全年财报(2025年2月26日发布,财年截至2025年1月26日),NVIDIA全年营收达1305亿美元,同比增长114%;其中数据中心业务全年营收1152亿美元,同比增长142%。单看第四季度,数据中心营收为356亿美元。而根据NVIDIA 2027财年第一季度财报(2025年5月28日发布,季度截至2025年4月27日),该季度营收达444亿美元,同比增长69%;数据中心业务营收393亿美元,同比增长73%。

这些数字代表了一个在规模上已经接近增速天花板的增长曲线——当基数足够大时,维持70%的同比增速在数学上变得越来越困难。NVIDIA需要新的增长引擎,而软件和框架层正是这个引擎的核心。

全栈战略的战略逻辑

NVIDIA的全栈战略并非新近才有,CUDA生态系统的建立是这个战略的早期版本——通过免费提供软件工具,将开发者锁定在NVIDIA硬件生态中。AVO框架是这个战略在AI代理时代的升级版本。

但AVO与CUDA的战略逻辑有一个重要区别:CUDA的价值在于让NVIDIA的GPU更容易被使用(降低门槛),而AVO的价值在于让AI代理任务只有在NVIDIA的完整技术栈上才能达到最佳性能(提高切换成本)。

这是一个更具攻击性的战略姿态。当AVO框架与NVIDIA的GPU硬件(H100/H200/B200系列)、NIM微服务、NeMo训练框架深度集成时,选择AVO就意味着选择了NVIDIA的整个技术栈。对于企业客户而言,一旦基于AVO构建了生产级AI代理系统,迁移到其他硬件平台的成本将是巨大的。

软件层的护城河建设

NVIDIA CEO黄仁勋在2025年多次公开场合强调”NVIDIA是一家平台公司”而非单纯的芯片公司。2025年3月的GTC大会上,NVIDIA发布了包括NIM(NVIDIA Inference Microservices)在内的一系列软件产品,将软件服务收入的战略优先级提升到了前所未有的高度。AVO框架的推出,是这一软件战略在AI代理领域的具体落地。

从竞争格局来看,NVIDIA在框架层的布局面临来自多个方向的挑战:

来自云服务商的挑战:AWS、Google Cloud、Microsoft Azure都在构建自己的AI代理编排服务。AWS的Bedrock Agents、Google的Vertex AI Agent Builder、Azure的AI Agent Service——这些服务与各自的云基础设施深度集成,具备天然的生态优势。NVIDIA需要证明其框架层的技术优势足以让企业客户绕过云原生方案,选择跨云的NVIDIA技术栈。

来自开源社区的挑战:LangChain、LlamaIndex、AutoGen等开源框架拥有庞大的开发者社区和快速迭代的生态系统。开源框架的灵活性和零许可费用对开发者具有强大吸引力。NVIDIA需要在性能上保持足够的领先优势,才能让企业客户为其闭源框架付费。

来自模型公司的挑战:Anthropic、OpenAI等模型公司也在构建自己的代理框架和编排工具。Anthropic在2025年推出了Claude的Computer Use功能和Agent SDK,OpenAI则持续迭代其Assistants API和Agents SDK。这些公司具备对自家模型内部机制的深度理解,可以构建针对性的优化框架。如果Claude Opus 5的最佳框架最终由Anthropic而非NVIDIA提供,AVO的战略价值将大打折扣。

NVIDIA的差异化赌注

面对这些挑战,NVIDIA的差异化赌注是:硬件-框架协同优化。AVO框架的某些性能优势,可能来自于对NVIDIA特定硬件特性的深度利用——例如利用NVLink的高带宽特性优化多代理通信,或利用HBM3e的特定内存层次结构优化Harness的记忆管理模块。

如果这个假设成立,那么AVO在NVIDIA硬件上的性能优势将是结构性的,而非纯粹的软件工程优势。竞争对手即使复制了AVO的架构设计,在非NVIDIA硬件上也无法复现相同的性能。这才是NVIDIA全栈战略的真正护城河所在。

这个战略与Apple的M系列芯片+CoreML框架的逻辑高度相似:通过硬件和软件的协同设计,构建竞争对手难以单独在任一层面超越的整体优势。


第五章:谁在被重新定价——Harness-first时代的赢家与输家

当框架比模型更重要时,整个AI产业链的价值分配将发生深刻的重构。以下是对主要利益相关方的影响推演,基于当前可验证的事实和合理的逻辑延伸。

模型公司:从王者到基础设施

这是Harness-first范式中受影响最深刻的群体。当底层模型趋于同质化,模型公司将面临持续的商品化压力。这并不意味着模型公司会失去价值——基础设施从来都不是没有价值的,但基础设施的定价逻辑与差异化产品的定价逻辑截然不同。

对Anthropic而言,Claude系列模型在AVO框架下展现出的100%性能,是一把双刃剑:一方面证明了Claude Opus 5的基础能力足够强大;另一方面也说明,如果没有AVO这样的框架,Claude的真实价值无法被充分释放。这引出一个战略问题:Anthropic是否应该更积极地构建自己的框架层,而不是让NVIDIA成为释放Claude价值的关键中间层?事实上,Anthropic在2025年已经在这个方向上加速布局——其Model Context Protocol(MCP)的推出正是试图在框架层建立自己的标准。

对OpenAI而言,情况更为复杂。OpenAI同时在模型层(GPT系列、o3系列)和框架层(Assistants API、Agents SDK)布局,但目前这两层的协同程度仍有提升空间。OpenAI在2025年5月发布的Codex产品(基于o3的代码代理)展示了模型与框架深度整合的可能性,但这仍是早期尝试。

应用开发者:从”选模型”到”选框架”

对于构建AI应用的开发者而言,Harness-first范式意味着决策框架的根本转变。过去的问题是”用GPT-4还是Claude 3?”,未来的问题将是”用AVO还是LangChain还是自建框架?”

这个转变对开发者既是机遇也是挑战。机遇在于:一旦选对了框架,同样的底层模型可以释放出远超预期的性能,这意味着应用层的竞争优势可以通过框架工程而非模型选择来建立。挑战在于:框架层的锁定效应比模型层更强——迁移框架意味着重写大量业务逻辑,而切换底层模型的成本相对较低(大多数框架支持多模型后端)。

2025年的AI代理框架生态正在形成明显的分层结构:从轻量级工具(如LangChain Expression Language,低锁定、灵活但性能天花板有限)到重量级平台(如NVIDIA AVO,高锁定、高性能但迁移成本巨大)形成了连续的选择空间。开发者在框架选择上的决策,将在很大程度上决定其未来3-5年的技术路线。

云服务商:中间层的焦虑

AWS、Google Cloud、Azure在AI代理框架领域面临一个结构性困境:如果NVIDIA的AVO框架成为行业标准,云服务商将沦为NVIDIA框架的运行环境提供者,在价值链中的地位将被进一步压缩。

这解释了为什么三大云服务商都在积极构建自己的AI代理编排服务。这些服务的战略目的不仅仅是提供功能,更是在框架层建立自己的生态护城河,防止NVIDIA通过框架层绕过云服务商直接触达企业客户。Amazon在2025年re:Inforce大会上宣布的Bedrock Agents增强功能、Google在Cloud Next 2025上推出的Agent Development Kit,都是这一防御性战略的体现。

企业客户:性能与可控性的双重需求

对于企业级AI部署而言,Harness-first范式带来了一个新的评估维度:框架的可审计性和可控性

企业客户不仅需要AI系统表现好,还需要能够解释AI系统为什么这样表现、在出现问题时能够快速定位根因、以及能够在必要时人工干预执行流程。这些需求天然倾向于框架层的解决方案——一个设计良好的Harness框架可以在每个决策节点记录完整的推理链条和工具调用日志,为审计和调试提供充分的信息。

这也意味着,对企业客户而言,选择框架的标准不仅仅是性能基准测试得分,还包括框架的可观测性(Observability)、可解释性(Explainability)和合规性(Compliance)支持。在这些维度上,NVIDIA的AVO框架是否具备优势,截至本文发布时暂无充分的公开数据支撑——这本身就是一个值得NVIDIA在后续产品发布中重点回应的问题。


第六章:大多数人没看到的那一层——Harness工程的元竞争

在关于AVO框架的讨论中,大多数分析停留在”框架很重要”这个结论上。但真正值得深挖的问题是:框架工程本身的竞争将以什么样的方式展开?

这是一个关于”谁来构建最好的框架”的元竞争问题,而答案并不显而易见。

框架工程的数据飞轮

构建高质量Harness框架的核心挑战,是如何处理长尾的边缘情况。ARC-AGI-3这类标准基准测试只能衡量框架在已知任务类型上的表现,而真实世界的AI代理部署会遇到无数标准测试无法覆盖的场景。

处理这些边缘情况需要大量的真实部署数据——哪些工具调用序列在特定任务类型下更有效、哪些错误模式最常见、哪些上下文压缩策略在不同领域有不同效果。这些数据只能从实际部署中积累,而不能从基准测试中获得。

这意味着框架工程存在一个数据飞轮效应:部署规模越大,积累的真实世界数据越多,框架优化的方向越精准,框架性能越好,吸引的新部署越多。NVIDIA在企业AI市场的广泛渗透——根据其财报,全球数据中心GPU市场中NVIDIA占据超过80%的份额——使其具备构建这个数据飞轮的先天条件。但这个优势能否转化为框架层的持续领先,取决于NVIDIA是否建立了系统性的框架性能反馈机制。

框架工程的人才稀缺性

Harness工程需要一种罕见的复合型人才:既深度理解大型语言模型的内部行为模式(包括注意力机制、上下文处理、涌现行为等),又具备系统工程的严密思维(分布式系统、状态管理、错误处理),同时还能理解具体应用场景的业务逻辑。

这种复合型人才在当前市场上极为稀缺。arXiv论文(2604.11548v1)的作者们在论文中明确指出,Harness Engineering需要被视为一个独立的工程学科,需要系统性的培训和知识体系建设。这个学科目前仍处于形成阶段,没有成熟的教材、没有标准的工程规范、没有成体系的最佳实践。

谁能最快建立起这个学科的知识体系并吸引相关人才,谁就能在框架层的竞争中获得最持久的优势。这不是一个季度能解决的问题,而是一个需要3-5年持续投入的战略布局。

开源的颠覆性潜力

在框架层的竞争中,开源社区是一个不可忽视的变量。历史上,每当某个基础设施层开始出现商业垄断的迹象,开源社区都会加速构建替代方案——Linux对Windows服务器的颠覆、Kubernetes对商业容器编排平台的颠覆,都遵循这个规律。

在AI代理框架领域,这个模式已经开始显现。Microsoft在2025年开源的AutoGen框架、Google DeepMind支持的开源代理项目,以及LangChain生态系统的持续壮大,都在为闭源框架提供替代选项。如果AVO框架保持闭源,开源社区将有强烈的动机构建性能可比的替代方案。而一旦开源框架在性能上接近AVO,NVIDIA的框架层护城河将大幅收窄,其全栈战略的商业价值也将受到挑战。

NVIDIA面临的战略选择是:开源AVO以扩大生态影响力(但牺牲差异化优势),还是保持闭源以维持技术护城河(但面临开源替代的威胁)。这个选择没有标准答案,但其结果将在很大程度上决定NVIDIA在框架层竞争中的长期地位。值得注意的是,NVIDIA在其他软件产品上采取了混合策略——CUDA核心免费但闭源,部分NIM微服务开放API但不开放源码——AVO可能会走类似的路线。


结语:Harness-first时代,重新定价的不只是技术

2025年8月,NVIDIA AVO在ARC-AGI-3上的满分成绩,将在未来被视为AI产业竞争范式转变的一个标志性时刻。但这个时刻的真正意义,不在于100%这个数字本身,而在于它所揭示的深层逻辑:AI系统的能力上限,不再由模型参数规模决定,而由框架工程的质量决定

这个逻辑转变对整个产业链的影响是系统性的:

  • 对模型公司而言,商品化的压力将迫使其在框架层寻找新的差异化空间,或者接受基础设施提供者的定价逻辑。
  • 对应用开发者而言,框架选择将成为比模型选择更重要的技术决策,且这个决策的锁定效应更强、切换成本更高。
  • 对云服务商而言,防止框架层被NVIDIA或其他专业框架提供商控制,将成为维持其在AI产业链中战略地位的关键任务。
  • 对企业客户而言,评估AI系统的标准需要从”模型能力”扩展到”框架质量”——包括性能、可控性、可审计性和长期可维护性。

对NVIDIA而言,AVO框架的战略意义超越了任何单一的产品发布。它代表着NVIDIA从”卖算力”向”卖智能”的战略转型——不只是提供运行AI的硬件,而是提供定义AI如何运行的框架。2027财年第一季度444亿美元的营收、73%同比增长的数据中心业务,是NVIDIA当前硬件主导地位的财务体现。但在Harness-first的新范式下,NVIDIA的真正考验不是能否继续卖出更多GPU,而是能否让AVO框架成为AI代理时代的CUDA——那个让所有开发者都不得不使用、让所有竞争对手都难以绕开的基础设施层。

对读者的实际意义: 如果你是AI应用开发者,现在是认真评估框架选择的时刻——这个决策的长期影响将超过你选择哪个底层模型。如果你是技术投资者,关注框架层的竞争格局将比追踪下一个模型发布更有价值。如果你是企业技术决策者,在评估AI供应商时,将”框架质量和可控性”纳入评估维度,与”模型能力”同等权重。

历史会记住这一点:在AI的第一个十年,胜利者是造出最强模型的人;在AI的第二个十年,胜利者将是造出最好框架的人。

而这场框架战争,才刚刚开始。


参考资料

  1. Nvidia just showed that the harness, not the AI model, is now the real hero — TechCrunch, 2025-08-21

  2. A Step Towards General-Purpose Personal AI Agents through Harness Engineering — arXiv, 2025-04

  3. NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA Investor Relations, 2025-05-28

  4. NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2026 — NVIDIA Investor Relations, 2025-02-26

  5. The AI race is shifting from bigger models to cheaper, smarter systems — CNBC, 2025-07-10

  6. 来源: AI Weekly (aiweekly.co), “NVIDIA’s AVO Hits 100 on ARC-AGI-3, Uses 12% Fewer Actions”, 2025-08(注:该来源为非主流科技媒体,核心数据点”12%更少操作步骤”已在TechCrunch报道中得到间接佐证)

  7. 来源: François Chollet, ARC Prize官方博客及社交媒体对AVO结果的评论, 2025-08(注:用于补充ARC-AGI-3基准测试设计意图及社区对结果的反应)