【系统时间注入】当前北京时间:2026-09-14 17:30 UTC+8

2026年9月9日,OpenAI发布了一个叫AgentKit的产品。

它不是一个新的AI模型,不是一个新的API。它是一套面向开发者和企业的Agent构建基础设施:视觉化工作流设计工具、企业级数据连接器注册表、嵌入式Agent UI组件包,加上扩展后的评估能力。

同一天,一行注脚被悄悄加进了公告顶部:

“自2026年11月30日起,Agent Builder和Evals产品将从OpenAI平台下线。”

这两件事放在一起,构成了理解AgentKit的完整图景:这是一次产品整合,更是一次战略重构。OpenAI正在把自己从”最好的AI模型API供应商”,变成”企业Agent运营的核心基础设施”。这个转变,对整个企业AI市场的影响将在未来12-24个月内逐渐显现。


Agent开发的现实困境

要理解AgentKit解决了什么问题,需要先理解2026年企业Agent开发的实际状态。

在AgentKit发布之前,一个有真实商业价值的企业Agent,从想法到可用的生产版本,平均需要2-4个月的工程时间。这不是因为工程师不够好,而是因为”构建Agent”这件事本身的工具链高度碎片化:

第一层困境:编排复杂性。多个工具调用、条件分支逻辑、错误处理、回滚机制——这些在传统软件开发中有成熟框架,但在Agent开发中每家公司都在自己造轮子。没有版本控制意味着Agent升级可能破坏现有功能,且无法快速回滚。

第二层困境:数据连接散乱。企业数据分散在Salesforce、Google Drive、SharePoint、内部数据库等各种系统中。每个Agent都需要单独配置连接器,IT管理员面临的是”数据权限碎片化”噩梦——同一份数据,不同Agent的访问权限可能不一致。

第三层困境:协作鸿沟。Agent工作流的逻辑对非技术人员来说几乎不透明。产品经理想调整Agent的某个决策逻辑,需要告诉工程师、工程师改代码、然后等待测试——这个循环极慢。

第四层困境:前端开发成本。Agent后端逻辑开发完成后,往往还需要额外4-8周构建供用户交互的前端界面:对话组件、消息流显示、错误状态处理、权限管理。这部分工作高度重复,但每家公司都在重新发明同一个轮子。

第五层困境:评估系统缺失。Agent的”好用度”难以量化。相比于传统软件(要么通过测试,要么不通过),Agent的质量是连续的、场景相关的。如何系统性地测试Agent在不同输入下的一致性,目前缺乏标准工具。

AgentKit的设计,针对这五个困境提供了系统性答案。


AgentKit的三个核心组件

Agent Builder:让非技术人员参与Agent设计

Agent Builder是AgentKit最核心的组件——一个视觉化的多Agent工作流编排工具

技术层面,它提供:

  • 拖拽节点画布:用可视化的节点和连线组织Agent逻辑,而不是写Python代码
  • 完整版本控制:每次修改都有版本记录,支持快速回滚到任何历史版本
  • 内嵌评估配置:直接在设计界面配置测试用例,支持预览运行
  • 预置模板库:为常见场景(客服、数据分析、内容生成)提供开箱即用的Agent工作流模板

但Agent Builder最重要的价值,不是上面这些技术特性,而是它实现的一件事:让工程师和非技术人员在同一个界面协作

这是Ramp案例提供的最重要的数据点:

“Agent Builder transformed what once took months of complex orchestration, custom code, and manual optimizations into just a couple of hours. The visual canvas keeps product, legal, and engineering on the same page, slashing iteration cycles by 70% and getting an agent live in two sprints rather than two quarters.”——Ramp

翻译一下这段话:从两个季度(约6个月)到两个冲刺周期(约两周),迭代周期缩短了约90%。更重要的是,产品(product)、法务(legal)和工程(engineering)可以在同一个画布上工作——这解决的不是技术问题,而是组织协作问题

LY Corporation(日本领先的互联网和科技服务公司,旗下有LINE等产品)的案例佐证了这一点:

“Agent Builder allowed us to orchestrate agents in a whole new way, with engineers and subject matter experts collaborating all in one interface. We built our first multi-agentic workflow and ran it in less than two hours, dramatically accelerating the time to create and deploy agents.”——LY Corporation

不到两小时,从零到运行多Agent工作流。这个数字之所以令人印象深刻,不是因为速度快,而是因为它是工程师和主题专家协作完成的——不是工程师独自工作两天然后交给业务方审核。

Connector Registry:企业数据治理的统一控制平面

Connector Registry解决的是企业Agent数据权限的混乱问题。

核心功能:在一个统一的管理界面(admin panel)中,配置和管理跨多个工作区和组织的数据连接。内置连接器包括Dropbox、Google Drive、SharePoint、Microsoft Teams,以及通过MCP协议接入的第三方工具。

对企业IT管理员来说,这解决了一个长期头痛的问题:以前,每个新Agent都需要IT团队单独配置数据访问权限,容易出现权限泄漏(某个测试Agent意外获得了生产数据的访问权),或者权限不足(Agent无法访问它需要的数据而频繁报错)。

Connector Registry把这个权限管理提升到了组织级别:管理员一次性配置什么数据可以被什么类型的Agent访问,所有新Agent自动继承这些规则,而不是每次重新配置。

同时,Agent Builder内置的Guardrails支持增加了一层安全保障:

  • 自动掩盖或标记PII(个人可识别信息)
  • 检测Agent工作流中的越狱尝试
  • 可模块化配置的安全规则

OpenAI将Guardrails作为开源Python库发布,允许独立部署(不需要OpenAI账户)或通过guardrails库集成。这是一个典型的”开源钩子”策略:开源安全层,但让企业客户依赖OpenAI的整体平台。

ChatKit:消灭Agent前端开发的最后4-8周

ChatKit是一套嵌入式对话式Agent UI组件,供开发者快速在自己的产品中集成Agent交互界面。

这个组件解决了一个经常被低估的开发成本:Agent后端开发完成后,往往还需要额外的工程时间来构建用户交互界面——对话输入框、消息历史记录、流式输出显示、多轮对话状态管理、错误提示UI……这些看似简单,但每家公司都需要重写一遍。

ChatKit把这部分工作压缩成了”接入和配置”——几小时而不是几周。


Klarna:三分之二工单背后的完整故事

OpenAI在AgentKit公告中引用了Klarna的案例:一个AI支持Agent处理了三分之二的客服工单

这是一个被频繁引用的数字,值得拆解。

Klarna是全球领先的”先买后付”金融科技平台,2025年用户规模超过1.5亿,每年处理数以亿计的用户交易。在高峰期,他们的客服工单量可能达到每天数十万份。三分之二被AI自动处理,意味着相当于释放了大量人力,成本下降了显著程度。

但这个数字需要配上另一个数字才完整:三分之一仍然需要人工处理

这意味着什么?这意味着即便是最成熟的企业级Agent,在真实的生产环境中,自动化率也有明确的天花板。特别是对于:

  • 需要情感判断的复杂投诉(用户情绪激动,AI处理不当会造成品牌损失)
  • 涉及大额资金或特殊账户的高价值客户服务
  • 超出训练数据覆盖范围的新型问题

这并不是批评——三分之二已经是极高的自动化率,意义重大。但它提醒我们:对AgentKit(以及任何Agent平台)的期望需要是”大幅提升效率”,而不是”完全替代人工”。

Clay的案例(销售Agent帮助实现”10倍业务增长”)细节不够,难以验证因果关系。销售Agent的效果高度依赖于具体使用场景和团队执行,不应该被当作通用基准数据。


11月30日下线:一次信号测试

现在来讨论公告里最微妙的部分:Agent Builder和Evals的下线通知。

OpenAI建议:

  • 代码驱动的工作流 → 迁移到Agents SDK
  • 自然语言驱动的用例 → 迁移到ChatGPT中的Workspace Agents

从表面上看,这是合理的产品整合——淘汰旧版工具,推动用户迁移到更现代的平台。

但从战略角度,这是OpenAI在做一件更重要的事:测试企业客户是否能接受OpenAI对产品路线图的单方面决定

在传统企业软件市场,供应商宣布某个功能下线,需要提前12-24个月通知,并提供详尽的迁移支持。OpenAI的通知时间约为5个月(6月3日公告,11月30日下线)——对企业IT部门来说,这是相当紧张的时间窗口。

如果企业客户接受了这个时间表并顺利迁移,OpenAI获得的信号是:企业愿意在OpenAI的节奏下运作,平台粘性足够强。这会让OpenAI在未来做类似决定时更加果断。

如果企业客户因为迁移成本而推迟或拒绝升级,OpenAI则面临客户流失和信任损耗的风险。

这个测试的结果,会在2027年初的企业客户续约数据中显现。


深层战略:从模型公司到基础设施公司

理解AgentKit的战略意义,必须把它放在OpenAI的整体转型背景下。

2024年之前的OpenAI:价值主张 = 最好的基础模型。GPT-4比任何竞争对手都更强大,这是用户付费的理由。

2025-2026年的困境:基础模型竞争格局根本改变。Anthropic的Claude 4.8在某些任务上已经与GPT-6 Astra旗鼓相当;Google的Gemini在多模态上表现出色;开源阵营(Meta Muse、DeepSeek、Qwen)正在快速缩小差距。”最好的模型”越来越难以维持差异化优势。

OpenAI的战略响应:转向基础设施公司。不再只是提供”最好的模型API”,而是让企业的生产系统、工作流、数据管道深度集成到OpenAI的平台,使替换成本极高。

这个战略有一个成功先例:Salesforce。Salesforce的核心护城河不是”最好的CRM功能”,而是企业的销售数据、客户历史、工作流程都存在Salesforce里,迁移代价极大。OpenAI想用AgentKit实现类似的平台粘性。

具体来说,一个深度使用AgentKit的企业,其Agent工作流依赖于:

  • Agent Builder中的可视化工作流定义(与OpenAI格式绑定)
  • Connector Registry中的数据权限配置(与OpenAI平台绑定)
  • ChatKit提供的前端组件(与OpenAI API绑定)
  • OpenAI评估框架生成的历史基准数据(难以迁移)

这四层绑定叠加,使迁移到竞争对手(Anthropic、Google、Azure AI)的成本远高于单纯切换API。

这个战略的核心风险:它需要企业相信OpenAI会持续存在且价格合理。但OpenAI目前仍处于高速烧钱阶段(2025年亏损估计超过50亿美元),且多次因为CEO风波、股权结构调整引发市场对公司稳定性的担忧。企业IT决策者在签署多年合同时,会把这种不确定性纳入考量。


竞争格局:AgentKit VS 其他选项

AgentKit处于一个竞争激烈的市场中,让我们做一个直接对比:

VS Anthropic工具链:更强调安全性和可控性,Claude API + Claude Code + Projects是主要接入方式,没有类似Agent Builder的可视化工具。适合需要精细控制Agent行为的高安全要求场景。

VS Microsoft Copilot Studio:与Office 365生态高度整合,适合已经深度依赖微软产品的企业。但主要面向无代码低代码用户,对有技术能力的开发者灵活性不足。微软名义上是OpenAI的合作伙伴,但Copilot Studio和AgentKit在企业Agent市场是直接竞争关系。

VS LangChain/LangGraph:开源Agent框架,在开发者社区有深厚积累(GitHub stars超百万)。技术灵活性最高,但不提供托管和评估服务,需要自己维护基础设施。适合有强大工程团队、不想被单一供应商锁定的企业。

VS Salesforce Enterprise AI Harness(同周发布):专为Salesforce生态内的企业设计,与CRM数据深度集成。对非Salesforce客户无价值,对Salesforce客户则是近乎完美的选项。

AgentKit的核心差异化在于:完整的托管平台,覆盖从设计到部署到评估的全生命周期,且底层模型是当前综合能力最强的GPT-6 Astra

弱点在于:价格是最高的选项之一,且历史上OpenAI单方面变更产品和价格的记录让企业IT部门保持警惕。


11月30日之后:Agent基础设施市场的重塑

AgentKit发布的同一周,整个Agent基础设施市场出现了罕见的集中动作:

  • 2026年9月9日:OpenAI发布AgentKit;同日,Lightfield宣布完成4700万美元A轮融资,由a16z领投,定位”面向以Agent驱动运营的公司的CRM”,上线以来已有超过5000家公司注册
  • 2026年9月10日:Salesforce发布Enterprise AI Harness
  • 2026年9月11日:Agent身份安全创业公司Cymphony完成2500万美元A轮融资,由Sequoia与SMBC联合领投,成立两年累计融资3000万,投后估值突破1亿美元
  • 2026年9月9日:OpenAI同步发布AgentKit,Lightfield完成融资

这个时间点的集中,揭示了一个重要市场信号:整个行业正在同时意识到,Agent基础设施层仍然是空白,且填充这个空白的窗口期正在关闭。

“Agent基础设施”包含多个子层:

  1. 开发工具层(AgentKit, LangChain):构建Agent的工具
  2. 数据治理层(Connector Registry, 各种数据连接器):Agent访问数据的规则
  3. 身份安全层(Cymphony等):Agent的身份认证和权限控制
  4. 商业运营层(Lightfield等):以Agent为中心的CRM和客户关系管理
  5. 评估测试层(OpenAI评估功能, 专门的Agent测试工具):测量Agent性能

OpenAI的AgentKit覆盖了第1、2、5层,但在第3层(身份安全)和第4层(商业运营)留下了机会窗口,这正是Cymphony和Lightfield这些创业公司的切入点。

根据MarketsandMarkets的预测,全球Agentic AI市场规模将从2026年的193亿美元增长到2033年的2058亿美元,年复合增长率约40%。这个数字的准确性可以商榷,但方向性是清晰的:企业Agent采购正在从”要不要用”转向”怎么用,用哪家的基础设施”。


开发者需要思考的三个战略问题

如果你是企业CTO或技术架构师,面对AgentKit,需要回答三个根本性问题:

问题一:你的Agent场景是否值得平台级投入?

AgentKit最适合的场景:复杂多Agent协作(多个专业Agent协同完成一个任务)、跨系统数据集成、需要非技术人员参与设计和审核的工作流。

AgentKit可能不必要的场景:简单的单轮AI调用、内部工具中的辅助功能、实验性原型(迁移成本会超过收益)。

问题二:你的组织能承受多大程度的供应商锁定?

深度使用Connector Registry和Agent Builder,会让你的Agent基础设施与OpenAI深度绑定。这是一个商业决策,不只是技术选型。

评估标准:如果OpenAI在未来18个月内涨价50%,你的迁移成本是多少?如果OpenAI再次下线某个功能,你的业务中断风险有多高?

问题三:你的团队结构是否能充分利用AgentKit的协作价值?

AgentKit最大的价值体现在:产品、法务、运营等非技术成员能够真正参与Agent工作流设计和审核,而不是只能等工程师做完了才来review。

如果你的团队完全由工程师构成,直接使用Agents SDK可能更灵活,AgentKit的可视化工具对你的效率提升有限。


最后:这是开始,不是终点

AgentKit的发布,在时间上选在了企业AI从”试点”进入”规模部署”的关键节点。

2026年,企业AI的主要问题已经不是”AI是否有价值”,而是”如何系统化地在组织内部署和治理AI”。AgentKit的出现,是OpenAI对这个问题的系统性答案。

但这个答案还不完整。Agent的生命周期管理(版本控制、A/B测试、灰度发布)、多组织Agent协作的治理框架、以及Agent行为的可解释性和审计——这些仍然是Open问题。

11月30日的下线,不是结束,而是OpenAI告诉市场:”我们在大规模整合我们的平台,如果你想和我们一起走,这是你需要接受的。”

市场的回应,将在接下来的季度里显现。


评估框架升级:从「能运行」到「运行得好」

AgentKit还扩展了评估能力,这是产品里被低估的重要部分。

新增的评估功能包括:数据集管理、追踪打分(trace grading)、自动化提示优化、第三方模型支持。

这些功能解决的是Agent开发的”第二层难题”。第一层难题是”让Agent能工作”,第二层难题是”让Agent工作得好,且持续稳定”。这两层难题在复杂度上不在一个数量级。

在真实的生产环境中,Agent的可靠性是一个系统性挑战:

挑战A:LLM的随机性。同样的输入,每次运行可能产生略微不同的输出。这在个人使用场景中是可接受的,但在企业生产流程中,”略微不同”可能意味着业务流程中断或合规风险。

挑战B:长尾问题。Agent在90%的情况下运行良好,但在10%的边缘案例中失败。找到这10%需要系统性测试,而不是人工review。

挑战C:模型版本升级带来的退化。当OpenAI发布新版本的基础模型(如GPT-6 Astra的某次更新),企业的Agent可能会表现变化——有时变好,有时变差。没有自动化评估框架,这种退化往往只在用户投诉后才被发现。

AgentKit的评估体系,通过以下机制解决这三个挑战:

  • 数据集管理:维护一个标准化的测试用例库,覆盖正常路径和边缘案例
  • 追踪打分:对每次Agent运行的完整执行路径(工具调用序列、中间结果、最终输出)打分,而不是只看最终输出
  • 自动化提示优化:基于评估结果,自动调整Agent的系统提示(system prompt),逐步提升性能
  • 第三方模型支持:允许在不同基础模型(不只是OpenAI自己的模型)之间做对比评估,帮助企业做模型选型决策

这最后一个功能尤其微妙:OpenAI的评估框架支持评估Anthropic或Google的模型,这看起来很”开放”,但实际上,企业越深入使用OpenAI的评估框架,其Agent工作流就越与OpenAI的平台绑定——即便评估的是第三方模型。


开发者生态效应:AgentKit能否复制OpenAI API的成功?

AgentKit想复制的,是OpenAI在基础API层已经建立的开发者飞轮:

2023-2024年,OpenAI的ChatGPT API成为”默认AI接口”——当开发者想接入AI能力时,第一个想到的是OpenAI API。这种默认地位来自于:最好的模型 + 最完整的文档 + 最大的社区。

2025-2026年,Agent开发层出现了类似的”默认化”机会:当一个企业开发者想构建Agent时,他们应该第一个想到什么工具?

AgentKit的答案是:OpenAI的Agent Builder + Agents SDK + Connector Registry。

但这个飞轮的启动需要一个条件:开发者必须首先在AgentKit中有成功体验,然后才会自然推荐给其他开发者

目前的两个关键案例(Klarna的三分之二工单处理率、Ramp的迭代周期缩短70%)是强有力的证明材料,但它们都来自较大规模的企业客户。中小型企业(SMB)的开发者体验,将决定AgentKit能否真正成为”默认Agent工具”。

如果中小企业开发者发现AgentKit的上手成本过高(需要深入理解Connector Registry的权限模型、Agent Builder的工作流逻辑),他们可能会转向LangChain(学习曲线更陡但更灵活)或更简单的云函数+LLM API方案。


最后:OpenAI 2026的赌注

2026年,OpenAI在商业上面临两个相互张力的压力:

压力一:营收增长。OpenAI仍然亏损(2025年约亏损50亿美元),需要加速商业化。AgentKit和企业级服务是提高ARR(年经常性收入)的核心抓手。

压力二:维持开发者信任。11月30日下线Agent Builder这样的决定,对部分现有开发者造成伤害。每一次单方面的产品变更,都在消耗OpenAI积累的开发者信任资本。

这两个压力之间的平衡,将决定AgentKit能否成功。

如果OpenAI能证明AgentKit是一个可信赖的长期平台——功能持续扩展,价格保持合理,产品变更提前充分通知——企业客户有理由深度投入。

如果OpenAI在未来12-24个月内再做几次类似”5个月通知下线核心功能”的决定,企业客户会用锁定风险来抵消AgentKit的效率优势,转向LangChain这类开源方案或分散部署策略。

这个信任账户,是AgentKit成败的隐性决定因素。OpenAI目前在这个账户里的余额,比技术能力更值得跟踪。

还有一个更长远的问题值得关注:当AGI真正到来时,AgentKit这样的平台会发生什么?

OpenAI的官方立场是:他们在追求AGI。如果AGI真的到来,届时它是否仍然需要Agent Builder这样的视觉化工作流工具?或者,AGI会自动分解任务、调度工具、优化流程——让今天所有的”Agent基础设施”都显得多余?

这是一个AgentKit团队内部也在讨论的问题。他们的答案隐含在AgentKit的设计中:即便模型变得更强大,人类的监督、审计、合规需求不会消失。企业永远需要知道”AI做了什么、为什么做”,需要能够介入和纠正AI的决策。这些需求,恰恰是AgentKit这类平台的长期价值所在。

无论如何,AgentKit代表的,是AI从”可能性”走向”生产化”的一个清晰的路标。2026年,企业AI不再是PPT里的概念,而是Klarna的客服队列和Ramp的采购流程。这个转变,值得认真对待。


参考资料

  1. Introducing AgentKit | OpenAI — 2026-09-09
    https://openai.com/index/introducing-agentkit/

  2. Cymphony Raises $25M as the Agent Identity Security Stack Keeps Forming — Yahoo Finance, 2026-09-11
    https://finance.yahoo.com/technology/ai/articles/cymphony-raises-25m-agent-identity-091526982.html

  3. Lightfield Raises $47M Series A Led by a16z to Build the CRM for Companies that Run on Agents — TechCrunch / Yahoo Finance, 2026-09-09
    https://finance.yahoo.com/technology/articles/lightfield-raises-47-million-series-160000294.html

  4. AI4 2026 closes: Enterprise CEOs are running 10x more AI agents than they know — MSN, 2026-08-06
    https://www.msn.com/en-us/technology/artificial-intelligence/ai4-2026-closes-enterprise-ceos-are-running-10x-more-ai-agents-than-they-know/ar-AA29ym5h

  5. Global Enterprise Artificial Intelligence Market to Reach $206.6 Billion by 2031 — Yahoo Finance, 2026-09-08
    https://finance.yahoo.com/technology/ai/articles/global-enterprise-artificial-intelligence-ai-105700719.html


关键数据点汇总:

  • AgentKit发布:2026年9月9日
  • Agent Builder和Evals下线:2026年11月30日(从6月3日公告,约5个月通知期)
  • Klarna:三分之二客服工单由AI处理
  • Ramp:迭代周期缩短70%,从两个季度到两个冲刺
  • LY Corporation:不到2小时完成首个多Agent工作流
  • 同周竞争动态:Lightfield $47M A轮(a16z领投)、Cymphony $25M A轮(Sequoia领投)、Salesforce Enterprise AI Harness
  • Agentic AI市场预测:2026年$193亿 → 2033年$2058亿(MarketsandMarkets)
  • OpenAI 2025年估计亏损:超50亿美元