OpenAI Astra for Law:大型律所AI竞争的新棋局,一份配置说明书,和一场关于法律AI可信度的真正考验

2026年9月17日,OpenAI发布了一个被它自己定义为”公司对法律行业长期投资的开端”的产品:Astra for Law

这是一个基于GPT-6 Astra构建的、专门面向律师事务所的AI版本——不是一个新模型,而是一个”配置包”:在Astra的基础能力之上,叠加了专用法律检索索引、面向法律分析与写作的自定义指令集,以及26个连接到律所日常工作工具的生态系统插件。

初始通过新设立的”Trusted Access Program”(可信访问计划)向Am Law 200律所(美国最大的200家律所)开放,已获早期访问的机构包括Sullivan & Cromwell、Ropes & Gray、Cooley,以及法律AI初创公司Harvey。

(来源:OpenAI官方博文,https://openai.com/index/astra-for-law/,2026-09-17)

这个发布有几个层面需要分开来看:具体产品能力、性能数据的实际含义、律所市场的竞争格局、以及OpenAI这次进入法律行业的战略逻辑。

一份详细的产品配置说明书

理解Astra for Law,首先需要理解它是什么,以及它不是什么。

它不是一个新模型。 Astra for Law的底层仍然是GPT-6 Astra——同一个通用AI模型。OpenAI称其为”legal configuration”(法律配置):通过专门的设置、工具和上下文,让通用Astra在法律专业工作中表现更好。

它的三个核心组成部分:

第一,专用法律检索索引。这是Astra for Law最具实质性新增价值的部分。索引覆盖美国判例法、法令、法规、法院规则和行政决定,来自超过2.3亿个URL,并持续每日更新。其中与Free Law Project(CourtListener非营利数据库背后的机构)的合作,将覆盖超过99.9%已发布美国先例判决的案例库纳入了检索范围。

法律研究的核心挑战历来是找到”精确的权威”——不只是相关的案例,而是具有约束力的先例,是在正确的司法管辖区、正确的法院层级下适用的判决。通用网络搜索在这方面有根本性局限,因为它无法区分”有约束力的先例”和”仅供参考的外州案例”。Astra for Law的专用索引,使模型能够进行更系统的权威性判断。

第二,法律分析与写作的自定义指令集。法律写作有其特有的规范:区分”holding”(法庭主要裁决)和”dicta”(附带意见);在引用先例时明确标注是否仍属”good law”(有效判例,未被推翻);处理合同条款时识别风险转移的逻辑链。这些规范是法学院教育的核心内容,但通用AI模型通常没有被专门训练来遵守这些规范。Astra for Law通过自定义指令集,将这些法律写作规范内嵌到模型的回应模式中。

第三,26个生态系统插件。这些插件将ChatGPT连接到律所日常工作的专业工具,包括:Thomson Reuters(法律数据库巨头)、Relativity(法律电子证据发现平台)、Clio(律所管理软件)、Intapp(律所业务发展工具)等。插件的存在意味着Astra for Law不只是一个独立的AI助手,而是被设计为律所工作流的集成组件。

那个40%提升:数字的精确读法

OpenAI提供了Astra for Law的基准测试数据,来自Vals AI的Legal Research Bench(法律研究基准测试,私有验证集,200道美国法律研究题目):

  • 整体答对率:Astra for Law 54.0% vs GPT-6 Astra纯网络搜索 38.7%
  • 相对提升:约40%
  • 案例引用数量:Astra for Law比纯网络搜索版本多找到24%的参考案例
  • 通道检索:在已审核的目标段落集合中,Astra for Law检索到的相关段落比纯网络搜索多达54%

这些数字看起来令人印象深刻,但需要几层解读:

第一,比较基准是”GPT-6 Astra + 通用网络搜索”,不是”与人类律师对比”。 54%的答对率意味着,在最高推理努力设置下,Astra for Law有46%的法律研究问题没有通过评估标准。如果一位年轻律师以46%的错误率处理法律研究任务,他们会面临严重的后果。评估的具体标准、题目的难度分布,决定了这个54%在实际工作中意味着什么。

第二,测试使用的是”私有验证集”。 OpenAI没有使用一个任何人都可以独立运行的公开基准。这不一定意味着问题,但它确实意味着外部研究者目前无法独立验证这个40%提升的可重复性。Vals AI的Legal Research Bench是一个商业基准,其具体题目不公开,这是标准的商业合作。

第三,40%的相对提升幅度是在真实律所工作流中的哪个环节体现的? 法律研究只是律所工作的一个子环节,而且通常是工时最短的部分——大量计费时间花在合同谈判、客户沟通、法庭陈述和案例策略上。如果Astra for Law在法律研究上提升40%,但在其他环节表现与通用Astra相当,那么整体ROI需要具体分析。

尽管有这些注意事项,40%的相对提升仍然是有意义的。在法律研究环节,准确率的提升直接转化为律师验证先例所需时间的减少,这个节省对大型律所的计费结构有实质性影响。

Am Law 200:OpenAI选择的切入口

OpenAI没有选择向所有律师开放Astra for Law,而是通过”Trusted Access Program”首先向Am Law 200律所开放。这是一个精准的市场定位选择。

Am Law 200律所是美国法律市场的顶端——这200家律所占据了美国律师业总营收的绝大部分,拥有最多的高端客户,处理最复杂的交易和诉讼,对AI工具的采购决策往往会引领整个行业。按照最新数据,Am Law 100律所(最大的100家)的年均合伙人收入超过300万美元,顶级律所(如Kirkland & Ellis、Latham & Watkins)的计费总营收超过60亿美元/年。

从商业角度,选择Am Law 200的逻辑是显而易见的:

  • 高价值客户:顶级律所的计费小时费率在300-1500美元/小时,对能够节省律师时间的AI工具有直接的财务投资意愿。如果Astra for Law能够将初级律师的法律研究时间减少30%,按照Am Law律所的收费结构,一家中等规模律所每年节省的成本可能超过数百万美元
  • 信号效应:如果Sullivan & Cromwell(全球最负盛名的精品律所之一,处理美国最重要并购交易)公开认可一个AI工具,整个行业的采购决策都会受到影响。类似Prestige效应——顶级客户的认可是最有价值的背书
  • 高要求客户的验证价值:顶级律所对准确性和可靠性的要求远高于普通用户,能够通过他们的验证,意味着产品真正达到了专业级标准

“Trusted Access Program”这个命名也有其战略含义:它暗示了与普通消费级AI不同的服务级别——更高的数据安全承诺(Zero Data Retention政策,不保留用户数据用于模型训练)、更严格的使用条款、以及更专业的支持。

法律行业的一个特殊需求是:律师具有对客户的保密义务(attorney-client privilege),这种保密义务是绝对的,不允许任何例外。如果使用AI工具的数据被用于模型训练,即使数据被”匿名化”,也可能构成对保密义务的潜在违反。Zero Data Retention政策直接针对这个法律合规风险,是Astra for Law面向专业法律用户的关键区别点。

OpenAI vs Anthropic:大型律所市场的真正竞争

这个发布被多方分析师解读为OpenAI在与Anthropic争夺大型律所市场。这个解读是准确的,但需要更具体的背景。

Anthropic在过去一年中已经在顶级律所市场建立了相当深的据点:Claude已经被多家Am Law 100律所采用,特别是在处理长文档(合同审查、尽职调查报告)方面。Claude当时200k token的超长上下文窗口曾经是竞争优势——一份典型的尽职调查报告可能包含数百页文件,能够在一个上下文窗口中处理整个案件的文件包,是顶级律所的直接需求。

Harvey——法律AI领域最受资本青睐的初创公司之一,估值据报道已超过150亿美元——最初是基于Anthropic Claude构建的,被多家Am Law律所采用,成为法律AI领域的代表性产品。

但值得注意的是:Harvey同时出现在Astra for Law的合作伙伴列表中。 Harvey是Anthropic生态系统的重要成员,但它选择同时接入OpenAI的Astra for Law。这反映了法律AI中间件公司的现实策略:它们需要为自己的客户提供最好的底层模型,而不是单一押注某一家模型供应商。

从Harvey的角度,这是完全理性的:律所客户的核心需求是”用最好的AI处理法律工作”,而不是”用某家特定公司的AI”。如果GPT-6 Astra在法律研究方面比Claude有实质性优势(如40%的性能提升数据所暗示的),Harvey没有理由只提供次优选项。

这意味着OpenAI和Anthropic在顶级律所市场的竞争,不只是”哪个基础模型更强”,更是:

  • 专业化配置的深度:OpenAI通过Astra for Law的专用索引和插件生态,在法律垂直领域建立了额外的壁垒;Anthropic需要决定是否推出类似的法律专用配置
  • 隐私和合规框架:Zero Data Retention、伦理墙设计、律所级别的数据控制——这些合规特性的竞争可能比底层模型性能更重要
  • 生态系统覆盖:26个插件是OpenAI这次发布的一个关键信号。谁的插件生态与律所的工具链更兼容,谁就能成为律所AI工作流的自然入口点

Anthropic目前没有公开宣布类似的法律专用配置产品,但其在律所市场的已有据点意味着这场竞争远没有结束。

法律AI的信任问题:一个尚未完全解决的核心挑战

任何面向法律专业的AI工具,都必须面对一个核心挑战:幻觉(hallucination)问题在法律场景下的后果是不对称的。

在消费者对话AI中,偶尔的错误信息是烦人但通常可接受的。在法律研究中,一个虚构的案例引用——一个在现实中不存在的”Doe v. Smith, 2019 WL 1234567”——可能导致律师在法庭简报中引用不存在的先例,进而产生律师事务所的职业责任(legal malpractice)风险,轻则当事人败诉,重则律师面临纪律处分。

2023年臭名昭著的”Mata v. Avianca”案是法律AI幻觉问题的经典反面教材。在这个案件中,律师使用ChatGPT进行法律研究,将AI”编造”的虚假案例引用提交到了联邦法庭,最终被法官罚款并受到专业警告。这个事件在全球法律界引发了强烈震动,是大多数律所初期对AI工具持保守态度的重要原因之一。

这正是为什么OpenAI特意强调了Astra for Law的检索增强生成(RAG)特性——通过将模型的回答锚定在真实的、可检索的判例库中,减少模型”编造”引用的风险。230亿URL的法律索引,加上每日更新,是对这个问题的直接回应。

但RAG不能完全消除幻觉风险,只是降低了它。模型仍然可能:

  • 正确找到了真实的案例,但错误解读了其适用范围(”holding”和”dicta”的混淆)
  • 正确引用了历史判例,但没有检测到它已经被后续判决推翻(”bad law”问题)
  • 在案例事实的相似性判断上做出了不正确的类比
  • 对不同司法管辖区的法律差异处理不当

这些风险的存在,是为什么Astra for Law被定位为”律师的工具”而非”律师的替代品”——系统的输出仍然需要受过训练的律师进行专业判断和验证。

也正是因为这个原因,”54%答对率”的数字应该被理解为”比通用搜索好很多”,而不是”已经达到律师级别”。在顶级律所的工作流中,AI产出的研究结果通常会经过初级律师的检验和合伙人的审查,形成一个”AI提速,人类把关”的流程。Astra for Law的40%提升,降低了初级律师验证每项引用所需的平均时间,但不意味着验证步骤可以被省略。

值得关注的是,随着RAG技术和法律专用检索系统的持续成熟,”法律AI幻觉率”这个指标的进步速度,可能是衡量这类产品真正实用性的最关键指标之一——比答对率更直接地回答”我可以相信这个AI的法律引用吗”这个律师最核心的顾虑。

Latham & Watkins参与AI治理设计的深层意义

发布公告中有一个值得关注的细节:OpenAI表示正在与Latham & Watkins(全球顶级律所之一,特别擅长科技交易和监管法律)合作,为Astra for Law设计信息权限、伦理墙(ethical walls)、客户指令和律所监督的治理框架。

这不只是一个合作公关公告。Latham & Watkins的参与意味着:

第一,OpenAI在为律所客户设计的治理框架时,引入了具有深厚律所运营经验的外部专家。 伦理墙(ethical walls,也叫”筛选”或”screening”程序)是律所内部防止不同客户之间信息流动的隔离机制——例如,一家律所同时代理两个利益冲突的客户时,需要确保负责不同客户的律师团队之间不能相互访问对方的案件信息。对AI工具来说,如何确保律所A的客户案件数据不会影响服务律所B的客户案件的AI响应,是一个同时涉及技术实现和法律合规的复杂问题。Latham & Watkins在这方面提供的不只是品牌背书,而是真实的领域专业知识。

第二,Latham & Watkins的背书是一个多层次的信任信号: 它既向其他顶级律所发出了”这个AI治理框架是经过专业律师设计的”的专业信号,也向监管机构发出了”OpenAI在进入法律行业时认真对待合规问题”的负责任信号。在一个专业信誉极度重要的行业,这种背书的价值不能低估。

OpenAI在进入法律这个高度敏感行业时选择这个策略,是用行业自身的旗舰机构来验证其治理框架适当性的聪明策略——降低其他律所的信任门槛,同时防止竞争对手将”AI监管合规”作为攻击OpenAI的弱点。

结语:一个开始,不是终点

OpenAI自己把Astra for Law定义为”公司对法律行业长期投资的开端”。这个措辞是准确的。

法律行业的AI采用比预期慢,原因在于其特有的风险厌恶文化:律所的核心商业价值建立在”我们不会犯错”的专业信誉上,而AI工具的引入不可避免地带来了新型错误风险(幻觉引用、错误的法律分析)。顶级律所对AI工具的保守态度,不是技术保守主义,而是对职业责任风险的理性管理。

但这种保守态度正在被侵蚀。原因是经济性的:当竞争对手律所使用AI将初级律师的研究时间减少40%时,不使用AI的律所在成本结构上就处于劣势,而这个劣势最终会转化为客户的成本压力和律所的市场份额流失。Astra for Law在这个背景下,不只是提供了一个AI工具,更是将律所市场的竞争格局从”是否使用AI”提升到了”使用哪种专业级AI”的新层次。

Astra for Law试图通过三种方式加速这个转变:专用索引减少幻觉、伦理墙设计降低泄密风险、从Am Law 200切入通过顶级客户背书建立信任。

这个策略是否有效,将在未来6-12个月内得到验证。Sullivan & Cromwell和Ropes & Gray是否会将Astra for Law纳入其常规工作流,以及他们的内部评估结果是否会以某种形式成为可观察的市场信号,是判断这个产品成功与否的最重要指标。

从更宏观的视角看,Astra for Law的发布标志着一个重要节点:AI已经开始向那些以”专业判断不可替代”为核心价值主张的行业(法律、医疗、审计)发起深度渗透。这些行业的共同特点是:准确性要求极高、监管合规要求复杂、客户信任的建立周期很长。AI在这些行业的成功,将以一种比消费级AI更慢但也更根本的方式,改变知识工作的经济逻辑。

在法律行业,信任不是一次性构建的,而是通过无数次不出错慢慢积累的。Astra for Law正在进行这场积累的第一步。


参考资料

  1. OpenAI — “Introducing Astra for Law”(官方产品发布博文,所有产品数据的核心来源)
    https://openai.com/index/astra-for-law/ (2026-09-17)

  2. Vals AI — “Legal Research Bench”(基准测试来源,用于Astra for Law性能评估)
    https://vals.ai (商业基准测试服务)

  3. Free Law Project — “CourtListener Case Law Data Coverage”(99.9%先例判例数据来源)
    https://wiki.free.law/c/courtlistener/help/data-coverage/case-law

  4. OpenAI — “GPT-6 Astra: Next Generation Intelligence for Work”(Astra底层能力描述)
    https://openai.com/index/gpt-6-astra-next-generation-work/ (2026-09-15)

  5. 2026-09-18日报 — 话题7”OpenAI Astra for Law”条目(事件时效性确认来源)

  6. CNBC — “Harvey legal AI raises at $15B valuation”
    https://www.cnbc.com/2026/09/11/harvey-legal-ai-15b-valuation (Harvey作为早期合作方的背景信息)

  7. Latham & Watkins官方网站(AI治理合作背景)
    https://www.lw.com/en/expertise/ai (律所AI法律服务背景说明,Astra for Law合作方)

  8. 法律AI行业背景 — Mata v. Avianca案(2023,AI幻觉引用的司法警示案例)
    参考来源:Casetext及多家法律媒体的后续报道