2026年8月27日,Google DeepMind宣布了一件在AI评估领域从未发生过的事:他们和新加坡AI安全研究所(AISI)合作,完成了世界历史上首次对前沿AI模型的双盲评估。

所谓双盲,是指评估过程中,模型提供方(Google)看不到评估问题,评估方看不到模型权重。双方各自拥有的核心信息被锁在一个硬件加密隔离区(Trusted Execution Environment,TEE)里——只有在这个密封的计算环境内才能交汇,而这个环境不属于任何一方。

这个实验的意义不在于Gemini考了多少分。意义在于:它第一次从技术层面证明,AI评估的结构性信任问题可以被解决。

为什么现有的AI基准全是”开卷考试”

在AI性能评估领域,有一个长期存在却极少被公开讨论的结构性问题——基准测试数据集迟早会泄露进训练数据

这个过程不需要任何主观恶意。模型在海量互联网文本上训练,而基准测试的问题和答案也存在于互联网上。随着训练数据规模不断扩大,模型见过某个特定基准的概率也在不断提高。当模型实际上已经在训练中”见过”测试题目时,它的高分衡量的不是推理能力,而是记忆检索能力——这两件事在实际应用中有天壤之别。

Google自己的技术报告引用了一项分析:在31个被研究的AI模型中,约有一半存在基准泄露的迹象。另一项2026年发布的研究得出结论:基准泄露可能显著虚增模型分数,而且更大的模型对这种效应更敏感——也就是说,越是声称能力强大的模型,越容易被基准泄露的问题干扰结论。

面对这个问题,行业有3种常见的应对手段,但全都有根本性缺陷:

保密基准:把测试题目保密,只通过API接口发送评估请求。但这意味着评估方必须把问题发给模型提供商的服务器——提供商的日志里出现了这些问题。即使他们签署了不记录的承诺,这仍然是基于信任的承诺,不是技术保证。

零日志协议:要求模型提供商签署协议,承诺不保存评估请求的日志。协议是文字,不是密码学。数据泄露、员工操作失误、或者未来的训练运行意外包含缓存数据,都会让协议失效。在AI公司的实际运营中,这种”意外暴露”的风险远比人们想象的高。

提供模型权重:把模型部署在评估方自己的环境里运行。问题是模型权重代表着数十亿甚至数百亿美元的训练成本,没有任何公司愿意把这个资产交给第三方,除非有可信的技术保障——而这个保障在双盲评估之前并不存在。

这3种方法形成了一个没有好出路的三角悖论:你无法同时保证题目保密、模型权重安全和评估过程独立可信。在这个悖论里,所有的AI基准评估本质上都在依赖信任和承诺,而不是技术保证。

2026年7月,由13个国家、100名研究者参与的《2026年新加坡全球AI安全研究优先级共识》文件,明确将这个结构性缺口列为优先级研究挑战,呼吁建立”能让模型权重和基准提示同时保密”的评估基础设施。

一个月后,Google DeepMind回应了这个呼吁。

双盲评估的技术机制:密码学替代信任

Google DeepMind的解决方案是可信执行环境(TEE,Trusted Execution Environment)。TEE是一种硬件支持的隔离计算区域——在这个区域内运行的代码和数据,即使是操作这台服务器的系统管理员也无法读取,只有TEE内部运行的程序本身可以访问。这种技术已经在金融支付(如Apple Pay的Secure Enclave)和医疗数据处理中广泛应用,但这是它第一次被用于前沿AI模型的性能评估。

实现机制分3步:

首先,Google DeepMind将Gemini 2.5 Flash Lite的模型权重加密,送入TEE。Google持有模型权重,但在TEE内部,他们看不到评估方发送的测试提示。

其次,评估联合方——新加坡AISI、隐私计算非营利机构OpenMined、AI基准测评联盟MLCommons、评估公司AVERI——将测试提示加密后也送入同一个TEE。评估方持有测试题目,但在TEE内部,他们看不到模型权重,也无法访问模型内部状态。

最后,在TEE内部,模型权重和测试提示交汇,完成推理,输出评估结果,整个过程中没有任何一方能同时看到对方的核心资产。

这个机制的核心价值是把信任从承诺变成了数学保证。对评估方来说,可以合理相信测试题目没有被Google看到。对Google来说,可以合理相信模型权重不会被评估方泄露或滥用。两方都不需要依赖对方的承诺,也不需要假设对方没有利益冲突。

TechTimes在报道这次评估时指出:这是历史上第一次,模型提供商和独立评估方在不需要互相信任的情况下,完成了正式的前沿AI模型评估。

“不需要互相信任”——这句话比表面看起来更深刻。基于信任的安全体系会随着商业竞争的激化和利益格局的变化而脆化,而密码学保证在任何情况下都成立,不受关系变化的影响。AI评估体系的长期可信性需要的正是后者。

为什么2026年这件事突然变得紧迫

AI基准可信度问题从学术讨论进入政策层面,是2026年上半年发生的变化。

多个国家和地区的AI监管框架开始要求高风险AI系统在部署前接受独立第三方评估。欧盟AI法案的实施条款、美国各州的AI监管立法、以及各类自愿性合规框架,都在以不同形式要求”第三方评估”。但没有任何一个框架能清晰回答一个关键问题:当模型提供商和评估方之间存在固有的信息不对称时,”独立评估”的独立性在技术层面如何保证?

传统的解决方案是职业声誉和法律责任——就像金融审计一样,审计师不可能同时为客户工作又假装独立。但AI模型评估面临一个金融审计从未遇到过的问题:即使评估方完全客观,他们在评估过程中接触的模型权重本身就可能成为竞争优势,这个激励冲突无法通过职业规范彻底消除。

更根本的是,即使评估师完全客观,评估过程本身的接触也可能无意间产生对未来竞争者有价值的洞察。这个风险在金融审计中不存在,因为审计的对象是财务记录,不是可以被复制和应用的模型能力蓝图。

Google DeepMind的双盲方法给了监管者一个技术可执行的路径:不依赖承诺和声誉,而是依赖密码学和可信执行环境。这意味着未来的监管框架可以要求具体的、可验证的评估协议,而不是含糊的”第三方独立评估”——后者几乎无法在实践中被严格执行。

这个先例对行业的长期影响

如果这种双盲评估方法逐步成为行业标准,会有几个系统性的变化发生。

AI排行榜的意义将被重新校准。当前各大榜单上的分数,有多少反映了真实能力,有多少来自于训练数据覆盖或间接接触基准题目?没有人能给出可靠答案。双盲评估提供了一个更干净的基准:在这套方法下得到的分数,至少可以排除一种重要的干扰源。

基准设计的激励结构将改变。当前大量基准面临一个恶性循环——一旦公开,就会很快被纳入训练数据,然后就”死了”,失去评估价值。双盲方法保护了基准题目的保密性,理论上可以让同一套高质量题目被多次使用。这给了基准设计者投入更多资源设计更有深度的题目的动力,因为题目不会在公开一次后就失去价值。

高风险场景下的AI部署决策将更有依据。当医院、金融机构、政府机构在考虑将AI纳入关键业务流程时,他们需要的不是”这个模型在某个榜单上排名第几”,而是”这个模型在与我的业务场景高度相关的任务上,经过了独立可信的能力验证”。双盲评估框架提供了后者的技术基础。

当然,这个方法有它目前的现实限制。TEE在理论上存在侧信道攻击的风险,虽然实际执行极为困难,但在安全研究领域这是已知的问题。更实际的限制是成本和协调复杂度——参与双盲评估需要多方机构协作、专用的计算基础设施、以及严格的操作流程,这比直接API测试要复杂得多、昂贵得多。

这意味着双盲评估短期内不太可能成为每个开发者测试模型的日常方法,它更可能成为重大模型发布前、监管合规要求下、以及关键采购决策场景中使用的高可信度评估手段。

但即使是这种有限的应用,也意味着AI基准信任危机有了它的第一个技术解法。这不是一个小的进步。

留下的更大问题:谁来评估评估者

双盲实验解决了评估过程的可信性问题,但留下了一个更深的问题——谁来决定用什么基准测试?

即使评估过程完全可信,如果评估维度的选择本身有偏差——比如只测试英语能力而忽略多语言场景、只测试学术知识而忽略实际操作判断、只测试单步任务而忽略多步推理——高分仍然可能是误导性的。

当前AI基准的深层问题是维度选择的局限性。主流基准测的是”回答问题的能力”,而企业使用AI的主要场景是”完成任务的能力”,这两者之间的差距是系统性的,不是通过改进评估方法就能消除的,需要从基准设计的底层重新思考。

这是双盲评估之后,研究界需要继续解决的更大挑战。可信的评估过程是必要条件,但不是充分条件。

一个被广泛可信的AI能力评估体系,需要同时解决”过程可信”和”内容代表性”两个问题。Google DeepMind完成了前者的第一步。后者,还需要整个行业的集体努力。


在AI能力军备竞赛愈演愈烈的2026年,一个可以被独立核实、技术上无法伪造的评估体系,不只是学术问题,它是AI系统能够被负责任地部署于社会关键基础设施的前提条件。

分数是工具。信任是目的。第一步已经迈出。

对中国AI评估生态的潜在影响

这个话题有一个维度在国际讨论中很少被提及:双盲评估框架的全球化。

当前AI安全领域的主流评估机构——AISI(英国/美国/日本版本)、MLCommons等——主要由西方机构主导。如果双盲TEE评估方法逐步成为行业标准,那么中国的AI模型提供商和评估机构将面临一个选择:加入这个框架,还是建立一套平行的评估体系?

2026年的地缘AI格局已经高度敏感,算法评估被政治化的风险是真实存在的。一套技术上可信的双盲评估框架,从某种意义上说,比任何政治宣言都更中立——因为它依赖的是数学,不是政治立场。如果这个框架能吸引中国机构参与,可能成为一种在高度紧张的科技地缘政治环境中,少数能维持技术层面合作的渠道之一。

但这需要参与框架设计的各方有足够的政治意愿,而这个意愿在2026年的科技政策环境里并非理所当然。新加坡AISI选择作为合作方参与这次实验,本身就是一个微妙的地缘政治选择——新加坡作为一个在中美之间维持技术中立立场的城市国家,是推动这类跨国合作的相对理想的中间人。

这次评估的另一层含义:信任危机的规模有多大

在2026年的AI市场里,信任危机的规模被严重低估了。

想象一下这样一个场景:一家医院正在评估是否将一套AI诊断辅助系统纳入临床工作流。该系统的开发商声称,他们的模型在放射科诊断任务上达到了”超过人类放射科医生平均水平”的准确率,并提供了详细的测试报告。这份报告由开发商内部团队完成,引用的基准数据集是公开的(因此可能已进入训练数据),测试方法和数据集的选择标准也由开发商自己决定。

医院的决策者应该相信这份报告吗?基于目前的行业状况,理性的答案是:没有独立验证,这份报告的可信度有根本性限制。

但独立验证的成本非常高——需要一家既有AI能力又对该医疗场景有深入理解的独立机构,获得足够大量的医疗数据进行测试,并且有一套可信的测试执行流程。这一系列条件加在一起,使得绝大多数企业在实际采购AI系统时,只能在缺乏充分验证的情况下做出决策。

双盲TEE评估框架降低了独立验证的信任成本。它不能直接解决”谁来进行评估”和”评估什么”的问题,但它解决了”评估过程能否被信任”的问题。这是整个信任链条中一个关键但此前缺失的环节。

随着AI系统在医疗、法律、金融、国防等高风险领域的部署越来越深入,对可信评估的需求只会增加,不会减少。Google DeepMind这次实验的价值,将随着AI部署规模的增长而增长。

参与方的选择反映的深层信号

最后,值得关注的是这次实验的参与方构成:Google DeepMind(模型提供商)、新加坡AISI(安全机构)、OpenMined(隐私计算非营利组织)、MLCommons(AI基准联盟)、AVERI(评估公司)。

这5个参与方的组合是有意为之的:一个商业模型提供商、一个政府安全机构、一个技术中立的非营利组织、一个行业联盟、一个专业评估机构。这个组合覆盖了基准评估生态系统的主要利益相关方。

为什么这个多方参与的结构很重要?因为如果只有Google和一家评估公司合作,这次实验容易被解读为”Google选了一家对自己友善的合作机构”。多方参与,尤其是有政府安全机构和技术中立非营利组织的参与,让这次实验的可信度超出了双边合作的水平。

MLCommons的参与尤其值得关注。MLCommons是负责ML基准测评标准化的主要行业联盟,他们对这种方法的认可,意味着这不是Google的一次性公关活动,而是朝着行业评估标准演进的一步。当MLCommons开始在其他基准中推广双盲TEE方法时,行业标准就会真正改变。

这需要时间,需要更多模型提供商愿意接受同样的评估标准,需要更多安全机构有资源和能力运行这类评估基础设施。但方向已经明确,基础设施已经被证明可行,参与者的构成提供了标准化推进的初始信用背书。

从这个角度看,Google DeepMind这次实验的历史地位或许不在于实验本身,而在于它提出了一个新的行业问题:其他模型提供商,你们准备好接受同样的检验了吗?这个问题的答案,将在未来几年里逐渐揭示AI评估生态的真实面貌——哪些公司对自己的模型能力有真实的自信,哪些公司需要模糊标准的掩护。公开的挑战已经发出。而对于使用AI系统的企业和机构来说,这个问题的答案也是一种重要的供应商选择信号:愿意接受双盲评估的模型提供商,他们对自己产品质量的自信,和不愿意接受的提供商,在字里行间已经有了差别。选择AI供应商时,”是否愿意接受独立的双盲评估”可以成为一个有意义的筛选维度,比查看内部测试报告更能反映提供商对自身产品的真实置信水平。这个维度在2026年8月27日之前还不存在,现在它存在了。


参考资料

  1. Google DeepMind. “Piloting the world’s first double-blind AI evaluations.” DeepMind Blog, 2026-08-27. https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
  2. TechTimes. “Google DeepMind Ran History’s First AI Benchmark Evaluation Where Neither Side Could Cheat.” 2026-08-28. https://www.techtimes.com/articles/325882/20260828/google-deepmind-ran-historys-first-ai-benchmark-evaluation-where-neither-side-could-cheat.htm
  3. The New Stack. “Google Double-Blind Evaluation.” 2026-08-28. https://thenewstack.io/google-double-blind-evaluation/
  4. Singapore Consensus on Global AI Safety Research Priorities 2026. ArXiv, July 2026. https://arxiv.org/abs/2608.14611
  5. MLCommons. AI Safety Working Group. https://mlcommons.org/