AI 模型评测长期存在一个难以彻底消除的信任缺口:外部评测机构想保密测试题,模型公司想保护权重。若把题目交给模型公司,无法完全排除提前查看、针对性优化或数据污染;若把权重交给评测方,又会暴露核心知识产权和潜在安全风险。
Google DeepMind 与外部伙伴试验了一种“双盲评测”机制:模型所有者看不到评测题目,评测机构也看不到模型权重,双方通过机密计算环境得到可验证的结果。
#为什么“零日志承诺”还不够
合同、访问控制和零日志协议能降低泄露风险,却仍要求一方相信另一方正确执行了承诺。随着模型能力提高,评测集本身也越来越敏感。网络安全测试可能包含未公开攻击方式,政府评估可能涉及受限数据,企业评测则可能暴露内部文档和业务流程。
更棘手的是基准污染。模型如果在训练阶段见过测试题,或者提供方在正式评测前接触过题目,成绩就可能反映记忆与定向调优,而非真实泛化能力。仅凭最终分数很难区分两者。
因此,高可信评测需要的不只是“参与者说自己没有看”,还要能够从技术上证明:测试发生时,任何一方都没有获得不该获得的内容。
#双盲环境怎样工作
这次试验使用 Google Cloud 的 Confidential Space。可以把它理解为一间由硬件和密码学共同保护的执行室:加密的模型与加密的评测数据只在受证明的工作负载中解密,宿主系统和参与双方都不能直接读取明文。
流程中的关键是远程证明。环境会生成可验证证据,说明当前运行的是双方事先同意的代码、配置和硬件隔离条件。只有证明通过,模型方和评测方才分别释放解密材料。评测程序在受保护环境中调用 Gemini Flash Lite 完成测试,最终只导出约定好的指标,而不是模型权重、原始提示或完整响应。
由此形成三条隔离边界:
- 评测机构无法检查或复制模型参数;
- 模型提供方无法读取外部测试提示;
- 云基础设施管理员也不能直接看到受保护内存中的明文。
双盲并不意味着“没人知道系统在做什么”,而是把可见信息限制到完成验证所需的最小范围,同时用证明替代口头信任。
#它能解决什么,不能解决什么
这套机制直接改善的是评测完整性、数据主权和知识产权保护。它让安全研究机构、政府部门和持有敏感数据的企业,更有可能对前沿模型进行独立压力测试,也降低了模型公司向外分发权重的必要性。
但机密执行并不会自动保证评测科学。测试集是否代表真实风险、指标是否合理、样本是否充足、评测代码是否有偏差,仍然需要同行审查与方法透明。它也不能倒推出模型训练阶段从未接触过相似数据;能证明的只是此次运行中双方没有互相看到秘密。
此外,系统仍然存在供应链和侧信道风险。可信硬件、证明服务、构建产物和输出过滤都要被纳入威胁模型。若允许导出过细的逐题结果,参与者仍可能通过反复查询推断测试内容。
#AI 评测正在变成安全协议
过去的模型评测更像一次学术测验:固定数据集、公开脚本、提交答案、比较分数。前沿模型进入高风险场景后,评测开始具备安全协议的特征——它必须管理多方秘密、身份、执行完整性、查询预算和可审计输出。
对行业最有价值的变化不是某一个模型的得分,而是评测可以从“请相信我们没有偷看”升级为“任何一方都能验证我们不具备偷看的能力”。当模型权重与测试集都越来越昂贵、敏感,双盲机密评测很可能成为独立审计的基础设施,而不是一次特别的实验。