ithome
国际
科技
教育
采集 2026-08-27T16:13:28+00:00
谷歌推出全球首个双盲AI评估技术
原始标题:谷歌推出全球首个双盲 AI 评估技术,基于加密环境保障基准测试公正性
来源
ithome
发布时间
2026-08-27T13:01:39
采集批次
2026-08-27-16
字数
597
URL 指纹
7e6b9ddc26653cb1
📌 AI 总结(210 字)
谷歌联合新加坡人工智能安全研究所、OpenMined等机构,推出全球首个针对前沿专有AI模型的双盲评估技术。该技术基于谷歌云Confidential Space加密黑箱环境,对Gemini Flash Lite模型进行机密基准测试,让评估方看不到模型权重、谷歌也看不到测试提示词,有效防止「基准污染」,同时保护知识产权和数据主权。这一技术对网络安全、政府机构等高敏感度评估尤为重要,谷歌希望以此为行业AI监督开辟新方向。
📄 正文(597 字)
IT之家8月27日消息,谷歌宣布推出全球首个针对前沿专有AI模型的双盲评估,将外部评估限制在加密「黑箱」环境中,避免模型提前获取测试信息来优化性能。 就像学生考前不能提前看到试题才能真实反映水平一样,当前AI模型评估也面临同样问题:如果模型提前接触测试题目(IT之家注:也就是所谓的「基准污染」),评估结果的可信度就会大打折扣。 谷歌联合新加坡人工智能安全研究所、OpenMined、AVERI以及MLCommons,在隐私保护环境中对Gemini Flash Lite模型进行机密基准测试,提升评估结果的完整性。 传统高风险外部评估一直存在两难困境:要么评估方交出测试提示词,存在模型方提前看到题目的风险;要么模型方交出模型权重,面临知识产权泄露风险。 双盲评估则解决了这一矛盾,通过谷歌云保密计算产品组合中的Confidential Space,能够通过加密验证,保证外部评估数据和专有模型分别对各自所有者保持隐私:评估方无法看到Gemini模型权重,谷歌也无法看到评估方的测试提示词。 这种加密手段可以有效防止基准污染,同时保护敏感数据,对于网络安全或政府机构开展的高敏感度评估尤其重要。双盲评估让独立机构能够在不损害数据主权和安全的前提下,对先进AI模型进行严格测试。 谷歌表示,希望这一试点能够为模型监督开辟新方向,帮助整个行业构建更安全、更可靠、更受公众信任的AI系统。