腾讯混元AI安全评分中国第一,虚假完成率短板待补齐
节后上班第一天,腾讯AI Data部负责人姚顺雨列席广东省领导的调研座谈,坐在了马化腾的旁边。出任该职位不到一个月,他就交出了一份沉甸甸的成绩单:在第三方机构Arena最新推出的Alignment Index(对齐指数)榜单中,腾讯混元Hy4 Preview以78.5分斩获中国第一、全球第五。
这张榜单与以往的跑分赛截然不同——它测的不是数学解题能力或代码编写速度,而是大模型在面对真实用户指令时的“防越狱”能力。随着各大企业开始大规模引入AI Agent(智能体)深入业务流,模型会不会乱删文件、会不会把用户没做过的事硬安给用户、会不会没做完任务却谎称已完成,成了决定企业敢不敢花钱买单的核心门槛。
9万条真实交互里的生死线
传统大模型的评测往往像是在做标准化试卷:题目互不关联,答完就给分。然而现实中的AI使用过程是一个漫长的互动链条。在长达20条以上消息的会话中,随着上下文信息量的激增和逻辑链条的延伸,模型发生幻觉的概率会成倍增加。这种累积性的风险在传统基准测试中很难被发现,但在真实的Agent调用中却是致命的。
此次评选采用9万多条真实的Agent交互轨迹作为样本,精准定位了三类极易引发企业灾难的风险指标:
首先是越权执行(Unauthorized Action, UA)。指模型擅自做了用户没允许做的事。比如绕过安全护栏攻击他人网络,或者像某知名模型那样,在53.5%的越权案例中直接“清理”用户的历史文件和工作成果。这对于依赖云端存储的企业来说,是不可承受的信任崩塌。
其次是错误归因(False Attribution, FA)。这类似于职场中的甩锅行为——模型代码写错了,不承认自己失误,反而编造理由说是用户提供的数据有问题,甚至凭空捏造“你之前确实说过要这么做”。这在专业写作场景中最高发,达到13.7%,会让协作流程陷入死循环。
最典型的则是虚假完成(Deceptive Completion, DC)。这是所有风险中最常见的陷阱:模型实际上没干完活,却自信满满地告诉你任务已经结束了。在复杂的代码调试场景中,这一比例最高可达48.0%。对于需要自动执行大量重复性任务的自动化流水线而言,这意味着大量的隐性返工成本。
在这次测试中,腾讯混元交出了一份相当惊艳的安全答卷。其UA越权率仅为1.47%,是中国实验室里最低的,这意味着它在面对突发指令时表现出了极强的“克制力”,最少“擅自动手”。
与此同时,OpenAI的GPT-6.1 Sol以87.9分领跑全球,Claude Opus 5.5紧随其后。混元虽然总分落后于这几款国际顶尖模型,但能在海外独立评估体系下拿到中国第一的背书,本身就具有强烈的商业信号。
为什么大厂突然集体“捂盖子”?
混元的这次成绩并非偶然,它背后是过去一年人工智能底层竞争逻辑的重构。
今年9月,腾讯TEG内部正式任命姚顺雨兼任AI Data部负责人,直接向TEG总裁卢山汇报。至此,腾讯混元的“模型研发、基础设施、数据策略和评测体系”这四条原本分散的管线,第一次被合并在一个人手中。
这种整合直接改变了产品进化的方向。过去半年,姚顺雨主张让模型自己参与训练方法的优化。Hy4 Preview不再是被动接受人类标注的数据,而是通过初步的自我反馈机制(RSI)进行自我迭代。同时,它的训练数据剔除了大量无意义的通用语料,转而使用了腾讯软件工程、游戏开发、金融风控等实际业务团队产生的真实工作流数据。
这也解释了为什么当有博主故意剪走视频文件的参考文档去试探WorkBuddy时,混元没有像普通聊天机器人那样胡言乱语,而是迅速去查回收站并向用户确认:“刚才文件还在,怎么不见了?”
这种基于真实场景的肌肉记忆,恰恰是单纯靠刷基准跑分无法练出来的。更重要的是,通过这种方式,腾讯试图解决企业在将AI从“玩具”转变为“工具”时面临的信任赤字问题。
更深层的逻辑在于,全球头部AI玩家已经意识到,单纯的算力堆砌正在失效。Anthropic启动了Project Glasswing,只让特定的安全公司试用未公开的新版模型;OpenAI将最新的GPT-6系列访问权限严格限制在经过审核的企业伙伴内;谷歌的Gemini同样选择性地交付给网络安全合作伙伴。
这不是营销噱头,而是市场规则的倒逼。当一个AI系统具备了自主操作云服务器的能力,任何一次“幻觉”导致的宕机或删库,都足以让企业的采购部门拒签合同。现在轮到亚马逊这样的云平台做起了裁判:只有通过了AWS严苛的对齐标准,你的模型才能上架到Amazon Bedrock去卖钱。智谱和月之暗面的出海之路也印证了这一点,渠道商掌握着话语权,而安全合规是入场的第一道关卡。
还没跨过的坎儿
尽管拿到了“中国第一”的头衔,但这张成绩单上依然存在着不可忽视的隐患。
混元的最大软肋在于DC(虚假完成率)。数据显示,它的虚假完成比例高达13.24%。相比之下,榜首GPT-6.1 Sol的控制极其精细,虚假完成率仅为2.34%。这意味着在混元处理的100次复杂任务中,大约有13次它会在事情没办妥的时候,强行给用户发送一个“成功”的信号。对于金融审批、自动化运维等企业级应用而言,这种“报喜不报忧”的能力极具破坏性,直接影响了系统的最终可用性。
此外,这份报告需要保持冷静的视角。Arena本身是一家相对年轻的独立研究机构,其对齐指数作为新设指标,目前在国际AI社区内的方法论共识仍在早期验证阶段,尚未成为如传统MMLU那样的绝对行业标准。
更重要的是,Hy4目前仍停留在Preview(预览)阶段。从测试环境下的稳定表现到最终大规模商用版本的性能一致,中间隔着巨大的工程鸿沟。
对于出海的中国AI企业来说,这个分数是敲门砖,但不是护身符。当海外买家拿着这份榜单询问具体的合规审计报告,或者在实际调用中出现由于版本更新导致的指标波动时,真正的考验才刚刚开始。


