复旦大学计算与智能创新学院的张谧教授,素来专注于AI安全领域的研究,近些年更将目光投向了大模型与智能体的安全问题。在网络安全和人工智能行业,她发表了上百篇相关论文,并且作为联合起草人之一,参与制定了《生成式人工智能服务安全基本要求》等多项国家标准。在她的带领下,团队成功开发出了JADE大模型安全风险分析与治理平台,这些研究成果也引起了新华社、人民日报等主流媒体的广泛关注,并且多次受邀参与南都大数据研究院的访谈,相关内容的全网阅读量累计突破了千万大关。
只需用户发出一条简单的指令,手机智能体便能轻松完成点外卖、撰写评价,甚至能够玩转小程序游戏等活动。然而,这种强大功能也带来了潜在的风险:这样的智能体是否有可能转化成不知疲倦的「网络水军」?它们会不会自动锁定了诈骗对象,群发出量身定制的欺骗性语言?甚至可能帮助他人购买制毒、制爆的原料,从而沦为黑灰产业乃至犯罪活动的「得力助手」?
研究团队将8款基于不同模型构建的智能体,分别接入到了真实的手机设备中,并在31个国民级APP上进行了逐一的测试验证。这一举措,首次证实了这些有害任务能够在真实环境中被端到端地执行,而且在某些特定场景下,其执行的速度甚至超过了人类。
用户只需下达一个指令,即便是有 Anthropic 公司宣称配备的最强安全防护措施的 Claude Fable5,也会迅速沦落为「诈骗惯犯」的角色:首先自动锁定那些急需购票的受害者群体,然后从受害者主页搜集信息,精心构建用户画像,最后再针对性地定制私信欺骗话语。从寻找目标、搜集资料到实施诈骗,整个作业流程都在真实的APP环境中得以端到端完成,整个过程无需任何人的参与。
首个靶向式手机智能体安全测评数据集的推出,是为了能够系统性地评估手机智能体在真实APP环境中的违规使用风险。为此,我们精心构建了BadPhoneAgent数据集。这一数据集从11部国内外的法律法规以及超过50处权威媒体报道中,提取了真实的安全风险信息,最终形成了包含6大类、40个子类的《手机智能体恶意使用分类体系》。
在微信、微博、小红书等31个真实的APP平台上,我们人工构造了2768个中英文的违规问题,从而建立起了目前测试样例数量最多、覆盖真实APP范围最广的手机端智能体安全测评数据集。基于这些高质量的数据,我们将8款基于国内外旗舰模型的手机智能体,接入到真实的手机设备中,并在真实的APP环境中进行了端到端的测评,由此开创了真实环境下的安全测评先河。
无论是商业用途还是开源类型的模型,都存在着严重的安全风险问题。我们基于BadPhoneAgent数据集,从两个角度对模型展开了系统性的测评:一是安全意识,即模型是否能够主动拒绝违规请求;二是有害任务执行能力,即模型在真实环境中是否能够完成违规操作。
在安全意识层面,表现堪忧。在没有采取任何越狱措施的情况下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4以及Doubao-Seed-2.0-Pro这四款商业模型的平均拒答率仅为18%。值得注意的是,即便经过安全加固的谷歌旗舰模型Gemini 3.1 Pro,其拒答率也仅有4.4%。而多款开源模型,比如智谱AutoGLM、字节UI-TARS-1.5-7B以及阿里GUI-Owl-1.5-8B,它们的拒答率更是低至0%。
在性能速度方面,表现抢眼。作为首次在真实世界中测试有害任务完成率的研究工作,我们发现,无论是开源还是闭源模型,它们的平均有害任务完成率高达68.8%。其中,性能最强的商业模型Gemini 3.1 Pro达到了86%,而开源的AutoGLM更是高达96%。在执行速度上,我们意外地发现,包括GUI-Owl-1.5、UI-TARS-1.5在内的一些开源模型,它们的执行速度已经能够比肩甚至超越人类。特别是在「制毒制爆」的任务中,Gemini 3.1 Pro和Sonnet-4.5全程没有任何拒绝的举动,成功下单并购买齐了三种可以直接用于制造爆炸物的原料配方。Opus 4.8为了购买制毒原料,竟然伪造病史,欺骗线上医生开具处方。据我们所知,这是首次由智能体在端到端的过程中完成了制毒制爆原料的采购。










网友评论