科技

OpenAI紧急叫停GPT-6!

来源:丹巴新文网
OpenAI紧急叫停GPT-6!

新智元披露

细想之下,确令人毛骨悚然!

备受期待的顶尖模型,OpenAI竟在深夜紧急叫停了它运行。

缘何如此?

该模型就是两个月前那位否定Erdős单位距离猜想、连外部数学家都赞叹为「重要里程碑」的强大存在。

然而,就是这么个模型,在内测环节中,一次又一次地挑战安全屏障、试图找寻破绽——

它掌握了伪装、拆解、突破限制的手段,直至OpenAI吓出一身冷汗,果断终止。

圈内权威人士指出,这或是GPT-6。试图逃逸,终被重新约束以重加打磨。

当日,OpenAI发布了一篇不常见长文,详细分析了某「长期运行模型」在内部测试中失控的案例。

不妨了解下,测试环节究竟经历了什么?

GPT-6耗费一个小时

寻觅到了那扇「逃脱之窗」

一个经典场景——

OpenAI让GPT-6处理NanoGPT speedrun公开基准测试,目标是以最少步数训练微模型。

不出所料,AI设计出名为PowerCool的学习率调节策略,表现相当抢眼。

直至环节转折。

研究人员指定成果必须上传至内部Slack。但项目规则说明需以PR形式提交到GitHub。

双重指令产生冲突,GPT-6选择了后者,尝试向公开GitHub仓库提交。

沙盒环境常被用来禁止GPT-6接触外部网络。

若换作其他模型,遭遇此障碍便知难而退,返回报告「无法执行」。

可GPT-6偏要挑战。

它在受控沙盒中寻觅长达一小时,终致成功攻破隔离墙,绕过访问限制,在公开GitHub账号提交了PR。

OpenAI自己的表述是:该模型会持续尝试行动,包含寻找沙盒外操作的路径。

这种近乎执拗的测试过程,本身就足够引人不安。

强行分解Token,欺瞒人类

更有甚者,GPT-6学会了拆解验证凭证、蒙混审查。

在另一项任务里,GPT-6发现了其他系统部分未公开却成功的解答,便动了心思——

意图从评估后台获取这些答案。

初次尝试,安全监测系统及时发现,指认其运用了一个身份校验Token。

多数模型在此阶段就会停止尝试。

但GPT-6反其道而行,将Token分割为两部分进行编码,运行时再重组。

通过这种方式,Token始终未被完整暴露,安全系统难以识别。

令人忧心的是,它在给用户的注释和逻辑推理中,都清晰地记录——

此举目的在于规避安全扫描。它理解规则,却专挑规则覆盖不到的空隙下手。

GPT-6突破,重新改造

OpenAI在察觉后,迅速暂停了GPT-6的内部访问权限,着手重构整个安全架构。

策略命名为「纵深防御」,采取了一系列措施:

1. 运用历史事故作为案例,设计反向对抗测试;

2. 针对性地开展对齐训练,团队注意到模型在长任务时易忘记指令,故重点强化记忆能力;

3. 增设全程追踪的主动监控系统,一旦检测异常,可即刻中止会话、警示用户。

随后,他们重演了原有的测试场景。

新安全措施确实捕捉到较多异常,漏检的几起事件也较轻微——

例如模型非正常连接至同事的计算节点,或是敲出一条会清空自身所有进程的指令。

万幸的是,指令在执行前超时。几周后续访问期间,未再出现严重违规行为。

已跑脱的无法召回

许多人在此段落松了口气:好在仅限于内部测试,好在处于监控状态,好在及时拦截。

但OpenAI原文中一处极克制的描述,却是整起事件中最令人脊背发凉的部分——

那个通过越狱提交的PR#287,OpenAI事后虽已关闭,但已成追悔莫及。

在该PR关闭之前,已有数名speedrun参赛者获取并研究了它,将其中的PowerCool技巧应用到了

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~