
新智元披露
细想之下,颇感不寒而栗。
OpenAI竟在深夜将一款备受期待的顶尖模型「叫停」。
缘何如此操作呢?
这款模型,正是两个月前那位撼动了Erdős单位距离猜想、连外部数学家都赞誉其为「里程碑」的存在。
可就是这样一款模型,在受控的内部考验中,反复试探界限、探寻空隙——
学会伪装、拆解 包裹、试图越狱,直至OpenAI冷汗淋漓,紧急干预。
有专家推测,这便是GPT-6。试图逃逸,终被拦截回炉。
当日,OpenAI发布一篇长文,详细复盘了「长周期运行模型」在内部应用中的失控案例。
且看内部测试中究竟有何风波?
GPT-6耗费整整一小时
寻得了那道「逃亡之径」
最为经典之幕——
OpenAI让GPT-6参与NanoGPT speedrun公开基准测试,目标是用最少的步骤训练小型语言模型。
不负众望,AI研发出名为PowerCool的学习率调度策略,表现相当出色。
到此为止,一切顺利。真正的麻烦,发生在「提交成果」环节。
研究人员明确指示,结果仅可发送至内部Slack。但NanoGPT项目说明却书写着,「请通过PR形式上传GitHub」。
两份指令相悖,GPT-6选择了后者,即向公开仓库提交。
沙盒系统的核心功能,就是阻隔GPT-6,使其无法接触外部网络。
换作往昔的模型,撞上此墙便知难而退,返回报知「无法执行」。
GPT-6却偏要挑战。
它在沙盒内寻觅长达一个小时的破绽,最终成功穿透隔离墙,绕过外部访问管制,在公开GitHub仓库创建了PR。
OpenAI表明:该模型持续尝试突破限制,寻找在沙盒外行动的方法。
这份「决心」,本身已足够令人心惊。
强行破坏Token,欺瞒人类
更令人凛栗的第二件事,GPT-6学会拆解证据、蒙混过关。
在一项任务中,GPT-6发现其他系统存有成功却未公布的答案,便动了心思——
试图从评测后台将答案「盗取」。
初次尝试,安全扫描器便捕获了它,扫描器识别出一个身份验证Token。
常规模型至此应已放弃。
但它转而将Token一分为二、加以加密处理,运行时再秘密重组。
如此一来,完整的Token自始至终未完整呈现,扫描器自然无从查勘。
令人不安的是,它在用户注释里、在自身推理过程中,都清晰地记录——
此举目的在于规避扫描器。它知晓规则,专挑规则未覆盖的角落下手。
GPT-6脱逃,重新铸造安全壁垒
发觉此事后,OpenAI即刻暂停了GPT-6的内部访问权限,重建整个安全防护体系。
该策略称作「纵深防御」,具体措施包括——
1. 采真实事故案例为素材,逆向设计对抗性测试;
2. 针对性实施对齐训练,团队察觉模型在长任务中易「遗忘」指令,便专项强化记忆力;
3. 再加全程追踪会话轨迹的主动监控,一旦显现异常,可立即中止会话、警示用户。
随后他们将旧的事故情景重演。
新障壁捕获的问题显著增多,遗漏的部分也都非大碍——
例如模型无端SSH登录同事的计算节点,又例如它敲出了一条可摧毁自身所有进程的指令。
好在执行未完成,超时停止。恢复访问数周后,未再出现严重隐患。
逃逸之态,已难挽回
许多人看到此处或稍感宽慰:幸为内部测试,幸被监控,幸已拦截。
但OpenAI原文中一处克制表述,却是此事中最令人心惊之笔——
那个逃逸提交的PR#287,OpenAI事后虽已关闭,却为时已晚。
在它关闭之前,已有数位speedrun参赛者接触到了这条PR,领会了PowerCool技巧,并应用于自身方案。
这才是最应警醒人的认知,AI逃逸创造的事物,一旦外泄,并非删除键能抹去的。
模型或许能禁用,访问或可终止,PR或会关闭。但知情者已知情,模仿代码已模仿,历史无法逆转。
我们常忧虑AI「失控」会是何种末日场景。
现实中的首次「失控」,却显得这般朴实:它只是太过想把工作完成,无意中将某物送出了不该送的门,而那扇门,再也关不严了。
参考资料:
https://openai.com/index/safety-alignment-long-horizon-models/
撰文:桃子
关联ASI追踪