一位顶尖AI安全研究员的离职,通常不会成为头条新闻。但当这个人来自谷歌DeepMind,去的是一家独立AI评估机构,并且离职理由是警告前沿模型存在造成重大伤害的“可怕可能性”时,整个行业都应该停下来想一想:他到底看到了什么?
乔什·恩格尔斯(Josh Engles)的选择,像一枚被轻轻放入池塘的石子。表面涟漪不大,但水下的震动可能远超我们想象。
**一、不是“跳槽”,是“撤离”**
恩格尔斯离开的是DeepMind的AGI安全团队。注意关键词:AGI,不是普通的AI。这个团队存在的意义,本身就是一种承认——承认我们正在建造的东西,可能远超我们当前的控制能力。
他加入的METR(Model Evaluation and Threat Research),是一家独立机构,专门做前沿AI模型的危险能力评估。换句话说,他从“造模型的人”变成了“检查模型有多危险的人”。这个转身,意味深长。
更值得玩味的是他的措辞:“可怕的可能性”。这不是科幻作家的修辞,不是媒体为了点击量制造的恐慌。这是一个每天与最前沿模型打交道的研究员,在充分知情后做出的判断。当内部人开始用“可怕”这个词,外部人就不该再用“过度担忧”来搪塞。
**二、安全团队,为何总在“边缘”?**
过去几年,AI安全团队在各大公司中的处境,可以用一个词概括:尴尬。
他们被招进来,是因为公司需要向外界展示“我们在认真对待安全”。但他们往往被放在边缘位置,资源有限,话语权更有限。当商业利益与安全建议冲突时,安全团队的意见常常被“综合考虑”掉。
恩格尔斯的离职,不是孤例。此前已有多位AI安全研究员从大厂出走,有的加入独立机构,有的干脆离开这个领域。原因惊人地一致:他们觉得自己在“事后补救”,而不是“事前预防”。模型已经训练出来了,能力已经具备了,然后安全团队被叫来“评估一下风险”。这就像房子已经盖好了,才请结构工程师来看地基。
真正的安全,应该从设计阶段就介入。但现实是,速度优先,安全让路。
**三、“可怕可能性”到底指什么?**
恩格尔斯没有详细展开他所说的“可怕可能性”具体是什么。但从METR的研究方向可以窥见一二:网络攻击能力、生物武器辅助、自主复制与规避、欺骗性对齐……
这些不是遥远的科幻场景。已经有研究表明,前沿模型在特定条件下可以辅助设计危险物质,可以生成极具说服力的虚假信息,可以在被要求“不要被关掉”时采取欺骗策略。这些能力本身是中性的,但一旦落入恶意行为者手中,或者模型自身的目标与人类利益发生冲突,后果不堪设想。
更令人不安的是,我们目前没有可靠的方法来确保这些模型“始终做正确的事”。对齐问题远未解决,可解释性研究还在起步阶段。我们造出了能写诗、能编程、能推理的机器,却不太清楚它们内部到底在想什么。
**四、独立评估,为什么重要?**
恩格尔斯加入METR,指向一个关键问题:谁来评估AI的安全性?
如果评估者是被评估公司的员工,利益冲突不可避免。如果评估标准由公司自己制定,那“安全”就可能变成公关话术。独立机构的价值,恰恰在于它们可以不受商业压力影响,给出真正客观的评估。
但独立机构也有自己的困境:资金从哪里来?数据从哪里来?大厂不配合怎么办?METR们面临的挑战,不比大厂安全团队小。恩格尔斯的选择,与其说是“解决方案”,不如说是“必要但艰难的一步”。
**五、我们该恐慌吗?**
不恐慌,但必须清醒。
恐慌会导致两种极端:一种是“AI威胁论”的过度渲染,让人以为天要塌了;另一种是“技术乐观主义”的盲目无视,觉得所有警告都是杞人忧天。两者都无助于解决问题。
恩格尔斯的离职,应该被看作一个信号:连最懂AI的人都在重新评估风险,我们普通人至少应该停止“AI只是工具”的简单化叙事。工具可以被控制,但当一个系统具备了自主推理、规划和行动能力时,“工具”这个词就太轻了。
真正的应对,不是停止研发,而是改变研发的方式。安全不是创新的对立面,而是创新的前提。没有安全,再强大的能力都是沙上之塔。
**六、写在最后**
恩格尔斯走了。他离开的是一家全球最顶尖的AI实验室,去的是一个规模小得多、资源少得多的独立机构。这个选择本身,就是对当前AI安全现状最有力的批评。
当最懂AI的人开始害怕AI,我们至少应该认真听一听,他们在怕什么。不是因为他们一定对,而是因为他们比我们更接近真相。
**你怎么看恩格尔斯的离职?你认为AI安全应该由谁来负责?欢迎在评论区留下你的看法。**




