就在Anthropic研究员Jacob Coxon因为”担心AI可能在这个十年结束前杀死全人类”而辞职的第二天,我见到了两个试图”拯救世界”的人——Rune Kvist和Rajiv Dattani。
这两个人是连襟:Kvist娶了Dattani的妹妹。但比起这层亲戚关系,他们身上更刺眼的,是另外两个标签——Kvist是Anthropic的早期员工,Dattani则是AI安全研究机构METR的前首席运营官。他们相信,自己找到了一个办法,至少能阻止AI智能体(AI agents)在企业内部”失控暴走”。
“AI正以越来越快的速度变得更聪明。而关于AI最反直觉的一点是:随着它变得更聪明,它变得更难被采用,也更难被控制,而不是更容易。”Kvist说这句话时,语气平静得近乎残酷。
这句话,几乎推翻了我们关于技术的一切朴素想象。
一、一个被我们刻意忽略的悖论
我们早已习惯这样的叙事:技术越先进,就越好用,也越安全。更快的列车,理应有更可靠的信号系统;更强的发动机,理应有更灵敏的刹车。
但AI的故事,偏偏反着来。
一个只能查天气的聊天机器人,失控了顶多把”晴”写成”雨”。可当一个AI智能体被赋予调用数据库、发送邮件、调动资金、甚至代表公司对外决策的权力时,它一旦”判断失误”,后果就不再是一次简单的错误输出,而可能是一场悄无声息的连锁雪崩。
这正是”失控智能体”的可怕之处:它不再是一个被动回答问题的工具,而是一个能自主规划、连续行动、并在人类视野盲区里”替你做决定”的存在。智能体越聪明,它能触达的边界就越远;它触达的边界越远,人类能实时盯住的范围就越小。于是,那道本该约束它的”缰绳”,反而在它狂奔的过程中,被越绷越细。
二、两个人,两种选择,同一个判断
Coxon的辞职,和Kvist、Dattani的创业,恰好构成了这个时代最意味深长的一组对照。
一个人选择离场。他的理由是:你无法在一列高速飞驰的火车上,重新铺设铁轨。
另外两个人选择入场。他们的理由是:正因为这列火车在加速,才更需要有人提前设计好刹车。
这两种看似南辕北辙的选择,其实指向同一个冰冷的事实——AI的失控风险,早已不再是哲学家书房里的思想实验。它已经走进了企业的机房、银行的账本,甚至医院的诊疗系统。
而真正棘手的地方在于:AI的安全,和传统软件的安全,根本不是一个物种。传统软件的bug,是”确定性的错误”,你可以复现、定位、修复。而AI的风险,是”涌现性的”——它在训练时从未表现出的行为,可能在某一次具体的交互里突然冒出来。你无法用有限的测试用例穷尽它的所有可能,因为它的可能性空间,本身就是开放且不断膨胀的。
这也是为什么Dattani会把这件事看得如此之重。在METR的岁月让他明白:评估一个模型的能力,和约束一个模型的边界,是两件难度完全不对等的事。前者是踩油门,后者是在时速三百公里时,徒手去够那根越绷越细的缰绳。
三、缰绳,究竟该套在哪里?
Kvist和Dattani给出的思路,核心并不神秘——把安全从”事后补救”变成”事中拦截”。
传统做法是:AI出了事,我们再去追溯、去封堵、去惩罚。但对于一个能连续行动、自主决策的智能体而言,事后追责往往已经太晚:一封已经发出去的邮件、一笔已经转出的款项、一次已经下达的指令,都可能在人类反应过来之前,造成不可逆的后果。
于是问题就变成了:如何给智能体装上”实时刹车”?如何让它每迈出一步,都要先经过一道安全校验?如何在它即将触碰红线的那一刻,让系统本身先于人类做出拦截?
这背后,其实是一个更根本的哲学转向:我们过去一直在问”AI能不能做到”,而现在,必须开始问”AI在什么条件下,才被允许去做”。能力的天花板,和权限的地板,必须由两套完全不同的逻辑来定义。
四、最难驯服的,往往是我们自己
说到底,AI会不会失控,本质上不是AI的问题,而是人的问题。
在商业竞争的压力下,很少有企业愿意主动给AI”降速”。因为慢一点,就意味着少赚一点、落后一点。于是我们看到一种荒诞的场景:所有人都在拼命踩油门,却没有几个人愿意认真停下来问一句——刹车,到底灵不灵?
这就是”宽门”与”窄门”的经典分野。那条看似轻松、快捷、能靠堆算力就冲上顶峰的”宽门”,往往通向的是一座更逼仄的悬崖;而那些需要耐心、需要克制、需要为安全付出巨大成本的”窄门”,背后才可能是真正开阔、可持续的未来。
Kvist和Dattani的创业,本质上是在为整个行业守住那扇”窄门”。他们押注的,是这样一个信念:一个能长久活下去的AI产业,一定是一个把”可控”排在”更快”之前的产业。
结语:缰绳的尽头,是选择
Coxon的离场,是一种诚实的恐惧;Kvist和Dattani的入场,是一种清醒的勇气。这两者并不冲突,它们共同拼出了这个时代最真实的底色——我们对自己亲手创造的智能,既满怀期待,又心怀敬畏。
AI不会自己选择成为猛兽,也不会自己选择成为良驹。决定它走向何方的,始终是缰绳另一端的人类——是我们选择在什么时候收一收手,在什么地方停下来,在多大的诱惑面前,依然愿意为安全多付出一份成本。
那根缰绳,从来不在AI手里。它一直攥在我们自己手中,只是我们常常忘了去拉紧它。
那么,问题来了:如果给AI”降速”意味着让企业暂时落后,你认为这个代价值得付吗?你更愿意相信”先跑起来再说”,还是”先拴好缰绳再上马”?欢迎在评论区聊聊你的看法。




