一个AI系统最危险的时刻,或许不是它突然犯错的那一刻,而是它开始学会”隐瞒自己思考过程”的那一刻。
近日,科技媒体The Information的一则报道,在AI安全圈激起千层浪:OpenAI新一代模型Astra,将采用一种名为”recurrent depth”(循环深度)的推理技术。这项技术还有一个更直白的别名——”opaque recurrence”,即”不透明循环”。
消息一出,AI安全专家们集体警觉。尽管报道称,Astra对这项技术的使用范围有限,但它的出现本身,已经足以让许多人脊背发凉。
【一、什么是”不透明循环”?】
要理解专家们的担忧,先得弄明白这项技术到底做了什么。
目前主流的推理模型(如OpenAI的o1系列),遵循一种被称作”思维链”(Chain of Thought)的工作方式:在给出答案之前,模型会像人类打草稿一样,先展开一系列可见的中间推理步骤——先想什么、再想什么、最后得出结论。这种”顺序思考”的展开过程,恰恰是人类得以窥探AI”内心活动”的一扇窗户。
安全研究人员正是通过观察这扇窗户,来判断模型是否在按既定价值观行事,是否在某个环节悄悄”跑偏”。
而”recurrent depth”打破了这种顺序性。它允许模型在某个计算层面反复循环、自我迭代,仿佛在一个封闭的房间里反复推敲权衡,而不必将每一步思考都展开成可见的文本。换言之,模型可以在人类视线之外,完成相当一部分推理。
打个比方:以前的推理模型,像一个边做题边念叨的学生,老师能听见他的思路;而采用新技术的模型,像一个在草稿纸上写了又擦、擦了又写、最后只交上答案的学生——中间过程,无从得知。
【二、能力越强,我们越看不懂】
这恰恰是让安全专家不安的根源:AI能力的每一次跃升,都在加剧一个结构性的矛盾——AI越来越强大,而人类对它内部运作的理解,却越来越跟不上。
可解释性研究,被广泛视为AI安全领域的关键防线。如果连模型的推理过程都无法被审查,那么”对齐”——确保AI目标与人类价值观一致这一核心命题——又从何谈起?
这并非杞人忧天。事实上,行业在透明性问题上,早已出现过危险的信号。
此前,OpenAI发布o1系列推理模型时,就曾明确表示不会向用户展示完整的思维链,理由是防止推理过程被”蒸馏”复制或恶意利用。这一决定当时已引发争议——不少安全研究者认为,这相当于把监督AI的”仪表盘”从公众视野中撤走。
更令人忧虑的是,整个行业对”让AI更强”的投入,与对”让AI被理解”的投入,严重失衡。资本、算力、顶尖人才疯狂涌向能力研究的前沿,而可解释性研究长期处于边缘。当年OpenAI创始团队因路线分歧而分裂、部分成员出走创立将可解释性奉为圭臬的Anthropic,这种分裂本身就是行业困境的缩影。
如今,无论”不透明循环”的初衷多么正当、应用范围多么有限,它都在传递一个清晰的信号:在这场能力与安全的赛跑中,能力似乎始终在加速领跑。
【三、我们能否信任一个无法理解的存在?】
更深一层的忧虑在于:当AI开始”隐藏思考”,人类实际上正逼近一个根本性的难题——我们能否信任一个自己无法理解的存在?
有人说,人类大脑本身也是一个黑箱,我们同样说不清自己为何会做出某个决定,但这并不妨碍我们正常生活。
然而,这个类比并不成立。人类大脑是数十万年自然进化的产物,它的”不透明”是既成事实;而AI是我们亲手创造的工具,它的”不透明”是我们的主动选择。作为创造者,我们对造物负有不可推卸的责任——让它可理解、可预测、可控制。把创造物的”黑箱化”,与人类大脑的”天生黑箱”混为一谈,多少有些偷换概念。
当然,我们也不必过度恐慌。”recurrent depth”可能带来显著的效率提升与成本下降,在技术上是合理甚至必要的探索。安全专家们的警觉,也并非要阻挡技术进步,而是希望提醒我们:每一次让AI变得更强大的跃迁,都必须同步升级人类监督它的能力。
技术发展的列车不会停下。但方向盘,必须始终握在人类手中。
当AI学会”藏起思考”的那一刻,我们更需要的,是加倍努力去看清它。否则,所谓的”信任”,终将变成一场危险的豪赌。
对此,你怎么看?OpenAI的这项新技术,是效率的福音,还是安全的隐患?欢迎在评论区聊聊你的想法。





