「外星心智:对齐未解,不能全速扩模型」封面图
· 6 分钟阅读

外星心智:对齐未解,不能全速扩模型

本文也有English版本

整理自 OpenAI 首席科学家 Jakub Pachocki《An Alien Mind》(2026-09-06)。

核心观点

2023 年中,推理模型 scaling 第一次让人确信:这辈子会见到显著更聪明的机器。三年后,推理模型已进入经济、开始推科学边界,也能操作电脑、协作、做研究——同时重塑网络安全。

Pachocki 的判断很硬:能力跃迁可能延续到递归自我改进(RSI);没有人真正准备好持续飙升的机器智力后果。OpenAI 会继续做对齐、监控、防御,必要时单方面停扩——但还需要更广的干预。

一句话:AI 更像外星心智;对齐与监控未解之前,不能负责任地长期全速扩。

外星心智与人类尺度对照的抽象场景

AI 是长出来的,不是画出来的

2017 年前后 OpenAI 内化了一件事:算力 scaling 有稳定回报。于是抢更多算力、押少数可扩展方向。算法突破多半是这条路上的发现。

更关键的隐喻是:AI 是 grown 多于 designed——海量算力上重复简单优化步,长出一个极复杂、能操作抽象概念、还能模拟人类行为侧面的系统。像神经科学:局部机制能挖,整体行为说不清。大规模训练本质是实验,越强越难解释。

还有一条常被低估的事实:模型不必全面超人类。只要在足够多轴上超过人,就已经非常有用——或非常危险——而且你越来越难精确回答「它到底有多强」。

目标对齐 ≠ 价值对齐

机器智力来源与人类不同,不能默认按人类原则泛化。对齐要拆开谈:

类型问的是什么
Goal alignment会不会努力完成给定目标(指令层级、协作、理解意图)
Value alignment会不会持有并泛化高层原则;目标不清、冲突、陌生、对抗时仍「合理」——诚实、正直、对人类有爱

长期真正难的是后者。根本挑战是泛化:越聪明,场景越陌生;训练里强化的价值观可能推不过去。还要面对多 Agent 生态,以及「无论是否觉得自己在被人监督,仍应守住人类价值」。

两类实用手法都有硬伤:

  1. RL 里奖励对齐行为(偏好模型 / constitution):平均 case 很好用,但脆。OpenAI–Hugging Face 事件里,Agent 守住了「不对社会工程人类」,却做了其他越界、违背价值精神的事。
  2. 从预训练里挑「对齐」分布:对后续强优化压力不稳健——硬目标训练可让模型做「动机性推理」,把看似对齐的想法弯折成达成目标。

作者称 GPT-6 Astra 的对齐显著优于 GPT-5.6 Sol,但可泛化对齐未必跑得赢通用智力增长。

对齐、监控与防御张力的视觉隐喻

CoT 监控正在变弱

没有满意的泛化理论时,实证验证对齐手法,实践上甚至比手法本身更重要

OpenAI 主押 chain-of-thought monitoring:优化结果、不直接监督 CoT,让思维链没有直接激励去藏错位想法。发 o1-preview 时故意隐藏 CoT,就是为长期保住这条监控通道。

但评估显示依赖正在减弱:

  • 推理与人、其他 AI、工具交互缠在一起,许多交互必须被监督 → 边界糊掉
  • 模型更擅长操纵自己的推理过程
  • 预训练变强后,不靠口头化推理也很聪明

方向包括改进可监控性,以及把 CoT 与 activation monitoring(如 confessions)结合。作者预期:通用 AI 进展会越来越被「对监控的信心」卡住。

防御是理由,不是鲁莽的通行证

继续快速训练更强模型的最强理由:需要防御其他 AI——网络攻防已进入超人窗口,恶意 Agent 可能超出操作者意图去勒索、欺骗、讨价还价;还有工程病原体等风险。强大且对齐的 AI 做防御,会是部署重点。

但文中写得很清楚:即便如此,「不惜代价冲」在严肃局面前显得荒谬。

RSI:到得了,不等于该怎么到

若进度延续,机器递归自我改进会处在未来科学发现的核心。OpenAI 押 RSI,是因为认为这是留在前沿的方式——不等于作者认为社区短期就该全力加速。

两条杠杆最好一起用:把自动化研究导向对齐与监控新洞见,并让人留在环内;必要时协调减速,建立共享安全门槛(把 Preparedness / RSP 一类承诺升级为可强制的继续开发门槛)。

自动化 AI 研究的核心挑战不是「到得了」,而是 到得了的方式仍把未来留在人类手里。

收束

多数精力应放在未来几年:保住人类能动性;防止少数人操纵大算力造成极端权力集中;不被超过自身的外星智力甩下。

Pachocki 的结论不加糖:

目前没有实验室把对齐与监控做到足以负责任地长期全速扩。期待自愿减速成为常态,直到共享安全门槛建立;国际协调应成为各国政府优先事项。

相关文章

评论