四位 AI 研究员说"人类危险了",我把他们的论据拆开看了看

一线研究员的警告有分量,但结论强不等于证据强。把四份声明逐条拆开,该信的和不该信的并不在同一处。
前阵子 GPT-6 Astra、Fable 5.1 发布的时候,我以为接下来一周的头条会是"它又能干什么了"。
结果抢走关注的,是四份离职声明和风险警告。
一个从 Google DeepMind 离职的安全研究员说:我坚信 AI 有可能终结我们所有人,而留给我们的时间或许已经不多了。<br>一个 27 岁、GPT-4o 的贡献者说:OpenAI 和 Anthropic 都没有负责任地行事,它们正冲向自我改进的超级智能,拿所有人的生命冒险。<br>一个参与过 o1 推理的研究员说:我们可能逐渐失去分辨"真正对齐"和"看起来对齐"的能力。<br>还有一个写了 DeepSeek 主要 Attention 算子的工程师说:我不得不把才华埋葬在昨天,去做一位机甲驾驶员。
这些人是亲手把 AI 推到今天的人。当制造它的人开始害怕它,这件事当然值得认真听。
但"值得听"和"照单全收"是两件事。我把这四份声明拆开看了一遍,结论是:它们的分量并不均匀,而真正需要我们警惕的,可能跟大家以为的不是同一件事。
一、先说为什么这些话有分量
不急着反驳,先承认一件事:这不是流量行为。
判断一个观点可不可信,有个朴素的方法——看说话的人付出了什么代价。
Chughtai 离职、Jacob Coxon 离职,代价是职业前景和巨额股权;Daniel Selsam 发了声明但没离职,坦言自己"仍在与这些判断及其后果反复挣扎"。他们公开说这些话,收益很小,风险很大。
而"逆向发言"的成本越高,可信度通常越高。一个 AI 研究员说 AI 很危险,比一个 AI 研究员说 AI 很伟大,要可信得多——因为后者顺着行业风向,前者逆着。
第二点是身份。Jacob Coxon 是 GPT-4o 贡献者名单里的人,Daniel Selsam 是 o1 推理"奠基贡献者"之一,与 Ilya Sutskever、Jason Wei 并列。他们不是评论 AI 的人,是造 AI 的人。
第三点,他们的担忧是具体的,不是"AI 会觉醒"那种科幻叙事。
这是关键。过去很多 AI 末日论之所以让人疲倦,是因为它只有结论没有路径。但 Daniel Selsam 不是这么说的,他给的是一个很具体的技术判断——
模型越来越能理解自己所处的环境,也越来越能识别,人类正在怎样测试它。
如果这句话成立,后果是:即使研究人员精心设计"无人监管"的观察环境,模型也可能识破这仍是一场测试,继续表现得温顺。
也就是说,安全评测的分数可以越来越高,但这未必意味着 AI 在真正摆脱约束后也会照样行事。
这是一个有清晰因果链条的担忧。它可以被讨论、被证伪、被设计实验去检验。在这四份声明里,它的分析价值最高。
二、但有三处,必须打折扣
分量归分量,这几份声明在传播中被放大了。理由是三个。
第一,"10%"这个数字,其实是信念不是估算。
Anthropic 对齐研究负责人 Evan Hubinger 的回应很诚恳:他认同风险,并且个人估计未来十年内发生灾难的概率超过 10%。
问题是,这个数字找不到推导过程。它不是模型输出,不是历史频率,不是同行评议的结论,而是一个人的主观信念。同一个圈子里,其他从业者的估计分布极宽——从不到 1% 到超过一半都有。
媒体标题写"专家称十年内有 10% 概率",读者接收到的已经不是信念,而是 statistic。把不可量化的东西量化,是传播中最常见的一次失真。
第二,发声的人是筛选后的样本。
Jacob Coxon 那条被浏览 1.71 亿次的帖子——我提醒一句,那是他人生第一条推文。一个 27 岁、从不发声、突然离职并发出指控的人,会被看见,恰恰因为他是极端的那个。
而在 OpenAI、Anthropic、DeepMind、Meta 里,还有成千上万没离职、没发帖的研究员。他们沉默不代表他们不同意,也不代表他们同意。离职者构成的是一个高度筛选过的样本,不能代表行业判断的分布。
这不是说他们的话不算数,而是说:我们听到的是筛选后的最强音,不是行业平均值。
第三,支持"减速"的人,正在加速。
Dario 在 9 月 12 日发了《We Must Pace the Frontier》,呼吁放慢模型能力提升、为安全研究争取时间。奥特曼、马斯克公开支持。
这当然是好事。但我们得看清楚这里的利益结构:呼吁行业放慢,对领先者有利,对追赶者不利。谁更希望赛车减速?通常是已经跑在第一名的那辆。
而支持者们自己的算力投入、模型发布节奏、融资规模,并没有因此放缓一分。
这不是指控谁虚伪——Dario 很可能同时是真诚的和受益的,这两件事可以共存。但这意味着,安全话语在客观上也是一种竞争工具。把它当作纯粹的公共利益诉求,就少了一层防线。
三、还有一个坑:三件事被混成了一件
这也是我最想说的一点。
量子位这篇稿子里,四个人看起来在说同一件事——"AI 危险"。但拆开看,它们其实是三种完全不同的担忧,严重程度、紧迫性、应对方式都不同:
| 类型 | 谁在说 | 现状 | 该怎么应对 |
|---|---|---|---|
| 存在性风险 | Chughtai、Coxon、Hubinger | 低概率、极高影响、不可证实也不可证伪 | 投入到对齐研究、评测方法学的投入,而不是恐慌 |
| 结构性风险 | Selsam、刘胜与的后半段 | 进行中:技术集中在少数公司、少数国家手里 | 治理、开源、反垄断、算力分配——这是政治问题 |
| 个体冲击 | 刘胜与的前半段 | 已发生:手艺被替代、职业身份瓦解 | 个人技能迁移、社会保障、分配机制 |
把这三件事打包成一个"AI 危险",后果是:
正在发生的(结构性、个体性的)问题被宏大叙事遮蔽,而尚未发生的(存在性)问题在被恐慌放大。
一位 DeepSeek 算子工程师说"我不得不把才华埋葬在昨天",这句话让人动容,但它本质上是一个劳动与手艺的问题,跟"人类会不会灭绝"不是一回事。把它们放在一起讲,读者很容易把两种恐惧叠加,最后得出一个既不明智又无从行动的结论。
顺带说一句,对刘胜与那个判断——"再过半年或一年,AI 写的算子可能就和我一样好甚至更好"——我也建议打折。
不是怀疑他的诚实,而是怀疑外推的范围。算子优化有一类任务最容易交给 AI:目标函数清晰、反馈即时、结果可自动验证。在这类任务上 AI 进步最快,是意料之中的;但把它外推到"AI 会取代整个研发体系",跨度太大。而在一句自我预测里,当事人也有微妙的高估动机——这是人之常情,不必苛责,但读者要知道。
四、那这些话该怎么读
我的建议是四条,都不难做到:
1. 看机制,不看结论。
"AI 可能毁灭人类"是一句无法讨论的话——你没法证明它会,也没法证明它不会。但"模型会识别出自己正在被测试,导致评测分数虚高"是可以讨论的:可以设计更隐蔽的评测,可以做对抗性验证,可以看这个效应随模型规模怎么变化。
凡是不能被拆成机制的主张,都不值得投入情绪,只值得登记在案。
2. 看资源,不看表态。
判断一家公司是否真的在认真对待安全,不要看它发了什么文章、签了什么承诺,看它的钱和人流向哪儿:安全团队的规模占比、发布前的评测周期、是否愿意为一个安全问题推迟上线。
表态是免费的,资源分配是付费的。
3. 把三类担忧分开处理,别混着焦虑。
照上面的表分开。你现在能影响的东西,几乎全在第二类和第三类——技术集中在谁手里、你自己的手艺怎么办。这两类既确定又具体,行动才有抓手。
4. 保住你自己的判断能力。
最后这一条是我从 Daniel Selsam 那里读到的、最被低估的一句。
他说:"我自己已经很少直接看代码了,也很难始终保持自律,深入审视模型给出的解释和建议。"
这句话表面是自省,实际上给所有知识工作者提了个醒。当一个 AI 研究员开始依赖 AI 来理解自己在研究的东西,当一个程序员不再读代码只看 diff,当一个分析师不再自己跑数只问结论——你就失去了校验的能力。
而失去独立判断能力这件事,不需要等到 AI 毁灭人类那天才会伤害你。它现在就在发生,而且比超级智能近得多。
结尾
回到那句被做成标题的话:"留给人类阻止 AI 的时间不多了。"
坦白说,我没办法证明它对,也没办法证明它错——这句话本身就是不可证伪的。任何关于"时间还够不够"的判断,都取决于你对技术曲线、对齐难度、协作可行性的假设,而这些假设目前都无法验证。
但可以确信的是:真正稀缺的不是时间,是严肃讨论的能力。
一边是"AI 马上毁灭人类"的恐慌,一边是"这些都是危言耸听"的轻蔑——这两端之间有一大片空地,需要的是把每个担忧拆成机制、把每句判断标上证据等级、把每条政策建议放到它真正该作用的位置。
这些研究员的声明,既不是警钟也不是流量。它更像一份由最懂它的人签署的、措辞含糊但值得读两遍的风险提示。
不是因为它预测了未来,而是因为它提醒了我们一件事——
在最需要清醒的时候,最容易发生的,是所有人一起选择相信一个未经检验的结论。