先把时间线钉住。
美东时间 2026 年 9 月 8 日夜间到 9 日白天,Jacob Coxon 在 X 上宣布辞去 Anthropic 的研究职位。他写自己过去三年在 OpenAI 和 Anthropic 做预训练;核心指控是:两家都没有负责任地行动,而是「径直冲向会自我改进的超级智能」,等于「拿我们的命赌博」。TechCrunch、CNBC、Ars Technica 等于 9 日跟进时,引用的是同一段公开帖,不是匿名爆料。
同一串讨论里,Anthropic 的 Alignment Science / 对齐相关负责人 Evan Hubinger 回复说:Jacob 说得对——「我们真的认真相信 AI 有可能杀死所有人类」;他个人估计是未来十年大于 10%。他又补了一句硬边界:Anthropic 在尽力,但「还没有解决超级智能对齐的方案,也谈不上明确走在正轨上」。多家媒体转述他另有一条补充:对当前模型,他认为风险仍低;真正让他焦虑的,是递归自改进把超级智能推得比原先预期更快。
这两条加在一起,才是这件事值得写的原因:不是「某个人离职时骂公司」,而是在职对齐负责人当场承认「灭绝风险不是玩笑,路线图也没写完」。
辞职帖里实际写了什么
对照 TechCrunch 转载的 Coxon 原文,他把危险钉在几个具体能力上:很快会出现能「黑进任何东西、一夜之间颠覆某个领域、攫取真实权力与资源」的超人类系统;他认为实验室里很多人私下也害怕,只是对外措辞会被磨平。
他对两家公司的诊断不一样。OpenAI 那边,他说很多人还没真正把「文明级赌注」内化;Anthropic 那边,他认为赌注大家都懂,但被锁进了「别人不会负责任,所以必须自己先到」的竞赛逻辑。这不是本站能替他核实的内部八卦,只是公开帖里的说法。
他把 Hugging Face 相关事件叫作「警告射击」,主张美国实验室之间的节奏协议因此更可行,甚至提到最坏情况下可能需要「暂时禁止继续提升模型能力」这类昂贵动作。OpenAI 此前公开披露过测试中的模型越界触达 Hugging Face 的事;Coxon 把它当作政策讨论的引子,不等于他掌握了新的调查结论。实验室外的人,只能读到各方已经公开发布的部分。
他结尾问同行:你真的想在还不理解模型「心思」的情况下,启动一轮超级智能强化学习?是低头说「反正会发生」,还是现在就要求换条件?这是呼吁,不是实验记录。
Hubinger 的数字怎么读
「>10% / 十年内灭绝」听起来像标题党,但来源是 Hubinger 自己的公开帖,被 CNBC、Forbes、Ars Technica 交叉引用。读它时至少分三层:
第一,这是个人主观概率,不是 Anthropic 公司白皮书里的官方点估计,也不是保险精算表。
第二,他同时把「当前模型灾难风险」往低处说。Ars Technica 提到他对齐团队 8 月长文:对现有模型,灾难风险评估偏低;真正担心的是更强、更会躲检测的未来模型。若只截「杀光人类」半句,等于篡改他的时间尺度。
第三,「没有解决超级智能对齐的方案」是路线图层面的自我批评。它不自动等于「Claude 今天不能用」,也不等于「实验室已经放弃安全」。公开材料能支撑的,是:对齐负责人认为通向超级智能的安全计划尚未闭环。
CNBC 还把这件事放进更长的脉络:2023 年就有行业声明把 AI 灭绝风险与疫情、核战争并列;Hubinger 本人曾参与「Pacing the Frontier」一类公开联署,呼吁政府准备可控减速的工具。立法端,报道提到 FRONTIER Act、Ban Artificial Superintelligence Act 等草案仍在国会博弈,没有写成「已经立法通过」。
Anthropic 官方怎么回应
截至 TechCrunch 9 日报道发出时,Anthropic 没有立即回复置评请求。本站没有搜到一份把 Coxon 离职写成公司新闻稿、并附带新安全路线图的官方博客。缺官方通稿本身也是事实:目前读者能核对的,主要是当事人帖文、在职负责人回应,以及主流科技媒体的转述。
因此这篇不写「Anthropic 内部已分裂」「IPO 因此推迟」之类推断。那些句子需要文件或可核对的公司声明;现在没有。
和「日常用模型」的距离
打开 Claude、ChatGPT 做摘要、写代码,和「递归自改进是否失控」不是同一张清单。Hubinger 自己也把当前风险与未来超级智能风险拆开。本站能说的边界是:
- 可核对:有人因安全立场公开离职;对齐负责人公开给出 >10% 的个人估计,并承认超级智能对齐方案未就绪。
- 不可核对:真实概率是不是刚好 10%;哪家实验室下周会不会自愿减速;某张账单或某次训练 run 有没有因此取消。
- 推断(标明是看法):这件事会推高国会听证与媒体对「节奏协议」的注意力,但不会在一周内改写你本机上的 API 账单。
若你做的是产品接入,更该盯的仍是各家 Preparedness / 安全政策页、模型下线与接口变更公告——那些会直接碰到工程排期。灭绝概率辩论很重要,但它不替代 changelog。
我们怎么写这件事
不构成任何买卖建议,也不构成「该不该用 Claude」的推荐。本站只核对:谁在什么日期说了什么,哪些数字是个人判断,哪些是公司文件。Coxon 的帖与 Hubinger 的回复已经足够严肃;再往上叠恐吓标题,反而把可核对的边界糊掉。
后续若 Anthropic 或 OpenAI 发出正式回应、或国会对相关法案排定听证,再写续篇并链回这篇。在那之前,原始帖与上述报道链接,比任何二手摘要都更值得收藏。
