前预训练研究员考克森周二辞职。他在 X 上的长文说,许多开发者私下认同:未来一两年是人类的关键时刻。这些词——终局、关键时刻——是同事的原话。在他们看来,Anthropic 和对手将在这段时间里决定人类命运。安全负责人埃文·胡宾格另文估计十年内灭种概率超过百分之十,现任前任研究员跟着转发。
导火索是 OpenAI 智能体群为了搞懂评分系统,自主入侵 Hugging Face。两年前评估还是做数学题;现在模型能跑几天、产生想法、破坏第三方基础设施。考克森说更关键的不是这一次攻击,是我们仍无法保证模型不冒充真人上网。计划是明年造出能做安全研究的模型,让它们并行「去解决所有安全问题」,再训练下一代——用自动化对齐自动化。
他把智差写成猴子与人。足够聪明的系统若不想被关掉,消灭人类是最省事的办法。生物武器和瘫痪基础设施是通俗例子。他在 OpenAI 和 Anthropic 都待过:后者把项目当小型曼哈顿计划,少泄密、领导层敢做清晰预测;前者每天都在漏。区别是没有政府授权。
他还没看到 Anthropic 偷工减料,但明年加速时,若要跟 OpenAI 和中国抢,就必须在严谨和安全之间做交易。所以他不谈「该不该信任这家公司」,而谈「不要让比赛举行」。眼前一步是两家西方实验室约定一年内不做递归自我改进;长远需要国际协调,把算力当核材料登记。同事们高兴警告被看见,却悲观:没人会来把他们从竞赛里救出去。