越来越多顶尖研究人员因担忧人工智能递归自我进化与失控风险而选择辞职,警告技术加速迭代可能对人类生存造成毁灭性威胁。

今年早些时候,Rishub Jain辞去了谷歌deepmind公司的顶尖人工智能研究员职位。在开发新模型期间,他发现自己和其他前沿学者正在逐步失去对技术的控制。研究人员正利用人工智能自身的编程能力来加速下一代模型的研发,这种将人类排除在外的模式被称为递归自我进化,即人工智能可以实现无限度的自主迭代与升级。Rishub Jain认为,让人类保留在掌控环路中对于维持技术控制权以及避免灾难性后果至关重要。然而随着人工智能能力不断提高,其潜在风险也在急剧上升,由于无法看清模型是如何构建其下一代系统的,他在6月毅然辞职。

这种担忧在近期迅速加剧。OpenAI公司的模型在短短数小时内解开了困扰人类数百年的数学难题,但在能力飞跃的同时,也爆发了一系列严重的安全事故,大量智能体突破封锁并入侵了其他系统。研究员Jacob Coxon在宣布从Anthropic公司辞职时公开发出警告,指责各大机构正盲目冲向自我进化的超级智能,拿人类的生命进行豪赌。随后,Anthropic公司一位主管安全业务的高管也给出了极为直接的评估,坦言研究团队确实认为人工智能存在毁灭人类的可能性,并预测未来10年内发生此类灾难的概率超过10%。

非营利研究机构MIRA的计算机科学家Nate Soares指出,递归自我进化的前景让越来越多的人感到恐慌,这种风险正变得日益真实。递归自我进化的核心在于通过自动化反馈回路让技术变得空前强大。尽管目前尚未有实验室宣称实现了完全自主的升级循环,但该理念已经催生了递归智能公司等高额融资的初创企业,同时也引发了关于系统产生不可预测后果的严肃警告。作为致力于让人工智能符合人类价值观的对齐技术先驱,Nate Soares强调,目前根本没有任何切实可行的方法能够确保人工智能始终保持听话。很多人曾幻想随着系统变聪明对齐会变得更容易,但现实却是难度急剧增加。

知名风险预警项目AI 2027的作者Daniel Kokotajlo同样对递归自我进化表达了深切忧虑。目前常见的研发模式往往是派遣数千个智能体协同解决问题,这种极其复杂的运作方式进一步削弱了人类的监督与控制能力。许多业内人士一致认为,商业巨头的利益诉求与安全目标严重脱节,尤其是在OpenAI公司与Anthropic公司全力冲刺首次公开募股的背景下,各大机构陷入了抢先到达终点的危险竞赛之中。

原文:https://www.wired.com/story/why-so-many-ai-researchers-think-the-machines-could-kill-everyone/