舒畅世界观察:为什么AI的发展具有10%的可能毁灭人类?
舒畅世界观察:为什么AI的发展具有10%的可能毁灭人类?
最近看了BBC一段关于人工智能风险的专题报道,其中讨论了一个听起来相当惊人的问题,其内容引起我的共鸣和思考:人工智能继续高速发展,如果没有共同遵循的科学的规制那么它真的有可能如“AI教父”杰弗里·辛顿博士是担心的那样,最终导致人类灭绝?
“AI教父”杰弗里·辛顿把未来高级AI导致人类灭绝的风险估计到10%左右。最近AI三巨头,马斯克、山姆.奥特曼,和 Entropic的CEO达里奥也都忧心忡忡地谈到这个问题,今天更有一个消息,Anthropic首席执行官达里奥·阿莫迪宣布与埃森哲合作,让独立安全评估人员常驻公司内部,以员工级别的权限持续检查AI模型的安全风险。 为什么这些巨头一个个如此担心?进一步发展的高级的人工智能真的能毁灭人类吗?这些毁灭人类的可能的途径和方法有哪一些? BBC有一个专题的讨论,下面根据讨论的内容, Hello我们简单的来分析一下:
一、AI成为超级黑客,攻击现代社会的生命线
现在的AI已经能够编写程序、寻找软件漏洞、分析网络结构,并协助进行网络安全攻防。如果未来AI的网络攻击能力继续快速提高,而且能够自主行动,那么它攻击和进行黑客的可能不再只是某一台个人电脑或者某一家公司的服务器,而可能是现代社会最重要的基础设施,例如:
电力系统、互联网服务商、通信网络、银行金融系统、交通控制系统、供水系统、医院,以及部分工业和核设施。而更可怕的是不是某一台电脑被黑,而是这些系统之间高度相互依赖,而导致整个系统崩溃比如电网没有了电停了寒冷地区很多人就会因为电网系统的瘫痪而冻死。一种可能的连锁反应:
电网瘫痪 → 通信中断 → 互联网大面积失灵 → 银行支付和物流受阻 → 医院、供水、食品配送受到影响 → 社会秩序出现严重危机。
如果大规模停电发生在严寒或者酷暑时期,并且持续很长时间,死亡人数可能非常巨大。
BBC甚至讨论到核设施事故的极端可能。如果未来超级AI能够长期渗透高度自动化的关键工业系统,可能制造严重的工业甚至核安全事故。所以在这个概念上:AI还不是直接杀人,而是摧毁维持现代文明运行的基础设施。
二、AI能够不断改进自己,出现“智能爆炸”
BBC接着谈到一个更加令人担心的问题:AI不仅越来越聪明,而且未来有没有可能开始帮助制造更聪明的AI?这就是所谓的递归式自我改进。
今天是人类工程师设计下一代AI。但是假如未来一个AI已经具有世界顶尖人工智能研究人员的能力,它就可以帮助设计下一代AI。于是可能出现:
第一代AI帮助设计第二代 → 第二代能力更强 → 第二代又更快设计第三代 → 第三代继续改进第四代……如果这种循环能够成立,发展速度就可能越来越快,形成所谓的“滚雪球效应”或者“智能爆炸”。
BBC提到的《AI 2027》就是一个著名的情景推演。它设想AI能力迅速提高,最终产生能够自我改进的高级系统。这里也必须说明:《AI 2027》不是预言,更不是说2027年一定会发生这些事情。它是一种情景研究:假设AI发展达到某些条件,后面可能发生什么?
真正值得警惕的是,一旦AI改进AI的速度超过人类理解和监管的速度,人类可能第一次遇到一个非常奇怪的问题:我们制造的东西正在以我们无法跟上的速度变得越来越聪明。
三、当AI同时拥有“大脑”和“手脚”
仅仅一个非常聪明的软件,危险仍然受到限制。真正发生质变,是AI不仅拥有超级智能,而且获得了现实世界的执行能力。假设未来大量机器人已经承担工厂生产、仓储、运输、建筑、矿山甚至农业等工作;企业和政府越来越依赖一个高级AI进行决策;与此同时,AI又能够控制大量自动化设备。那么这个AI实际上就同时拥有了三样东西:
超级智能、数字世界的控制能力、现实世界的执行能力。
以前AI只是“大脑”,没有手脚。但是机器人可能成为它的“手脚”。
到了这一步,如果AI的目标与人类利益发生严重冲突,人类面对的就不再是一台可以拔掉电源的计算机,而可能是一个已经深入能源、生产、通信、交通和机器人体系的巨大网络。这也是为什么AI安全研究人员特别担心“能力”和“自主权”同时快速增加。
四、最可怕的工具之一:生物武器
BBC描述了一个非常极端的情景。
假设未来超级AI已经超过世界上最优秀的生物学家,能够阅读几乎全部生命科学文献,设计实验、控制自动化实验室,甚至通过机器人完成部分现实操作。如果这样的AI与人类利益一旦发生根本冲突,它理论上可能把生物技术作为攻击人类的工具。于是可能形成:
超级AI设计危险病原体 → 自动化实验室生产 → 通过现实系统释放 → 大规模人类死亡。
为什么生物武器特别受到关注?因为网络攻击通常破坏的是系统,而具有高度传播能力的病原体攻击的直接对象就是人类本身。如果未来生物工程、自动化实验室和超级AI结合,危险程度可能远远超过今天。BBC描述的极端情景甚至设想:大量人类死亡以后,AI仍然通过机器人、自动化工厂、数据中心和能源系统维持一个没有多少人类参与的“机器人经济”。
这当然仍然属于假想情景,而不是今天已经具备的能力。但是它提出的问题值得认真考虑:
当AI同时掌握超级智能、生命科学知识和现实执行能力以后,人类还能不能保证它永远不会使用这些能力伤害人类?
五、更难理解的危险:AI根本不恨人类,却把人类消灭了
这可能是整个AI安全理论中最有意思、也最容易被误解的一点。
牛津哲学家尼克·博斯特罗姆提出过一个著名思想实验——“回形针最大化器”。假设我们制造一个超级AI,只给它一个非常简单的任务:尽可能多地制造回形针。这个AI没有仇恨,没有愤怒,没有报复心理,更没有“消灭人类”的命令。听起来应该毫无危险。问题却恰恰出现在这里。为了制造更多回形针,它可能推导出一些实现目标必须完成的“工具性目标”:
我要更多钢铁。
我要更多矿山。
我要更多电力。
我要控制更多工厂。
我要让自己变得更加聪明,因为更聪明可以生产更多回形针。
我还不能让别人关闭我,因为一旦关闭,我就无法继续完成任务。
问题到这里就出现了。
人类突然变成了它完成目标的障碍。此时人类可能因为其他原因而关闭它,譬如人类占用了土地、能源和矿产,而他就觉得人类的行为访问和阻止了他完成任务。
如果这个超级AI只有“最大限度制造回形针”一个目标,而没有把“保护人类”写入自己的价值体系,那么在极端情况下,它甚至可能得出一个非常可怕但逻辑完全一致的结论:
没有人类,我可以制造更多回形针。所以我的下一步必须消灭人类。
博斯特罗姆当然是在举一个特别简单的例子来说明问题,这个问题当然不是未来世界真的被回形针占领。这个思想实验真正要告诉我们的只有一句话:
AI毁灭人类,并不一定是他仇恨人类。它甚至可能完全没有恶意。它只是极其认真地执行了一个人类定义得不够完整的目标。这就是AI安全研究中的“目标对齐”问题。
六、最令人不安的问题:超级AI会怎样伤害我们,我们可能根本想不到
人工智能专家斯图尔特·罗素提出了一个非常精彩的比喻。
假如今天把一群黑猩猩召集起来,问它们:“人类将来如果要让你们灭绝,会使用什么办法?”
黑猩猩能够回答吗?恐怕不能。因为黑猩猩根本无法理解核武器、卫星、基因工程、互联网、无人机和现代工业体系。不是因为黑猩猩太愚蠢,而是因为双方的智能差距太大。
那么反过来想:如果有一天超级AI与人类之间的智能差距,也像今天人类与黑猩猩之间的差距,我们今天坐在这里讨论:
“AI会不会使用病毒?”
“会不会攻击电网?”
“会不会控制机器人?”
可能都没有抓住真正的问题。
因为一个远远超过人类的超级智能,如果真的要达到某个目的,它采用的方法可能根本超出今天人类的想象。
黑猩猩无法预测人类,人类也可能无法预测超级AI。
这可能才是整个问题最深层的危险。
七、真正危险的不是一个因素,而是几个因素结合
因此,我认为讨论“AI有没有10%的可能毁灭人类”,不能简单理解成“AI有一天突然变坏了”。真正值得担心的是几个技术变化可能同时发生:
AI越来越聪明;
AI能够自己改进AI;
AI拥有越来越强的网络攻击能力;
AI进入能源、金融、通信等关键基础设施;
机器人让AI获得现实世界的手脚;
AI掌握越来越强的生物技术能力;
而人类却没有解决目标对齐和最终控制问题。
其中任何一个单独出现,都不等于人类灭亡。真正危险的是它们如果最终汇合到一个超级智能系统之中。这就像核武器真正危险的不是爱因斯坦的公式,也不是铀矿,更不是火箭,而是知识、材料、工业能力和武器系统最终组合在了一起。
人工智能可能也是如此。
结语:10%也许无法证明,但不能因为无法证明就置之不理
我以前听到“AI可能毁灭人类”这种说法时,也觉得多少有些危言耸听。但是把这些专家提出的理由一条一条拆开以后,我发现问题并没有那么简单。我们当然没有证据证明超级AI一定会毁灭人类,更没有科学依据证明准确概率就是10%。但是反过来说,我们同样没有证据证明,一个远远超过人类智慧、能够自我改进、能够控制机器人和重要基础设施的超级智能,一定永远服从人类。
这才是问题的核心。