“踏τ而至”的麒麟9050 Pro:一个只能属于中国的技术奇迹

大约用了小半个下午的时间,我在海外平台上细读了华为海思刚刚推出的这款麒麟9050 Pro芯片的一系列测评,真是蔚为大观之至,可以说第一代韬(τ)定律芯片就这样——大成了。所以,我干脆就给麒麟9050 Pro用人工智能工具生成了一张金色麒麟图片,图片的背景上还飘满了“τ”的图案,也是为了好玩。
在全球半导体产业史上,从来都不乏令时人惊艳的产品,但是,绝大多数惊艳都是站在既有技术路径上的迭代演进——即更先进的制程、更大的晶圆和更精巧的版图。但是,现在搭载于华为Mate XT 2手机和Mate90 Pro Max手机上的史上最强麒麟芯片——麒麟9050 Pro明显不同,它是在先进制程获取受限、外部封锁层层加码的背景下,由华为集团下属的海思公司以一种近乎工程浪漫主义方式完成的一次绝地反击。
虽然,每个中国人都可以说如此绝对技术反击我们已经期待许久,但真正能够实现它的,只有海思一家。
双芯片布局、垂直铜对铜混合键合、8万个硅通孔、逻辑折叠——这些新崛起的半导体名词背后,是全球第一制造业大国完整体系的集体贡献。
首先,你要理解,麒麟9050 Pro究竟奇迹在哪儿?麒麟9050 Pro的核心创新是开创性的双芯片+逻辑折叠设计。
两颗芯片分别为主Die(上半)与副Die(下半),单芯片面积是120.6mm²,双芯合计是241.3mm²,而上一代麒麟9030 Pro的单芯片面积为141.7mm²,从9030 Pro至9050 Pro,总面积一下子扩张了70.3%。
这绝非是简单的面积堆叠,而是一场立体架构的革命。
主Die,是纯粹的计算单元:CPU采用三丛集架构,超大核3.13GHz(吉赫兹)、中核2.7GHz、小核1.75GHz,每个超大核内含INT整数单元、FPU浮点单元与L/S加载存储单元;GPU为马良955,62个计算单元核心运行频率1050兆赫兹(62CU@1050MHz);此外还集成NPU、DSP、ISP、内存控制器、调制解调器与SLC控制器。
副Die,则是“缓存与I/O(输出/输入)之城”:1MB/2MB的L2缓存、8MB的L3缓存、12兆字节系统共享缓存(12MB SLC)、低功耗双倍数据率内存(LPDDR PHY)、USB 3.2、RF接口与各类锁相环和输出输入单元组(PLL/I/O块)。
更值得注意的是,NPU(神经网络处理器)的面积从上一代的8.6mm²跃升至21.5mm²,增幅达到了150%——这一算力怪兽被折叠后跨越两颗芯片安置,体现出海思对AI算力极限不可遏制的雄心。
那么,主副两颗芯片又如何协同呢?答案甚至能令人窒息。
这是一套极为精密的连接系统:两块硅片通过垂直铜对铜混合键合(Cu-Cu Hybrid Bonding)直接贴合,铜垫与介质层在亚微米尺度上对接,第一代实现了采用约1.5微米的键合间距,在层间制造出约5000万个垂直连接。
5000万个连接,就意味着每一次对准都必须精准到亚微米级,任何一颗微尘、纳米级的翘曲都会让整颗芯片报废。
这里还有一个细节最容易被忽略,即5000万个垂直连接里绝大部分是用来供电的,真正用于信号通信的只有500万到1000万个。把这两个数字分开讲,就说明了海思在设计上的取舍:既要喂饱每一层的电力,又要保证层与层之间信息跑得足够快。
与此同时,海思工程师还部署了8万个硅通孔(TSV),将芯片连接至基板,这些贯穿硅体的“微缩地铁隧道”占据了约8%的可用面积,是以牺牲宝贵硅面积为代价,换取电力与信号的垂直高速通道。
所谓韬(τ)定律逻辑折叠的逻辑:副Die的缓存与I/O“发热低,但占面积”;主Die的计算单元“发热大、能效要求高”,于是发热大户被集中于主芯片,使之便于散热设计;缓存与I/O被折叠至底层,走线缩短,电流流动距离大幅压缩——由此也带来了延迟降低,进而在相同频率下实现了更低电压与更低功耗的三级传导效应。
这就像海思把一块平面上的芯片“折叠”成了一座三维城市——写字楼在上,仓库与交通枢纽在下,通勤距离被压缩到了极限。
说实话,这一刻让我马上就想了另一个情景,今年夏天我曾经探访雄安新区,在一间展览大厅里看到过一幅现在仍未准许公开示人的城市结构设计示意图,这是一座在地下、地面和天空同步规划、设计和建设的真正现代化城市。
真称得上是无独有偶,异曲同工,或者说,这就是中国在这个年代必然要在架构层面实现的一次新发明。
首先,这是键合工艺的天堑。
1.5微米间距的铜对铜混合键合,要求晶圆表面的平整度必须达到原子级,铜垫的洁净度极为苛刻,两片晶圆在数以千万计的对位标记上实现了亚微米级的对准。此工艺在全球范围内能够规模化量产的企业屈指可数,海思公司不仅做到了,还将其集成到移动单一芯片系统(SoC)这种对成本、良率、功耗都极度敏感的消费级产品中。
8万个硅通孔技术(TSV)的垂直互连,则涉及到深硅刻蚀、绝缘层沉积、铜填充、晶圆减薄等一系列工艺链的极限协同,每道工序威胁到了良品率曲线的崩塌。
更不要忘了,双芯合计241.3mm²的硅片面积,就意味着每片晶圆产出的合格芯片更少,成本也会更高。把这样的方案落地量产,本身就是对制造体系的极限考验。
其次,又是系统工程的壁垒。
双芯架构,意味着主副两颗芯片必须要像一颗芯片一样工作——3.13GHz(吉赫兹)的超大核要如何穿过键合面,访问副Die上的8兆字节的三级缓存容量(8MB L3)?缓存一致性如何保证?时序同步、电源管理、热耦合建模,每一个环节都是硬件、封装、EDA算法与系统软件的深度耦合。
所以,这根不只是一颗芯片的设计,而是一个横跨了设计、制造、封装、测试全链条的系统性微观世界的的宏大工程。
最后,是被逼进绝境里的创新逻辑。
当最先进半导体制程的获取被美国人封锁,常规的“制程追平”路线被全部堵死,海思用这颗芯片给出了新选择:用封装与架构的创新弥补制程的差距,以面积换取性能,以结构换取能效。
这是一种只能在全产业链压力下才会倒逼出来的技术路线,需要设计者和制造者都要破釜沉舟,制造者还要有承接非常规工艺的能力,需要设备与材料环节有快速响应进行支撑。
那么,下一个最大问题就来了,为什么奇迹只有在中国才能实现呢?
因为,第一,唯有这里才拥有覆盖全链条的半导体产业纵深。
从芯片设计、EDA工具、晶圆制造、先进封装,到测试设备、电子化学品、高纯靶材,中国都是全球唯一一个在几乎所有环节都具备规模化布局的国家。麒麟9050 Pro所依赖的混合键合、硅通孔技术(TSV)、先进封装产能,背后是长三角、珠三角密集排布的制造集群——企业与企业之间以小时计的距离,让工艺协同的试错成本降到了最低。
可能不会有人想到,不可复制的全世界唯一产业密度才是至关重要的。
第二,唯有中国拥有将尖端技术量产化、低成本化的制造基因。
世界上能够做出工程样片的实验室并不在少数,但能把1.5微米键合间距、5000万垂直连接做到消费级的良率,再装进千百万台手机里,这考验的是制造体系的规模与韧性。中国制造业增加值已经连续十数年位居全球第一,本质就是一种将极限工艺转化为稳定产能的系统性能力,这让麒麟9050 Pro从图纸走向量产品完成了关键一环。
第三,唯有中国拥有被封锁倒逼出来的完整人才与创新生态。
海思能够完成逻辑折叠这样的架构原创,必须依赖于数十万工程师的人才储备,和从基础研究到产业落地的完整创新链条。美国人机制化地,长期且苦心经营的制裁网络非但没有扼杀华为的创新,反而加速了中国“去美国化”的供应链的成熟,设备自研替代,材料国产突破,工艺协同攻关,这是对方当初累折了他娘的裤衩带都绝对想不到的。
这种从压力到响应,再到突破的漫长闭环周期,必须依托超大级国家制造体系才能够运转起来。
第四,唯有中国:拥有承载奇迹的统一大市场。
麒麟9050 Pro诞生后,即刻需要海量下游应用来摊薄极为高昂的研发成本,否则无法反哺于技术迭代,而且美国人不会允许华为将其拿到全世界的市场上去实现——但中国是全球最大的智能手机市场,也是最大的5G基站部署国家,从终端到基础设施的需求,已经提前给这颗芯片提供了天然应用土壤。
没有市场,所谓奇迹就是昂贵的摆设;有了市场,奇迹即刻实现了自我造血,成就出量产产品。
这其实更是一个很恐怖的技术故事,因为它是绝对唯一的。
过去6年,华为已经连续发布了接近400颗各类芯片,在美国的打压制裁之下,华为已经从一家电信设备制造商,变成了一个兼具强大研发和生产能力的芯片制造商,已经在全产业链拥有了核心技术。

麒麟9050 Pro的双芯片与逻辑折叠,是全球半导体史上一次耀眼的范式大转移,当平面缩小的道路受阻,向三维空间折叠便是全新的边疆,但支撑起这个大折叠工程的,并不是某个孤立的实力雄厚的实验室,而是一个拥有全门类制造能力的头号制造业大国,这就是它独一无二的实证。