推动中国AI实现惊人飞跃 幕后智囊是他

华尔街日报网 2026-08-21 09:42+-

十多年前,计算机极客唐杰和杨植麟还只是一对师生,梦想着制造出一台能像人类一样思考的机器。如今,两人已双双跻身中国人工智能(AI)领域的领军人物之列,让美国AI先驱们警惕地感受到追赶压力。

身为清华大学(Tsinghua University)教授的唐杰参与创立了智谱(Z.AI)。在模型能力和全球使用量方面,智谱紧跟在Anthropic和OpenAI之后。杨植麟曾被唐杰提名为清华大学最高学术奖项的候选人,如今他领导着另一家公司月之暗面(Moonshot AI)。这两家公司的估值均达到数百亿美元。

中国AI模型的迅速崛起在硅谷和华盛顿引发了一系列疑问。中国AI实验室是如何在如此短的时间内取得如此大进展的?他们的AI模型从何而来?像唐杰和杨植麟创办的这类公司是否在窃取美国模型的技术?是否应该为了保护美国国家安全而封禁他们的产品?

唐杰和杨植麟的职业生涯表明,中国在AI领域的发力绝非突如其来。现年49岁的唐杰深耕机器学习领域已有大约25年。十多年前,他便已跻身中国AI专家之列,这些人在使用计算机执行语言理解和人脸识别等类人任务方面身处最前沿。

唐杰、杨植麟以及他们的研究同仁(其中许多人起步于清华大学及其他几所机构)在中国各大科技中心构建起一个虚拟的硅谷。得益于学术界发表研究成果的文化,以及中国开发者偏爱那些基本可以免费下载和修改的开源技术,知识在他们之间得以轻松流动。

为了在生成式AI时代迎头赶上,中国公司依赖于独创与模仿相结合的这一熟悉模式,这也是中国在电子、汽车和绿色能源领域取得成功所依托的模式。中国AI开发者将在美国受过训练的计算机科学家招募回国,并紧跟美国的最新进展。

更有争议的是,一些公司似乎“蒸馏”了美国模型,以此加快自身模型的训练速度。在这一过程中,新系统通过向现有系统提出数十万个问题并分析其回答来进行学习。

Anthropic指责智谱和月之暗面等多家中国公司从事大规模蒸馏,称此举违反了其政策。这两家公司均未对此事置评。中国模型开发公司的从业人员承认,模型蒸馏在全球范围内都是普遍现象,而一些中国公司在使用这种方法时可能比美国同行更为激进。

推动中国AI实现惊人飞跃 幕后智囊是他

推动中国AI实现惊人飞跃 幕后智囊是他

清华大学教授唐杰(上图)参与创立了智谱。他的昔日门生杨植麟(下图)领导着月之暗面。TINGSHU WANG/REUTERS

埃隆·马斯克(Elon Musk)在今年6月曾预测,中国要到2027年第一季度才能赶上Anthropic顶级的Fable模型。唐杰在X平台上予以回击,称用不了那么久。

中美两国的行业领袖均表示,中国最顶尖AI模型的能力仅落后美国最顶尖模型几个月。

本月,智谱发布了最新的GLM-5.3模型,并表示该模型在网络安全能力方面已与Anthropic的Mythos 5旗鼓相当。

中国政府长期以来一直将AI和计算机科学视为推动经济增长和维护国家安全的重要引擎。中方的追赶策略既包含国家层面的扶持,也引入了私营部门的竞争。国家向清华大学等高校的研究项目倾注巨资,并为初创企业提供资金支持,与此同时,中央和地方政府也成为了这些初创企业服务的早期客户。

今年春天,在Anthropic推出能够检测网络安全漏洞的Mythos模型之后,一些中国官员将其比作AI时代的核武器。意识到华盛顿可能会阻止外国人获取美国顶级模型,中国政府正通过一只国家基金支持国内AI开发者,并放宽规定以帮助初创企业在公开市场上市。

央企投资协会(Investment Association of Central State-Owned Enterprises)的数据显示,今年上半年,中国近一半的股权投资流入了AI领域,其中大部分来自拥有政府背景的基金。

人才储备

21世纪初,中国互联网行业开始腾飞,随着数以百万计的用户开始在网上购物、搜索和交流,海量数据应运而生。企业开始投资机器学习,以提高电子商务的效率并分析用户的在线行为。

政府在探索监控人口和检测威胁的方法时,寻求能够识别人脸和声音的计算机程序。中国的高校培养出了专门研究计算机视觉的学生,这是计算机科学的一个分支,旨在教机器像人类一样观察世界。

那个时代诞生了包括商汤科技(SenseTime)在内的计算机视觉初创企业“AI四小龙”,它们培养了许多如今活跃在AI领域的工程师。

资金和人才涌入中国顶尖的科技学府清华大学。2005年,前普林斯顿大学(Princeton University)教授、以计算机科学先驱艾伦·图灵(Alan Turing)命名的图灵奖得主姚期智(Andrew Yao)在清华大学设立了精英化的“姚班”,以培养顶尖人才。

清华大学教授、智谱联合创始人唐杰从攻读博士学位起就一直扎根在这所学府。他研究的是数据挖掘,这门学科旨在从大型数据集中提取隐藏的模式,后来成为AI的基础。

科技作家梅赫兰·居尔(Mehran Gul)在其著作《创新的新地理》(The New Geography of Innovation)中写道,唐杰曾告诉他,在获得清华大学博士学位后,他认为自己能在中国干一番大事业,而且通过这种方式也许能更好地帮助中国,所以他决定留下来。

唐杰喜欢通过跑马拉松和参加铁人三项来考验自己的耐力。他以同样的风格管理着自己的实验室。

推动中国AI实现惊人飞跃 幕后智囊是他

唐杰在中国顶尖的科技学府清华大学管理着一个实验室。图片来源:CHEN YEHUA/XINHUA/ZUMA PRESS

Kevin Zhong曾在清华大学攻读硕士学位期间与唐杰有过短暂合作,目前在伦敦工作。他表示,唐教授的团队以高强度著称。Zhong回忆说,这位教授总是敦促他的团队通过实验来检验机器学习技术和想法,研究人员有时会在实验室待到凌晨3点来完成实验。

Zhong还说,“他们很有能力,一直能在顶级期刊上发文,也很懂怎么把研究成果变现。”

到了2010年代,唐杰的实验室在全国心怀抱负的科技人才中已享有声誉,他昔日的门生开始纷纷入职硅谷的顶尖公司。日后创立月之暗面的杨植麟在17岁时便开始接受高强度的编程训练,并参加了全国青少年信息学奥林匹克竞赛。在清华期间,他与唐杰一起开发了机器学习算法。

2018年,中国政府为国家机构和高校的研究人员创办公司并将其技术推向市场扫清了障碍。第二年,唐杰将如今名为智谱的公司从他的清华实验室剥离出来独立运营,部分启动资金来源于他运营的一个数据分析平台,该平台的客户包括谷歌(Google)和IBM。

早在中美AI之争成为头条新闻之前,唐杰就已将自己视为OpenAI掌门人阿尔特曼(Sam Altman)的竞争对手。当OpenAI在2020年发布开创性的GPT-3模型时,智谱希望能开发出同样出色的产品。

几年前,唐杰在他的个人网站上写道,他正将全部精力投入到通用人工智能领域,使命是教机器像人类一样思考。

在师从唐杰之后,杨植麟在匹兹堡的卡内基梅隆大学(Carnegie Mellon University)获得了博士学位。他之后回到中国协助这位昔日恩师开展研究,同时决定创办自己的公司。

作为一名狂热的摇滚鼓手,杨植麟将他初创公司的中文名定为“月之暗面”,灵感来自平克·弗洛伊德(Pink Floyd)的同名专辑。至于英文名,他选择了Moonshot。

在上海,另外两名前清华大学研究人员也创办了自己的公司开发AI模型。其中一人正是出自著名的“姚班”。

最后一个入局者是DeepSeek。其创始人梁文锋在20年前从计算机视觉领域起步,后来创立了一家利用AI分析金融市场的对冲基金。2023年,他与唐杰进行了交谈,唐杰后来告诉手下员工,梁文锋与众不同的思维方式给他留下了深刻印象。同年,梁文锋将DeepSeek从他的对冲基金中剥离出来,宣布了与唐杰相同的目标:实现类人智能。

这些初创公司的创始人来自中国各地,唐杰来自西部四川省一个小地方,而杨植麟和梁文锋则来自充满创业精神的南方。他们聚集在北京和杭州等少数几个城市,梁文锋曾在杭州求学并在此创业。

推动中国AI实现惊人飞跃 幕后智囊是他

今年7月在上海举办的世界人工智能大会上,月之暗面的展台展示了其Kimi K3模型。图片来源:HECTOR RETAMAL/AFP/GETTY IMAGES

用更少的资源做更多的事

这些初创公司的创始人深知中国相较于美国的短板:不仅缺乏资金,而且由于美方的出口管制,中方无法获取最先进的AI芯片。

到2025年年中,唐杰从包括中国多家科技巨头和香港风投家沈南鹏(Neil Shen)在内的投资者那里筹集了约12.5亿美元。有政府背景的基金也响应中国政府培育本土AI公司的号召,提供了资金支持。然而,与OpenAI的阿尔特曼和Anthropic动辄筹集数十亿美元相比,中国企业的这些融资额依然显得相形见绌。

投资银行Jefferies后来计算出,这些年间中国科技公司的投资额不到美国同行的五分之一。他们必须用更少的资源做更多的事。

梁文锋在DeepSeek的团队想出了一些最重要的变通方法,包括多头潜在注意力机制(MLA)。这项技术通过为之前的对话创建压缩版本,大幅削减了AI模型在聊天机器人对话等场景下的内存占用。使用更少的内存可以节省算力和资金。

DeepSeek是中国最早采用“混合专家”(MoE)模型设计的公司之一。在这种架构中,模型会将问题导向专门的专家模型,就好比主厨将意大利面的订单交给厨房里的负责意大利菜的厨师。DeepSeek向中国业界展示了一条在提升模型性能的同时减轻对芯片需求的切实可行之路。

正是这些技术带来了2025年1月的“DeepSeek冲击”。当时,梁文锋的公司发布了一款性能强大但成本低廉的新型开源模型,美国股市因中国竞争对手的异军突起而短暂下挫。OpenAI的阿尔特曼在X平台上发帖称,DeepSeek模型令人印象深刻,并坦言“迎来一个全新的竞争对手确实令人振奋!”

梁文锋的中国同行们同样受到了强烈震撼。知情人士称,在月之暗面,杨植麟接到了忧心忡忡的投资者打来的电话,其中一位投资者想知道为什么杨植麟未能预见到DeepSeek的崛起。

杨植麟将DeepSeek发明或验证的技术整合到了月之暗面随后的模型中。其K2和K3模型均采用了MoE设计和MLA的变体。反过来,DeepSeek也使用了月之暗面优化的一项技术来提高训练效率和稳定性。

在今年5月份的一次DeepSeek会议上,一些投资者追问创始人梁文锋,技术开源是否还能赚到大钱。他的回答体现了中国开源运动的精神。他表示,自己并不担心竞争,因为市场足够大。

除了蒸馏美国AI模型外,部分中国公司还通过聘用曾效力于美国AI领军企业的中国籍人才来汲取美国的技术经验。中国互联网巨头腾讯(Tencent)聘请了两名曾在OpenAI工作过的清华毕业生。TikTok母公司字节跳动(ByteDance)将一名谷歌研究员招揽回国内,并在一年内构建出一款强大的视频生成工具,该工具目前被内容创作者和好莱坞制片厂广泛使用。

今年1月,唐杰旗下智谱(当时名为北京智谱华章科技)的高管们在香港证券交易所敲锣,使智谱成为首家公开上市的中国AI模型初创公司。熟悉其运营情况的人士表示,到7月份,智谱的年度经常性收入(基于订阅服务的一项关键指标)已升至10亿美元,约为DeepSeek的两倍。

推动中国AI实现惊人飞跃 幕后智囊是他

今年1月,唐杰旗下智谱(当时名为北京智谱华章科技)的高管们在香港证券交易所敲锣(左)。图片来源:KANE WU/REUTERS

这仍然远远落后于美国巨头。据听取了公司简报的投资者透露,Anthropic的年收入在7月份达到650亿美元。

在5月份的DeepSeek会议上,梁文锋表示,中美公司之间最关键的差距在于计算机芯片,而不是人才。来自阿里巴巴(Alibaba)和智谱等顶级实验室的研究人员表示,他们能分配到的高端芯片数量通常只有OpenAI和谷歌同行的五分之一。

Gavekal Technologies驻迈阿密的分析师莱拉·卡瓦贾(Laila Khawaja)表示:“虽然中国公司将成本效益追求到了极致,但拥有更先进芯片且愿意烧钱的美国公司在探索性研究上投入了更多资金,这可能会带来阶跃式的创新。”

几家中国AI开发者正在训练拥有5万亿至10万亿参数的模型,参数是衡量模型能力的一个直观指标。业内人士估计,Anthropic的最新模型拥有超过5万亿个参数。

熟悉相关计划的人士表示,唐杰正在训练智谱的下一个旗舰模型,他的团队希望该模型能够执行持续数周的复杂研究任务。唐杰在7月份给员工的一份内部信中写道,谁能率先将智能上界向上推升一寸,谁就能重新定义千行百业的能力边界。

  • 最新评论
  • TJZ

    写得好像AI是中国人发明的,而这些中国人如果没有美国发明AI他们什么都不是!中国人擅长偷盗剽窃和山寨,他们学会了对发明者并不心存感激,只是给自己贴金捞钱,帮一个封建集权政权做大!世界上没有一个国家会这样!

    屏蔽
1