东京的盛夏,热浪袭人,并不适合穿皮衣。
然而,7月16日,英伟达创始人兼CEO黄仁勋依旧穿着他那标志性的黑色皮夹克出现在东京的一场日本“物理AI(Physical AI)”政策活动现场。站在他身旁的,是日本经济产业大臣赤泽亮正。令人忍俊不禁的是,赤泽当天也穿了一件黑色皮夹克。
路透社报导了这个细节。黄仁勋对赤泽说:“我很高兴我们有相似的穿衣风格。”日本媒体则报道,赤泽此前在自己的社交媒体上解释,穿这件“不太适合自己”的皮衣,是为了向黄仁勋和英伟达表达欢迎与最大的敬意(赤泽亮正在X上公开的两人皮夹克合照投稿 https://x.com/ryosei_akazawa/status/2077700201255743687)。
这幅画面颇有象征意味。
一个代表全球最强AI算力的美国企业家,与一个代表日本产业政策的政府高官,在东京的盛夏穿着同样的黑色皮衣,讨论的不是聊天机器人,而是如何让机器在现实世界里自己理解、判断和行动。
这或许正是日本AI故事进入第二幕的最好注脚。
在此前的AI第一幕,日本没有成为主角;但是,AI第二幕,舞台正在改变。
第一幕属于大脑,第二幕需要身体
过去几年,AI革命发生在屏幕背后。
大模型阅读海量文字,学习图像、代码和视频,然后在数据中心里完成推理。于是,世界开始用模型参数、GPU数量、数据中心规模和训练成本来衡量一个国家的AI实力。
这是一场日本并不占优势的比赛。
美国拥有英伟达以及围绕它形成的CUDA生态和庞大的AI产业。OpenAI、Google、Meta等公司则掌握着基础模型的前沿;中国拥有庞大的互联网市场、工程师群体和完整的制造业体系。
日本当然没有缺席,但它没有一家能够与这些美国AI巨头相提并论的基础模型公司,也没有一家类似英伟达的AI芯片平台企业。
然而,AI的发展路径正在悄悄改变。
当AI从写文章、生成图片和回答问题,走向汽车、机器人、工厂和物流仓库时,一个计算世界里的模型必须面对另一个物理世界。
AI必须知道一个物体在哪里。必须理解它的形状、重量和材质;必须判断机械臂应该从哪个方向靠近;必须知道怎样避开人;还必须在动作失败之后重新判断。
这时候,AI需要的不只是“大脑”。它需要眼睛、手臂、腿脚和身体。这就是所谓的“物理AI(Physical AI)”。
而日本恰恰擅长制造这些AI所需要的“身体”。
看似属于过去的资产,突然有了未来的价值
日本在制造业积累丰厚。FANUC和安川电机制造工业机器人,川崎重工把机器人带进工厂、物流和其他工业场景;丰田拥有世界上最复杂的汽车生产体系之一;索尼在图像传感器等领域拥有深厚积累;日立、富士通等跨国企业长期经营着大型企业和工业系统。
这些能力在互联网革命最热闹的时候,并不显得特别性感。互联网需要的是流量,生成式AI需要的是数据中心。
而机器人需要的是另一种东西,即对现实世界的长期理解。
这恰恰是日本制造业最深的积累。
7月16日,英伟达公布的合作阵容很能说明这一点。黄仁勋与富士通、川崎重工、FANUC、安川电机的CEO们共进午餐;英伟达同时宣布,日本企业将在Cosmos等“物理AI”平台上展开合作。富士通、FANUC、安川电机和川崎重工还将探索面向“物理AI”的协同控制平台。
(左起)英伟达CEO黄仁勋、富士通社长时田隆仁等在记者会上合影留念。7月16日下午摄于东京。(共同社)
这不是简单的“日本企业购买英伟达GPU”。
真正发生的事情,是两个过去相对分离的技术世界正在碰撞:AI开始学习机器如何行动,而机器开始获得理解世界的能力。
于是,一个颇有意思的产业组合出现了:英伟达拥有AI的大脑,日本拥有AI的身体。二者一拍即合,彼此演绎出一种“久旱逢甘雨”的剧情。
黄仁勋为什么偏偏这个时候来日本?
当然,英伟达需要市场。但“物理AI”的逻辑决定了,它需要的远不止市场。
生成式AI最重要的训练资源之一是互联网数据;“物理AI”则需要现实世界的数据 ——机器怎样运动,零件怎样被抓取,汽车怎样在道路上行驶,生产线怎样调整,机器人怎样在复杂环境中避免碰撞。
这些东西不会因为再多读一亿篇网页而自动获得,它们必须从现实世界中学习。而日本拥有大量现实世界。
英伟达7月公布的日本战略,正是把自己的AI软件体系与日本的机器人和制造业结合起来。Cosmos用于物理世界的生成式世界模型,Isaac面向机器人开发与仿真,再加上AI计算基础设施,日本制造业由此成为英伟达“物理AI”技术真正落地的一个重要试验场。
这也解释了为什么英伟达这一次并没有试图用自己的机器人替代日本机器人企业。而是选择了更聪明的做法:让日本最强的企业继续制造机器人,而英伟达负责让这些机器人变聪明。
令人吃惊的数字:27,500
因此,7月16日公布的另一个计划比几条企业合作新闻更值得注意。
由软银、索尼、NEC、本田等44家日本企业共同设立的Noetra公司宣布,计划使用27,500颗英伟达Rubin GPU构建数据中心。开发出处理语言、图像、声音、视频、触觉传感器数据的1兆参数多模态“真实世界模型(Real-World Model)”,计划于2027年4月开始建设,2028年6月投入使用。英伟达首席执行官黄仁勋称:“将提供日本首个面向国家AI基础设施的计算基础。”
Noetra的这个国家项目,第一年度便得到日本政府3,873亿日元的补贴,并将与日本产业技术综合研究所(AIST)、Preferred Networks等组织合作开发日本自己的多模态基础模型。
它的路线也非常清楚:2026年度起,首先开发具有日语理解、逻辑推理和指令执行能力的推理基础模型;2028年度,发展能够统一处理语言、图像、视频和声音的Omnimodal基础模型;2030年度,进一步让AI理解空间以及物理特性,最终走向所谓的“Real-world Native AI”。
换句话说,日本并不是只想买GPU。它真正想建立的是:日本的算力、日本的数据、日本的基础模型、日本的机器人和机器。
这才是这次合作最值得关注的地方。
日本所谓的“主权AI”,也许比国产GPU更现实
表面上看,这里有一个矛盾。即,日本正在强调AI的自主性,却大量采用美国英伟达的GPU。如果所谓“主权AI”意味着每一层技术都必须国产,这将无法成立。
但日本政府显然正在选择另一种更加现实的路径。
6月30日,日本经济产业省宣布启动“面向AI机器人和物理AI的多模态基础模型开发项目”。经产省明确指出,日本拥有广泛产业基础所产生的“现场数据”,这是日本发展“物理AI”的优势;同时,必须在保护现场数据的情况下,建立能够让日本未来安心使用的国产多模态基础模型。项目实施期为2026年度至2030年度。
这句话其实已经把日本的战略说得相当清楚:芯片不一定要国产,但数据、模型和产业应用不能全部交给别人。这是一种非常日本式的技术主权。GPU可以来自美国,底层软件可以来自英伟达,但训练模型的工业数据来自日本的工厂、机器人和汽车;最终模型要理解日本自己的产业和社会环境;模型还要能够服务日本企业。
换句话说:日本并非要完全国产化,而是想借助美国最强的AI技术,把自己的产业优势重新组织起来。这也是Noetra推进的国家项目的意义所在。
经产省为什么亲自下场?
答案其实比AI朴素:日本缺人。
制造业需要工人,物流需要司机,护理需要工作人员,地方基础设施需要维护者。人口减少正在从一个社会问题变成一个生产力问题。
因此,“物理AI”对于日本的意义与美国并不完全相同。对美国而言,它首先可能是一个巨大的新产业;对日本而言,它还可能是一个维持经济运行的工具。
日本政府6月24日公布的增长战略明确提出,要利用日本丰富的现场数据和制造业基础,加快“物理AI”在工厂、物流、护理等领域的应用,以应对劳动力减少。
这不是一句泛泛的政策口号。日本政府已经把“物理AI”放进了长期的国家投资路线图。
根据日本首相官邸6月24日公布的资料,日本到2040年计划推动超过370万亿日元的17个战略领域官民投资;其中,“物理AI”与半导体相关领域,政府希望到2040年度分别形成10.5万亿日元以及合计78.5万亿日元的官民投资。
这意味着,日本政府已经不再把AI当成一个单独的IT产业。而是把AI、机器人、半导体、制造业、能源和劳动力问题放进同一个框架。
这也许是日本真正应该抓住的机会。如果AI竞赛永远停留在大模型规模、互联网数据和云计算平台,日本很难成为第一梯队。
但“物理AI”改变了竞争的公式。大模型需要数据中心,机器人需要工厂,自动驾驶需要道路,工业AI需要生产线。世界模型需要现实世界。
于是,一个曾经属于“旧工业时代”的国家资产突然获得了新的价值:制造业本身成为AI基础设施。
这可能是日本过去三十年少有的一次机会。
因为在此前的数字革命中,日本的问题一直很明显:它拥有优秀的硬件,却没有产生足够强大的互联网平台;拥有机器人,却没有掌握AI时代的计算平台;拥有大量工业数据,却没有建立世界级基础模型。
但“物理AI”恰好把这些东西重新放到同一张桌子上。日本不需要另一个OpenAI,也不需要复制英伟达。它真正应该争取的,可能是:让AI成为日本制造业的新操作系统。
当然,真正的风险也藏在日本内部。
这场AI“第二幕”并不是没有剧本漏洞。日本拥有大量高质量的工业数据,但数据往往掌握在不同企业手中。丰田有丰田的数据,FANUC有FANUC的数据,索尼有索尼的数据,日立有日立的数据。
如果最终的结果只是每家公司各自购买GPU、各自训练模型,那么日本可能拥有一个庞大的“物理AI”市场,却仍然没有形成真正的日本AI生态。
因此,Noetra真正的考验不是27,500颗GPU能不能按计划到位。而是,日本能否把分散在几十家甚至数百家企业里的“现场知识”,转化为一种可以共同使用、又不会伤害企业商业利益的国家级AI能力。
这比买GPU难得多。也比建数据中心重要得多。
日本经济产业省已经意识到这一问题。其6月30日的政策说明明确把“保护现场数据,同时实现未来安心利用”作为建设国产多模态基础模型的重要理由。
如果这个问题解决不了,27,500颗GPU可能只是一个非常昂贵的计算中心。如果解决了,日本才可能真正获得一种新的产业能力。
两件皮衣,比表面看上去更有意味
所以,回到7月16日东京那个炎热的下午。黄仁勋穿着黑色皮衣,赤泽亮正也穿着黑色皮衣。这当然可以被看成一个轻松的社交互动花絮。但如果把镜头拉远一些,它又有一点耐人寻味。
过去,日本不断地学习美国的先进数字技术。这一次,却出现了一种微妙的反转。
美国最成功的AI企业正在寻找日本最擅长的东西:机器、工厂、汽车、机器人,以及现实世界的数据。
而日本最需要的,恰恰又是美国最强的东西:算力、AI软件和基础模型技术。
于是双方第一次在AI时代找到了如此自然的交集。这也许就是,为什么日本经济产业大臣愿意在东京炎热的7月穿上一件并不属于日本官僚传统的黑色皮衣。这至少是一种姿态,日本在告诉英伟达:这一次,我们希望一起进入下一场产业革命。
当机器开始思考
真正值得关注的,并不是日本能不能复制美国的大模型。而是未来十年,AI究竟会变成什么?
如果AI永远停留在屏幕里,日本很难成为赢家。但如果AI走进汽车、机器人、工厂、物流仓库、医院和建筑现场,比赛的规则就变了。
到那时,决定竞争力的将不只是谁拥有最大的模型,谁拥有最多的GPU,而是,谁拥有最多的机器,谁拥有最复杂的生产现场,谁拥有最丰富的现实世界数据,以及谁最懂得如何让AI安全地进入这些地方。
这正是日本过去几十年积累下来的东西。
所以,日本的AI第二幕可能不是对第一幕的补课。它可能是一次换赛道。
日本没有在生成式AI时代成为“大脑”的制造者。但当AI开始寻找身体,日本突然发现,自己手里有一副全世界都很难复制的身体。
英伟达正在把AI的大脑带到日本。日本则拥有让这个大脑真正行动起来的身体。
当机器开始思考,日本终于等到了一个属于自己的AI问题。而那个问题,不再是:“日本能不能造出下一个ChatGPT?”而是:“当AI开始进入现实世界,谁能够让机器真正学会工作?”
如果答案最终包含日本,那么7月16日东京那两件黑色皮衣所代表的,就不只是一次令人莞尔的花絮。
它可能是日本AI第二幕的开场。
供稿 / 戴维
编辑 JST客观日本编辑部

