王兴兴们的难题,正在被京东解答
AI,悄然来到了虚拟世界与现实世界的临界点。 2026年9月3日,一辆没有方向盘、没有脚踏板、没有后视镜,更加没有远程操控的特斯拉Cybercab驶上奥斯汀街头,它的车载AI能实时完成从环境感知、意图预测到车辆控制的全链路决策。 AI,初步具备了在开放物理世界中的行动能力。 同一天,GPT-6 Astra也实现了像人一样直接“看”屏幕来操作电脑,根据自然语言的需求,拆解工作任务,完成并最终自主交付,实现了数字世界的复杂自主操作。 相对而言,机器人行业似乎仍停留在表面的热闹——一边是资本和热度持续攀升,新品密集发布,大模型公司纷纷入局具身智能;另一边是真实场景的落地依然艰难,大多数机器人还停留在展厅和实验室里。 宇树科技创始人王兴兴在2026世界机器人大会上做过一个判断:当一台机器人走进陌生家庭,仅凭一句语言指令就能完成80%的日常任务,具身智能的“ChatGPT 时刻”就来了。这个时刻,快则两三年,慢则五到十年。 王兴兴能这么讲,那一定意味着在某个空间,正发生着普通人不知道的事情。因为,物理世界的AI和数字世界的AI有一个巨大的不同,就是它没有唾手可得的素材:人类最简单的判断、动作,拿稳一只碗,平稳搬动一个箱子,怎么拧螺丝,不同台面搬桌子要用多大力……这些数据,只能在真实的仓库、工厂、医院和家庭里,一次一次磨出来。 这意味着,机器人的GPT时刻,最终比拼的是谁能建立起真实数据-仿真训练-模型进化-场景应用-反馈优化的完整闭环。 事实上,当观众在电视上看着宇树机器人的表演之时,物理AI正在许多无人瞩目的地方小步快跑着。 8月世界机器人大会上,京东发布机器人战略布局,宣布截至2028年,将投入百亿资源。9月9日的JDD大会,京东又把主题定为“JoyAI・跃迁物理世界”。 京东为什么要如此笃定地all in物理AI?是不是它已经触摸到了通向那一个时刻的窗。 几厘米,1亿小时 物理AI迟迟达不到实用的最大阻碍是什么?简单说就是,人觉得最容易的,却是机器人最难实现的。 今天的机器人,看起来足够炫——能跑、能跳,轻松突破人类身体的极限,能在舞台上跟着音乐跳舞。但只要把它们从聚光灯下挪开,放进一个真实的家庭,它甚至不如一个刚刚学着做家务的孩子。 斯坦福大学《AI Index Report 2026》数据显示:机器人在仿真环境中的操控成功率高达89.4%, 但一旦到真实家庭场景后便骤降到12.4%,即使是顶级模型也完成不了超过1/3的任务。 这不是什么高精尖的工作,就是最普通的洗碗、擦桌子,打扫卫生等等。 王兴兴就说过:“拿东西时,最后几厘米的误差无法修正,成功率就会暴跌。” 最后几厘米,听起来微不足道,却是实验室和现实世界之间的最难翻越的距离。 数字世界是封闭的、可重复的,你让AI写一首诗,写十次,虽然措辞不同,但都算完成了任务。但物理世界是开放的、容错率极低,桌边放着一个玻璃杯,机器人不仅要识别这是杯子,还要判断杯子有多满、重心在哪、该用多大的力度握住拿起放下,任何一个变量出了差错,杯子可能就碎了。 这就是机器人的泛化能力不足。 它的背后,是三个更深层的短板:缺数据、缺世界模型、缺闭环。 业内估算,具身智能要实现觉醒,大约需要 1亿小时的真实世界数据。 而今天即使整个行业加起来,离这个数字还差着数量级。 所以最后几厘米,靠的不是某个天才模型的灵光一现,而是海量真实数据、持续仿真训练和规模化场景验证的长期积累。 京东要做物理AI的基础设施 这种长期积累,恰恰是创业公司最难做的事。 能沉下心啃下这块硬骨头的,注定不是追风口的人,而是修桥铺路的人。历史早就告诉过我们,每一次技术革命,最后赢的也都少不了这批人。 1882年,爱迪生在纽约珍珠街建成了世界上第一座商业发电厂。那时候,如果你想开一家工厂,最时髦的做法是自己买一台蒸汽机,自己发电。但很快人们就发现,这既不经济也不可靠,机器坏了没人修,电压不稳产品就废了。于是,电网出现了。不需要每家工厂自己发电,只需要接上电网,按下开关,电就来了。 一百多年后,同样的故事在互联网时代重演。2000年前后,如果你想做一个网站,需要自己买服务器、自己租机房。几年后,云计算出现了。不需要每家公司自己建数据中心,只需要接上云,点开控制台,算力就来了。 今天,同样的故事在物理AI时代上演。 如果你想做一台机器人,最普遍的做法是自己做本体、自己训模型、自己采数据、自己建产线、自己做销售、自己搞维修。但很快人们就会发现,模型训好了没有真实场景验证,本体造好了零部件成本降不下来,产品卖出去了坏了没人修。 所以物理AI时代,也需要一个建电网的人。 这个人,就是现在的京东想要去做的。 JDD大会上,京东再次重申,要建设“全球最大的物理世界运营商”。 这句话的分量,可能比任何一款机器人产品都要重。它意味着,这家公司想做的不是某
发表评论