小米XLA旧将联手DeepMind科学家,具身智能赛道再添新玩家

2026-09-23 20:51 1002 次浏览

从手机到机器人,两个技术背景的交叉点

具身智能领域最近多了一个新名字。前小米XLA负责人与一位DeepMind前科学家共同创业,方向锁定在具身智能。这个组合有意思的地方在于,一个来自手机厂商的AI平台团队,一个来自全球顶尖的通用AI研究机构。手机厂商做AI,讲究的是在有限算力下把体验做稳;DeepMind做研究,习惯的是从第一性原理推演智能的本质。两种思路撞在一起,恰好是具身智能当前最缺的东西。

具身智能不是新概念,但过去两年它的热度明显上了一个台阶。大模型让机器人的感知和决策有了新的工具,谷歌、Meta、微软都在这个方向投了研究资源。TikTok的母公司字节跳动也在机器人领域有所布局。国内阿里云、腾讯云则从算力基础设施切入,为具身智能团队提供训练和推理支持。创业公司要解决的是更具体的问题:怎么让一个物理实体在真实环境里稳定完成任务。

为什么这个时间点值得关注?因为技术栈正在收敛。感知用视觉Transformer,决策用大语言模型或视觉语言模型,控制层则结合传统运动规划与强化学习。这套组合拳在实验室里已经跑通了不少demo,但从demo到产品之间隔着一条很宽的河。

具身智能的竞争焦点不在模型大小

很多人以为具身智能的瓶颈是模型参数不够大。实际跑过机器人的人知道,麻烦在别处。一个视觉语言模型可以在云端轻松跑到千亿参数,但机器人本体上的计算单元通常只有几十瓦功耗。把大模型塞进机器人,推理延迟会直接毁掉控制闭环。

所以真正要解决的问题是:

  • 怎么把大模型的常识推理能力蒸馏到能在边缘端实时运行的规模
  • 怎么让机器人在遇到没见过的物体时,不靠重新训练就能做出合理反应
  • 怎么把仿真环境里学到的策略迁移到真实世界,且不需要大量真机数据

前小米XLA负责人在这方面的经验可能很关键。小米的AI团队过去几年在端侧模型部署上积累了不少工程能力,知道怎么在手机这种资源受限的设备上跑模型。这套方法论迁移到机器人上,逻辑是通的。而DeepMind前科学家带来的,大概率是强化学习和世界模型方面的研究功底。谷歌DeepMind在机器人领域有RT-1、RT-2这样的项目,探索过用视觉语言模型直接输出机器人动作。

两个背景合在一起,指向一个很具体的路线:不做通用人形机器人,先做特定场景下的具身智能解决方案。这是创业公司比较务实的切入方式。

商业化落地,先找场景还是先磨技术

具身智能的创业公司面临一个经典选择:先找落地场景养活团队,还是先打磨通用技术等风来。从目前行业里的做法看,多数团队选择先切一个垂直场景。仓储物流、家庭服务、商业清洁是几个常见方向。

仓储物流的具身智能已经有相对成熟的玩家,亚马逊的机器人部门做了很多年。家庭服务机器人则更难,因为家庭环境的非结构化程度极高。一个杯子放在桌上还是放在架子上,对机器人来说是完全不同的任务。商业清洁场景相对标准化,但天花板也低。

这个新团队会选哪条路,目前没有公开信息。但可以推测,有小米背景的团队可能对消费级场景更有感觉。小米本身有智能家居生态,扫地机器人、陪伴机器人都有产品线。如果创业方向和小米的生态有某种互补关系,想象空间会更大。

另一个变量是算力成本。训练一个具身智能模型,需要大量仿真环境和真机数据。阿里云和腾讯云都在推自己的GPU实例,谷歌云和AWS也在争取这类客户。对创业公司来说,算力支出是实打实的压力。如果团队有办法降低对大规模算力的依赖,比如用更高效的仿真训练方法,会是一个竞争优势。

这个赛道需要更多耐心

具身智能不是那种一年就能看到爆发式增长的领域。它涉及硬件、软件、数据、场景多个环节的配合。谷歌做机器人做了十几年,真正落地的产品也有限。Meta的机器人研究更多停留在论文层面。微软把重心放在Azure的机器人服务上,提供的是平台能力而非整机。

国内的情况类似。阿里云和腾讯云提供算力和AI平台,但整机方案要靠创业公司和硬件厂商。小米自己在机器人领域有探索,但步子不算快。这个新团队的成立,至少说明人才在往这个方向流动。

对技术人员来说,具身智能的吸引力在于它把AI从纯数字世界拉回到物理世界。模型不再只是生成文本或图片,而是要控制一个真实的物体去完成动作。这中间的挑战,比刷榜要难得多。前小米XLA负责人和DeepMind前科学家的组合,能不能在这个方向上做出不一样的东西,值得持续关注。至少从背景看,他们比纯学术团队更懂工程落地,比纯产品团队更懂前沿技术。

接下来要看的是他们多久能拿出第一个可演示的原型,以及这个原型选择在什么场景里证明自己。具身智能的竞争,最终会落在谁先找到可复制的商业化路径上。