“不想具身再落后美国两年”,清北团队正面对打Figure

“不想具身再落后美国两年”,清北团队正面对打Figure

摘要:

“大模型时代,国内花了大概两年才勉强追上GPT-4。我不希望具身智能这个方向上,咱们也跟美国有这样的差距。”

凤凰网科技 出品

作者|董雨晴

过去一年,人形机器人行业形成了一种心照不宣的默契:先活下来。

轮式机器人进厂、机械臂上岗,用看得见的订单给投资人讲商业化的故事。双足人形当然是终局,没人否认这一点,但终局实在太远,走路都费劲的东西谈什么干活?不如先做一个能交付、能回款的形态。

这最终让中美具身智能的路线开始产生错位,本体很热,大脑很冷,以至于Figure 03的全身操作演示过去7个月,国内仍无人完整复刻。

但刚刚成立8个月的德塔智能不这么认为。这个正式成立是在2026年1月的公司,重点在突破的就是双足人形基模。创始团队有着清华、UCLA和北京通用人工智能研究院的背景。过去8个月,德塔完成了六轮融资,累计金额超6亿元,智元、乐聚等国内几个头部本体厂商同时出现在股东名单里。

自动播放

9月28日,一个让德塔团队期盼已久的旗舰模型终于发布,Delta-0,同期发布的还有两段一镜到底的视频,视频中搭载了Delta-0模型的宇树G1先是完成独立放唱片,后又进行了收拾床铺、把衣服扔进洗衣机、开冰箱扔垃圾等一连串32步动作、9项家务,全程自主。

X上有人评价,“令人印象深刻的协调性和全身控制能力”,这也正是德塔智能的特殊所在,其技术底座是一套三层架构,从顶层往下分别是大脑、小脑和力位混合控制。最后这一层的技术,曾让德塔智能拿下了2025年机器人学习顶会CoRL的最佳论文。

8月下旬和9月下旬,凤凰网科技在中关村两度见到德塔智能CEO马晓健。四个小时的对话里,他几乎没有使用任何创业公司惯常的宏大叙事,谈得最多的是逻辑:为什么双足人形是唯一解,为什么数据之争的答案被多数人搞错了,以及一家不做本体的公司凭什么赢。

人形机器人,专治各种不服

“国内大部分具身智能企业专注的是机械臂、轮式机器人。但行业里热度最高、大家印象最深刻的本体是双足人形。大家都说现在最重要的事情是做大脑,但大部分大脑公司没有做通用人形大脑,而是在做轮式大脑。”马晓健说,“这很奇怪。”

国外不是这样。Figure、Tesla、OpenAI、Google、Meta都在做双足人形基模。马晓健的判断是,国外团队想做的是终局,也知道该怎么做;国内一部分团队未必真想做,也未必清楚人形机器人该怎么做,于是才有了更容易的中间形态。

马晓健用了一个比喻,他说人形机器人堪称专治各种不服。做轮式机器人,你可以只懂算法、不碰硬件;做人形,大脑、小脑、硬件必须全栈贯通,“你觉得自己大脑能力很强,可以完全不care硬件,那你在人形上一定会吃瘪”。

德塔智能的背景与选择恰恰相反。今年1月成立,专注于做双足人形形态上的具身大脑,或者叫基模。不做本体,不做轮式。这个定位在当下并不讨巧。有时投资人也会问德塔,为什么只做双足?马晓健的回答一度有点中二:“这个问题不该问我,为什么不去问马斯克?”

马晓健的远见与底气都来自团队。马晓健本科在清华计算机系孙富春、刘华平实验室待了三年,发了NeurIPS、Spotlight、ICRA等四篇机器人顶会,也曾在Google Robotics和NVIDIA Research从事研究,回国后就加入了北京通用人工智能研究院。联合创始人刘航欣本科毕业于弗吉尼亚理工大学,博士毕业于UCLA,现任北京大学助理教授,曾主导研发全手视触觉灵巧手F-TAC,也参与了首届DARPA Robotics Challenge,那是十年前,人形机器人还在赛场上不停摔跤的年代。

联合创始人兼首席科学家黄思远过去做3D视觉,本科毕业于清华大学自动化系,后来在UCLA实验室参与“让计算机视觉从识别猫狗走向理解物理、理解空间”的项目,也曾在DeepMind、Meta从事前沿研究。马晓健说,他们不是从纯机器人或纯AI转过来的,而是一直做AI和机器人结合,是“AI+robotics native”。

这可能是当前中国乃至全球都最稀缺的一类人,既懂AI,又了解硬件,是软硬兼修的复合型人才,也是真正的原生具身智能人才。

图|拉洗衣机门

2015年,三人在UCLA的实验室汇合。那个2015年启动的项目,目标写在纸面上是“让计算机视觉从识别猫和狗,走向理解物理、理解空间”,今天这个概念有了一个更时髦的名字:world model(世界模型)。当时,UCLA牵头,MIT、Stanford参与,黄思远主导了单目单张图还原3D场景等标志性成果,这项技术后来成为李飞飞World Labs产品的核心源头。

“我们的两个标签,机器人和3D,将近十年前就开始搞了。那时候还没有具身这个词,叫Robot Learning。”马晓健说。

十年是一个容易被忽略的时间尺度。它意味着当2023年GPT带火具身智能、大批团队从大模型和自动驾驶跨界涌入时,德塔的三位创始人已经在这个方向上完成了完整的学术训练和工程积累。这便是原生团队的价值,而不是看见风口入局,再调整方向。

2023年博士毕业时,马晓健面前并非没有美国的选项,但彼时北美具身智能的产业环境是另一番景象:“美国没有太多制造业基础,你propose一个robot project,大家并不喜欢。除了Google和很小一部分的Tesla,没有太多可选项。”他在NVIDIA实习时的同事,包括后来的具身赛道关键人物,当时都还没有明确要做这件事。而国内,通研院给出了明确的信号和充足的资源,更重要的是,刘航欣和黄思远已经在国内,团队是齐的。

马晓健告诉凤凰网科技,尽管德塔成立的时间晚,但早在2024年初,他们就和乐聚、宇树成立联合实验室。那时宇树刚发布H1,乐聚也刚跨过三代。在通研院时期,马晓健负责数据和基模,建起跨本体数据采集工厂;刘航欣则负责跟乐聚探索工业场景,一汽红旗上下料、南方电网巡检、整机厂料盘分拣等场景都已尝试过,还组队用乐聚机器人跑马拉松;黄思远则一头扎进了双足人形底层技术。2025年中,他们判断双足人形已经完成0到1,到了1到10的临界点。2026年1月,公司正式独立。

“所有事情都很难。那为什么不做倍数更高、通用性更强的事?”马晓健说。这是他反复讲的逻辑:做终局,做通用,做有门槛的事。

巧合的是,最近1-2个月里,原本做轮式大脑的明星企业都开始入局双足人形,这恰恰印证了轮式的卡点显著,而人形才真正大有可为。

“我不希望在具身这个方向上,和美国也有大语言模型时的差距”

“双足人形是完全从0到1的东西。机械臂一直存在,所以给人一种已经ready的错觉;但人形很多底层突破就是这几年的事。2025年初我们把技术和行业整体梳理了一遍,判断0到1已经完成,马上进入1到10,到了该用更多资源去规模化的临界点。”

大洋彼岸,Figure的节奏几乎同步:2025年8月切换到F03、把整套模型栈推倒重来改为端到端,三个月后放出了那段让整个行业印象深刻的demo。此后的故事已经成为行业公共记忆,2026年3月家庭场景视频刷屏,5月Helix-02实现双机协作和8小时自主轮班,7月第1000台F03下线,产能达到每小时一台。8月,Figure在美国旧金山湾区租了30套房子,让机器人进家做家务。

而那段demo放出半年多,中国没有一家公司完整复刻。

“这是挺值得警醒的。”马晓健说,“大模型时代,国内花了大概两年才勉强追上GPT-4。我不希望具身智能这个方向上,咱们也跟美国有这样的差距。”

紧迫感之外,他还给出了一个比“人形无缝适配人类工作空间”更底层的论证,解释为什么双足不是情怀而是效率最优解。

具身智能要规模化,行业正在形成的共识是scale人类数据。那么问题来了:哪种本体能最高效地从人类数据中学习?答案只可能是双足人形,因为它的作业方式与人完全同构,人的数据只需做重定向就能直接用于训练;而轮式、机械臂形态总有一大块作业模式与人不同,人开烤箱是走过去弯腰拉开,轮式机器人要先移动、再升降、调整机械臂角度,同一任务是两套动作逻辑,模型必须额外学会为这种本体专门设计的作业模式,再补采大量专用数据。

“假设达到GPT-3时刻需要5000万小时人类数据,人形学5000万小时可能就够了,别的本体还不够。人力数采效率本来就是最高的,其他路径效率都偏低。”沿着这条逻辑链往下推,结论出人意料:基模只能靠人类数据高效训练,人形又是人类数据学习效率最高的本体,那么人形反而会最快拿到强大基模、最快实现经济上可行的交付。所谓“轮式先落地”,可能真的就是一个错觉。

如果说路线选择回答的是“做什么”,数据回答的就是“凭什么做得成”。而恰恰在数据这个问题上,过去一年整个行业走了一段代价不菲的弯路。

据Interact Analytics统计,截至2026年4月底,全国已投用的数据采集与训练中心有64个,加上在建和规划至少90个,其中13个部署了上百台机器人。几千平方米的场地里,家居、商超、工厂被一比一还原,几十上百台机器人排队上课,采集员戴着VR设备遥操,是第一代数据工厂的标准图景。

热潮之下,问题很快浮现。马晓健是较早公开指出遥操模式天花板的人之一,他的判断有三个层次。

其一,遥操数据的产能受制于物理时间和人:高技能遥操员极难培养,“很多公司开玩笑说最核心的资产是几个‘遥操仙人’”。其二,遥操数据与特定本体绑定,换个机型复用率就大幅下降。其三,也是最根本的,遥操数据在训练流程里本就不该是主力,它适合的是少量精标的后训练;如果一家公司需要海量遥操数据才能work,恰恰说明它的预训练基模没做好。“遥操量很大的时候,暴露的是预训练不够好,它只能是阶段性方案。”

仿真数据是另一条被寄予厚望的路径,理论上可以靠堆算力无限生成。但马晓健认为这里存在一个被普遍回避的成本真相:“仿真数据的scaling law,横坐标不该是数据量,而该是开发仿真器投入的成本。假如仿真器得97%逼近真实世界才能work,从95%到97%这两个点,投入的资源是极其夸张的。开发GTA的Rockstar Games好几千人,做的还只是面向游戏的模拟器。”

三条路径逐一推演后,德塔智能的选择是人类数据,而且是完整的“全身全景”人类数据。今年7月,他们发布了头戴式数采设备Delta D1,目前唯一靠单台托盘设备就能同时采集全身全景数据的装置。

“全身”两个字是这里面的关键,也是多数上半身数采方案的盲区。马晓健举了一个让我印象深刻的例子:车门很沉,人开车门从来不是靠手臂硬拽,小孩尤其如此,会有一个腰、腿、脚协同的全身借力过程。如果只采集上半身,数据会教会模型一个错误动作,用力拽。“同样都是采数据,采一双手和采全身花的精力是一样的,为什么不做一个更完整、更终局的?”

这个选择与双足路线严丝合缝:既然选了最适配人类数据的本体,就必须喂给它完整的、不残缺的人类数据。路线、数据、设备,在德塔的体系里是同一个逻辑的不同切面。

马晓健透露,今年地方新建的数采项目,包括不少一期项目的二期、三期,诉求已经明显变化,说得最多的是两件事:要人类数据而非遥操数据,要看到数据在预训练中的实际效果。他也借此重构了数据工厂的参与结构:过去是“主机厂+运营方”两方模式,跑不通;德塔进入后变成模型公司、场景方、主机厂、运营方的四方模式,模型公司定义数据标准并消纳一部分数据,场景方提供真实任务,主机厂提供本体,运营方负责日常运转,数据才真正形成“采得出、卖得掉、用得上”的闭环。

数据之上是模型。德塔智能的技术底座是一套三层架构,马晓健的讲解方式像在还原人体本身:最上层大脑以15到20赫兹频率理解环境、空间和任务,输出对手、脚、躯干的抽象控制指令,做到这一层,恰好够控制机械臂和轮式底盘,这也是为什么简单形态不需要往下走;但人形机器人是29个自由度的高度耦合系统,“哪怕只是伸一下手,都伴随腰、胯、腿、脚的全身协调”,于是需要第二层小脑,把抽象指令转译成大几十到一两百赫兹的全身运动控制;而双足系统天然不稳定,与环境交互时作用力会把自己带翻,因此还需要第三层,力位混合控制,在没有力传感器的条件下同时精确控制位置与力。

最后一层背后的技术,为德塔智能拿下了2025年机器人学习顶会CoRL的最佳论文,这是该顶会第一次把Best Paper授予全中国大陆团队。

这套架构也解释了行业里另一个普遍痛点:为什么很多模型一换本体,性能就大幅跳水。马晓健认为,表层原因(相机机位不同导致的视觉差异、动作空间不对齐)靠堆数据就能解决,真正的底层障碍是不同构型的本体对同一任务的作业方式根本不同,一个模型同时学两套迥异的动作逻辑,自然学不好;而人形机器人之间因为构型同构、作业方式相通,跨本体天然更容易,剩下的只是数据重定向和sim-to-real gap两项工程knowhow,恰恰是德塔团队积累最久的地方。这也是他们能够同时与宇树、乐聚、智元等不同本体厂商合作的技术底气。

9月28日,随着Delta-0正式发布,这套方法论第一次接受公开检验。他们基本上复刻了Figure在1月实现的成绩,Demo里放出了不少细节,机器人要打开的家电门都是真实的:洗衣机门需要约4千克的拉力,洗碗机门需要约5千克,而它所使用的宇树G1本体,上肢负载只有1.5千克。硬拽不可能拉开,机器人的做法是蹲下身、用核心和下肢发力,甚至一手顶住柜门、一手抠住门沿,双手配合、全身协调,“这只有人形能做到,因为它学会了人是怎么用全身跟环境打交道的。”

图|踩开垃圾桶盖子

不造本体的玩家,怎么赢下终局?

一个绕不开的疑问是,人形机器人强调全栈,德塔智能却偏偏不做本体,把最容易先赚钱的硬件环节外置,这个模式成立吗?

马晓健的答案是区分全栈理解和全栈自研。做模型必须全栈地懂硬件、懂小脑,但不必全栈自己造,因为中国的产业土壤不支持Figure式的垂直整合。“Figure连本体、手、基模、大模型全自己做,甚至做大模型去对标OpenAI。但国内过往成功的企业,大多是专注把一件事做穿做透。这是两种产业范式。”

德塔的选择是把全部资源压在基模这一个点上,数据设备自研也只是因为“市场上没人能提供我们需要的完整数据”,除此之外保持克制。本体侧则以联合研发的方式与主机厂协同,模型团队反向输出洞察,告诉硬件团队什么设计能与AI算法匹配,共同迭代。

这个理解,建立在行业已经出现过普遍踩坑的情况之上。

人形硬件领域遍布“局部最优陷阱”:绳驱手、直线关节,听上去极致拟人、符合第一性原理,实际却可能让模型难以适配。Figure创始人Brett Adcock今年就公开承认,第一代绳驱手是他犯过的最大工程错误,行业趋势正在转向直驱手。“人形有太多这样的local optimum(局部最优),陷进去两三年就过去了。要么直接抄一个被验证过的方案,要么让做模型的人深度参与设计(本体),这正是我们的价值。”

而提及市面上的多数本体厂商,马晓健的判断是,人形本体远未收敛:散热、续航、负载、精度、耐久,“现在的人形可能还达不到福特T型车的技术水平”;而比亚迪等车厂正在密集入局,Tesla甚至停掉Model S、Model X两条产线all in Optimus,本体侧的竞争只会更惨烈。

和马晓健第二次见面时,人形机器人历经了波澜。凤凰网科技从多个渠道了解到,一级市场目前已暂停人形机器人项目投资。马晓健开了个玩笑,最初决定做人形基模的时候大家看不懂,等大家看懂了,市场又不投了。不过他也说,这次demo的放出,给了不少人信心,认为当人形机器人真正有技术性突破的时候,赛道的信心会再次回来。

这个判断也来自于对刚需的观察。

“你去看机器人视频下面的评论,翻来覆去只有两种呼声:帮我做家务,以及帮我去做危险的事,井下、海上、野外。没有人说帮我做咖啡、帮我分拣药品。”前者是刚需,后者既不危险、又非必要。而所有危险、偏远、人不愿意去的场景,恰恰都同时要求下肢的通过性和上肢的操作能力,这正是双足人形的领地,也是轮式和四足先后被淘汰的原因。

他跟我们分享了很多不适合人类作业的场景,新疆的油井之间相隔十几二十公里,沙漠高温,人开皮卡单程三小时,设备一旦故障就意味着三小时停工,若现场有一台机器人,当场就能复位;海上的风电、光伏升压站离岸几十公里,无法长期值守,过去只能停电等人;变电站的倒闸操作本就有漏电概率,“你永远不知道自己是不是下一个”,换成机器人,被电坏的是机器而不是人;还有井下,矿工早已不需要亲手挖煤,真正的工作是操作设备,而透水、瓦斯的风险始终存在。

事实上,国家电网、南方电网上半年的内部采购需求中,超过一半、约二十多亿元的份额都投向了双足人形。

海外市场是另一个被忽略的增量。马晓健提到,有头部厂商上半年海外业绩很好,卖了很多到欧洲和美国。国内需求海外也有,甚至更多。国外没有像样的供应商,中国机器人有价格优势,更重要的是能交付work的东西。“你让宇树机器人表演一个飞吻,老外觉得太棒了。国内已经养刁了,得翻跟头才觉得差不多。”

目前,德塔的人员规模在70人左右,已有计划扩展到100人出头,硬件和模型四六开。马晓健认为,人形人才不能靠挖,只能自己培养。德塔智能自己的下一步,是让机器人真正“上街”。

但进家依旧遥远。第一道坎自然还是技术本身,比如在5000万小时人类数据后,训出一个any task、any thing成功率30到50的基模,再通过后训练解决家庭非结构化、长尾任务。但第二道坎已经不是技术,是伦理、安全、隐私和保险、立法。现在所有人形机器人理论上都有能力伤到人,社会愿不愿意在身边放一个这样的设备?汽车上路有车险、交强险、道路规则,机器人进家庭也需要一套体系。

“这个时间建立有一个过程。”但对行业来说总得有人先迈出技术第一步。