Wang Kaixuan / 3D Vision & Robotics

Wang Kaixuan Blog

王凯旋的个人博客,分享 3D 视觉、机器人、具身智能和 AI 领域的思考与周报。

2026 年 09 月 04 日

在机器人公司 Figure 上班是种什么体验?——对话 Jed Yang(杨佳宁)

#AI 总结

B站访谈 · 许华哲Harry × Figure 研究员
在机器人公司 Figure 上班是种什么体验?——对话 Jed Yang(杨佳宁)

节目:许华哲Harry(B站频道)
嘉宾:Jed Yang 杨佳宁 · Figure 研究员(密歇根大学博士,前 Meta FAIR 实习,SAM 3D 贡献者)
时长:47 分钟 · 发布:2026-08(B站)

来 源

B站访谈 · 许华哲Harry × Figure 研究员:https://www.bilibili.com/video/BV1RS8i66Eng/

本报告由音频转写(whisper 自动识别)后按金字塔原理整理 · 引用时间戳为音频原片时间

—— 金 字 塔 结 构 ——

顶层结论 · 一句话

Figure「电影感」背后的能力是真实的——全身控制与硬件协调是真门槛;但人形机器人从 Demo 走向部署,当前第一优先级是可靠性,泛化则要等数据积累

支柱一 · 估值之谜

390 亿美元估值 = 创始人融资能力 + 强商业团队 + 人形「终局光环」,而非单纯技术溢价

支柱二 · 真实性

视频全部为 1 倍速自主完成,无遥操作造假;外部看到的是最高水平,内部看到的是更多未解决的问题

支柱三 · 部署瓶颈

现阶段可靠性 > 泛化性;泛化优先级全公司最高,但本质是等数据的事——遥操作难规模化,Human Data 是发力方向

支柱四 · 路线判断

模型架构之争(快慢系统/端到端/VLA/世界模型)不重要,数据 recipe 才是需要积累的护城河

01人物坐标:从 FAIR 到 Figure

这可能是中文互联网上第一场对 Figure 员工的采访。嘉宾杨佳宁(Jed Yang)入职约 10 个月,此前在密歇根大学读博(具身智能实验室),两次在 Meta FAIR 实习并参与 SAM 3D 项目,近期该工作获 CVPR 2026 Best Paper Honorable Mention。

核心结论

从「发论文为导向的 FAIR」到「一切服务于一个产品的 Figure R&D」,是从研究平台到高度整合的创业公司的转变——这位 3D 视觉研究者选择在毕业时「做最本质的东西,就是机器人本身」。

背景两次 FAIR 实习:见证研究黄金期的尾巴

2024 年夏天的 FAIR 还是「以 publication 为大目标」的研究超级平台,明星个人与团队以兴趣为导向做研究;2025 年夏天再回去时,已能感受到组织风波——小项目被降级、优先级调整。福利也在缩水(奶茶配送等已取消),但对一个常驻实验室的博士生而言依然极具吸引力。

24 年的时候其实还像以前大家理解的 FAIR,大家基本上就是做 research,以 publication 为大目标;25 年就已经能感觉到有一些变化,组织上的风波。 [00:02:16]

转型从 3D 视觉转向机器人:3D 离具身智能更核心

杨佳宁博士期间做过视觉语言导航(VLN),发现模拟器里最好的方法基本都依赖 3D 地图,因此判断 3D 研究离具身智能的核心更近。同实验室其他 PhD 多从 NLP 角度切入(用语言拆解任务),他选择更接近机器人本身。毕业时遇到机器人机会便果断转型。

我就会觉得 3D 方面的 study 会离所谓 embodied AI 更核心一点、更接近一点……毕业的时候有这种机器人的机会,我就果断做最本质的东西了,就是机器人本身。 [00:06:21]

文化Figure 更像 R&D:一个 monorepo 服务一个产品

与 Meta 各组各有 infra/data/训练代码不同,Figure 全公司(软件+硬件)共用一个 monorepo,所有代码最终服务于同一款产品。在机器人这个高度整合的领域,精力更集中。杨佳宁近半年的工作重心是用人类数据(Human Data)帮助机器人提升技能。

Meta FAIR 还是一个 research 的超级平台……但 Figure 毕竟是创业公司,而且在机器人这个高度整合的领域,我感觉更像是 R&D 一点,产品和 research 都有。 [00:04:22]

02估值之谜与「拍电影」质疑

成立不到四年、估值冲到 390 亿美元的 Figure,因视频质感过于电影化、又几乎从不在展会(CES/RSS/WAIC)现场演示,长期被调侃为「拍电影的公司」。内部人如何回应?

核心结论

估值高企来自创始人融资能力、强商业团队与人形「终局光环」的叠加;而视频虽然确由电影团队拍摄,但内容全部为 1 倍速自主完成、无遥操作——真正难的不是动作本身,而是全身控制与硬件协调这套基础设施。

估值390 亿美元的三个来源:会搞钱、商业团队、终局光环

杨佳宁坦承估值逻辑有三:一是创始人「比较会搞钱」;二是公司有很强的商业团队——Figure 可能是聊客户最多的机器人公司之一,且极度在意形象呈现(工业设计、Demo 调性、贴摄像头等细节);三是人形自带「终局光环」——大家相信最终形态就是像人一样的机器人,Figure 入局早、又在当时美国机器人公司稀少的窗口期,饼自然做得很大。

一方面可能确实是创始人他比较会搞钱……另一方面我也确实感觉到公司有一个挺强的商业团队,包括机器人的 ID design、Demo 的调性,各种细节都能感觉出来公司比较在意自己的形象。 [00:11:28]

大家对这种人形可能自带有一种终局光环……如果有一家公司说自己要做这种终局游戏,又开始的比较早,可能就会把这个饼做得很大。 [00:12:39]

真实性「拍电影」的回应:视频全是 1x 自主完成

Figure 近年确实用专业电影团队拍摄视频(设备与制作流程极专业),这正是「虚假感」的来源。但入职后杨佳宁确认:所有视频里的行为都是自主的,没有遥操作;快递分拣直播、整理洗碗机、胯部顶抽屉、整理床铺都是真的。入行后他发现这些动作本身并没有那么难——真正门槛高的是全身控制(whole-body control)、硬件协调性与反应速度。

其实所有的视频上面出来的东西确实都是自主的,确实也没有像大家怀疑的遥操作这样……Figure 放出来的视频从来都是 1x 和 autonomous,这个其实不用太怀疑。 [00:14:23]

Figure 的 whole body control、硬件的协调性、反应迅速,这方面是真正门槛比较高、不太好做到的。一旦这些基础设施有了以后,其实要学一些动作并不是特别的困难。 [00:14:56]

初印象进门第一课:贴摄像头 + 大堂里巡逻的机器人

面试 onsite 当天,手机电脑摄像头全部贴住、禁止拍照;大堂里有机器人巡逻,一侧是戴头显穿动捕服的数据采集员在遥操作,另一侧机器人在自主干活。因为是人形,视觉冲击力尤其大。但入职后很快看到硬币的另一面:外部 Demo 展示的是 controller 与硬件丝滑度的最高水平,内部则要直面可靠性数字——整理洗碗机这类任务干十次能成功几次,与理想目标仍有不小差距。

当你一进去,手机电脑的摄像头就贴住了,不能拍照,比较保密……可能你会看到有机器人在大堂里面走巡逻,我当时头脑里就两个字:科幻。 [00:07:34]

外部 demo 出来的东西是一个水平,内部的话你可能还会看到更多的问题……比如说这个洗碗机它可以泛化到什么程度、reliable 到什么程度,可能干十次到底有多少能成功,这些只有进去以后才会发现还是有不小的挑战。 [00:08:40]

节奏公司重心的迁移:硬件可靠度 → RL 全身控制 → 数据泛化

Figure 前一两年的重心是把硬件水平与可靠度提上来,并把 controller 从 MPC 换成基于 RL 的全身控制——这带来了 Demo 能力的质变。现在 controller 上来了、数据基础设施也有了,问题变成:如何让机器人真正干可泛化、特别可靠、能产生价值的任务。

前一两年的 focus 是把硬件的水平还有可靠度提上来,以及把 controller 从以前的 MPC 换成现在这种 RL-based 的 whole-body control,这些给整个公司带来一个质的飞跃。 [00:10:00]

安全为什么从不去展会:70 公斤的腿部机器人风险太大

一是公司想营造「酷」的调性,设计精心雕琢;二是坦诚地说,人形机器人过早对外暴露确实有风险——它是有腿的存在、重量约 70 多公斤,动作不对时力量很大(网上已有跳舞机器人误伤路人的案例),因此对测试和可部署内容的要求更高。但投资人和客户进公司参观后的感受「还是很震撼」。

毕竟他是一个有腿的存在,重量可能得有 70 多公斤左右,如果他摔倒了或者动作不对……其实当他不太对的时候,他的力量是很大的,所以这些确实会让我们对能 deploy 的东西有更高的要求。 [00:16:02]

03Demo 的价值演变与 200 小时直播

2026 年之后,「能干一件事」「能跳一支舞」已让观众麻木。什么样的 Demo 还有价值?Figure 用一场原计划 7×24 小时、最终延长到 200 小时的物流直播给出了自己的答案。

核心结论

Demo 门槛正在快速提高:长程操作与灵巧即兴仍有说服力,简单视频重要性持续下降;而 200 小时直播真正 impressive 的不是智能水平,而是动作流畅度与全系统稳定性——这是对硬件、续航充电、调度等各层面的综合考验。

标准2026 年的好 Demo:超长程 + 灵巧即兴

杨佳宁认为 Demo 依然有用,但关注点更细致了。两类仍有价值:一是超长程操作(如主持人许华哲团队的 POKE 展示——长视频要保证全程无错是指数级难度,他「仔细学习了一下」);二是特别灵巧、带即兴发挥的视频(如近期同行的叠衣视频能应对前所未见的状态)。相对简单的视频重要性在 2026 年后持续下降——因为领域整体变好了。

进入到 2026 年以后,好像 demo 的门槛确实在提高……能干一个事已经有点麻木,或者说能跳一个什么舞已经有点麻木了。 [00:17:12]

如果要拍得很长的话,然后要保证中间没有错误,还是比较难的,因为它是指数级的难度。 [00:17:50]

直播x24 → 200 小时:最难的不是智能而是系统稳定

物流分拣任务从智能角度看并不难,这场直播最 impressive 的是动作流畅程度与系统稳定性:机器人续航约 3 小时,没电要自主回去充电——这些恰恰不是最火的具身智能模型所 handle 的部分,但整个链路都要做好、硬件也要非常可靠。原计划 7×24 小时直播,后来「看好像也没什么问题」就继续延长,最终达到 200 小时。

这个视频对我来说最 impressive 的一点,可能更多的是它动作的流畅程度,以及它的系统的稳定性……这中间也有很多并不是所谓现在最火的具身智能模型来 handle 的部分,但整个要做好、硬件也非常 reliable,总体上还是比较 impressive。 [00:19:03]

本来是进行 7×24 小时的直播,后来可能看好像也没什么问题,就继续延长了一下,最后延长到 200 个小时。 [00:19:57]

传播Frank、Gary、Rose:直播间里长出来的网感

直播中网友给机器人起名(Frank、Gary、Rose),调侃「Gary 总是干活不太行,Frank 干得就比较好」——后来公司真把这些名字贴到了机器人上。从宣传效果看这场直播相当成功。

能看到评论区有网友给机器人起名字……说 Gary 总是干活不太行,Frank 干的就比较好,还挺有网感的,后来也是把这个名字真的贴到机器人上。 [00:20:20]

范围Figure 的 Scope:解决所有 Physical Labor

家庭场景视频、工厂物流直播、宝马汽车产线合作——Figure 的范围既包括家用也包括工厂商业应用,总体目标是解决所有体力劳动。家用与商用两件事:模型层面有分野,但机器人远不止模型,其他部分的迭代是共享的。

我觉得 Figure 的 Scope 应该就是既包括了家用,也包括这种工厂的商业应用,所以它总体上就是想解决所有的 physical labor。 [00:21:15]

04部署核心:可靠性优先,泛化等数据

人形造出来了、200 小时也直播了,真正要部署落地时什么最重要?这是整场访谈技术含金量最高的部分——也是内外认知差最大之处。

核心结论

如果只选一个,现阶段选可靠性(reliability):泛化本质上是「等数据」的事,而可靠性对科研迭代信号和商业落地都有长期回报。同时泛化在全公司层面优先级最高(CEO 定调今年关键词就是 generalization),最大预算都花在泛化上;数据路线上,遥操作很难规模化,Human Data 是杨佳宁个人发力最多的方向。

优先级可靠性 vs 泛化性:现阶段选前者

很多人会答泛化性,但杨佳宁的判断是:追求泛化主要是等数据的事;而追求可靠性,无论对科研能获得的迭代信号、还是对商用场景产生实际效用,都有长期帮助——这是现阶段获得进展更快的方式。当然不能一直只追求这个。

如果只选一个的话,我在这阶段可能会选可靠性……追求泛化我觉得主要是要等数据的这么一个事情,但是你追求一些 reliability,是对你后面长期也会有很多帮助的。 [00:25:45]

数据量Demo 背后的真实数据量:lower double digit

对于「整理卧室/洗碗机/收拾客厅的成功率与泛化性」这一敏感问题,杨佳宁给出一个行业内通用的读法:视频里没放数字,说明还没那么可靠和能泛化,「但也没有大家想的那么糟糕」。他看到这些 Demo 任务并不需要多少数据——具体数字不能透露,但可以想象是「两位数下段」(lower double digit,即 10-30 条量级的数据)。

如果一个视频他没有太放出来数字的话,肯定就是说还是多少不会那么的 reliable 和能泛化……具体的数字我不能太透露,但是大家可以想象,就是 lower double digit number。 [00:24:46]

泛化CEO 定调:今年的关键词是 Generalization

泛化在整个公司层面优先级非常高——CEO 在全员大会上说今年关键词就是 generalization。策略是积累更多数据、尝试更多 recipe。杨佳宁相信公司现在花的最大的钱(数据、人才、算力)都在泛化上;之所以展现得少,一是大量 research 推力在可靠性上,二是 Figure 「想完整的时候再展示」的调性需要更多时间。

泛化性在整个公司层面来说的优先级是非常高的,我记得 CEO 之前在一个全员大会上也说,今年的关键词就是 generalization。 [00:27:48]

我其实相信公司现在花的最大的钱,不管是从数据上、人才上,还是算力上,都是花在 generalization 上的。 [00:28:25]

数据路线遥操作的必要性成立,但可扩展性不成立

对比行业各家路线(真机数据派、UMI 无本体派、Human Data 派):杨佳宁认为遥操作作为 recipe 的最后一环已充分证明必要性(市面上所有 recipe 最后一个 stage 都逃不开它),但至少在人形本体上很难 scale——人形遥操作难度极高,操作员都非常 skilled;且至少需要一人一机一空间,运输成本、场外安全要求(到别人家收集不能砸坏地板)、维修、现场运维、场地与供电、双人支持(一人操控一人管录制/reset)……总成本非常高。这正是他前半年在 Human Data 方向投入较多 effort 的原因。

我觉得 teleop 应该还是很难 scale,尤其是当你的本体是一个人形机器人的话,它的 teleop 的难度其实还是挺高的。 [00:29:38]

遥操作这种数据收集至少最少需要一个人和一个机器人,然后还需要有一个空间能容纳,所以光这一个限制条件,就可能非常限制它最后的 scaleability。 [00:30:38]

05技术路线判断:架构之争不重要,数据才是护城河

快慢系统还是完全端到端?世界模型还是 VLA?这些当下最热 的路线之争,在一位一线研究员眼里排位如何?3D 背景出身的人又怎么看 3D 生成与机器人的关系?

核心结论

在 coding agent 如此发达的当下,换一套模型架构非常容易,真正需要积累的是整个数据 recipe;目前无论 human data、teleop data 还是 egocentric video data 都远远不够,此时争论架构并不紧迫。3D 生成已在机器人领域实际发挥作用(生成模拟器资产),而灵巧手怎么训练仍是最大的 open question。

架构模型派系之争:不重要,数据 recipe 才是

被问「模型层面重要吗——快慢系统、完全端到端、世界模型还是 VLA」,杨佳宁的回答干脆:「我觉得其实不太重要」。理由是换模型架构的成本很低,而数据 recipe 需要长期积累。只有当数据会影响 recipe 时架构才会重要一些——但现状是数据远远不够。

我觉得像这种模型上的派系之争,尤其现在在 coding agent 如此发达的情况下,换一套所谓模型的架构其实是非常容易的,我觉得更难的就是你整个数据的 recipe,这个是需要积累的。 [00:33:29]

不管是 human data、teleop data,还是所谓这种 egocentric video data,其实都不是特别多,我觉得在这种情况下争论这些架构并不是特别的紧迫。 [00:34:00]

2B/2C商用与家用:模型分野,其余共享

两条路线既非完全独立也非简单递进:模型层面有分野——现阶段追求商用,重点在后训练(Behavior Cloning 的 SFT、真机 RL、Preference Tuning);进家则更关注 VLA 与世界模型(Figure 也都在探索)以及如何更好利用遥操作数据。但机器人不只有模型——手的设计问题、下一代相机排布、充电简化、多机调度、异常行为、与有人环境交互的安全、worst case 损伤控制……这些研究是共享的,而且在相对可控的商业环境里迭代更快、团队成长更迅速。

机器人它其实不光是模型,模型只是一部分,甚至不是一个特别大的部分。很多其他部分的各种迭代是共享的……这些方面的研究在一个相对可控一点的商业环境,比起家用来说可能会迭代得更快,让团队成长的也更迅速。 [00:22:54]

3D3D 生成与机器人:已实际结合,未来只会更多

3D 作为独立领域已有市场,同时确实在帮助机器人——公司内部和外部合作者都已在用开源 3D 模型生成素材。杨佳宁目前看不太清的一条是灵巧手如何训练:纯 Behavior Cloning 学到特别灵巧的操作很难,所以很好奇将来的灵巧操作会不会更依赖模拟器里的仿真——若是如此,生成各种资产就变得非常重要。

我现在还不太确定的一条就是如何训练灵巧手,我觉得这还是一个非常大的 open question……会不会将来更灵巧的操作会更多依赖于模拟器里面的仿真,如果是这样的话,可能生成各种资产就变得非常重要。 [00:35:18]

代表作SAM 3D:单图点选生成 3D 资产,CVPR 2026 荣誉提名

杨佳宁去年实习参与的 SAM 3D 获 CVPR 2026 Best Paper Honorable Mention(他自谦只是作为 intern 贡献了一小部分)。用法:上传一张图片到网页、点一下某个物体,先 2D 抠图、再生成该物体的 3D mesh 或高斯 splat。愿景正是服务机器人——把现实世界变成 3D 资产、丰富模拟器资产丰度。挑战在数据(把 2D 分割数据与 Objaverse 等 3D 资产库桥接);模型上用了 MoT(Mixer of Transformer)等 3D 领域少用的前沿结构,后训练还加入 DPO 偏好优化让产出更符合人类喜好。他也感慨这个项目成了 FAIR 那部分以 research 为导向、最终开源回馈社区工作的「最后一舞」。

如果你能把现实世界的东西全都变成一些 3D 资产,也许你就可以大大的丰富你在模拟器里的资产的丰度,我觉得这个是当时这个项目的愿景。 [00:36:56]

它不光是成为了我的所谓的代表作,也成为了 Meta 曾经 FAIR 这一部分的一个代表作,还以开源的形式呈现给 community……我觉得也算是最后一舞了。 [00:38:30]

06终局想象与给年轻人的建议

机器人何时真正进入千家万户?家庭机器人与人该是什么关系?访谈最后从技术走向了社会想象与人生哲学。

核心结论

「机器人的到来不是一种科技变化,而是一种社会制度的变化」——当机器人足够丰富,商品与服务价格趋近于零,价值观与人与人的关系都会重新洗牌。家庭机器人的定位是「全能家电」而非情感陪伴:干人不想干的事,而不是替代人想干的事。而给年轻人的建议是:在感兴趣的事情里,选最难的那件开始做。

时间线5 到 10 年:肯定能做成,但很难预期具体时间

杨佳宁自问「5 年左右」,但细想中间还有多少问题要解决又觉得时间不够用;同时 coding agent 的崛起、大公司积极收集和售卖数据、数据丰度突然增多,又可能带来比想象更快的进展。综合判断:肯定能做成,可能 5 到 10 年。

我想跟自己说的是可能 5 年左右,但当你细想一下这中间还有多少问题要解决,又觉得时间好像有点不够用……但是感觉我们都能看到的是它肯定会做成,可能也就 5 到 10 年。 [00:32:21]

社会社会制度之变:小学生租一队机器人开「玩具作坊」

这句话源自他入职 Figure 时恰逢 Figure 03 发布、登上美国《时代》周刊的文章。底层逻辑:机器人足够丰富后,商品和服务的价格会无限趋近于零,人人可获得想要的东西——价值观、优先级、人与人的关系都会重新洗牌。他常想象这样的场景:一个有小想法的小学生,用 coding agent 写程序、租用物理世界里的机器人,真搭起一个小作坊/工厂来实现自己的梦想——想象空间非常大。

当你机器人变得非常的丰富、数量非常多的时候,商品和服务的这种价格可能就会无限的趋近于零……很多人的价值观以及优先级都会重新洗牌。 [00:40:04]

也许他就喜欢生产玩具,他以后就不止于说我买一个玩具——他可以直接说一句话,coding agent 写一个程序,然后租用几个物理世界里的机器人,真的搭一个小型的作坊来实现他的梦想。 [00:41:06]

定位家庭机器人 = 全能家电,而非情感陪伴

在杨佳宁的想象里,家庭机器人更像一个全能家电:家里所有能干或不想干的活都可以交给它,但他并没有想象它会成为情感陪伴。机器人更多是去干人不想干的部分,而不是替代人想干的部分——与家人的情感交流才是更有人性的部分。至于「放盘子对视一下、拿胯部撞烤箱门」这些巧思,更多来自工业设计团队对 look and feel 的强把控,research 有时还要花额外精力去满足——现在数据收集资源仍以实用为主,「能到那一天就好」。

我觉得家庭机器人在我想象里面,还更多像是一个全能的家电……我倒并没有想象它会太成为一个所谓情感的这种陪伴。 [00:42:14]

我觉得机器人更多的是去干人不想干的这一部分事情,而不是替代人他们想干的这部分事情。 [00:42:45]

建议给年轻人:在感兴趣的事里,选最难的那件

为什么选难的?因为年轻人没有什么资本,冒险精神与敢于挑战就是最大的资本。当你选择干一件特别难的事,年长的人甚至会无条件帮助你——他们冒不了这个险(家庭、各种考量),没有时间资本做冒险选择,于是你成为对他们很有吸引力的「投资」。另一方面,做成难事带来的成就感与自信,长期也很有帮助。

在你感兴趣的事情里面,如果有好几件,选一个最难的事情开始做,往往会收获到一些意想不到的回报。 [00:44:36]

当你没有任何资本的时候,其实你的冒险精神、敢于挑战的精神,就是你最大的资本……当你作为一个年轻人选择干一个特别难的事的时候,他们甚至会无条件地帮助你或者支持你。 [00:45:20]