EN

Wang Kaixuan / 3D Vision & Robotics

Wang Kaixuan Blog

王凯旋的个人博客,分享 3D 视觉、机器人、具身智能和 AI 领域的思考与周报。

2026 年 09 月 19 日

Reward AI 深度调研报告

#AI 总结

HUMAN HAND ONE DATA INTERFACE OM-1 CONTROL ANY BODY
Embodied AI Company Deep Dive

从斯坦福 DexCap / Mobile ALOHA 谱系长出来的「跨本体机器人基础模型」

调研日期:2026-09-19 公司成立:2025 走出隐身:2026-09-14 规模:11–50 人
原文 / 原始来源(置顶)
官网 · https://www.rewardai.com/
一级技术文档 · OM-1: Frontier Robot Intelligence, Learned Firsthand from Humans(2026-09-14)
About us(CEO 署名) · https://www.rewardai.com/about/
官方演示视频 · https://youtu.be/IJvyS2aPsnA | 官方 X @RewardAI_ | YouTube @reward-ai
官方 公司官网 / 官方社媒 / 创始人本人署名内容 旁证 学术论文、项目页、第三方媒体、公开档案 推断 本报告基于上述材料的推理(非官方确认)

00结论先行

五条核心判断

1. 公司画像。Reward AI 是一家 2025 年成立、2026-09-14 走出隐身的旧金山湾区机器人基础模型公司,由两位斯坦福博士 Zipeng Fu(CEO,中文名多译作付梓鹏 / 符梓鹏)Chen Wang(CTO) 联合创立。官方旁证

2. 技术主张一句话。把机器人学习的数据入口从「机器人本体」前移到「人手」:用一套自研 7 自由度可穿戴采集设备 Omnibody Hand 把人类自然操作录成多模态流,训出跨本体的通用策略 OM-1,再用仿真强化学习训练的高频控制层去消化不同机器的动力学差异——即官方口号 One Model, One Data Interface, Any Body官方

3. 它是 UMI → DexCap 谱系的工业化升级版。UMI 的核心机制是「同一个手持夹爪,人戴着采、机器人装上跑」;Reward AI 把夹爪换成「同一个 7-DoF 功能手 + 触觉/接近/力 + 电磁追踪」,并显式拆出一个独立时钟的控制层。CEO 本人是 UMI on Legs(CoRL 2024)的合著者,CTO 是 DexCap(RSS 2024)一作。旁证·技术溯源

4. 目前唯一可验证的硬指标,是采集端的追踪误差(高速段平均过冲 24.9 mm → 9.5 mm,降 60%)。任务成功率、数据规模、模型参数量、推理频率、融资金额、客户名单——全部未披露官方旁证

5. 商业化尚未真正开始,但方向已经写在脸上。无定价、无客户、无 API、无开源;创始人反复强调「Efficiency is ROI」与「所有视频均为 1 倍速」,明确对标产线节拍与部署回报,并强调模型可以「直接落到客户厂房里已经站着的机器人上」。官方推断

01公司速览

项目内容性质
公司名Reward AI(品牌与 X 账号均写作 Reward AI,官网域名 rewardai.com)官方
成立时间2025(LinkedIn 公司页);两位创始人分别于 2025 年前后完成斯坦福博士官方
地理位置San Francisco Bay Area(第三方媒体口径,官网未标注地址)旁证
规模11–50 人(LinkedIn 公司页);Privately Held官方
定位自述「engineers, company builders and researchers … spanning the full stack: from large foundation models to gearboxes, from hands to legs, from visual and tactile perception to high-frequency control」官方
首个产品OM-1(Omnibody Model 1)通用机器人策略 + Omnibody 全栈(Omnibody Hand / One Data Interface / Control Any Body)官方
融资未披露金额、轮次、投资方。第三方行业通讯明确指出「截至本次发布,官网尚未披露融资金额和投资方」旁证
开放程度模型权重、代码、数据集、API 均不开放;无论文发表旁证
联系方式general@rewardai.com(商务)、careers@rewardai.com(招聘)官方

02信息来源清单

调研共梳理出 49 条信息源,按性质分为三类。下表是按类别汇总的骨架。

类别条数代表来源在本报告中的作用
官方15 官网首页 / About us(CEO 署名)/ Blog 索引 / OM-1 技术博文 / 官方演示视频 / 官方 X @RewardAI_ / 官方 YouTube @reward-ai / LinkedIn 公司页 / Zipeng Fu 首发帖 / 两位创始人个人主页与 CV 事实基线。但需注意:所有性能声明均为「公司自述」,尚无第三方复现
旁证31 DexCap / Mobile ALOHA / HumanPlus / DeepWBC / UMI on Legs / UMI / Sequential Dexterity / MimicPlay / SwingBot 等论文与项目页;Humanoids Daily、RuntimeWire、Digital CxO、CIVL、humanoid.guide、腾讯新闻·机器人前瞻、网易、SOURCEMIND、alphaXiv、Lacuna 技术脉络溯源 + 交叉验证 + 竞争定位。媒体报道中区分「事实转述」与「作者评论」
推断3 基于官网 About 页「Selected past work by our team」14 张图的作者反查;基于「不开源 + 无客户 + Efficiency is ROI」的商业化路径判断 补充官方未披露的信息。均标注推理链条,与官方事实分开表述
一个关键的隐藏信源

官网 About 页有一栏 「Selected past work by our team」,是一组滚动图片。它的正文文本在页面上不可见,但每张图片的 alt 属性是可读的官方文本——这是目前唯一能推断「除两位创始人之外还有谁」的官方线索。本报告第三节的团队推断即基于此。

同理,OM-1 博文中 9 段演示视频的 aria-label 也是官方文本,其中一条直接写明:「Omnibody Hands in motion, on robot arms and worn by a person at a table」——这是判断「同一只手既戴在人手上、也装在机器人上」的官方证据。官方

03核心成员:背景与代表性优势

3.1 Zipeng Fu(付梓鹏 / 符梓鹏)· 联合创始人 & CEO

Zipeng FuCo-founder & CEO · Stanford CS PhD · 前 Google DeepMind 研究员
本科
UCLA,计算机科学 + 应用数学双学士(2016–2020),师从 Song-Chun Zhu(朱松纯)
硕士 / 研究
CMU 机器学习硕士 + 机器人研究所(Robotics Institute)研究生研究员(2020-08–2022-06),师从 Deepak PathakJitendra Malik
博士
Stanford AI Lab 计算机科学博士(2022-09 起),导师 Chelsea Finn2.5 年完成;获 Pierre and Christine Lamond Fellowship(CS 系 top 7)
大厂 / 产业
Google DeepMind 学生研究员(2023-06–2023-12,与 Jie Tan 合作,做机器人导航大模型);Vayu Robotics 实习(2022-07–09)

官方 个人主页 zipengfu.github.io 与其 CV;旁证 alphaXiv 档案补充 Vayu Robotics 经历

博士期间及之前的工作:一条「从底层自适应到系统可部署」的完整链

代表作时间 / 会议做了什么沉淀的能力
RMA: Rapid Motor AdaptationRSS 2021
(CMU 硕士期)
让四足机器人在未知地形上通过在线自适应快速恢复运动能力;被 WSJ、Forbes、DARPA 等广泛报道 底层鲁棒控制 + 在线自适应
Deep Whole-Body ControlCoRL 2022
Oral · Best Systems Finalist
用一个统一策略同时解决「操纵」与「移动」,即四足/轮式底盘 + 机械臂的全身控制 全身控制(WBC)的系统化
Robot Parkour LearningCoRL 2023
Oral · Best Systems Finalist
四足机器人跑酷:在复杂地形上做感知驱动的敏捷运动 感知—控制 tight coupling
UMI on LegsCoRL 2024 把 UMI(手持夹爪采集)学到的操纵策略,通过「以操纵为中心的全身控制器」装到移动底盘上 直接参与 UMI 谱系:理解「采集—策略—控制」三段如何咬合
Mobile ALOHA(共同一作)CoRL 2024 低成本(约 3.2 万美元)双臂移动操纵系统;炒虾、开柜、按电梯、冲洗锅具;软硬件全开源,全球刷屏 系统级工程 + 大规模影响力
HumanPlus(共同一作)CoRL 2024
Best Paper Finalist(top 6)
人形机器人通过第一视角「影随」人体动作学习,再从人类动作做模仿学习 人形本体 + 人类动作到机器人的迁移
Mobility VLA / Open X-EmbodimentCoRL 2024 / ICRA 2024(Best Paper) 导航大模型;跨本体数据集与 RT-X 模型(DeepMind 主导的协作) 大模型范式 + 跨本体数据标准
代表性优势(本报告判断)

他的核心能力不是「提出新算法」,而是「把学习到的策略真正部署到开放世界」。从 RMA(让控制器在未知地形不崩)、DeepWBC(把移动与操纵合成一个策略)、Robot Parkour(把感知与控制耦合到极限)、到 Mobile ALOHA / HumanPlus(做成可复现、可开源、可演示的完整系统),这条线的每一步都在回答同一个问题:怎样让一个 learned policy 在真实机器、真实节拍下不失效。

这直接解释了 OM-1 的架构选择:为什么「控制层」是一等公民——独立高频时钟、仿真 RL 训练、在线优化相邻预测过渡。这不是一个做 VLA 的人会优先设计的东西,而是一个做了四年「deployable robot systems」的人会优先设计的东西。推断(基于其论文序列与 OM-1 架构的一致性)

次要但关键的一点:他是 UMI on Legs 的合著者,对 UMI 这条「用同一套手持硬件消解具身鸿沟」的路线有一手经验。这解释了为什么 Reward AI 敢把「同一个 Omnibody Hand 既戴在人手上、也装在机器人上」作为跨本体机制。旁证

3.2 Chen Wang · 联合创始人 & CTO

Chen WangCo-founder & CTO · Stanford CS PhD · 师从李飞飞与 C. Karen Liu
本科
上海交通大学 计算机科学学士,师从 卢策吾(Cewu Lu)
博士
Stanford 计算机科学博士(2020 起,2025-06 毕业),师从 李飞飞(Li Fei-Fei)C. Karen Liu
研究经历
MIT CSAIL(2019,Edward Adelson GelSight 触觉组)→ NVIDIA Research(2022,NVIDIA Graduate Fellowship Finalist)→ Google DeepMind(2024)
研究方向自述
「robot learning for dexterous manipulation, imitation learning from human motion, and long-horizon planning and control」

官方 个人主页 chenwangjeremy.net

博士期间及之前的工作:一条极度聚焦的「人类动作 → 机器人动作」线

代表作时间 / 会议做了什么沉淀的能力
DenseFusion / 6-PACK / 力-扭矩动力学CVPR 2019
ICRA 2020
IROS 2019
6D 物体姿态估计(RGB-D 稠密融合、类别级关键点跟踪);peg-in-hole 的可迁移力-扭矩动力学模型 接触与力的建模(本科阶段已切入)
SwingBotIROS 2020
Best Paper Award
用手内触觉探索学习物体物理特征,完成动态摆甩操纵(MIT GelSight 组) 触觉驱动的动态操纵
Co-GAIL / HAN / robomimicCoRL 2021
IROS 2021
从人人协作示范中抽取协作策略;手眼协调的动作空间;robomimic 大规模模仿学习基准 模仿学习基础设施
MimicPlay(一作)CoRL 2023
Oral · 三项 Finalist
从「人类自由玩耍」的视频中提取 latent plan,指导低层机器人策略,大幅减少对机器人本体示教的依赖 用廉价人类数据换昂贵机器人数据
Sequential Dexterity(共一)CoRL 2023 把多个多指手策略「链接」起来完成长程操纵,无需重新抓取即可切换功能模式 多指灵巧 + 长程组合
VoxPoser / ReKep / TRANSIC / Obj-DexCoRL 2023–2024 用大模型合成 3D value map;关系关键点约束做时空推理;sim2real 在线纠正;从人类动作数据做物体中心灵巧操作 高层规划 + 落地纠正
DexCap(一作)RSS 2024 便携式手部动捕系统:胸前相机架(RGB-D LiDAR + 3 台 SLAM 相机)+ 电磁场动捕手套 + 背包计算/供电(约 40 分钟);采人类灵巧操作 → fingertip IK 重定向到 LEAP 灵巧手 → 点云 Diffusion Policy Omnibody Hand 的直接前身
代表性优势(本报告判断)

他整个博士在做同一件事:降低「人类示教 → 机器人执行」的转换成本。Co-GAIL(从人人协作示范学)→ MimicPlay(从人玩的视频学 latent plan)→ Sequential Dexterity(多指策略链接)→ DexCap(便携设备直接采人手)→ Obj-Dex(人类动作数据直接训物体中心灵巧操作)。这条线没有任何一步是「顺便做的」,每一步都在削薄同一个瓶颈。

第二层优势是传感侧的完整度:他在 MIT GelSight 组做过纯触觉驱动的操纵(SwingBot,IROS 2020 最佳论文),又在本科阶段做过力-扭矩动力学建模。Omnibody Hand 上「触觉 + 指间接近 + 力 + 手内相机」这套多模态组合,几乎是他人生的技术简历直接硬件化了。推断

词组证据:官方博文明确写 「Building on our prior work DexCap …」;创始人在首发帖中也写 「We build on our prior work DexCap at Stanford.」官方

3.3 创始人之外的团队:基于官方 past-work 图谱的推断

官网没有 team 页,LinkedIn 公司页只显示 Zipeng Fu 一个具名成员 + 5 个匿名头像。About 页的「Selected past work by our team」是唯一官方线索,共 14 张图。把图片 alt 文本与各论文/项目逐一反查,可以得到下表。除标注为官方/旁证的行外,人员身份均为推断。

past-work 图(官方 alt 摘要)对应工作已知作者性质
双臂机器人在灶台炒虾Mobile ALOHA(CoRL 2024)Zipeng Fu(共一)官方
人形叠卫衣 / 系鞋带HumanPlus(CoRL 2024)Zipeng Fu(共一)官方
两只灵巧手用剪刀剪胶带DexCap(RSS 2024)Chen Wang(一作)官方
机器人手拼装积木Sequential Dexterity(CoRL 2023)Chen Wang(共一)官方
机械臂操作意式咖啡机VIOLA(CoRL 2022)Yifeng Zhu 等(UT Austin)推断
夹爪装穹顶光学触觉指尖DenseTact(ICRA 2022)Won Kyung Do、Monroe Kennedy III(Stanford ARMLab)推断
四足+机械臂在草地俯身Deep Whole-Body Control(CoRL 2022)Zipeng Fu(共一)官方
小型人形爬木台阶ToddlerBot(arXiv 2502.00893)Haochen Shi、Weizhuo Wang(二人同时也是 DexCap 共同作者推断(置信度较高)
Science Robotics 封面:四足跨过倒木腿足 locomotion 代表作大概率即 Robot Parkour Learning(Zipeng Fu 共一)旁证
移动操纵器从桌面拿起苹果GDM / Meta 机器人工作大厂机器人研究背景成员推断
Falcon 9 双助推器同步着陆航天工程背景疑似有 SpaceX 经历的硬件/工程成员推断
3D 打印摆线针轮减速器剖开自研传动机械/硬件工程成员推断
官方自述的能力覆盖(可交叉印证上表)

About 页原文:「We are engineers, builders and researchers who pioneered robot learning in dexterous manipulation, mobile manipulation, and legged locomotion, spanning the full stack: from large foundation models to gearboxes, from hands to legs, from visual and tactile perception to high-frequency control.」官方

即官方宣称同时具备:大模型(foundation models)— 减速器齿轮箱(gearboxes,硬件传动)— 手(hands,灵巧操作)— 腿(legs,腿足运动)— 视觉与触觉感知 — 高频控制。这与上表反查出的「VIOLA / DenseTact / ToddlerBot / 摆线减速器 / Falcon 9」构成相互印证。推断

04技术路线:软硬一体的 Omnibody 栈

4.1 全景架构

① Omnibody Hand 7-DoF 可穿戴功能手 触觉 · 接近 · 力 · 相机 视觉惯性 + 电磁追踪 ② One Data Interface 多模态流统一封装 各模态按原生采样率 无 staged 场景 / 无人监督 ③ OM-1(One Model) 纯人类数据 · 单阶段训练 输入:图像/触觉/接近/位姿 输出:方向/速度/力/事件时序 ④ Control Any Body 仿真 RL 训练的高频控制层 吸收动力学 / 扰动 / 延迟 独立时钟 + 在线过渡优化 同一策略 → 任意本体(无本体专属微调) 桌面机械臂table-top arms 工业机械臂industrial arms 人形机器人humanoids(含全身操作/导航) 轮式移动操纵器mobile manipulators 数据可跨硬件持续复用 · 「今天采的数据训练还没被设计出来的本体」
图 1:Omnibody 技术栈四层架构。第①②③层与第④层的分离是整套设计的核心——「智能」与「身体」被显式切开。来源:Reward AI 官方 OM-1 博文 官方(图中文字为官方原文的中文压缩)。

4.2 数据采集方式:Omnibody Hand

硬件设计取舍:功能灵巧 ≠ 逐关节仿人

官方明确反对两条路:一是「脆弱的 20+ 自由度逐关节复刻人手」,二是「平行夹爪」。Omnibody Hand 走中间:一个紧凑的 7 自由度设计,只保留对操纵真正重要的功能。

设计要素官方表述
精细捏取采集拇指-食指对捏,同时记录拇指与食指屈曲,使拇指既能配合食指也能配合其余手指
力量抓握中指、无名指、小指在掌指关节(MCP)联动,配合拇指屈曲包覆物体
手内重定向在手中调整物体姿态(in-hand reorientation)被列为三大优先项之一
人体工学不变性集成的远端屈曲机构吸收指长差异,降低对关节对位的敏感度,免除 per-user 连杆调整。官方理由:佩戴不适会让人改变抓法,而「被补偿过的抓法不再是我们要记录的行为」
传感通道全局快门手内相机(图像)、高频触觉、指间接近传感、力、手部位姿轨迹
追踪方案视觉-惯性 + 电磁(EM)传感增强,并有算法补偿环境电磁扰动

唯一公开的量化指标

平均过冲误差 vs 运动速度(官方自测,8 档速度 × 每档 10 次) 30201050 3122130 39485867 平均速度 (cm/s) 24.9 mm 视觉-惯性 9.5 mm Ours(电磁) Visual-inertial Ours (electromagnetic) 平均过冲 误差 (mm)
图 2:官方博文原图的数据重绘。测试设计:两套追踪器刚性共装在同一结构上,在两个已知间距的机械限位之间往返运动,超出固定行程的部分即为过冲。注意:这是采集端(手部追踪)的误差,不是机器人任务成功率。官方

UMI 谱系定位:这是你最关心的一节

Reward AI 没有在官方材料中提「UMI」二字,但从硬件、动作表征到延迟处理,Omnibody Hand 与 UMI 是同一设计范式的迭代。下表把三代设备并排。

维度UMI(RSS 2024)DexCap(RSS 2024)Omnibody Hand(2026)
形态3D 打印手持平行夹爪 + GoPro胸前相机架(RGB-D LiDAR + 3 台 SLAM 相机)+ 电磁动捕手套 + 背包电源7-DoF 可穿戴功能手(一体式)
末端自由度2-DoF 夹爪(仅开合宽度)手指 3D 位置(相对手掌,EMF 测)7-DoF:拇指/食指独立屈曲 + 中/无名/小指 MCP 联动
追踪GoPro + IMU-aware SLAM(改进 ORB-SLAM3)SLAM 相机 + 电磁场视觉-惯性 + 电磁(EM) + 环境电磁扰动补偿
视觉155° 鱼眼 + 双侧镜「隐式立体」胸前 RGB-D全局快门手内相机(快速运动下保持视觉上下文)
接触 / 力无(仅有夹爪宽度本体感知)无(纯位置)触觉 + 指间接近 + 力
动作表征相对轨迹(相对当前夹爪位姿)指尖 IK → LEAP 手 16 维关节位置运动方向 / 速度 / 力 / 事件时序(本体无关)
跨本体机制要求「平行夹爪行程 > 85 mm」,免标定需为每个目标手做 fingertip IK 重定向;用 FK 生成机器人手点云补进观测以弥合视觉鸿沟不做数据级重定向,交给仿真 RL 控制层吸收
采集效率约 3× teleoperation约 3× teleoperation,接近自然人类速度未披露(但按人类自然节拍,无需放慢)
代表作式 demo动态抛掷 87.5%、洗碗 70%、野外泛化 71.7%30 分钟人类 mocap 数据学会新任务,无需遥操作<30 分钟学会含挑战动力学的长程新任务
UMI 设计的「继承」与「改造」

继承(5 条):

  1. 同一套硬件,人戴着采、机器人装上跑。这一条有官方直接证据——OM-1 博文视频 aria-label 原文:「Omnibody Hands in motion, on robot arms and worn by a person at a table」,另有「An Omnibody Hand on a robot arm unscrewing a braided hose fitting」「Two robot arms with Omnibody Hands gripping either side of a cable connector」。官方
  2. 便携、in-the-wild、脱离机器人采集。
  3. 以手部/腕部相机为观测中心(UMI 是腕上 GoPro,Omnibody 是手内全局快门相机)。
  4. 本体无关的「相对 / 功能」动作表征。
  5. 显式处理延迟(UMI 做推理时 latency matching;Reward 升级为独立时钟控制层)。

改造(4 条,也是 Reward 声称的差异点):

  1. 平行夹爪 → 7-DoF 功能手。官方直指 UMI 类方案的软肋:「平行夹爪能解决很多任务,但通常是通过约束接近方向、接触位置与操纵策略来实现的」。对应 Humanoids Daily 的评述:2-DoF 夹爪「人为限制了接近角与接触点」。官方旁证
  2. 纯视觉 SLAM → 视觉-惯性 + 电磁。理由:视觉更新率限制了跟随快速反向运动的能力,常见补救是事后平滑轨迹或要求人放慢——两者都会破坏「就是要采快速伸手与细微修正」这个目标。官方
  3. 补上触觉 / 接近 / 力。补齐纯视觉推断不出的「接触、力、时序」这一层物理信息。
  4. 延迟处理从「对齐」升级为「解耦」。UMI 做的是推理时的观测—动作延迟匹配;Reward 让控制层跑在自己的高频时钟上,并在线优化相邻两次预测的过渡,使推理延迟的抖动完全不打断运动。

谱系可证性:Zipeng Fu 是 UMI on Legs(CoRL 2024)合著者,Chen Wang 是 DexCap 一作——两位创始人分别站在 UMI 分支与 DexCap 分支上,Omnibody Hand 是这两条线的合流。旁证·技术溯源

4.3 数据标注方式:官方口径是「根本不需要标注」

这是 OM-1 与主流路线最不相同的一点,值得拆开看。

标注环节传统做法OM-1 的做法性质
动作标签 遥操作采集 → 记录机器人关节/末端状态 → 需按本体动作空间对齐 标签是传感器内生的:位姿轨迹(追踪)、接触与接近(触觉/接近传感)、力(力传感)、事件时序(抓取/释放,由接触+力信号判定) 官方
动作重定向 DexCap 需 fingertip IK 把人手映射到 LEAP 手;UMI 需按本体夹爪行程过滤 官方声称没有数据级重定向:OM-1 直接「从人类运动生成机器人动作」,本体差异交给控制层 官方
视觉域适配 DexCap 用 FK 生成机器人手点云叠加进点云观测,弥合人—机视觉鸿沟 未披露类似机制(推测被「同一只 Omnibody Hand 也装在机器人上」这一设计绕过) 推断
数据分桶 pre-training / post-training 分阶段,每阶段可能需要不同标注与筛选 无分界:所有演示经同一接口以同一格式进入,「第一条演示与最新一条演示训同一个策略」 官方
场景组织 staged 实验室场景、专人监督采集 官方:无需 staged setup、无人监督,「工作、玩、做饭、或只是过一天」都在产出数据 官方
质量纠正 DexCap 提供 human-in-the-loop 纠正(residual correction 等) 未见提及;取而代之的是「涌现的重试/补偿/停止」行为 旁证
标注成本去哪了?(本报告推断)

官方把「标注」描述为零成本,但工程上它更可能是被转移到了另外两处,而这两处官方都未披露:推断

  1. 采集设备侧:多传感器时空标定、不同佩戴者的一致性、电磁环境扰动补偿——这些是 One Data Interface 的隐性成本,也是 Omnibody Hand 必须自研的原因。
  2. 控制层侧:要「零样本落到任意本体」,就必须为每种目标本体建立足够好的动力学模型与域随机化,并在仿真里训练 RL 控制器。每接入一个新本体,仍有工程量,只是从「重新采一遍数据 + 重新训策略」变成了「训练一个控制层」。

换句话说:Reward 把成本从「数据端·随任务线性增长」搬到了「硬件端·一次性投入 + 控制端·随本体种类增长」。这个置换是否划算,取决于他们能覆盖多少种本体——而这正是目前完全看不到数字的地方。

4.4 模型 OM-1 与控制层

模块公开的技术要点性质
输入模态图像(场景上下文)、触觉信号(接触与滑动)、指间接近(接触前状态)、手部位姿轨迹;并消费这些流的时间历史官方
采样率处理按各传感器的原生采样率处理,不统一下采样到相机帧率——保住高频触觉与运动线索官方
输出动作运动方向、速度、力、关键事件(抓取/移动)的时序官方
训练范式单阶段;无 pre-training / post-training 切分;扩展靠「增加人类数据」而非「为每种机器人设计新训练阶段」官方
架构「为高效推理定制的新架构」(未披露任何细节:参数量、backbone、是否 Transformer/Diffusion 均未说明)官方
控制层仿真中 RL 训练;处理与速度/加速度相关的动力学、外部扰动、系统延迟;独立高频时钟;在线优化相邻两次预测的过渡官方
覆盖能力不只桌面操纵,还包括全身工作(支撑、倾身、踏入任务)以及移动机器人的导航官方
效率主张<30 分钟人类演示数据学会全新任务(含挑战动力学、长程);长程任务执行 <30 秒(1× 速度)官方
涌现行为一臂失误另一臂自动补偿;知道何时重试;能适应对抗性扰动;环境变化过大时主动停止官方

4.5 已公开的 Milestone(演示清单)

截至 2026-09-19,官方共公开 9 段演示视频(OM-1 博文内嵌,720p/60fps,画面左上角统一带官方「Fully autonomous, 1x speed」水印)与 1 段发布合集。下列任务名直接取自官方 aria-label 与视频文件名。每个任务配 GIF 预览(由官方 mp4 转制)。

关于这批视频的元数据(本报告新增核实)

从官方 9 个 mp4 文件直接读到真实时长:最短 9.9 s(cross-embodiment),最长 158.6 s(iphone-long)。其中 laundry 原片 16.5 s,与官方文案「约 17 秒」吻合——说明视频长度≈单次任务时长。由此得到一个官方未说明的观察:官方口径是「长程任务执行 < 30 秒(1× 速度)」,但 ethernet-unplug(107.8 s)与 iphone-long(158.6 s)远超 30 秒,二者应包含多次重试或连续多循环作业,而非单次任务。推断

旗舰演示原片 9.9s cross-embodiment 演示:人形与工业臂同一策略分拣
cross-embodiment 跨本体分拣

人形机器人与一对工业臂都装了 Omnibody Hand,在同一策略下把传送带上的物品分拣入箱。

能力指向 · 跨本体同一策略官方章节 · Omnibody Hand官方
原片 14.9s Omnibody Hand 硬件特写:装机与佩戴
omnibody-hands 硬件本体特写

Omnibody Hand 运动特写——同一只手既装在机器人臂上,也被演示者戴在手上。这是「人戴采集、机装执行」同构主张最直接的画面证据。

能力指向 · 采集与执行的硬件同构官方章节 · Omnibody Hand官方
原片 26.0s · GIF 节选 传送带分拣抛投演示
sorting-2 传送带分拣

两只机械臂从移动传送带上抓取物体并抛入料箱。

能力指向 · 动态目标 + 高速节拍官方章节 · Conclusion官方
原片 16.5s 双臂拧开编织软管接头
unscrew 拧开软管接头

装在机械臂上的 Omnibody Hand 在传送带上方拧开编织软管接头,另一臂扶稳组件

能力指向 · 双臂分工 + 旋拧官方章节 · 功能灵巧性官方
原片 107.8s · GIF 节选 拔开以太网连接器卡扣
ethernet-unplug 拔网线卡扣

两臂用 Omnibody Hand 抓住连接器两侧并拔开;需极精确按压卡扣才能释放。被创始人点名为「deceptively hard」。

能力指向 · 精细接触 + 力控官方章节 · 多模态原生采样率官方
原片 13.6s 人形机器人取件并抛掷
pick-and-toss 取件抛投

人形机器人从料架取件并抛掷一旁。

能力指向 · 人形 + 动态抛掷官方章节 · Conclusion官方
原片 158.6s · GIF 节选 四臂协同手机包装长程任务
iphone-long 手机包装长程任务

手机包装长程任务,发布中展示四臂协同(quadmanual)。是 9 段视频中时长最长的一段。

能力指向 · 长程 + 多机协作官方章节 · 多模态原生采样率官方
原片 16.5s 双臂折叠床单
laundry 折叠床单

两臂在洗衣店折叠床单。原片 16.5 s 与官方文案「约 17 秒」一致,是唯一可交叉验证时长的演示。

能力指向 · 柔性物体 + 长程官方章节 · Conclusion官方
原片 10.5s 人形拉开冰箱门取饮料
fridge 开冰箱取物

人形拉开完全关闭的不锈钢冰箱门并伸手取饮料。

能力指向 · 未知负载 + 抗扰控制官方章节 · 控制层独立时钟官方
另见 · bartending 发布合集内

倒酒液、加冰、摇壶、拔瓶塞、倒入杯中,一次性完成。该片段出现在官方发布视频中,官网博文未提供独立 mp4,故无 GIF。

能力指向 · 长程多步骤官方章节 · 发布视频官方
GIF 的制作口径(可复现,避免误读)
  • 来源:全部取自官网博文的官方 mp4 直链(/blog/OM-1/videos/*-720-h264-labeled.mp4),未做任何裁剪或变速。
  • 转制:ffmpeg 降采样至宽 320 px、96 色、4.5–7 fps。因此 GIF 比原片卡顿,不代表官方帧率;原片为 60 fps。
  • 节选说明sorting-2ethernet-unplugiphone-long 三段因原片过长(26 s / 107.8 s / 158.6 s),GIF 采用均匀抽样的多片段拼接,非连续播放。其余 6 段为完整时长。
  • 保真度:GIF 保留了原片的水印与「labeled」标注层,可作为官方「1× 速度」主张的原始证据。
  • 体积:9 个 GIF 合计约 12 MB,单个 0.7–1.8 MB,均已启用懒加载;单个文件均 < 2 MB,可直接用于微信公众号动图(上限 10 MB)。
  • 原始 mp4 与官方视频:全部 9 个 mp4 已本地留存;完整发布合集见 YouTube 官方视频

4.6 时间线

2019–2020
触觉与姿态估计积累
Chen Wang 在 MIT CSAIL(GelSight 组)做 SwingBot(IROS 2020 最佳论文);DenseFusion(CVPR 2019)、6-PACK(ICRA 2020)。旁证
2021–2022
腿足自适应 + 全身控制
RMA(RSS 2021)、Deep Whole-Body Control(CoRL 2022, Oral / Best Systems Finalist)。Zipeng Fu 在 CMU → Stanford。旁证
2023
跨本体与人类数据两条线并行
Robot Parkour Learning(CoRL 2023);MimicPlay / Sequential Dexterity / VoxPoser(CoRL 2023);Open X-Embodiment(ICRA 2024)。旁证
2024-03 / 2024-06
DexCap 问世(OM-1 的技术原点)
arXiv 预印本 → RSS 2024。便携 mocap 采人类灵巧操作,吞吐约 3× 遥操作,30 分钟人类数据学会新任务。官方引用旁证
2024-11
Mobile ALOHA / HumanPlus / UMI on Legs
同届 CoRL 三连。Zipeng Fu 在其中两篇为共同一作,并参与 UMI on Legs。旁证
2025
Reward AI 成立
LinkedIn 公司页标注 Founded 2025;Chen Wang 2025-06 斯坦福 CS 博士毕业。官方
2026-09-14
走出隐身,发布 OM-1
官网 + 官方 X/LinkedIn 同步首发;公布 Omnibody 全栈与 9 段演示;英伟达 Jim Fan 评论「So smooth」;X 帖 >2000 赞。官方旁证
未公布(官方预告)
quadmanual → 混合机器人团队;人形全身操作与导航
官方原话:「beginning with quadmanual manipulation … and extending to mixed teams that read each other's intent, hand off objects, divide roles, and recover together」;「OM-1 can power humanoids to do whole-body manipulation and navigation. More on this later.官方

05商业化战略与现状

5.1 现状:可以确认的事实

维度状态性质
融资完全未披露——金额、轮次、投资方均无。第三方行业通讯明确指出「截至本次发布,Reward 的官网尚未披露融资金额和投资方」旁证
客户 / 部署未披露任何客户名、部署数量或试点旁证
定价 / 时间表无商业化时间表、无定价旁证
开放策略模型权重、代码、数据集、API 全部内部保留;无论文发表;官方要求引用形式为「blog article」旁证
团队规模11–50 人;招聘邮箱 careers@rewardai.com 在官网显著位置官方
本体合作公开材料中未点名本体厂商。有一条待核实的第三方线索指向 Flexiv(非夕)Rizon 臂参与过演示,未能二次核实推断·待核实

5.2 战略信号:从官方措辞里读出来的东西

官方表述(原文)解读性质
「Efficiency is ROI. ROI is what gets robots deployed.」 把「效率」直接定义成投资回报。这不是研究者的措辞,是卖给工厂的措辞官方
「If other models look faster, check the corner of the frame: 2x, sometimes 5x.」 主动挑起「速度造假」议题,把 1× 原速做成品牌资产。攻击性定位官方
「Every clip we publish runs at 1x speed, clearly labeled.」 同上,写进了 About 页的方法论部分,不是临时公关话术官方
「can be dropped onto whatever robots already stand on a customer's floor 不卖本体。目标客户是已经买了机器人的工厂 / 集成商 —— 存量设备升级,而不是卖新硬件官方
「A robot earns its place in a factory, a kitchen, or a warehouse …」 目标场景:工厂、厨房、仓库。与演示任务(3C 包装、传送带分拣、折衣、调酒)一致官方
「beginning with quadmanual manipulation … extending to mixed teams」 多机协作是差异化叙事:瞄准「单臂干不了的活」(搬家具、大件装配、高峰期厨房)官方
「demonstrations we collect today will still be training robot bodies that haven't been designed yet」 数据资产论:数据不随硬件换代贬值,而是升值。这是给投资人和客户的双重叙事官方

5.3 商业化路径推断

本报告判断(推断,非官方确认)

大概率路径:B2B,向已有机器人存量的客户提供「策略 + 控制层」的部署/授权,同时可能出租或销售 Omnibody Hand 采集设备用于客户现场采任务数据。推理链条:

  1. 不开源、无 API → 排除了「做社区标准/生态平台」的路子,价值捕获必须发生在交付环节。
  2. 「drop onto whatever robots already stand on a customer's floor」→ 明确不造本体,因此收入不可能靠硬件整机,只能靠软件能力 + 采集设备。
  3. 「Efficiency is ROI」+ 反复强调节拍 → 卖点是替代人工的每小时产出,计价方式很可能是按部署站点/机器人数量,而非按 token 或按模型调用。
  4. 招聘邮箱置顶 + 11–50 人规模 + 刚走出隐身 → 处于「建交付能力」而非「建销售网络」的阶段,近期更可能是少数深度试点而非广铺。

核心壁垒判断:不是模型本身,而是「采集设备—数据接口—控制层」这条闭环。任何一环缺了,跨本体就退化成普通 VLA。这也意味着:他们的护城河高度依赖 Omnibody Hand 的可制造性与成本——而这恰恰是公开信息里最薄的一环。

5.4 竞争格局定位

路线代表公司数据入口性质
人手可穿戴采集
(Reward 所在)
Reward AI 7-DoF 功能手 + 触觉/接近/力 + EM 追踪;功能性中间路线——比 2-DoF 表达力强,比 20+ DoF 同构更解耦官方旁证
同上 · 最贴近的对手 Sunday Robotics
(Tony Zhao + Cheng Chi)
Skill Capture Glove:更简单的 2-DoF 平行夹爪式;强调手套与自研 Memo 机器人手的几何与传感器对应;主攻家务(折衣)旁证
严格同构路线 X Square Robot(深圳) TwinDEX:9-DoF 外骨骼,通过与配套三指机器人手严格物理同构来消除具身鸿沟旁证
互联网视频预训练 Dyna Robotics(Dyna-2)
Rhoda AI(DVA)
海量网络/人类视频预训练 + 任务数据后训练。Rhoda 报告最大模型 100 秒内无人介入完成率 84.7%旁证
VLA / 基础模型 Physical Intelligence(π0)
Gemini Robotics 1.5 / 2
Skild AI(S1)、Generalist(GEN-1.5)
开放机器人数据集 + 遥操作 + 合成数据混合。Gemini Robotics 2 称可用数小时、通常 <200 个样本适配新双臂机器人旁证
数据基础设施 XDOF(GELLO 系)、Mecka AI 把采集/清洗/标注/质控外包成服务;XDOF 6 月披露 7000 万美元融资并开源 ABC-130K(13 万条双臂轨迹 / 195 类任务)旁证

06关键风险与待验证清单

七条风险
  1. 所有性能指标均为公司自测。唯一可量化的数字(24.9 → 9.5 mm)测的是采集端追踪误差,不是任务成功率。第三方(Humanoids Daily、humanoid.guide)均明确指出:无大规模成功率数据、无论文、无开源。旁证
  2. 「Any Body」的边界需要澄清。官方视频 aria-label 显示,跨本体演示中的人形与工业臂都装了 Omnibody Hand。若「零样本跨本体」的前提是本体必须装上同一只手,那么它的适用范围与「随便什么机器人即插即用」之间存在口径差。这是本报告认为最值得向官方追问的一点。官方素材推断
  3. 无第三方复现路径。权重、代码、数据集、API 全不开放,外界无法独立验证。旁证
  4. 融资不透明。无金额、无投资方,无法评估 runway 与可获得算力。在一个「算力即壁垒」的赛道里,这是重大信息缺口。旁证
  5. 「<30 分钟」容易被误读。第三方通讯特别澄清:这指的是演示数据量,不是端到端训练耗时。旁证
  6. 长期运行稳定性未验证。行业对标的是「99.9% uptime」,而实验室演示与产线连续运行之间还有很长的路——这也是 Skild AI 等公司公开挑战「demo culture」的核心论点。旁证
  7. 采集设备的规模化未验证。Omnibody Hand 集成了 7-DoF 机构、触觉阵列、接近传感、全局快门相机、EM 追踪——它的成本、良率、耐用性、标定流程,是整条路线能否规模化的物理瓶颈,而官方对此零披露。推断

未来 3–12 个月观察清单

  • 是否发布论文或完整技术报告(当前引用形式仍是 blog article)
  • 是否给出标准化成功率与失败案例(而非仅演示视频)
  • 是否出现第三方测试、客户部署或试点披露
  • 是否披露融资金额与投资方
  • 是否开放 API / 权重 / 数据集
  • quadmanual 多机协作与人形全身操作 + 导航的后续进展(官方已预告 "More on this later")
  • Omnibody Hand 是否会单独对外(销售/租赁/开源硬件)

07附录:核心信息源速查

#来源URL性质
S04OM-1 技术博文(一级来源)rewardai.com/blog/OM-1/官方
S02About us(CEO 署名)rewardai.com/about/官方
S11Zipeng Fu 首发帖LinkedIn · zipengfu官方
S12Zipeng Fu 个人主页 / CVzipengfu.github.io官方
S14Chen Wang 个人主页chenwangjeremy.net官方
S16DexCap(RSS 2024)项目页dex-cap.github.io旁证
S24UMI(RSS 2024)项目页umi-gripper.github.io旁证
S35Humanoids Daily · 走出隐身报道humanoidsdaily.com旁证
S36RuntimeWire · OM-1 发布runtimewire.com旁证
S42腾讯新闻 · Mobile ALOHA 作者新模型new.qq.com旁证
S44SOURCEMIND · 北美具身公司名单行业通讯(明确指出融资未披露)旁证
报告生成:2026-09-19 | 调研口径:公开信息(官网 / 官方社媒 / 学术论文与项目页 / 第三方媒体)
报告中标注 官方 的内容来自 Reward AI 官方渠道或其创始人本人署名内容;标注 旁证 的内容来自学术论文、项目页或第三方媒体/档案;标注 推断 的内容为本报告基于上述材料的推理,未经官方确认。
本报告不构成任何投资建议。所有性能数据在获第三方独立复现前,应视为公司自述。