2026 年 08 月 23 日
移动智能的 GPT-3 时刻
#周报

今天带孩子去上体能课。老师用几个拱门和锥桶搭了一条赛道:先推着球钻过拱门,再在锥桶之间绕八字,最后抱着球跑回起点。教法很简单,老师先领着孩子们一起走一遍路线,边走边讲每一步该怎么做,然后让孩子们从起点自己开始。中途做得不对的地方,老师会喊一声,指出细节让孩子留意。一般一两趟下来,孩子们就能完整地跑完全程了。
这个教法看着平常,仔细想想其实很有意思:孩子没有经过”训练”。他没有练一百遍,就是看了一遍、听了一遍,理解了任务的结构,然后就能上手做。这件事对一个两三岁的孩子来说太自然了,自然到我们不会觉得这是一种”能力”。但如果换成一个机器人,这几乎是做不到的——大部分机器人只会执行几类预先设定好的任务,你没法在现场教它一条新路线,让它把这条路线当场学会。
上周看到 Generalist 发布的 Gen 1.5,讲的也是这件事,他们把这个模型称为具身智能的 GPT-3 时刻。GPT-3 之所以被认为是一次分水岭,不是因为它某个 benchmark 刷得更高,而是因为它第一次让 few-shot in-context learning 变得可用:prompt 里给两三个例子,它就能做一件从没被专门训练过的新任务。教会它一个新任务的成本,从收集几千、几万条训练样本,塌缩成了几秒钟打字。Gen 1.5 想做的是同一件事发生在机器人身上:不用重新训练模型,只靠现场给的几个例子,就能让机器人上手一个新任务。
Gen 1.5 的核心能力可以拆成两块。第一块是 in-context learning,也就是现场用各种形式的 context 去定义任务,而不是从预设的任务库里选一个。这个 context 可以是语言,可以是图片,也可以是人类示教的视频——你录一段自己怎么擦桌子、怎么摆盘的视频给它看,它就能照着做,不需要为这个动作单独收集数据、单独训练。第二块是即兴能力,强调模型能根据手头现有的工具,或者当下的具体条件,灵活地把任务完成,而不是死板地套用一个固定的执行方式。手边没有专门的刷子,用香蕉也能把台子刷干净——这种在意料之外的情境下现场想办法的能力,才是真正让人觉得”这东西有点智能”的地方。
这两块能力放在一起,说的其实是同一件事:任务不再需要被提前枚举、提前训练,模型能够在见到任务的那一刻理解它,并且现场想办法完成它。这跟体能课老师教孩子走路线,是同构的——老师没有让孩子练一百遍这条特定的路线,孩子看一遍就懂了,遇到锥桶摆得歪一点、球滚偏一点,也能现场调整着完成。
我之前写过一篇「让智能走出家门」,当时更多是在畅想移动智能进入社会之后能做什么事:帮忘带充电器的同事去工位取东西,帮忙分发外卖到指定楼层,做安保巡检。那篇更偏向应用层面的想象。今天想往前推一步,具体想一想移动智能要走到”能被现场教会新任务”这一步,中间要经过哪几个层次,以及每个层次要怎么达成。
移动智能的几个层次
我把移动智能大致分成三层,判断标准是”换一个环境、换一种任务,要付多少代价”。
第一层,是依赖人工建图的预设导航。地图要先建好,语义目标要人工绑定坐标,换个场地就要重新部署。今天商用的送餐机器人、酒店配送机器人基本都在这一层,代价是每次进场都要投入数天到数周的现场工程。
第二层,是常规导航能力的齐备:跟人、寻物、按地图走、漫游、执行目标明确的指令,这些基本形式都能做,也能读懂门牌和路牌,能自己规划含楼层切换的路线。但这一层依然只能执行预先定义好的任务类型,你没法当场让它做一件训练时没见过的事。
第三层,也是我认为真正的分水岭,是 in-context learning 的出现——机器人能接受现场用语言、图片、演示定义的一个具体任务,并且不需要额外训练就能执行,哪怕这个任务在训练时从未被枚举过。这一层最大的变化不是能力清单变长了,而是获得新能力的方式彻底变了:适配一个新任务的成本,从”要花时间和数据”变成了”几乎不花代价”。这跟体能课的类比完全对得上:孩子不需要针对每一条新路线单独练习,看一遍就能上手;第一层和第二层的机器人做不到这一点,永远需要为新任务单独投入。
第一层和第二层是量的积累,是把已知的事情做得更全、更稳。第三层是质变——它决定了移动智能能不能真正走进普通人的生活,而不是只能待在几个被精心设置好的场景里打转。第一层和第二层决定它能不能用,第三层决定它是不是真正的智能。
第三层可以被哪些方式控制
第三层的关键在于,任务可以用很多种不同形式的 context 现场定义,而不是只支持一种固定的指令格式。目前能想到的形式大致有:
- 演示:带着机器人走一遍路线,或者录一段人怎么做这件事的视频给它看,它照着执行。这类信息量最大,同时包含了空间路径和时序节奏,体能课老师的教法本质上也是这一种。
- 语言指令:比如”先往左走,看到电梯后向右转”,指定的是路径序列而不是终点坐标,走法错了就算失败,即使最后到的地方是对的。语言指令也有粒度的概念,以上可能是十几米到几十米的粒度,我也可以有几米级别的粒度,如”绕着这几个桶蛇形走位,走到消防栓折返”。
- 图像或图文路径:在一张照片上画一条红线表示路线,模型要能分辨这条线是指令而不是场景内容,还要把 2D 的曲线映射到 3D 的自身路径上。
- 实时多模态交互:边走边说”左转”“这里绕一下”,难点不在语义理解,而在时序对齐和响应速度。
这个列表不追求穷尽,真实世界里人给指令的方式远比这个丰富。列出它们的目的是想说明,输入的通道需要足够宽——如果用户需要先学习”支持哪几种指令格式”才能用,那就还没到真正的第三层。
数据应该怎么构建
顺着这个逻辑往下想,数据该往哪个方向去收集,答案就比较清楚了:要追求人类的、各种各样的、多样的轨迹与任务数据。这里的因果链是直接的——数据足够多样,才能标注出多样的指令,模型才能学会输出多样的行为。数据本身不多样,指令标注不出来,模型自然也学不会。
这里有一条不太直觉但很重要的认知:当数据量足够大的时候,会自然出现大量合理但罕见的轨迹。这些轨迹不是噪声,也不需要被清洗掉,它们本身就是智能的一部分。原因很简单——我们今天可能根本想象不出某些情境会出现,但真的遇到那种情境时,就是需要那样处理才合理。一个人在真实场景里碰上一个没预料到的局面,当场做出的反应,恰恰是最有价值的数据,因为这种反应本来就没法被提前设计出来。模型的即兴能力,说到底就是这批数据带来的。
所以数据采集不能只在空地上让人走预设好的路线,也不能是在仿真器按照规则合成的视频,那样收集到的都是”表演出来的”轨迹,遇到真实场景时反而做不出对应的动作。真正有价值的是人在真实建筑里、真的要去某个地方时留下的轨迹——里面会包含犹豫、抬头看路牌、走错了往回走、等电梯、避让行人,这些细节恰恰是罕见轨迹和即兴反应的来源。真实性和多样性在这里其实是同一件事。
商业模式该怎么搭
真实数据的问题是,它不会凭空产生,必须先有机器人在真实场景里跑起来,才有真实的轨迹可以回流。这就决定了商业模式不能是”先把技术攻关到很成熟,再拿去卖”,而应该是一个闭环:选一个能接管的真实场景,用现有的能力低水平地进场(配合人工兜底),把跑出来的真实数据回流回去训练模型,模型能力变强之后,再扩大能接管的范围,或者进入下一个场景。
这个闭环里最关键的一步是选场景,而选场景本质上就是在选数据、选模型将来的能力边界。一个场景要满足几个条件才值得进:它要求的能力和最终想做到的目标场景是相似的(哪怕绕点路,也不能是条死路);哪怕只完成任务里的一个子环节,也能先进去开始跑;数据在隐私和合规上能被拿回来训练。比如办公楼的内勤配送就是一个不错的起点——楼层、电梯、走廊这些核心能力和大部分室内移动场景是共享的,而且”东西在我工位左边第二个柜子”“走后门别经过前台”这类现场定义的任务需求,每天都会自然产生,恰好是训练第三层能力最需要的那种数据。
这个模式不需要一开始就做到很高的成功率。哪怕机器人只能处理最高频、最简单的三成需求,剩下七成交给人来兜底,商业上依然能成立——一家酒店可以从十个保洁员变成七个保洁员加三个机器人,同时这三成的任务持续产出真实数据,反过来推动能力往上走。技术攻关和商业化不是先后关系,而是同一个循环的两面。
结语
回到体能课的场景。孩子能一遍学会一条新路线,不是因为他天生擅长走路线,而是因为他具备了两个更基础的能力:一是能通过别人现场给的几个例子理解一件新任务是什么(in-context learning),二是遇到锥桶摆歪了、球滚偏了这种意料之外的小状况,也能现场调整着把任务完成(即兴)。
移动智能想要走出被精心设置好的场景,走进真正意义上的日常生活,关键不在于机器人的动作有多稳、地图建得有多细,而在于智能本身——尤其是这两种能力。few-shot learning 让机器人不再需要为每一个新任务单独收集数据、单独训练;即兴让它在面对没被设计过的情况时,依然能想办法把事情做完。这两点合在一起,才是移动智能真正意义上的 GPT-3 时刻。
参考
- Generalist Team. GEN-1.5: Embodied Foundation Models are One-Shot Learners. Aug 2026. generalistai.com/blog/gen-1.5
- Physical Intelligence. π0.7: a Steerable Model with Emergent Capabilities. Apr 2026. pi.website/blog/pi07
- Physical Intelligence. π*0.6: a VLA that Learns from Experience. Nov 2025. pi.website/blog/pistar06
- 黄青虬(墨奇智能 CTO). 具身是一场马拉松,VLA 和世界模型都不够本质. 漫谈 Light the Star #82, Aug 2026.
- Wang Kaixuan. 让智能走出家门. Mar 2026. wang-kx.github.io