新智元报道
新智元报道

早晨,你还没睁眼,厨房里已经传来轻微的碰瓷声。
推门出去,机器人管家X1站在餐桌旁,你没说话,它就把把椅子轻轻拉开了一点。
你把门一关,它转身走向客厅,捏起那根逗猫棒。
猫伏低身子,尾巴一下一下拍地。逗猫棒上的羽毛刚晃到半空,猫就蹿起来扑了过去。
最后一瞬,X1把手臂一抬,猫爪擦着空气划了过去。它的手腕又轻轻一抖,羽毛荡回猫鼻尖,猫翻身再扑,它再躲开。几个回合下来,它已经摸透了这只猫的脾气。
晚上你推开门,一句「我回来啦」还没落地,X1已经夹着拖鞋迎上来,送上专属问候:「公主,请换鞋。」
这就是大家梦寐以求的个性化家庭服务——一个能够适应你的习惯、理解你的家庭环境、为你量身定制服务的机器人管家。
但逗猫的手法、回家的「迎接仪式」——每家每户都不一样。这些东西出厂时预装不了,也穷举不完。
最简单的办法,是你亲自演示一遍给它看。看完,它就会。
为此,诺因(Knowin)发布了生成式学习框架GLOW(Generative Learning of World)。
原文链接:https://knowinai.com/tech.html
他们认为机器人能否走进千家万户,关键在于机器人「理解人的技能、泛化执行」。
这背后就是他们独特的判断:
家庭场景的商业化不会从通用能力开始,而会从有限、高频、可验证的任务集合切入。
而且家中有老人、儿童、宠物,有明火和化学品,安全是进入家庭的准入门槛,而不是加分项。
话不多说,我们先看一下「一教就会」效果如何。
诺因公布了四组实机对照,每组左边是人的操作过程,右边是机器人学完之后自己做。
第一组是开盒收纳。
人示范的时候收的是一样东西,但机器人执行的时候,要收的物品换了另一种。
它先开盖,并且能够泛化识别物品和位置发生变化,再把东西放进盒子,最后合盖,一气呵成。
|
|
左:人展示开盒收纳;右:机器人换了物品照做(加速4.5倍)
请注意,动作只教了一次,机器人需要利用现场反馈完成每个阶段,成功将收纳这一动作泛化到多种物体和位置。
第二组是浇花。
人用的是黑色细嘴壶,但机器人手边只有一把绿色浇水壶。
壶的大小、颜色、位置发生变化,但它能够准确认出,把从人的操作中学到的抓持、朝向和倾斜关系用到这把壶上,浇完再放回去。
|
|
左:人用黑色细嘴壶浇水;右:机器人换成绿色浇水壶照做(加速3.5倍)
也就是说,机器人学会的是执行浇花这一任务,而不是简单重复看到的教学动作,能够适应场景中的变化。
第三组是擦桌子,也是最有意思的一组。
人拿着抹布,沿心形轨迹擦了一遍,机器人学完,也擦出了一个心形。
|
|
左:人沿心形轨迹擦桌;右:机器人复现(加速3.5倍)
它把「擦桌子」这个目标和「怎么擦」这个人的习惯一起学走了。「公主,请换鞋」这种梗,靠的就是这个。
第四组是调酒。
桌上摆着好几个杯子,人先按顺序倒了一遍,让机器人看清先倒哪杯、再倒哪杯。
机器人学完,虽然位置顺序变了,但准确识别物品,依次取杯、倾倒、回正、放回,把多个步骤接成了一套完整的流程。
|
|
左:人依次取杯调酒;右:机器人复现完整流程(加速12倍)
四组任务,模型权重没有动过一个参数。看过人的操作过程,机器人就能上手,一教就会,并且能泛化到更多位置、物品和场景。
在任务中,AI要协同调用多种能力:识别对象与动作,定位操作目标,判断交互结果,规划下一步。
此外,模型还要具备对物体和位置的泛化能力。
在诺因测试中,GLOW能力斩获三个榜单第一,用数字也证明了其泛化能力之强。
在RoboDojo的18项复杂任务里,GLOW平均成功率62.2%,而 GPT-6(Robocurve)是22.2%,提升了40个百分点。
在专治「背题」的LIBERO-Pro上,GLOW成绩为86.7%,GPT-6 Astra只有58%,单模型这一档86.7的平均分排第一。
在 Embodied Arena 的 2D-Embodied QA Benchmarks 榜单中,在 20 个具身模型中,GLOW以 65.62 的综合得分勇夺第 1,脱颖而出。
机器人观看人的操作视频时,用一个技能编码器把连续的视觉经验压成一份可复用的技能上下文。
它提取的是任务结构,也就是哪个东西是操作对象、要放到哪个区域、动作的先后顺序是什么,以及做到什么样才算完成。
浇水的六个阶段。上排是人用黑色细嘴壶浇水,下排是机器人把抓持、朝向、倾斜的关系映射到绿色浇水壶上
执行时,这份上下文和当前画面、语言指令、机器人状态拼在一起,逐token生成判断和动作。
GLOW还能结合当前的实时观察,把你昨天的「教学」融入当下的自回归生成中。
它会自主规划路线,避开茶几上的水杯,打开盒子。你还可以用语言随时调整目标和做法。
能这么干,前提是大脑和双手在同一个模型里。
行业里常见的VLA路线,把视觉大模型当个编码器,外接一个动作模块,中间要做复杂的表示转换。
WAM路线则要先生成一段未来的「逼真视频画面」,再输出动作,计算开销很大。
GLOW的核心KnowinGlow是一个原生统一的自回归模型,把视觉、语言、动作编织进同一条序列。
BrainSkill负责空间理解和语义落地,ActSkill负责闭环动作生成,原来分开的「大脑」和「双手」,现在是同一个模型里的两项技能。
它的上下文里装着相机的实时RGB-D画面、你说的那句指令、机械臂当前的关节角度和夹爪开合,以及刚才一秒执行了什么动作、得到了什么反馈。
GLOW把这些物理世界的信息像文字一样连缀成一篇「长文章」,然后顺理成章地续写出下一个动作。
物理推理测试。图中彩色线条是候选动作轨迹,问「为了烹饪番茄该选哪组顺序」,模型答:切番茄、打开炉火、揭开锅盖、倒油、放入番茄
续写出来的也不是「move_to(cup)」这种模糊指令。
模型直接生成末端执行器的三维位姿、相对平移与旋转增量,以及夹爪的开合控制,精准到毫米。
目标点定位测试。左:「把橙色积木放到绿色积木上」,模型给出目标点[[368,664]];右:「在蓝色杯子与青色碗之间的空闲区域标出位置」,模型给出[[534,800]]
而诺因选择这条路线,看中的不只是「教一遍就会」,还有统一建模与持续学习的长期价值。
而GPT-6 Astra在操作机器人上的最新进展,则进一步佐证了诺因长期坚持的自回归技术路线。

学会了,还得做得成。真实的物理世界里,抽屉可能卡住,杯子也可能从夹爪里滑出去,光有计划不够。
这一点上,诺因直接把刚被Brockman叫作AGI的GPT-6 Astra拉进了同一个仿真厨房。
结果,号称AGI的GPT-6,卡在了一个抽屉上。只因它不知道自己的手有没有被挡住。
但GLOW知道。它有一套叫Harness的任务运行系统,每做一个动作都会拿到一份执行回执。
比如系统下达「向柜体走24.3毫米」,回执显示实际只走了1.6毫米。
位移残差一出来,系统立刻明白遇到物理阻力了。这个「受阻」结果连同夹爪状态和新画面一起进入下一轮上下文。
大脑随即决定,是继续用力,还是换个姿态重来。
同样的任务、同样的起点,让GLOW和GPT-6 Astra各做一遍,差别就出来了。
开柜子最底层的抽屉,GPT-6 Astra手伸过去拉开的是上面那层,纠正了1200步,底层抽屉还是关着的。
GLOW靠回执发现受阻,换成水平接近、夹爪对角闭合,1138步,开对了。
|
|
开最底层抽屉。左:GPT-6 Astra,1200步没开开;右:GLOW,1138步开对(录像加速10倍)
抓瓶放碗,GPT-6 Astra折腾了863步,瓶子和碗还差3.4厘米,判定阈值是3厘米。
GLOW 157步,间距6.9毫米。
|
|
抓瓶放碗。左:GPT-6 Astra,863步(加速7倍);右:GLOW,157步
靠近瓶颈、碗沿或抽屉把手时,GLOW会切换成每次只动5毫米的有界小幅移动,两次微调之间重新看一眼。
抓住杯子之后它也不会直接走,而是先请求抬升30毫米,看物体是否跟着夹爪动,确认夹牢了才进入搬运。
开抽屉前也会「试拉」,确认牵引力已经建立。
这种物理试探,像极了人类的本能。
GPT-6 Astra控机器人并不弱。Robocurve把它接上双臂,积木入碗20次成了19次,全网刷屏。
但同一份测试的后半截,毫米级的拼图入槽,20次只成了2次。
看懂任务,和能完成任务,中间隔着一只有「痛觉」的手。
通用大模型的路线是采集海量人类数据、训练、发布、再采集。
可在非标、复杂的每个用户家庭里,很难去采集海量数据。
GLOW的解法是自己造数据。
造数据的引擎叫KnowinDream。它按户型、家具和物品生成一个个虚拟家庭,再往里安排各种事件,比如家人把杯子挪走,或者在机器人搬东西的时候从旁边经过。
KnowinDream按提示词连续改场景:换光照、换成赛博朋克霓虹、再换成中式餐厅
真机跑出来的经验也会喂给它。X1逗猫成功了,或者抓杯子滑了一下,这些成功、失败与恢复的过程都会回流到KnowinDream。
它把当时的场景重建出来,再扩增成更多相似的情况,交给KnowinWorld推演验证。
KnowinWorld · 双臂模拟交互。场景、任务、多视角与动作结果构成连续具身经验
到现在,KnowinDream已经生成了大约200M条这样的数据。
KnowinWorld不需要耗费巨大算力去生成视频画面,它只做纯粹的物理状态推演。
这样它能在极低成本下,在脑内进行千百万次试错。
叠碗任务
最关键的一步是校准「进化机制」本身。
机器人真实执行的结果,会与 KnowinWorld 之前的预测对照,偏差用来持续校准模型。这些真实反馈也会回流到数据生成链路,修正合成数据、标签与筛选标准。
更强的基模,会生成更准确的数据与标签;更高质量的数据,又会训练出更强的下一代基模。新的基模再反过来提升下一轮数据生成、标注和验证的质量。
由此形成「模型变强 → 数据变好 → 下一代模型更强 → 数据进一步变好」的递归增强闭环。
诺因把这叫面向物理世界的递归自我改进(RSI):改进后的模型,会反过来增强下一轮自我改进的能力。
安全闸门也设在这一环。每一次能力升级,都要先在世界模型里验证,通过任务完成率、恢复率与安全回归三道检查才会实装。
一旦发现退步,立刻回滚。
诺因不打算让机器人一进家门就「什么都能做」。他们会先从有限、高频、能验证安全的任务切入。
家里有老人、儿童、宠物(比如开头那只猫)、明火和化学品,安全是准入门槛。
门槛之上,决定谁能真正走进千家万户的,是「一教就会」这种交付方式。
工程师不用上门采集数据、重新微调,你演示一遍就行。
2026年的这个9月,GPT-6 Astra证明了通用大模型的认知能力已经触及物理世界的边缘。
GLOW则走通了另一条路。
架构统一到自回归,世界模型不追求画面逼真、只求决策有用,数据也从被动采集变成真实执行回流的RSI闭环。
从陪猫玩新玩具,到收纳你独有的私人物品,「一教就会」打通了从流水线工具到个性化家庭专属管家的最后一公里。
X1折叠起来收纳高度不到40厘米,计划明年发布。
到时候,你想让它说什么、怎么擦桌子,教一遍就行。
编辑:大卫 摩西












