如果一家公司宣布自己拥有100万小时机器人数据,应该怎么看?
先别急着被“100万”打动。
8月31日,在觅蜂科技媒体群访现场,盖世具身智能把这个问题直接抛给了觅蜂科技董事长兼CEO姚卯青:抛开小时数,怎么判断一家公司的具身数据到底有没有价值?
他的回答反而给“百万小时”这个数字泼了一盆冷水:“盲目地采集100万小时说实话还是很容易做到的事情,重复地做工种任务就可以了,但几乎没有任何价值。”
这或许才是“百万小时”之后,具身数据产业真正需要面对的问题。
第一篇讨论过,机器人如果要进入开放世界,需要远超今天规模的数据;第二篇讨论的则是,当需求从百万小时走向千万、亿小时,数据生产正在从数采工厂扩展到社区、家庭和真实工作岗位。
可规模一旦真正上来,新的问题就会迅速出现:有数据,不等于有训练数据。
一名员工戴着设备工作3小时,硬盘里当然会多出3小时视频。
但这3小时里,人有没有真正执行任务?手有没有离开画面?动作轨迹准不准?场景是不是已经采过无数遍?模型究竟能从里面学到什么?
如果这些问题没有解决,那么具身智能可能很快从“缺数据”,走向另一个极端:拥有海量数据,却不知道哪些值得训练。
所以,百万小时之后,数据行业真正开始竞争的,很可能不是“采”,而是“炼”。
“100小时视频”和“100小时训练数据”,不是一回事
具身数据最容易产生的误区,是把摄像头运行时间直接理解成数据资产。
二者实际上相差很远。
姚卯青在群访中解释所谓“有效数据”时,给出了几个非常基础、甚至有些琐碎的例子:
如果采集过程中手根本不在画面里,不能用;人戴着设备却长时间“摸鱼”、没有动作,也不能算;哪怕人在操作,做的事情本身也必须有意义。
然后才进入更加技术性的要求。
设备声称60FPS,实际平均帧率究竟能不能达到59.98、59.99;相机标定是否准确;HandPose提取出来的手部轨迹究竟是几厘米误差,还是能够压缩到5—7毫米;更重要的是,这些精度还必须能够通过真值进行验证。
换句话说,真实发生过,不代表真实记录对了。
这是具身数据和普通互联网视频非常不同的一点。
一段做饭视频即使少了几帧,人依然能看懂厨师在切菜。
但如果机器人需要从中学习动作,几帧误差可能意味着手的位置、接触时刻乃至物体状态发生偏差。
图像里“差不多”,到了机器人的控制系统里未必还是“差不多”。
所以,具身数据真正的生产过程,在摄像头停止录制之后其实才刚刚开始。
觅蜂现场披露的MEgo Engine,就是试图解决从Raw Data到Training Dataset之间的这段距离:原始数据要经过预处理、空间感知、原子化语义标注和质量评估,同时完成时间对齐、轨迹重建、人体关键点估计、任务拆解等处理。
先不讨论这套系统本身做得是否足够好,它至少说明了一件事:所谓具身数据公司,未来很可能不能只是一家“录像公司”。
真正的门槛,是把一段人类行为翻译成模型真正能够理解和调用的训练资产。
机器人学的不是“擦桌子”,而是擦桌子里的动作
这种翻译究竟是什么意思?
假设一个保洁人员佩戴设备,连续工作两个小时。
对人来说,这是一段完整而自然的劳动过程。
他走到桌边,拿起抹布,移动杯子,擦拭桌面,把垃圾丢进垃圾桶,再走向下一张桌子。
但模型很难直接从一段两小时长视频里知道:
哪一刻任务开始?
哪一段是在抓取?
什么时候发生了放置?
哪个动作属于擦拭?
哪一步失败之后发生了重新调整?
所以,第一步往往是把长时间的人类行为“拆开”。
觅蜂技术负责人刘力介绍,其系统会将小时级、甚至2—3小时连续数据拆解成不同层级的语义信息,从整体任务继续拆成子任务,再拆成更细的原子动作,目前其披露可识别120余种动作类型,例如摆放、释放、放置、抓握等。
这个过程其实揭示了具身数据真正有价值的单位可能是什么。
未必是“小时”。
它可能是一次抓取。
一次插入。
一次旋转。
一次失败后的重新尝试。
甚至是一段“伸手——接触——移动——释放”形成的完整交互链条。
这也是为什么单纯比较两家公司谁有100万小时、谁有200万小时,越来越缺乏意义。
一个数据集里可能充斥几十万小时相似动作;另一个虽然总量更少,却包含大量不同物体、不同环境以及可以复用的原子技能。
如果最终进入模型的是后者,那么“小时”很可能只是生产统计指标,而不是价值统计指标。
姚卯青在群访中也提到,目前客户首先会看场景,其次看HandPose等空间精度,再往后是动作与标签的描述精度;最终目标是数据能够直接进入模型,同时动作表现还要符合人正常工作的状态。
这意味着,具身数据行业正在经历一个很典型的变化:从“有没有”,进入“能不能直接用”。
甚至“坏数据”,也未必真的坏
但如果只是把低质量数据全部删除,事情依然没有那么简单。
这一点反而是觅蜂此次发布中比较值得讨论的技术思路。
在ManiEval数据质检体系里,觅蜂提出的原则不是简单“过滤”,而是:“不过滤,只分级。”
按照现场介绍,数据会从数据类型、任务类型、传感器质量、语义质量和动作质量等维度评分,再进入四种不同用途:精确数据用于策略模仿学习;语义和环境信息更加丰富的数据用于预训练和表征;包含环境干扰、动作偏差或部分失败的数据,则可以用于错误检测和任务进度感知;长尾边界数据则用于泛化测试和corner case能力增强。
这背后其实有一个很值得展开的问题:什么叫“坏数据”?
如果一个人在抓杯子时手滑了一下,从模仿学习的角度看,它当然不是一个值得机器人复制的标准动作。
但机器人未来进入真实世界之后,难道永远不会手滑吗?
如果模型从来没有见过失败,又如何知道失败正在发生?
更进一步,如果机器人拿杯子拿到一半发生偏移,它应该继续执行、重新抓取,还是直接终止任务?
这时候,一段“不成功”的人类动作,反而可能比1000次完全相同的成功动作更有价值。
这与自动驾驶行业曾经经历过的数据逻辑非常相似。
早期大家热衷比较测试里程。
但随着系统能力逐渐提高,真正稀缺的往往不再是正常直行一万公里,而是那些少见、困难甚至导致系统失败的corner case。
具身智能很可能也会经历同样的转变。
机器人会叠1000次完全相同的衣服之后,第1001次成功可能不会增加多少新的知识。
但突然换成一件特别柔软、特别滑、形状异常的衣服,机器人失败了。
这个失败,可能反而是一条更值得留下的数据。
所以数据产业未来的价值衡量,也可能逐渐从“采了多少成功动作”,变成:发现了多少模型原本不会的问题。
最有价值的数据,可能是机器人失败的那一刻
这一逻辑继续往前走,就会来到第三篇真正重要的地方:
数据不是一次性交付给模型之后就结束了。
真正成熟的数据体系,应该与机器人部署形成闭环。
觅蜂此次展示了一套相应思路:模型利用前期数据获得初步能力之后进入真机执行,机器人执行产生的数据再回流,系统从中寻找失败场景和困难场景,重新加入训练,然后更新模型策略。
其中REMORA Value Model试图进一步判断任务进度、发现异常动作,并把失败样本重新作为高价值数据使用。
当然,这里需要保持一点距离。
这套闭环目前仍然主要是觅蜂披露的技术路线和自身测试结果,它究竟能在不同机器人、不同模型和复杂真实部署中带来多大的稳定增益,还需要更多外部项目验证。
但这个方向本身非常重要。
因为它意味着具身数据产业最终可能从一种“库存生意”变成一种“反馈生意”。
过去的逻辑是:
采100万小时,整理好,然后卖掉。
未来可能变成模型先训练——机器人去工作——找到失败——判断为什么失败——重新采对应的数据——再训练。
到了这个阶段,一个机器人企业真正需要的数据,不再是供应商货架上“还有多少小时”。
而是我的机器人现在最缺哪一条数据?
这两个问题,差别巨大。
前者是按库存组织生产。
后者则是按模型能力缺口组织生产。
如果这一转变成立,未来具身数据行业最核心的能力,很可能也会随之变化。
能够一次性采到100万小时,当然是一种能力。
但真正更难的事情,是当机器人在一个陌生场景里失败之后,能够快速定位:
它为什么失败?
缺的是视觉理解?
空间轨迹?
某种物体交互经验?
还是根本没有见过这种边界情况?
然后再回到真实世界,准确补上这一块经验。
数据飞轮真正的“飞轮”,不是数据越来越多,而是模型越来越知道自己缺什么。
数据行业最终还是要回答一个问题:效果呢?
所以回过头来,怎么判断一家具身数据公司的数据真正有价值?
姚卯青在群访中的回答其实有三层。
第一,看覆盖够不够广,不能100万小时都在重复几个工种;第二,看能不能拿出详尽的质量验证报告;第三,看数据有没有真正被客户验收、签验收单甚至形成收入,因为市场付费本身也是一种验证。
这些指标都合理。
但从产业观察的角度,还应该再加上最后一层:模型效果。
数据最终不是为了卖数据。
甚至也不是为了做出一份漂亮的质量报告。
它最终应该回答的是:
模型用了以后,机器人究竟有什么变化?
成功率有没有提高?
过去做不了的任务是不是学会了?
换一个陌生场景还能不能工作?
发生错误之后能不能恢复?
同样增加1万小时数据,A数据集让成功率增加10个百分点,B数据集只提高1个百分点,那么即使两者都满足60FPS、毫米级精度和完整标签,它们对模型的真实价值仍然不同。
这也是目前整个具身数据行业仍然缺少的一块公开证据。
觅蜂此次展示了HandPose、数据治理、ManiEval和Value Model等能力,也公布了一系列技术指标。例如按照公司测试结果,其HandPose在特定遮挡、交互和高速移动测试中,手部重建误差达到4.29毫米,时序帧间抖动误差1.11毫米。
这些数字能够证明数据处理链路的一部分能力。
但它仍然不是最终答案。
算法把手的位置重建得更准,最终有没有让机器人把任务做得更好?
后者才是数据价值真正闭环的一刻。
今天具身智能产业热衷谈Scaling,这很容易理解。
百万小时、千万小时、亿小时,都是极具冲击力、也非常容易传播的数字。
但随着数据规模越来越大,行业迟早会进入一个新的阶段:
“有多少数据”会变得越来越不重要,“每增加一份数据,机器人究竟学会了什么”会变得越来越重要。
这可能也是具身数据产业真正的分水岭。
第一阶段,比的是谁能采。
第二阶段,比的是能规模化生产。
而到了第三阶段,竞争的问题可能变成:
谁更早知道,机器人下一步最应该学什么。
当行业走到这一步,“百万小时”就不再是终点,甚至不再是最重要的指标。
真正值钱的,不是数据仓库里又多了一小时。
而是这一小时,恰好补上了机器人原本不会的那件事。
声明:以上内容为本网站转自其它媒体,相关信息仅为传递更多企业信息之目的,不代表本网观点,亦不代表本网站赞同其观点或证实其内容的真实性。投资有风险,需谨慎。
Copyright (C) 1999- www.bandworld.cn, All Rights Reserved
版权所有 环球快报网 网站地图 备案号:皖ICP备2022015281号 邮箱:bgm1231@sina.com