前面有人发“百万小时数据,AI新弹药”,说得在理,但我觉得更值得盯的是这弹药怎么造出来的。严格来说灵初智能在全国铺数据采集中心、年底冲百万小时,这件事本身比数字更有看头,它说明具身智能的数据瓶颈已经逼着行业把数据采集做成了重资产生意。
大模型时代,语料能爬能买,谁有算力谁就能炼。可机器人要的是真实世界的动作数据,拧瓶盖、叠衣服,这些只能让人戴着设备一条条实采。嗯瓶颈从算力悄悄挪到了真实世界的数据产能。于是建采集中心、招采集员,人工智能创业头一回这么“重”,轻飘飘的算法公司开始干建厂招人的脏活累活。
还有个细节,他们开源了1000小时手部数据。这事儿没那么单纯。先开源,等于先定义“怎么采、采什么、什么格式”,标准定义权卡住了,后面整个生态的入口就在你手里。不是慈善,是抢地盘。
所以问题抛回来:当数据工厂变成实体资产,具身AI的护城河到底是模型还是那几座厂房?有更细的数据结构公开吗,还是只放了个样例集。