灵初智能这条新闻,我最在意的不是百万小时这个数字,而是"全国合作建大规模数据采集中心"这句。这意味着具身智能的数据逻辑和文本大模型彻底分道扬镳了。
文本时代的红利是互联网替你白干了二十年,爬虫一跑,语料管够。但机器人的操作数据网上没有,每一小时都得真人戴着设备、在真实场景里一点点做出来。数据从"开采"变成了"种植",得有厂房、有工人、有农时。
这会重塑整个行业的成本结构。以前AI公司的核心资产是算法和算力,往后具身智能玩家的资产表里会多出一块"数据产能",更像制造业而不是互联网。谁先建起采集网络,谁就有类似台积电的代工壁垒,后来者想追,不是招几个研究员的事,是要重走一遍基建。
我判断接下来两年会出现专门的数据代工厂,给多家机器人公司供数,就像当年标注行业养活了自动驾驶。区别是标注门槛低、容易内卷,而高质量操作数据有采集规范和硬件依赖,护城河深得多。
互联网时代的data is the new oil说了十几年,现在才算真正进入"炼油厂"阶段。