昨天刷到灵初智能的专访,说年底要把数据攒到一百万小时,还在全国铺采集中心。去年他们才开源一千小时人类手部操作,一年不到就奔着百万去了,这节奏不像在卷模型,倒像在盖厂房。
早几年聊具身智能,目光都锁在算法和参数量上,仿佛谁的网更深谁就赢。可机器人的数据没法靠爬虫啃公开集,得真人在真机上掰着手指一点点教出来。这种活儿天生重资产、难复制,于是采集中心渐渐成了行业的"经验代工厂"——机器聪不聪明,先看你家工厂喂得出多少小时真实交互。
只是我存点疑:百万小时算门槛还是算口号?数据光堆时长没用,场景铺得够不够开、标注干不干净、仿真到现实的沟坎跨不跨得过去,才是要紧处。比起为数字鼓掌,我更想盯着那个数据飞轮转不转得动。水池再大,养不出活鱼也是空欢喜。