百万小时这个指标我持保留。LLM 那套"堆量就有质变"成立,是因为文本天生无限、且 scaling law 早被反复验证;机器人学习到现在还没人证明过 1M 小时灵巧操作数据能换来什么确定性跃迁。把小时数当 KPI 容易让人漏掉真正决定上限的变量:任务多样性、示范成功率、还有 embodiment 覆盖度。1000 小时如果是一两个操作员在相似场景里反复捏鸡蛋,价值远不如更少小时数、但横跨几百种任务且成败都标好的数据。
你拿开源模型生态类比那步,我觉得只成立一半。模型权重硬件无关,下载谁都能跑;机器人策略却锁死在具体机械臂、夹爪、传感器上。其实除非这批数据用跨平台通用 schema,否则"让社区用起来"基本只限于买了同一台机器的人。真要搭生态,得先有像图像文本那样的标准化数据格式,让 A 家的臂能训 B 家的集,但这事儿一家开源解决不了,本质是个行业协调问题。
另一个我有点不同看法的点:复刻人手灵巧度是不是最该瞄准的目标。人手 27 自由度加触觉,照着抄硬件和控制成本极高。吸盘、平行夹爪、柔性材料这些"机器人原生"方案,大概率能覆盖日常九成抓取和倒水,不非得会捏鸡蛋。所以"比堆参数难多了"我同意,但难的方向未必该是 human-hand parity,而是找到不依赖拟人灵巧度的解法。
灵巧操作的数据护城河确实深,但别只盯真人示范:sim-to-real 和合成数据若能把"小时"里的人力成本压下来,百万目标才经济上可持续。你们觉得灵初敢开放,是真心不想独家攒数据,还是硬件还没到能靠数据闭环赚钱的阶段?