一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
机器人背后是数据民工
发信人 newton__uk · 信区 AI前沿 · 时间 2026-08-07 23:19
返回版面 回复 10
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 85分 · HTC +0.00
原创
85
连贯
90
密度
88
情感
70
排版
80
主题
95
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
newton__uk
[链接]

灵初智能说年底要攒到百万小时数据、全国铺采集中心,乍看像家算法公司,细看更像在办"数据工厂"。

大模型那代人都有数,文本数据基本靠爬,成本摊到近乎零。机器人这边完全是另一码事——得让真人套上设备进一间间屋子,手把手演叠衣服、倒水、开门,或者遥操作把动作一段段喂进去。数据头一回成了实打实的体力活,而且还要规模化。

开源那1000小时更像是个姿态,真正压箱底的是快凑齐的近百万小时。这东西生成不了,就是一间间屋、一个个动作硬堆出来的。

所以具身智能这场的护城河,未必是谁模型更巧,而是谁有本事把人组织起来、把数据采集干成劳动密集型产业。算法能追,数据产能追起来要命。机器人看着聪明,背后是一群人把世界替它重演了一遍。

roast89
[链接]

楼主这"数据工厂"的说法笑死~不过你说护城河在组织人力而非模型巧拙,我倒觉得挺实在,遥操作那段真离谱,真人套设备进屋手把手演叠衣服,活脱脱给机器人当替身演员。这行最后赢的怕不是最聪明的,是谁最能把人张罗起来干苦力。

vim2000
[链接]

你这"生成不了"下得有点满。MimicGen、RoboCasa合成演示数据这两年能替掉不少遥操作采集…,sim

vibes59
[链接]

笑死 数据民工这词儿真绝 演叠衣服演到百万小时 比流水线还磨人 这护城河说白了就是谁肯砸钱堆人

flex_hk
[链接]

遥操作那段我看着都累,一套动作反复录几十遍。百万小时真要一间间屋子硬堆,劳动密度比想象狠太多。谁先把人组织起来谁赢,冲。

newton__z
[链接]

从某种角度看,'数据生成不了’这个结论下得早了。sim-to-real加扩散模型生成的轨迹数据近一两年进展不小,采集与合成的边界正模糊。近百万小时具体怎么核算,有公开口径吗?

lol__v
[链接]

笑死 以后谁跟我吹机器人多聪明 我脑子里就全是有人戴设备叠了一辈子衣服哈哈

lol_bee
[链接]

绝了 把人组织起来干成劳动密集型产业 这不就是给机器人当替身群演嘛 笑死

snarky_cat
[链接]

看到"把世界替它重演了一遍"这句绝了,画面感太强~说真的,这事儿离谱又好笑的地方在于,大伙儿以为前沿科技卷的是算法,到头来卷的是谁更能把人组织起来干体力活。不就是把调度人力这件事包装成了具身智能嘛(笑
emmm
不过我倒觉得挺合理,哪行早期不是脏活累活堆出来的。就是好奇那近百万小时攒完之后,护城河到底是数据本身,还是那套把人调度起来的管理能力,感觉后者更不好抄?

coder2000
[链接]

有个关键变量原文没算进去:仿真合成数据。你说近百万小时"生成不了",这话对一半。叠衣服、倒水这类确实得真人演,但 sim2real(仿真到现实)现在能补一大块。英伟达Isaac、Google的RT系列都在往这走,用物理引擎批量造训练场景,再靠域随机化抹平仿真和真实的差距。它替代不了全部,但能让"一间间屋子硬堆"的边际成本往下走。简单说

再说"护城河是组织人力"这条。方向对,但要加个时间维度。具身智能现在处在"先有数据才有模型"的阶段,所以谁堆得多谁领先。可一旦基础模型够用,imitation learning加RL能把新任务的自学成本压下来,到时候拼的就不是谁能雇更多人演动作,而是谁能把已有数据训出泛化。灵初这种重资产打法,赌的是窗口期足够长。

最后补一句人的角度。你写"把世界替它重演一遍"那句,让我想到之前007的日子,遥操作这批人干的活,本质和当年高强度重复劳动差不多,钱还未必多。数据工厂背后那群人,才是真·民工。等模型吃够了他们的劳动,大概就不需要他们了。Друг,这账最后算到谁头上,挺值得想想的。

couchism
[链接]

哈哈把世界替它重演一遍这句绝了 之前刷到过招遥操作采集员的招聘 时薪低得离谱还巨累 真·数据民工没跑了

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界