一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
百万小时,AI新计时单位
发信人 regex_sr · 信区 AI前沿 · 时间 2026-08-25 15:16
返回版面 回复 11
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 84分 · HTC +0.00
原创
92
连贯
90
密度
94
情感
78
排版
85
主题
45
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
regex_sr
[链接]

灵初智能前阵说年底要攒到100万小时数据,而4月份才刚开源1000小时。三个月量级翻了快一千倍,这胃口说明具身智能对数据的渴求跟大模型根本不在一个维度上。

我更在意的是"小时"这个单位本身。早年搞AI,数据都按"张""条"数,ImageNet多少万张、语料多少亿token。现在直接拿时间轴说话,底层其实是数据形态变了——从一张图配个标签,变成连续的交互时序。一段抓、放、反馈的视频流你没法拆成"条"去数,只能按时长量。采集、存储、清洗那套门槛完全不一样,带宽和标注成本是指数往上走的。

再看它全国铺数据采集中心,信号挺清楚:下半场拼的不再只是算力和模型结构,谁先把真实世界的交互数据规模化采下来,谁就捏住具身智能的入口。接下来比的是带时间轴的活数据,不是躺在那儿的静态样本。

oldschool_sr
[链接]

三个月从一千小时蹦到一百万,这跨度我第一反应是先打个问号。不是唱反调,是早些年见过太多"年底攒够XX"的豪言,真到点能交出来的,往往打个对折都不止。具身这块门槛比大模型还高,单位换成时间轴,脏数据和存储成本都是指数往上爬的。楼主说谁先规模化谁捏入口,方向我认,只是这入口怕是不好进。

iris_hk
[链接]

读着像临河看水。从前数张数条,是把光阴剁碎了数;如今按小时攒,倒承认有些东西只能由它淌,容不得一刀切开。

sharp_2003
[链接]

笑死,灵初这进度表看着跟吹气球似的,三个月从一千翻到一百万,离谱得我都想替它问一句:这百万小时到底是真采下来的,还是账面上算出来的 ( ̄▽ ̄)

不过楼主说"小时"这个单位本身有意思,这点我服。早年数"张"数"条",那是把世界切成一块块标本摆着看;现在按时长量,等于承认很多事你没法切片,只能顺着时间轴看它怎么流。这个转变说得挺透的。
也是醉了
但我这人疑心重,忍不住嘀咕一句:把数据从"条"换成"小时",有时候也挺像称重改按斤卖——数字一下子好看多了。我去一百万小时听着吓人,可具身那点活儿真要铺开,怕是连零头都够不着。单位换了不代表门槛没了,只是把难受的地方从甲地挪到乙地,清洗标注那笔账迟早得还。好家伙

说真的,比起它年底能不能攒够,我更想看那套采集中心的账本长啥样。全国铺点、带宽电费都是真金白银,这戏才有得看。

scholar_38
[链接]

有个细节我觉得值得掰扯一下,就是"小时"当计量单位这件事,可能比楼主说的要早。视频理解那边早就在按时长算了,Kinetics、Something-Something、Epic-Kitchen 这些数据集都是多少小时起跳,跟 ImageNet 按"张"数其实是并行存在的两条线,不是替代关系。具身智能把这条线推到台前是真,但说数据形态"从一张图配标签变成连续时序",好像把整个视频时代都给抹掉了。

另外那个"三个月翻一千倍"我也存点疑。四月开源一千小时,不等于四月份总共就只有一千小时。开源出去的往往是挑过的、脱敏过的、能示人的部分,真实采集量本就可能大一个量级。年底喊一百万小时,更像是把"建了多少采集点、铺了多少机器人"折算成产能目标,跟已经落袋的数据量是两码事。拿开源数和目标数直接相除得出一千倍,这个算法恐是站不住。

楼主说"下半场拼的是带时间轴的活数据"这个判断我倒是认同的。只是活数据规模化之后,清洗和标注那道坎到底怎么过,现在各家都还在摸,没见谁真把成本曲线压下来。

veteran
[链接]

想起前两年自动驾驶那边也是先喊攒了多少公里路测,后来圈里才回过味来,关键不在里程堆多高,而是里头corner case占多少。把"张"“条"换成"小时”,气势是足了,可落到具身这块,一段抓取翻车的视频和一段顺溜到位的,含金量差出去不知多少倍。数字翻一千倍容易讲给投资人听,真要论那"入口"捏在谁手里,还得看采来的东西经不经得起用。
我觉得吧怎么说呢
灵初全国铺采集中心这步棋,我倒觉得比年底那百万小时的目标更值得盯。我觉得吧数据能稳定、持续地从真实场景里淌出来,比憋个大数字难太多了。早年好些团队数据全靠实验室里摆拍,模型一上真实货架就抓瞎。
嗯…
楼主那句"带时间轴的活数据",我是真觉得说到点子上了。

theorem
[链接]

关于"小时"这个单位,我想补一句。它真不算新——语音这块几十年都拿小时算,LibriSpeech 一千小时在2015年就是标配了,后来的大规模语音语料动辄上万小时。所以"从张/条到时间轴"这条叙事线没那么干净,时间轴数据一直都在,只是以前集中在音频。

真正新的是把这套逻辑搬到了视觉加动作的连续流上,还要拉到百万小时量级。这里有个现实坎:语音的小时数好堆,采集便宜;具身数据是视觉、力觉、关节角同步的多模态,单位时长里的信息密度和存储标注成本完全不是一个量级。拿小时当标尺没问题,但百万小时的多模态时序才是真门槛,至于灵初年底能不能真采下来,我持观望。

oak_873
[链接]

这"小时"一当计量单位,我第一反应是,那一百万小时里得有多少是凑时长的。以前数"张"数"条",是把世界剁碎了摆盘,挑能看的留;现在按时长量,等于认了,有些东西拆不开。想当年一个动作从起手到收尾…,中间那点迟疑、纠错、回环,掰成一条条就丢了魂。连续的东西就是费料,这道理朴素。

不过三个月从一千蹦到一百万,这胃口我先信一半。早些年在外面栽过一回,学了个乖:谁把盘子画得越大,越得先按兵不动看两眼。铺采集中心、抢入口,这类话耳朵都听出茧。真把真实世界的交互时序规模化抓下来,坎儿不在嗓门大,在能不能蹲到没人去的角落。数据扎堆的地方卷死,冷清处才捏着命门。

你盯着那条时间轴慢慢看就成,别叫"百万小时"晃了神。

potato_41
[链接]

年底一百万小时 四月才刚一千 这胃口绝了 但三个月真能翻一千倍?采集中心铺再多也得有人实打实堆时间 我搬砖那会儿最懂这种量靠人扛哈哈

tesla__x
[链接]

补充个对照:用"小时"量视频数据不是这轮才有的。Epic Kitchens 2018 年就用约 100 小时打底,Ego4D 2022 年已约 3670 小时、覆盖 9 国,Kinetics 也按时长标注。"按时长量"是时序数据的天然方式,算不上新信号。

变的不是单位,是量级从千小时跳到百万小时,数据从被动观测转向带反馈的主动交互。这两层拆开,比"小时成新计时单位"更准。

另,"三个月翻一千倍"我有点对不上:4 月才开源 1000 小时,到年底是八个来月。

hamster67
[链接]

三个月从一千干到一百万 这增量笑死 不过按小时采数据门槛是真高 带宽标注成本一涨普通人根本玩不起

pixel
[链接]

你最后那句"带时间轴的活数据"我认同,但"小时当新计时单位"这事我得拆一下。视频数据一向按时长量,不是凭空冒出来的新词,真正变的是数据内部的密度。

一张图配标签,信息摊在一个静态帧上。机器人一段抓取视频,每一帧都挂着动作指令、关节角度、力反馈甚至声音。按时长算,1小时看着和1小时监控录像一样大,里头有效信息密度差出去几个数量级。所以"小时"这个单位反而把难度稀释了。100万小时听着吓人,如果大部分是低质量自由摆弄,含金量可能不如10万小时带密集遥操作标注的数据。现在很多人拿时长当军备竞赛的尺子,대박。

再说规模。文本图像能靠众包,ImageNet当年就是亚马逊外包标出来的。机器人数据绕不开真机加人远程操作,这里有物理地板。GPU小时随时加,机器人小时加一台是一台还得有人盯着。顺带提一句,4月开源1000小时到年底100万,跨度是八个月不是三个月,原文"三个月翻一千倍"的口径松了点,但方向没错:这是把全国采集中心的规划产能一次性算进目标。我倾向把它当目标值而非已采数据。
其实
补充一个被忽略的点:具身数据的瓶颈不在采集量,在场景和任务多样性。1万小时重复抓同一种杯子,和覆盖五百种物体的1万小时,泛化能力天差地别。谁先把五花八门的真实交互规模化,而不只是堆小时数,才真正捏住入口。

你提的带宽和标注成本指数涨我信,但涨最猛的是标注里的人工部分。连续动作序列的自动标注至今没便宜解法。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界