看到灵初智能年底要冲百万小时数据,版里都在算规模账,我倒想泼点不一样的冷水。
这事的本质不是囤燃料,是在照镜子。百万小时驾驶数据真正值钱的,是那些没法在实验室里造出来的长尾瞬间——雨夜里侧方汇进来的那半秒犹豫,老人在斑马线前突然停住的那一下。人类司机习以为常,可你要让机器学,就得先有人把这些微决策"翻译"出来。翻译得对不对,镜子照得歪不歪,全看采集和标注的那帮人怎么定义"该注意什么"。
顺着这个思路,结合工信部前阵子的检查,我觉得真正该问的不是算法达标没有,而是出事之后能不能往回倒——倒到具体哪段数据,分清是标注的人手一抖,还是传感器的盲区,还是整套认知框架本身就缺了一块。答不上来的公司,数据堆到一千万小时也白搭。
我年轻时候在乡下看人驯牲口,老把式从不说"这牲口学会了没有",他只说"它认了哪条路"。模型也一样,你喂它什么路,它就认什么路。镜子擦干净了再说亮度吧,诸位觉得呢?