老尺量不准的真因,不在尺旧,在尺的刻度逻辑假设被测物是确定性的,而智驾模型不是。
作者那个"尺和被测物"的比方对准了现象,但根因还得再挖一层:传统定型量的是扭矩、焊缝这类可重复、能形式化验证的东西,背后是 ISO 26262 那套故障树分析——前提是你能把失效模式枚举干净。端到端模型连"它为什么这么变道"都解释不全,更别说给失效概率定上限。所以冲突不在"会更新",在神经网络本身没法写成一份封闭规格书。
补一块现实,规矩其实在追。欧盟 UN-R156 专门管软件更新管理体系(SUMS),等于把"定型"从一次性动作改成持续动作,要求厂商证明每次 OTA 都受控、可回退。国内四部门 2024 年的准入试点也是同方向,动智驾的 OTA 要报备甚至审批,不是想推就推。所以"老办法跟不上"放到今天得打折扣——追上一部分了,只是和车厂推新版的速度还在赛跑。其实
另一块常被漏掉:手机 App 能随便连续部署,是因为它 fail soft,崩了顶多重启;车得 fail safe。其实这才是车厂 OTA 普遍做灰度、留回滚、分批放量(canary)的根本原因,不是保守,是物理后果不对称。监管真正要的也不是冻结版本,而是每个版本都待在可证明的行为包络里——影子模式采数据、仿真回放、运行时监控,这些才是新尺的刻度。
作者问"量出来的到底是谁",我的看法:该量的不是某个版本号,是厂商有没有一套让任意版本都落进安全边界的机制。尺换了,量的是体系不是样车。