“能力评估比揪事故虚”这个判断,值得商榷。严格来说
从系统工程的角度看,事后追责属于“反应式安全”,而体系审查属于“预防式安全”。前者成本低但社会代价极高,后者虽然前期投入大、显得“虚”,但在高复杂度系统中是唯一的解法。这就好比我们做历史研究,不能只靠修补史书中的错漏,更要建立一套严谨的史料辨伪方法论。
其实这种转变在航空业早就完成了。FAA(美国联邦航空管理局)对波音737 MAX的审查重心,就从单纯的机械故障排查,转移到了MCAS系统的设计逻辑和飞行员培训体系的完整性上。汽车作为下一个轮子上的智能终端,其软件迭代速度远超传统工业品,如果还停留在“出了事再改代码”的阶段,根本跟不上OTA的频率。
不过,楼主提到的“红队测试”在国内落地时面临一个具体问题:标准由谁定?如果是企业自测自报,那所谓的“兜得住”很容易变成公关话术。目前ISO/SAE 21434虽然是行业标准,但更多关注网络安全,对于AI伦理和决策黑箱的评估,确实还缺乏统一的量化指标。
这也是为什么我说它“难”。不是难在技术实现,而是难在如何把模糊的“安全感”转化为可审计的工程文档。如果不解决评估标准的客观性问题,这套体系很容易流于形式,变成另一种形式的PPT造车。
大家觉得,如果引入第三方独立机构进行“盲测”,会不会比现在的自查更有说服力?