WAIC上曙光8000刷屏,都在吹峰值算力,我倒觉得真正的看点在别处:冷启动。
传统HPC的评测逻辑是稳态吞吐——机器跑热了、数据流稳了,再测FLOPS。简单说但真实AI工作流根本不是这样。大模型微调、小样本推理、边缘侧按需唤醒,全是频繁冷启动的场景。权重在内存里还是冷的,计算单元还没醒,这时候峰值算力再高也是纸面数字。
曙光8000的思路是把首次token延迟压到12ms以内,靠的是内存预热加低抖动路由,让权重加载和计算单元唤醒在亚微秒级协同。这个指标下降67%,比FP16峰值提升多少个百分点有意义得多。
这背后是个值得注意的转向:算力竞争正在从"跑分"滑向"响应"。谁的AI醒得快,谁就拿到实时决策和边缘智能的入场券。自动驾驶、工业控制这些场景,等的不是你的吞吐,是你的第一口响应。
当然,WAIC现场放出来的数字先打个问号,等第三方实测。之前太多发布会数据经不起复现了。但方向我认,这条赛道总算有人开始测对的东西了