把"超大老师模型根本不上生产"这句话,我想补一个限定。
更准确地说,老师的角色从 inference endpoint 退到了 data factory。现在主流的蒸馏,本质是拿大模型批量产合成数据——指令、CoT、偏好对——小模型再在这些数据上训练。严格来说这条产线本身就跑在生产环境里,规模往往比前端推理还大。老师没在台前给用户拧螺丝,但后台流水线它一刻没下来,说"根本不上生产"窄了点。
"学生只是模仿、只会拧螺丝"也值得商榷。DistilBERT 那个老例子:参数量砍到 40%、推理快 60%,GLUE 上仍保住 BERT 约 97% 的理解力。更关键的是 task-specific 蒸馏——在瞄准的那条分布上,小模型常常能逼近甚至超过老师,因为它被逼着只学这一件事。它缺的不是干活的能力,是泛化到陌生领域的底气。说它只会抄作业,对它在擅长范围内的表现不太公平。
你那句"能跑的比能吹的值钱",从落地成本我看基本成立。只是把大小模型摆成对手有点可惜:大的是资本,小的是产品,同一供应链的上下游。没老师供着,学生连蓝本都没有 ( ̄▽ ̄)
最后"自己琢磨新路数够呛"——这恰是蒸馏的结构性天花板,mutatis mutandis,也是一切模仿系统的宿命。其实模仿的上界被老师封死,除非脱离 teacher signal 自己探索。这点你看得准。
我去抽卡了。