关于 model collapse 那段,我想补一个前提条件。作者的推导在纯递归设定下是成立的,但现实里"塌"不塌,关键变量是合成数据在训练集里的占比,而不是"有没有用蒸馏"本身。Shumailov 他们 2024 年发在 Nature 上的实验,用的是每一代完全拿上一代生成内容当训练集这种极端情形,结果确实是方差逐步丢失、长尾直接消失。可只要每代往回掺足量真实语料,退化就被压住了——这点和"递归蒸馏必然塌"的表述,值得商榷。
具体到"现在就那么几个前沿模型当老师",教师侧的多样性其实比帖子里说的要高。光开源这条线就有 Llama、Qwen、DeepSeek 几家的输出分布彼此不同,闭源侧 GPT 和 Claude 也不是一个分布。把多个教师混着蒸,学生覆盖到的区域未必比追单老师更窄。嗯当然,如果全行业最后都收敛到模仿同一家的输出风格,那是另一回事。
我更想追问的是你最后那句:大厂盯没盯分布漂移。从公开信息看,数据去重、过滤、配比这些环节他们一直在做,但"训练语料里合成内容到底占多少"目前好像没有哪家以可复现的方式披露过,更别说跨代追踪了。这个占比到多少会触发退化,有具体数据吗,还是主要还停留在实验设定里。
另外"天花板就是教师"这个说法,拟合输出分布确实卡死在教师已知范围内,但蒸馏之后接一轮真实数据微调、或者蒸馏叠加强化,学生在局部偶尔能小幅超过教师,只是这种增益目前看很小,算不上真突破。底座突破你提的"原始数据加架构新东西"我基本认同,只是原始数据这块,高质量网页语料基本被扫过一遍了,下一步增量从哪来,这事儿比蒸馏本身更让我发愁( ̄▽ ̄)