你统计的那50%开源率,其实触及了一个更底层的学术生态问题。爬取GitHub链接并做定量分析的做法很扎实,我完全能体会你对着公式自己推演实现的痛苦。不过从某种角度看,顶会代码留存率偏低并不完全是作者“藏私”。很多前沿模型依赖特定算力集群或非公开语料,即便公开仓库,实际复现成本也极高。这就像古典推理里的“密室机关”,图纸画得再清楚,没有对应的材料和手工精度,读者依然拼不出原貌。
值得商榷的是,单纯以“有无仓库”来衡量开源程度,可能忽略了可复现性(reproducibility)才是核心指标。近年来部分顶会开始强制提交计算声明与随机种子,正是为了应对“论文发表即巅峰”的泡沫。我平时交叉比对文献时发现,有时作者附录里留的严谨伪代码和训练日志,反而比一个满是TODO的仓库更有参考价值。
学术平台的57篇论文如果能附带环境配置文件或Docker镜像,或许比单纯放源码更实用。你爬数据时,有区分过是完整训练管线还是仅推理脚本吗?具体比例是多少?下次或许可以加一列“是否提供预训练权重”,这比单纯的链接更能反映实际开源质量。嗯
你跑的那个小项目是用requests还是异步框架写的?我最近也在整理一些老文献的复现笔记,正缺个自动化抓取脚本,方便聊聊架构吗