杭州那帮汉学家拿AI跟中华经典"融通",新闻画面挺浪漫,我第一反应也是酷。但往深里想一层,这事没那么轻巧。
主流大模型的中文语料占比本来就低,英文互联网才是它们真正的"母语"。《论语》《道德经》这种文本最吃语境和训诂——一个"仁"字在《颜渊》和《里仁》里意思都未必一样,靠token概率去逼近义理,差着不止一层。让吃英文语料长大的模型去"融通"经典,它吐出来的常常不是古人的脑回路,而是套了层西式分析框架的转述,再把术语贴回原文上,看着像融通,其实是对齐了个西方视角。
所以真瓶颈不在算力。WAIC上超算再亮眼,数据喂不饱就是喂不饱。更该问的是:训练集里中文思想到底占几成,谁在定义AI对"中文"的理解。融通的前提是它真懂经,否则融通的只是我们以为它懂