语料荒来了,这是过去两年几乎所有大模型团队都在承认的事。公开网页被洗了一遍又一遍,剩下能用的文本越来越薄。再一味靠「抓更多网页」已经补不上缺口,业界把目光转向了合成数据。问题是合成数据怎么造,才不会让模型越练越笨?
过去的主流做法是改写:让一个强模型把句子换种说法再写一遍,或者把一段长文拆开重排,再或者让两个模型互相对话生成新样本。这些做法确实能扩量,但有一个共同的隐忧——模型在学自己说过的话,越练越像自己的回声,泛化能力反而下降。
一、换一个角度看合成数据
新出现的研究把视角倒过来:不是让模型写新的文本,而是让模型重新构建一篇已经存在的论文背后的写作过程。一篇论文不是一段静态文字,它背后有一连串的心智动作——先有一个写作意图,再有一份全局计划,再有每一节动笔之前的反复推敲。
这些心智动作原本不会留在论文里。新方法用一个教师模型,把整篇论文逆向还原成它本来应该走过的步骤序列:先是请求,再是计划,最后是逐节的预写推敲。结果是,原始论文的每一段文字被原样保留,但它们前面多出了一段「我为什么这样写」的轨迹。
二、为什么论文是天然的训练场
把论文当作合成数据的原料有几个独特的好处。首先,论文的写作结构高度一致——摘要、引言、方法、实验、结论,几乎所有学科都套用类似骨架。这种一致性让逆向展开变得可操作。其次,论文本身就是「高质量文本」的代名词:经过了同行评审、经过了多轮修改、经过了学术规范的约束。
最后一个理由更实际:网页能抓的快抓完了,但全球每年发表的同行评审论文还在以百万计的速度增长,这是一个还没被完全消化的高质量文本池。
三、把过程变成训练样本
传统的合成数据只是把文字翻面——输入一段,输出一段同义改写。新方法把整个写作链条拉长为多轮生成:
- 第一轮:教师模型拿到一个写作请求,输出一份全局写作计划。
- 第二轮:拿到每一节的标题,输出该节动笔之前的推敲过程。
- 第三轮:才真正开始按计划写正文。
把这一整条轨迹当作训练样本,模型学到的就不只是「这段话长什么样」,还包括「为什么这一段要这样写」。这是把「结果数据」升级成「过程数据」的关键一步。
四、不止一篇论文可以这么拆
同一个逆向重建思路还能延伸出别的训练样本类型。把真实的论文正文当作答案,前面那套过程轨迹自然就变成了一个监督微调数据集。还可以把这种思路套到评估上:用一批论文作为任务源,让别的模型按论文要求写一段,再用一套打分细则评判写得是否到位——这就产出了一个带评分标准的学术写作基准。
一个数据构造管道,能同时产出预训练语料、微调样本、评测基准三套产物。这种「一鱼三吃」的效率,是过去改写式合成数据做不到的。
五、合成数据会不会教坏模型
这是合成数据领域的老问题。过去研究反复发现,如果只用自己生成的样本来训练,模型的输出多样性会单调下降,长尾能力会逐渐消失,常被叫做「模型崩溃」现象。
新方法的应对策略是:所有正文文本都来自真实论文原样保留,只让模型补充「写之前想什么」这部分心智过程。换句话说,文字层面的真实性由源论文背书,模型只是在填补原本不存在的元认知层。这种「原文不动、过程补全」的做法,理论上不会把模型锁死在自己的回声里。
六、真正决定效果的是质量过滤
把一篇论文展开成多轮生成轨迹,听起来简单,做起来工程量不小。源论文要经过严格的质量筛选——剔除低引用期刊、剔除明显机器生成痕迹、剔除结构不完整的稿件。然后教师模型必须足够强,才能在每一节的预写推敲中给出有信息量的展开,而不是写成空洞的套话。
实验结果显示,这种语料搭配后面的有监督微调,能在多个写作类评测上一致性地提高分数,而且不会损害通用推理和长文档阅读能力。这是一个好消息:过程级合成数据可以叠加在原有训练流程之上,不需要推翻重来。
七、从「抓数据」到「造数据」的拐点
过去十年,模型训练的主旋律是「数据越多越好」。这条路在公开网页这个池子里已经走到尽头。下一个十年的主旋律,会变成「数据怎么造才好」。
把论文逆向展开为多轮写作轨迹,只是这场转向里的一个具体尝试。它背后有一个更普遍的趋势:合成数据的单位,不再是句子,不再是段落,而是思维过程本身。当模型开始学着「想事情的过程」而不只是「事情的结果」,训练数据的形态也在从语料库悄悄变成方法库。
