• 周日. 9 月 13th, 2026

小模型为何学不会老师的「慢思考」

小晶体与大晶体的折射对比:暗夜蓝背景下,一颗发光玻璃球与一座透明晶阵并置,象征小模型无法承载大模型思考链路的结构差异

当一个 70B 的「会慢思考」模型被压成 1.5B 的小模型,表面上还能答题,但凡是涉及多步串联推理的问题,准确率往往跌掉一半。这种现象反复出现在公开榜单和近期几篇系统测量里。它不是简单的「参数变少了所以变笨」,而是知识从大尺度表征向小尺度蒸馏时被结构性地切除了一段——这段恰好是慢思考最依赖的部分。

一、慢思考是什么,为什么难「教」

慢思考并不是写得长。它指的是模型在回答前先在内部走过若干中间步骤:拆解子目标、验证中间假设、选择下一步工具。这条内部轨迹会消耗大量激活与计算,但能换来在高难度任务上明显高于直觉式的正确率。

对小模型来说,难点在于链条中每一步都依赖于前一步的中间状态。模型容量越小,留给「保留中间状态、跨步骤对照」的预算越紧。这不是「装不下答案」的问题,而是「装不下思考过程」的问题。

二、蒸馏时丢了什么

常见蒸馏流程会把大模型的输出概率作为软标签,让学生模型拟合。但这里有一个根本性的错位:老师模型的「思考过程」分散在几十层前向计算里,并不在输出那一行上。学生模型只能看到结论,模仿不到那条生成结论的路径。

结果就是,小模型可以学会结论的语言形式,却没法复现达成结论所需的多步串联。它在单步判断、模式匹配类题目上和老师差距不大,可一旦问题被刻意改写成需要逐步验证的形态——比如多跳推理、几何反推、复杂代码调试——准确率就出现断崖。

三、为什么「再多数据」也补不上

一种直觉是给学生模型灌入更多长链条样本,让它照着模仿。但测量显示这条路线的收益递减很快:链条越长,学生模型与老师的差距越大;当链条超过某个长度,学生的表现会落到接近纯直觉猜测的水平。

原因是,模仿长链条需要的是「维持中间状态并选择下一步」的能力,这种能力本身取决于网络深度和隐藏维度,而不是训练样本数量。样本可以教会模型「在某一步给出特定字符串」,却没法教会模型「保留一个尚未使用的中间结论,等到第三步再调用它」。这是结构问题,不是经验问题。

四、能力继承的天花板

把不同参数规模蒸馏后的能力继承比画成曲线,会看到几条规律。简单模式识别和语言风格可以近乎无损地传递;中等难度的多步任务会损失 20% 至 40%;高难度的、需要三步以上自我校验的任务,损失经常超过一半,并且这种损失在更小的学生模型上不是线性放大,而是断崖式出现。

这也解释了为什么当业内尝试用更大的老师模型去教更小的学生时,能力的传递比并不按老师模型规模线性增长。换言之,老师变聪明并不会自动让学生变聪明——除非学生自身的容量足以承载那条思考链。

五、这改变了什么

对落地端来说,这意味着「把大模型压成小模型上设备」是有上限的。可以压,但压不走慢思考。实际工程里,常见做法是反过来:保留云端的大模型做规划与校验,把小模型放在端侧做模式匹配与本地决策。这种「云端慢、本地快」的分工,与其说是工程妥协,不如说是对蒸馏能力边界的一种尊重。

对研究端来说,这意味着提升小模型推理能力的关键不是堆叠更多长链条数据,而是想办法把思考过程「外化」——让模型把中间状态写成显式文本、调用外部工具、把长链条拆成多次短链条分别执行。这些做法绕开了学生容量的硬约束,把慢思考从「内部表征」转译成了「外部流程」。

这种结构差异决定了,未来一段时间内,端侧小模型和云端大模型不会是简单替代关系,而是不同形态的协作者。理解这条边界,比单纯追求参数量缩减更有意义。

admin77

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注