把两个语言模型摆到一起互相辩论、互相挑错,听起来像比单模型自查更可靠的做法——可现实正好相反。一项受控事实核查评测发现,辩论流程在常见基准上的事实错误率,比单模型独立自查还要高 12 至 18 个百分点。问题不在哪个模型更聪明,而在辩论这个机制本身:当核查变成表演,受影响的不是被反驳的那一方,而是整个流程。
过去两年,多智能体框架被普遍宣传成一种「自带纠错」的范式。把一个生成器、一个批评者、再加一个裁判拼起来,听起来像一道工序完善的质量检测流水线。新研究却把这条流水线拆开检验,结论并不讨喜:批评者与生成器共享同一类训练信号,它们既不真正「对立」,也没有独立的「事实」。结果就是,辩论更像合奏,而非质询。
一、为什么辩论看起来很美
多智能体辩论的支持者有一个直觉论据:如果两个独立推理者在结论上撞车,那结论多半是可靠的;如果它们在关键事实上互相反驳,至少有一方会暴露错误。听起来符合科学共同体的运作方式——多视角、多压力、多轮争辩,错误自然被挤压出去。
这一直觉在人类世界里被反复验证。但当「辩论者」是两个训练目标几乎一致的语言模型时,这套机制就失去了前提条件:两个「观点」并不是独立采样,它们来自同一份预训练分布、相似的对齐微调、相近的解码策略。让这样的两个模型互相辩论,更像是让一个人复述自己的话。
二、这场评测做了什么
研究者用了超过 4000 条事实性问题,每一条都附带可机器核对的真值。他们设计了三种流程:
- 单模型独立自查:模型生成答案后,再被要求自己列出可能的事实错误并修订;
- 双模型辩论:两个模型各自作答,再轮流批评对方立场,迭代若干轮;
- 三模型陪审团:在辩论之上再加一名「裁判」,由裁判整合双方论点。
关键设计是:所有流程共用同一对底层模型、同一组解码参数、同一份系统提示,以确保差异只来自流程结构,而非模型本身的强弱。
评判指标也不是笼统的「答得对不对」,而是被拆成了三件事——最终结论是否命中真值、回答是否引入了新错误、以及辩论过程中是否出现了可以被观察到的「修正动作」。第三项是关键:辩论流程常常给出「看起来更好」的答案,却没在中间真的修订任何事实,错误只是被重述得更顺畅了。
三、最反直觉的数字
单模型独立自查的事实错误率约为 19%;双模型辩论约为 31%;三模型陪审团约为 27%。也就是说,加入辩论者,反而比单模型自查多错 12 个百分点,即便再加一名裁判,也只比纯辩论流程略好,远未追平独立自查。
更值得玩味的是「修正动作」的统计。在辩论流程里,只有约 3.4% 的轮次真正修订了上一轮的事实错误;剩下的都是「进一步解释」「换个例子」「调整语气」之类的话术修补。换句话说,辩论更像在打磨措辞,而非在核实事实。
研究者写道——当所有参与者共享同一类训练信号,「辩论」在形式上是对抗,在信号空间里却是高度相关的同分布采样。
四、为什么辩论会放大错误
有三个机制被点出来。
第一,重复即确证。当一个错误陈述被两个模型都重复一遍,它不再像「孤立幻觉」,而像「共识」。后续读者会把这次共识当成事实,辩论不仅没消除幻觉,反而给它穿上了合议制的外衣。
第二,措辞升级。为了反驳对方,模型会主动加上限定词、来源提示、「据多项研究」一类话术。这些修辞听起来更可信,但常常并没有对应的真实来源,于是事实错误被语义化的外衣掩盖。
第三,裁判被同化。第三名裁判在裁决时倾向于采纳「更连贯的那一方」,而连贯性高不等于事实正确。结果是裁判不是在核查事实,而是在判定谁更会辩论。
五、自查为什么反而更稳
单模型独立自查之所以更可靠,并不是因为这个模型「更诚实」,而是因为它被要求把同一段答案读两遍:一遍作为生成者,一遍作为怀疑者。这两遍之间存在时间错位,使得「我刚说过的话」和「我现在要挑错的话」之间有一个可被利用的不一致空间。
而辩论流程把这个空间抹平了。两个模型实时看到对方的回答,为了不显得「前后不一」,它们会主动收敛到同一种叙事。这种收敛不是事实对齐,而是表态对齐。在事实核查场景里,这种对齐是有害的。
它意味着什么
多智能体框架仍然是工程上的好工具——它在角色扮演、规划拆解、长任务分阶段执行上确实有用。但「让两个模型互相辩论来提高事实正确率」这种用法,并不是机制问题,是被高估了。
真正可靠的核查流程,需要的不是更多参与者,而是来自外部的事实锚点:检索增强、可执行的工具调用、对真值独立可核验的引用结构。在这类锚点被补齐之前,靠「模型之间的互相批评」去逼近事实,更像一个被包装得很漂亮的回音壁。
这也是为什么这一轮评测值得记住——多智能体不是答案,多源、多工具、可验证的外部信号才是。当核查流程被设计得足够独立于模型的措辞偏好,事实错误率才真正开始下降。
本站编辑整理,资料来源公开网络。如有错误欢迎指正。