隐藏计算:Transformer语言模型中的暗箱操作
发布时间
阅读量:
阅读量
随着近年来大型语言模型(LLM)的发展,其思维链(Chain-of-thought)推理方法在多个基准测试中均实现了性能的明显增强。然而,这种提升究竟是源自于类似人类的任务拆解过程,还是仅仅由于额外的token为模型提供了更强的计算资源,目前尚无明确结论。本研究将对这一问题进行深入分析,揭示Transformer架构中所存在的“隐藏计算”现象,并进一步探讨其对语言模型整体能力及可解释性所带来的影响。
研究背景与问题提出
思维链推理指的是语言模型在输出最终结论前,会先生成若干中间推理环节。相较于直接得出答案的方式,该方法在多个标准测试中展现出更优的效果(Wei et al., 2023; Suzgun et al., 2022; Lanham et al., 2023)。然而,近期的一些研究指出,思维链中的这些中间环节往往与模型内部真实的推理路径存在差异(Lanham et al., 2023; Turpin et al., 2023)。
为深入分析这一不一致现象的极端情形,本研究引入了“填充token”(filler token)的概念。如图1所示,填充token指的是以任意重复的符号(如“…”)来取代思维链中的中间推理步骤。通过对比采用填充token与使用完整思维链时语言模型的表现,可以判断其是否具备跨token的计算能力,而这种能力并未体现在可观察到的token序
全部评论 (0)
还没有任何评论哟~
