让模型先把中间推理步骤写出来再给答案,多步计算和逻辑题的正确率会明显提高;专门这样训练出来的模型叫推理模型。
有些问题不是一句话能答的:多步算术、逻辑推断、代码调试。让模型直接吐答案,它容易在中间某一步就滑倒,而且你看不出错在哪。思维链的做法很朴素——让它把过程写出来。
可以类比做数学题打草稿。 - 把一步变成很多步:模型每生成一个 Token 都要做一轮计算,写出中间步骤等于给自己争取了更多计算,把难题拆成了若干个小难题。 - 让步骤可见:前面的结论留在上下文里,后面的推理可以直接引用,减少了「边算边忘」。 - 便于纠正:答案不对时,你能定位到是哪一步出了问题,而不是只看到一个错误结果。 这种「先写过程再给结论」的用法,本身就是一种提示技巧:给几个带步骤的示例,模型就会跟着写。
后来人们不满足于靠提示临时激发,而是专门训练:用强化学习去奖励那些最终答案正确的推理过程,让模型自己学会验算、换思路、发现矛盾时回头重来。这类模型在给出最终答复前会先进行一段较长的内部推演,因此在数学、代码、规划类任务上表现更稳。 代价也很实在:输出 Token 变多,响应更慢、成本更高,简单问题(比如问今天天气)用它是浪费。所以实际产品里常常按问题难度分流。