首页 / AI 百科 / 思维链与推理模型

思维链与推理模型Chain-of-Thought and Reasoning Models

推理优化

让模型先把中间推理步骤写出来再给答案,多步计算和逻辑题的正确率会明显提高;专门这样训练出来的模型叫推理模型。

有些问题不是一句话能答的:多步算术、逻辑推断、代码调试。让模型直接吐答案,它容易在中间某一步就滑倒,而且你看不出错在哪。思维链的做法很朴素——让它把过程写出来。

为什么有效

可以类比做数学题打草稿。 - 把一步变成很多步:模型每生成一个 Token 都要做一轮计算,写出中间步骤等于给自己争取了更多计算,把难题拆成了若干个小难题。 - 让步骤可见:前面的结论留在上下文里,后面的推理可以直接引用,减少了「边算边忘」。 - 便于纠正:答案不对时,你能定位到是哪一步出了问题,而不是只看到一个错误结果。 这种「先写过程再给结论」的用法,本身就是一种提示技巧:给几个带步骤的示例,模型就会跟着写。

推理模型

后来人们不满足于靠提示临时激发,而是专门训练:用强化学习去奖励那些最终答案正确的推理过程,让模型自己学会验算、换思路、发现矛盾时回头重来。这类模型在给出最终答复前会先进行一段较长的内部推演,因此在数学、代码、规划类任务上表现更稳。 代价也很实在:输出 Token 变多,响应更慢、成本更高,简单问题(比如问今天天气)用它是浪费。所以实际产品里常常按问题难度分流。

常见误区

相关词条
提示工程 大语言模型(LLM) RLHF 与对齐
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页