首页 / AI 百科 / 微调与指令微调

微调与指令微调Fine-tuning and Instruction Tuning

训练方法

在已经训练好的大模型上,用少量专门数据继续训练,让它更贴合某个领域或更听话;指令微调专教它按你的要求办事。

预训练出来的模型只会续写文本:你问它一个问题,它可能接着编出更多问题,而不是回答。要让它变成一个听指挥的助手,还需要后一阶段的训练,这就是微调存在的意义。

微调在做什么

可以类比「通识教育之后的上岗培训」。预训练给了模型语言能力和世界知识,微调用针对性的数据把它往具体方向再推一程。 - 全量微调:更新全部参数,效果上限高,但显存和算力开销大,也容易把原有能力练坏。 - 指令微调:用大量「指令—合适回答」的样例来教模型听懂要求。这是把基座模型变成对话助手的关键一步,数据质量比数量更关键。 - 领域微调:用行业语料(法律、医疗、客服话术)让它熟悉专业表达和术语习惯。 - 参数高效微调:只训练很小一部分新增参数,成本大幅下降,适合资源有限的团队。

什么时候值得做

当你要的是风格、格式、行为习惯的稳定统一,微调很合适:固定输出模板、特定语气、稳定遵循一套业务规则。数据几百到几千条高质量样例就可能有明显效果。 当你要的是新知识,微调通常不是最优解:靠检索把资料放进上下文更便宜,而且更新资料不需要重新训练。

常见误区

相关词条
LoRA 与参数高效微调 RLHF 与对齐 过拟合与正则化 提示工程
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页