大语言模型的训练目标简单到有点出人意料:给它一段文本,让它猜下一个词是什么。但在海量数据上把这件事做到极致之后,模型开始表现出翻译、总结、推理、写代码这些没有被专门教过的能力。
怎么工作
- 预训练:在大量文本上做自监督学习,就是不断遮住后文让它猜。它不需要人工标注,所以能吃下人类积累的几乎全部公开文本。
- 涌现与规模:参数量、数据量、算力一起放大到某个程度后,模型的能力会出现比较明显的跃升,而不只是线性变好。
- 后训练:光会续写还不够听指挥,于是还要用示范数据做指令微调,再用人类偏好做对齐,把它从「文本续写器」变成「助手」。
- 生成方式:每次输出时,模型对词表里所有可能的下一个 Token 给出概率,按某种采样策略挑一个,再把它接到后面继续算,如此循环,一边写一边生成。
为什么重要
它把过去需要专门训练的模型,变成了一个用自然语言就能调用的通用工具。写文案、查资料、做表格、写代码、做客服,很多任务的实现方式从「写程序」变成了「写提示」。对独立开发者来说,这意味着一个人也能做出过去需要团队才能做的产品。
常见误区
- 它在预测而不是在查库:它按自己的语言直觉生成,没有内建的事实验证步骤。
- 它可能一本正经地编造:这叫幻觉,是生成式方法的固有风险,需要检索、引用、人工复核来兜底。
- 参数大不等于一定更好:数据质量、训练配方、后处理都影响最终表现。