首页 / AI 百科 / 梯度下降

梯度下降Gradient Descent

训练方法

最主流的参数优化方法:算出误差下降最快的方向,让参数朝那个方向小步走,反复走很多次,直到误差尽量小。

知道了每个参数该往哪调(梯度),还得决定「一次调多少、调几次」。梯度下降回答的就是这个问题,它是几乎所有神经网络训练的默认做法。

怎么工作

最贴切的比方是雾中下山。你看不见全貌,只能感觉脚下哪个方向最陡,就朝那里迈一小步,再重新感觉,再迈一步。 - 损失函数:把「当前参数有多差」变成一个可计算的分数,山的高度就是它。 - 梯度:告诉你当前位置最陡上升的方向,那么反方向就是下降最快的方向。 - 学习率:每一步迈多大。这是最关键的超参数——太大容易一步跨过谷底来回震荡甚至越走越高;太小则慢得让人绝望。 - 批量:每走一步看多少样本决定方向。全量批梯度下降方向稳但一步很贵;随机梯度下降每步只看一条样本,快但抖;小批量(mini-batch)折中,也是实际最常用的。 - 改进版:动量让下降有惯性、能冲过小坑;自适应方法(如 Adam 一类)会给不同参数分配不同的有效步长,在稀疏或尺度差异大的场景里更省心。

为什么重要

它是「把模型变好」这件事的可执行版本:只要能算出梯度,就能靠反复迭代逼近一个好解。整个深度学习的规模之所以能扩展——更多数据、更多参数、更多算力——靠的正是这种简单、可并行、能一直迭代下去的优化范式。

常见误区

相关词条
反向传播 神经网络 过拟合与正则化
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页