首页 / AI 百科 / Transformer

TransformerTransformer

模型架构

2017 年提出的一种神经网络结构,完全靠注意力机制处理序列,能大规模并行训练,是今天几乎所有大语言模型的基础骨架。

在 Transformer 出现前,处理语言的模型大多要按顺序一个词一个词地算,前一步算完才能算下一步。这让训练无法充分并行,也让长句子里的信息容易衰减。2017 年的一篇论文提出:既然注意力能让每个位置直接看到所有其他位置,那就不用循环了,全部用注意力堆起来。

怎么工作

可以把它理解成一条流水线,每一层都在做同一种「互相参考、各自加工」的操作: - 编码器—解码器:原始设计分两半。编码器负责把输入整体读懂,解码器负责一边看已生成的内容、一边参考编码器的结果,逐词产出。 - 自注意力:每个词都和句子里所有词算一次相关性,得到一个融合了上下文的新表示。 - 多头注意力:并行做多组自注意力,每组关注不同类型的关系(语法、指代、语义搭配)。 - 前馈网络:每个位置再各自过一个小型全连接网络,做非线性加工。 - 残差连接与归一化:把输入直接加回输出、把数值尺度稳定住,这是网络能堆到几十上百层而不崩的关键。 - 位置编码:因为不再有先后顺序,必须额外把位置信息注入进去。

为什么重要

它把序列建模从「必须串行」变成「可以并行」,于是模型规模、数据规模、算力投入第一次能顺畅地一起放大。今天的语言模型、多模态模型、代码模型,绝大多数仍是这个骨架的变体。

常见误区

相关词条
注意力机制 自注意力与多头注意力 位置编码 大语言模型(LLM)
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页