AI 百科 · 共 20 个词条

把 AI 术语说人话

大模型、注意力机制、RAG、LoRA、MoE…… 这些词天天见,但很少有人讲清它们到底在说什么。 这里每一条都用大白话拆开讲:它解决什么问题、怎么工作、为什么重要、常见误区在哪。 不用数学背景也能读懂。

全部 基础概念 训练方法 模型架构 推理优化 应用工程
神经网络Neural Network 一种模仿大脑神经元连接方式的计算模型:大量简单单元层层相连,靠调整连接强度从数据里找规律,是今天所有 AI 大模型的地基。 基础概念 查看详情 ↗ 反向传播Backpropagation 训练神经网络的核心算法:把预测误差从输出端一层层往回传,算出每个参数该往哪个方向调、调多少,让网络越学越准。 训练方法 查看详情 ↗ 梯度下降Gradient Descent 最主流的参数优化方法:算出误差下降最快的方向,让参数朝那个方向小步走,反复走很多次,直到误差尽量小。 训练方法 查看详情 ↗ 过拟合与正则化Overfitting and Regularization 过拟合指模型把训练数据背下来了、遇到新数据就失灵;正则化是一套给它加约束、防止死记硬背的办法。 训练方法 查看详情 ↗ 注意力机制Attention Mechanism 让模型处理信息时能挑重点:给输入的不同部分分配不同权重,需要什么就多看一眼什么,而不是所有内容平均对待。 模型架构 查看详情 ↗ TransformerTransformer 2017 年提出的一种神经网络结构,完全靠注意力机制处理序列,能大规模并行训练,是今天几乎所有大语言模型的基础骨架。 模型架构 查看详情 ↗ 自注意力与多头注意力Self-Attention and Multi-Head Attention 自注意力是让句子里每个词参照其他所有词来更新自己;多头注意力是同时用多组视角做这件事,再合并结果。 模型架构 查看详情 ↗ 位置编码Positional Encoding 因为注意力本身不区分词的先后顺序,需要额外把位置信息告诉模型,这套标记方式就叫位置编码。 模型架构 查看详情 ↗ 词嵌入Word Embedding 把词变成一串数字向量的技术:意思相近的词,向量也彼此靠近,模型因此能用数学运算来处理语义。 基础概念 查看详情 ↗ Token 与分词Token and Tokenization 模型不直接读字,而是先把文本切成一个个小片段(Token)再处理;切分方式直接影响成本、上下文长度和效果。 基础概念 查看详情 ↗ 大语言模型(LLM)Large Language Model (LLM) 用海量文本训练出来的超大神经网络,靠不断预测下一个词学会了语言,能对话、写作、编程,也能犯下很像样的错。 基础概念 查看详情 ↗ 上下文窗口Context Window 模型一次能读进去的 Token 上限,决定了它同时能记住多少内容;超出窗口的部分会被丢弃或另想办法处理。 基础概念 查看详情 ↗ 思维链与推理模型Chain-of-Thought and Reasoning Models 让模型先把中间推理步骤写出来再给答案,多步计算和逻辑题的正确率会明显提高;专门这样训练出来的模型叫推理模型。 推理优化 查看详情 ↗ 提示工程Prompt Engineering 通过设计给模型的指令、示例和上下文,让同一个模型输出得更准、更稳、更符合要求的一套实践方法。 应用工程 查看详情 ↗ 微调与指令微调Fine-tuning and Instruction Tuning 在已经训练好的大模型上,用少量专门数据继续训练,让它更贴合某个领域或更听话;指令微调专教它按你的要求办事。 训练方法 查看详情 ↗ LoRA 与参数高效微调LoRA and Parameter-Efficient Fine-Tuning 不改动原模型,只额外训练一小块参数来适配新任务,显存和时间成本大幅降低,让小团队也能微调大模型。 训练方法 查看详情 ↗ RLHF 与对齐RLHF and Alignment 用人类的偏好反馈来调教模型,让它输出更有帮助、更诚实、更安全,而不是只追求「猜对下一个词」。 训练方法 查看详情 ↗ RAG 检索增强生成Retrieval-Augmented Generation (RAG) 回答前先去自己的资料库里检索相关内容,再把资料和问题一起交给模型作答,能让答案有据可依、也更容易更新。 应用工程 查看详情 ↗ 量化与模型蒸馏Quantization and Knowledge Distillation 把模型变小变快的两条主要路线:量化是降低每个参数的数值精度,蒸馏是让大模型教出一个小模型。 推理优化 查看详情 ↗ 混合专家模型(MoE)Mixture of Experts (MoE) 把一个大网络拆成许多专精的小网络,每次只叫其中几个来处理当前内容,于是总参数量很大、实际计算量却不高。 模型架构 查看详情 ↗
本站是免费的副业装备导航站,不售卖任何课程或资料。词条为原创整理,用于科普; 技术细节如有出入,请以论文与官方文档为准。
← 返回首页 · AI 名人堂