参考

术语表

用大白话解释术语

编码器与解码器 Encoder and decoder
在 2017 年的 Transformer 中,编码器一次读入整个源句子;解码器在因果掩码下逐个词元地写出输出,并通过交叉注意力读取编码器的输出。
编排者 Orchestrator
多智能体系统中负责拆分任务、把各部分交给工作智能体并汇总其报告的那个智能体。
残差流 Residual stream
贯穿整个模型的每词元向量。每一层都读取它,并把自己的输出加回去,而不是替换它。
查询、键、值 Query, key, value
为注意力从每个词元生成的三个向量:它在找什么、它能提供什么、以及被选中时传出什么。
词表 Vocabulary
模型认识的固定词元集合,每个词元有一个 id 和嵌入矩阵中自己的一行;它在训练之前由分词器确定。
词元(token) Token
模型作为一个单位读取的一段文本(一个词、词的一部分、一个字节或标点),每个都有词表中的一个 id。
动量 Momentum
沿过去梯度的滑动累加方向迈步,而不是只看最新的梯度,这样来回的振荡相互抵消,一致的方向逐渐加速。
对比学习 Contrastive learning
通过比较来训练:匹配的一对(一张图和它的说明文字)被拉近,批次中每一对不匹配的都被推远。
对话模板 Chat template
对话模型训练时使用的文本格式:<|im_start|> 等特殊词元标记每条消息的开始和作者,模型的回合从模板停下的地方开始。
多词元预测 Multi-token prediction
训练模型额外预测更远的词元(下一个之后的那个),作为一个更密集的额外训练信号。
多头潜在注意力(MLA) Multi-head latent attention (MLA)
DeepSeek 的注意力:每个词元的键和值被压缩成一个小的潜在向量,KV 缓存只存它;每个头的键和值都从它还原出来。
反向传播 Backpropagation
一次性算出损失对每个权重的梯度:从输出往回,逐层应用链式法则。
分块预填充 Chunked prefill
把长提示词的预填充拆成若干块,搭载在其他请求的解码步里一起跑,这样没有哪一步会变得很慢。
工具调用 Tool call
模型写出的、请外部程序运行某个函数的文本,例如带有名称和参数的 JSON;程序运行它并把结果放回上下文。
归纳头 Induction head
一种注意力头:找到当前词元更早出现的位置,并关注紧跟其后的那个词元,从而延续重复的模式。
后置 LN 与前置 LN Post-LN and pre-LN
LayerNorm 放在哪里:放在每次残差相加之后(后置 LN,2017 年的 Transformer),或放在每个子层读取的那份副本上(前置 LN,GPT-2 及之后的模型),后者训练更稳定。
滑动窗口注意力 Sliding window attention
只往回看固定数量词元(即窗口)的注意力;无论文本多长,这样的层最多只保存这么多键和值。
混合专家(MoE) Mixture of experts (MoE)
一种带有多个专家 MLP 和一个路由器的层;每个词元只经过路由器挑中的少数几个专家,因此模型可以存储远多于每个词元实际使用的参数。
基座模型 Base model
只经过预训练的模型:它会按训练数据的风格续写文本,还没有被调教成听从指令。
激活参数 Active parameters
一个词元实际经过的权重。在混合专家模型中,它远少于模型存储的参数:词元没被送去的专家留在内存里闲置。
计算受限与内存受限 Compute-bound and memory-bound
GPU 的一步是受限于算术速度,还是受限于读取内存的速度;每读一个字节只做很少运算的步骤(比如解码一个词元)要等内存。
计算最优 Compute-optimal
在固定训练预算下,模型大小与训练词元数之间使损失最低的分配;按 Chinchilla 的拟合,大约每个参数 20 个词元。
奖励模型 Reward model
在偏好对上训练、给每个答案打分的模型,人们偏好的答案得分更高;RLHF 再调教语言模型去提高这个分数。
交叉注意力 Cross-attention
查询来自一个序列、键和值来自另一个序列的注意力:在翻译模型中,解码器(目标)通过它读取编码器的输出(源)。
交接 Handoff
把一部分工作或整个对话从一个智能体交给另一个,通常借助工具调用;接手的智能体只能看到交给它的内容。
教师强制 Teacher forcing
训练时给解码器喂正确的前序词元,而不是它自己的猜测,这样在因果掩码下每个位置都能同时训练。
仅编码器 Encoder-only
没有因果掩码、一次读入整段文本、为每个词元输出一个向量的 Transformer,用于理解而不是生成文本。BERT 是仅编码器结构。
仅解码器 Decoder-only
从左到右、在因果掩码下阅读并预测下一个词元的 Transformer。GPT-2 和 LLaMA 都是仅解码器结构。
困惑度 Perplexity
e 的平均下一词元损失次方:大致相当于模型在每一步要从多少个词元中做选择。越低越好。
扩散模型 Diffusion model
被训练来去除数据中噪声的模型;生成时从纯噪声出发,一步步去噪。
连续批处理 Continuous batching
每个解码步之后都重新安排服务批次:完成的请求立即离开,等待的请求随即补上,而不是等整批都结束。
链式法则 Chain rule
若 y 依赖 x、损失依赖 y,则损失对 x 的斜率等于损失对 y 的斜率乘以 y 对 x 的斜率。
量化 Quantization
用更少的比特存储数字,比如把权重存成带缩放系数的 8 位或 4 位整数,以少量精度损失换来更小、更快的服务模型。
零样本 Zero-shot
在没有任何针对性训练样本的情况下完成任务,例如把图片与为每个类别写的一句说明做比较来分类。
路由器 Router
混合专家中的一个小矩阵,为每个词元给每个专家打分;得分最高的几个专家被执行,权重由它们分数上的 softmax 决定。
片段破坏 Span corruption
T5 的预训练任务:输入中的若干片段被替换为哨兵词元,模型只需写出被删掉的片段。
前缀缓存 Prefix caching
在请求之间保留提示词开头部分的 KV 缓存,这样像系统提示词这样很长的共同开头就不必重复计算。
嵌入 Embedding
一个学到的数字向量(GPT-2 中是 768 个数),代表一个词元或一个位置;用法相似的词元最终会得到相似的向量。
嵌入模型 Embedding model
把一整段文本变成一个向量的模型,训练目标是让意思相关的文本得到方向相近的向量。
权重衰减 Weight decay
每个训练步把每个权重缩小一点点,除非损失需要它们大,否则权重就保持较小。
上下文学习 In-context learning
模型完成提示词中通过示例或指令展示的任务,而权重没有任何改变。
少样本提示 Few-shot prompting
在真正的问题之前,先在提示词里放几个做好的示例,让模型沿着这个模式续写。
哨兵词元 Sentinel token
在 T5 的片段破坏任务中,标记被删除片段位置的占位词元(<extra_id_0>、<extra_id_1>……);目标序列依次列出每个哨兵及其后的片段。
视觉 Transformer(ViT) Vision Transformer (ViT)
一个 Transformer 编码器,它的词元是图像块加一个 [CLS] 词元;对 [CLS] 的输出做分类。
缩放定律 Scaling law
观察到的规律:随着参数量、训练数据和算力增长,模型的损失以幂律的形式平稳、可预测地下降。
贪心解码 Greedy decoding
总是选择概率最高的下一个词元。
梯度 Gradient
对每个权重来说,损失随这个权重变化而变化的快慢。训练就是让每个权重朝梯度的反方向挪一点。
停止串 Stop string
一旦模型写出就立即结束生成的文本;智能体循环用它在模型编造工具结果之前把控制权收回。
投机解码 Speculative decoding
用一个小的草稿模型先猜几个词元,再由大模型一次前向全部检查,保留一致的前缀;输出与大模型自己生成的完全相同。
图像块嵌入 Patch embedding
ViT 用来代替查词表的方法:每个 16 × 16 的图像块被展平并乘以同一个共享矩阵,等价于核大小 16 × 16、步长 16 的卷积。
微调 Fine-tuning
在一个较小的、针对某项任务的数据集上把预训练模型再训练一些,通常还会在上面加一个小的新输出层。
温度 Temperature
softmax 之前把 logits 除以 T:小于 1 使分布更尖锐,大于 1 使其更平坦,T → 0 就变成贪心。
文本到文本 Text to text
T5 的统一框架:从翻译到分类,每个任务都是输入一段字符串、输出一段字符串,并用 “summarize:” 这样的前缀指明任务。
无分类器引导 Classifier-free guidance
采样时分别在有条件和无条件下运行扩散模型,再沿条件带来的方向多走一些,让生成的图像更贴合条件。
线性注意力 Linear attention
把过去折叠成一个固定大小状态的注意力层,而不是保存每个键和值,所以它的内存不随文本增长;Qwen3-Next 和 Kimi Linear 把它与全注意力混合使用。
相对位置偏置 Relative position bias
T5 为注意力提供顺序感的方式:每一对查询–键按距离分入一个桶,每个桶、每个头学到的一个数被加到它的分数上。
写时复制 Copy-on-write
多个使用者共享同一块内存,直到其中一个要写入时才为它复制一份私有副本。
选择性扫描 Selective scan
Mamba 的状态空间步骤:步长 Δ 以及矩阵 B 和 C 都取决于当前词元,所以模型可以按词元决定往状态里写什么、保留什么。
学习率 Learning rate
每个训练步沿梯度反方向移动权重的距离(η)。通常先从零预热,再逐渐衰减。
训练 Training
在大量文本上经过许多步调整每个权重,使模型给真实的下一个词元更高的概率。
掩码语言建模 Masked language modelling
BERT 的训练任务:遮住一些词元,让模型根据两侧的词来预测它们。
因果掩码 Causal mask
对每个位置遮住它之后的位置,使模型无法偷看它正要学着预测的词元。
有限差分 Finite difference
把输入向两边各挪一小步,用输出的变化除以步长来估计斜率;很慢,但很适合用来核对。
余弦相似度 Cosine similarity
两个向量指向同一方向的程度:点积除以两者的长度,范围从 −1 到 1。对长度为 1 的向量,它就是点积。
预填充与解码 Prefill and decode
生成的两个阶段:预填充在一次前向中处理整段提示词并填满 KV 缓存;之后每个解码步只处理一个新词元。
约束解码 Constrained decoding
每一步在选出下一个词元之前,先把会破坏所需格式(JSON 语法、工具名列表)的词元全部屏蔽,这样输出总是符合格式。
在线 softmax Online softmax
分块计算 softmax,维护运行中的最大值和总和,最大值变大时把之前的项重新缩放;结果与普通 softmax 完全相同。
指令微调 Instruction tuning
用写在对话模板里的“指令 + 好的回答”来微调预训练模型,让它回答请求而不是续写文本。
智能体 Agent
一个在循环中运行语言模型的程序:模型选择行动(例如调用工具),程序执行并把结果送回,直到任务完成。
注意力 Attention
让每个位置从自身和之前的位置汇集信息,权重取决于它的查询与这些位置的键匹配得有多好。
注意力汇 Attention sink
许多注意力头会把多余的注意力放在第一个词元上,而它的值几乎不贡献任何东西;总览页的配色把这部分注意力视为无操作。gpt-oss 则给每个头一个学到的 sink:一个额外的分数,不对应任何词元也能分走注意力。
注意力头 Attention head
并排运行的多个注意力计算之一,每个只处理向量的一段(GPT-2 中是 768 个数里的 64 个),可以各自追踪不同的关系。
状态空间模型(SSM) State-space model (SSM)
一种序列层,在词元之间传递固定大小的状态,ht = Ā ht−1 + B̄ xt,并从状态中读出输出 yt = C ht。计算量随长度线性增长。
adaLN-Zero
DiT 的条件注入方式:时间步和类别决定每个块中 LayerNorm 的缩放和平移,以及每个子层输出上的门控;门控从零开始,所以每个块起初相当于恒等变换。
Adam
Transformer 的标准优化器:为每个权重维护梯度的滑动平均(m)和梯度平方的滑动平均(v),按 m / √v 迈步,所以每个权重前进的步幅相近。AdamW 则把权重衰减单独加上。
BatchNorm
在一个批次的样本之间对每个特征做归一化(视觉模型中常见)。Transformer 改用 LayerNorm,对每个词元单独归一化。
BPE
字节对编码:一种分词器,从字节出发,反复合并训练文本中最常相邻出现的一对符号。GPT-2 就这样学到了 50,000 条合并规则。
DPO
直接偏好优化:用成对的“被偏好 / 被拒绝”答案来调教模型,一个损失函数就能相对冻结的参考模型提高被偏好答案的概率、降低另一个的概率。
FlashAttention
一种精确的注意力内核:在 GPU 片上 SRAM 里分块处理查询、键和值,配合在线 softmax,因此 N × N 的分数矩阵从不写入 HBM。
FLOPs
浮点运算次数。一次乘加算作两次。
GELU
一种平滑的非线性函数:大的正输入几乎原样通过,小的被削弱,负的被压到接近 0。
GEMM
通用矩阵乘法 C = A · B:Transformer 几乎所有的计算量都花在这上面。
GQA
分组查询注意力:几个查询头共享一个键/值头,从而缩小 KV 缓存。
JSON Schema
描述 JSON 数据结构的标准方式:有哪些字段、各是什么类型、哪些是必需的。工具定义用它来描述参数。
KV 缓存 KV cache
生成时,过去词元的键和值被存下来,这样每个新词元只需计算自己的部分。它随每个词元、每一层增长。
LayerNorm
把每个词元的向量重新缩放到均值 0、离散度 1,再对每个特征施加学到的缩放(γ)和平移(β)。
logit 透镜 Logit lens
把中间某一层直接送入最后的 LayerNorm 和反嵌入,看看如果模型在这里停下会预测什么。
logits Logits
未经归一化的原始分数,词表中每个词元一个;softmax 把它们变成概率。
LoRA
低秩适配:冻结原有权重,把对它们的改动学成两个细长矩阵的乘积来完成微调。
MLP
多层感知机:两次矩阵乘法,中间夹一个非线性函数(GELU),对每个词元单独作用。
PagedAttention
vLLM 存放 KV 缓存的方式:按固定大小的块按需分配,通过每个请求的块表找到它们,就像虚拟内存的页。
QK-Norm
在查询和键做点积之前先对它们各自归一化,防止训练中注意力分数变得过大。
RAG
检索增强生成:在文档集合中找出与问题最相关的段落并放进提示词,让模型据此作答。
ReAct
一种智能体提示格式(Yao 等,2022):模型交替写出思考(Thought)、指明工具的行动(Action),以及装着工具结果的观察(Observation)。
RLHF
基于人类反馈的强化学习:先用人们对答案的偏好训练一个奖励模型,再用强化学习(通常是 PPO)调教语言模型,写出得分高的答案。
RMSNorm
去掉均值的 LayerNorm:除以均方根,再施加一个学到的缩放。
RNN
循环神经网络:逐个词元读取序列,更新隐藏状态 h[t] = f(h[t−1], x[t])。每一步都要等上一步完成,所以无法并行。
RoPE
旋转位置编码:查询和键的每一对分量按随位置增长的角度旋转,于是分数中与位置有关的部分只取决于两个词元之间的距离。
SFT
监督微调:在示例对话上继续训练预训练模型,下一词元损失只在回答部分计算。
softmax Softmax
把一列分数变成和为 1 的正权重:每个分数取 exp,再除以所有 exp 之和。
SRAM 与 HBM SRAM and HBM
GPU 的两种主要存储:SRAM 小而极快,位于芯片上、紧挨着运算单元;HBM 大(数十 GB)而较慢,位于芯片旁边。
SwiGLU
一种 MLP:其中一个投影经过 SiLU 后,逐元素地门控另一个投影。
top-k 与 top-p Top-k and top-p
一种采样方式:先只保留概率最高的 k 个词元,或保留概率之和达到 p 的最小集合,再重新归一化。
WordPiece
BERT 的分词器:把单词贪心地切成词表中最长的片段;## 表示接续一个单词的片段。
x · W 与 W x x · W and W x
同一个乘积的两种写法。论文常写 W x(列向量);代码和本站写 x · W(x @ W),每个词元一行。