语言模型研究的基本问题,是如何根据已有上下文描述后续符号出现的可能性。这个问题可以用于文本续写,也可以通过适当的输入输出表示扩展到问答、翻译、代码生成与工具选择。然而,从一个条件概率模型到可实际使用的应用,还必须经过数据构建、参数学习、生成决策、资源配置和效果验证。只有同时理解这些环节,才能解释一个模型为什么给出某种答案,以及一个应用为什么能够或不能完成任务。
本章首先建立语言建模的研究对象,再沿发展历程解释表示、结构与训练方式的变化,介绍规模定律和涌现能力,进而区分模型、学习算法与应用系统。这里出现的概率式用于表达问题结构,具体推导将在后续数学与模型章节展开。
本章问题
语言模型学习的是何种分布?技术发展怎样改变表示与学习方式?规模增长能预测什么,任务能力又应怎样验证?一个预测概率怎样转化为生成决策?这些问题决定后续各章的论述层次。
1.1语言建模的研究对象
文本序列化
文本由字符组成,模型通常处理词元(Token)序列。词元是编码规则规定的离散单元,可以对应字节、字符、词的一部分或特定控制标记。给定有限词表 \(\mathcal V\),一段文本经分词器转换为
\(T\) 是编码后的序列长度,不必等于字符数或词数。词元编号只表示其在词表中的身份;编号相邻不意味着含义接近。连续向量表示及其学习属于模型的一部分,而不是整数编号本身的性质。
例如,“学习语言模型”可以被某种编码规则分成“学习”“语言”“模型”三个单元,也可以被另一种规则分成更多字符或字节单元。两种编码可以都正确恢复原文,但词元数量、词表大小和预测任务已经不同。因此,讨论上下文长度、每词元损失和生成速度时,需要同时知道所使用的编码规则。
语言模型给序列赋予概率。设参数集合为 \(\theta\),模型分布记为 \(p_\theta\)。概率链式法则允许将联合概率分解为
第一个位置的条件前缀为空;实际系统也可以用约定的起始标记表示初始条件。式中每一项回答同一个问题:在当前前缀已知时,下一词元的概率如何分布?模型需要在词表上给出非负且总和为一的概率,而不是只给出一个词元。
式(1.2)本身是概率恒等式。用神经网络计算条件概率、限制可读取的前缀长度、在位置间共享参数,才是具体的建模选择。区分恒等关系和模型假设,有助于避免把某种网络结构误认为语言建模的唯一形式。
条件生成及任务表示
在问答或翻译中,输入条件 \(c\) 与待生成序列 \(y_{1:T}\) 具有不同职责。模型描述的是
\(c\) 可以包含问题、对话历史、检索材料或经过编码的图像特征。条件的表示方式不同,网络接收信息的路径也可能不同。把图像转为视觉特征后接入语言模型,与把图像描述写成文本,并不构成相同的条件信息。
训练数据决定模型能够从哪些条件与答案的对应关系中学习。目标函数决定哪些预测受到约束。即使采用相同的网络,一个只预测回答部分的训练过程,与一个同时预测问题和回答的过程,也可能学习到不同的行为偏好。
序列通常还需要终止规则。结束词元表达模型认为回答已经结束,最大长度则是运行时的外部限制。有限词表上每步概率归一化,不足以单独保证模型必然在有限时间内生成结束词元;系统还需要给出明确的终止条件。1
1.2语言模型的发展历程
语言模型的发展贯穿三条相互影响的线索:怎样表示上下文,怎样利用语料学习,以及怎样把预测能力用于任务。下述时间节点用于定位代表工作;不同路线长期并存,结构的提出时间也不等于它在语言建模中广泛使用的时间。
分布式词表示
Shannon 在1948年的通信理论工作中讨论了英语的统计近似,为把语言序列看作概率对象提供了早期基础(Shannon 1948)。传统统计语言模型常采用\(n\)元语言模型(\(n\)-gram Language Model),用最近的 \(n-1\) 个词近似完整前缀:
这里假定已为序列开头补入适当的起始标记。给定历史 \(h\),可用计数比 \(\frac{c(h,w)}{c(h)}\) 估计下一词为 \(w\) 的概率,其中 \(c(h,w)\) 为历史后出现该词的次数,\(c(h)\) 为历史出现次数。若历史未出现,分母为零;若某种接续未出现,直接估计又会赋予零概率。平滑、回退与插值据此分配概率质量,并在长短上下文之间共享统计证据。
增加 \(n\) 可以利用更多局部信息,却也增加了需要估计的组合数量。有限语料难以覆盖大量长片段,语义相近的词也不会因整数身份不同而自动共享证据。2003年 Bengio 等人的神经概率语言模型联合学习词的连续表示与条件概率,使相似表示可以参与共享计算(Bengio 等 2003)。它仍采用有限窗口,但把部分泛化能力交给了可学习的表示与函数,而不必为每种上下文单独保存一组频数。
循环状态及长程依赖
循环神经网络(Recurrent Neural Network,RNN)将前缀逐步写入隐状态。2010年 Mikolov 等人的循环语言模型是这一方向的代表工作(Mikolov 等 2010)。状态可随序列持续更新,因而摆脱了显式固定词窗口;不过,早期信息需要经过多次状态变换才能影响远处预测,学习容易受到梯度衰减或增长的影响。
长短期记忆(Long Short-Term Memory,LSTM)结构早在1997年已经提出,通过门控和记忆路径改善跨时间步的信息与梯度传递(Hochreiter 和 Schmidhuber 1997)。它与后来循环语言模型的应用属于不同的时间节点。门控能够缓解长程学习困难,但固定维度状态仍需压缩历史,训练计算也保留沿时间推进的依赖。由此产生两个后续问题:能否直接访问相关位置,以及能否提高长序列训练的并行程度?
预训练表示及 Transformer
把无标注语料中学到的表示迁移给下游任务,使不同任务可以共享语言知识。静态词向量为同一词型提供固定表示,但一词多义需要结合上下文区分。2018年的 ELMo 使用预训练双向语言模型的内部状态构造上下文相关表示,再把这些表示交给任务模型(Peters 等 2018)。
2017年的 Transformer 以注意力组织序列到序列计算,使一个位置可以直接结合其他可见位置的信息,并允许训练时并行计算多个位置(Vaswani 等 2017)。这种并行性不消除自回归生成对前一步输出的依赖;密集注意力也引入随序列长度二次增长的位置交互。它改善了信息访问和训练计算的组织方式,同时带来了新的存储与计算约束。
2018年的 GPT 工作使用生成式预训练,再针对下游任务微调(Radford 等 2018);同年公开、2019年正式发表的 BERT 使用掩码预测学习双向表示(Devlin 等 2019)。二者体现了预训练与任务适配的不同路径。BERT 的双向掩码目标与 GPT 的因果下一词预测在可见信息和概率含义上有区别,不能因共同使用 Transformer 就视为相同的语言建模目标。
规模化、上下文学习及指令交互
2020年的 GPT-3 工作系统研究了在提示中给出说明或示例、保持参数不变的任务适应方式(Brown 等 2020)。这种上下文学习(In-Context Learning,ICL)改变输入条件,与通过梯度更新参数的微调不同。它拓宽了同一预训练模型的使用方式,但效果仍取决于任务、提示格式、示例选择与训练数据;少样本表现不能直接证明模型掌握了任意任务规则。
规模化还带来资源分配问题:同一计算预算应训练更大的模型,还是让较小模型读取更多数据?2020年的 Kaplan 等人研究与2022年的 Chinchilla 工作,使这一问题可以通过损失曲线和经验拟合讨论(Kaplan 等 2020; Hoffmann 等 2022)。参数增长、数据供给、优化过程及硬件系统共同影响结果,单独比较参数量不足以解释能力差异。
面向用户的交互还要求模型理解请求、遵循格式并体现偏好。2022年的 InstructGPT 工作结合示范数据微调与人类反馈训练,展示了对预训练模型行为进行进一步塑造的路径(Ouyang 等 2022)。语言建模损失、指令完成质量和偏好评价对应不同目标;后训练改善交互行为的证据,仍需按所用评价方式解释。
推理训练、多模态及工具扩展
后续发展沿多个方向展开。2023年的视觉指令微调工作把视觉表示接入语言交互(Liu 等 2023);ReAct 将推理文本与环境动作交替组织(Yao 等 2023);2025年的 DeepSeek-R1 报告研究了通过强化学习提升推理表现的训练路径(DeepSeek-AI 2025)。这些工作分别改变可接收的信息、可执行的动作和训练反馈,不能只用模型规模解释。
在训练完成后,系统还可以为困难问题分配更多生成、搜索或验证计算。额外计算是否改善答案,取决于候选质量、验证信号与选择方式;更长的输出并不自动更可靠。模型接入工具后,实际执行、状态管理与权限控制也需要由应用系统承担。沿这条发展线索阅读后续章节,应分别追问:结构改变了哪条信息路径,训练改变了哪个目标,系统又增加了什么外部条件?
1.3规模定律及涌现能力
规模定律的适用范围
规模定律(Scaling Law)是对模型、数据、计算与测量结果之间关系的经验描述。对语言模型,常见研究对象是在可比数据分布上测得的平均验证交叉熵。一个用于理解参数与数据约束的拟合形式为
其中 \(N\) 为参数量,\(D\) 为训练词元数,\(E\) 为拟合底座,其余系数由实验估计。式子表示:在适用范围内,扩大参数或数据可以降低相应的损失余量;只扩大其中一项,另一项仍可能限制收益。拟合底座不应直接解释为已知的真实语言熵。
Kaplan 等人报告了特定实验条件下损失随规模变化的幂律规律;Chinchilla 工作进一步研究固定训练计算下的参数与数据配置,得到其计算最优范围内两者应近似同比例增长的结论(Kaplan 等 2020; Hoffmann 等 2022)。这些结果依赖各自的训练设置与拟合范围,不能转化为适用于所有模型的固定词元参数比。模型结构、语料质量、重复使用数据及推理服务成本变化,都可能改变预算选择。
对常见密集模型的粗略训练预算,可写成 \(C\approx\kappa ND\),其中 \(C\) 是训练计算量,\(\kappa\) 汇总结构与计算口径相关的系数。在固定 \(C\) 下增加 \(N\),通常需要压缩 \(D\),因此更大模型未必带来更低损失。第23章《预训练原理》进一步推导拟合、计算最优分配和外推验证。这里需要先掌握的判断是:规模定律用于有条件的预测与规划,任务正确率仍需单独测量。
涌现能力的度量
涌现能力(Emergent Abilities)在 Wei 等人的2022年研究中,指一些在较小模型中未观察到、在较大模型中出现,且难以从小规模表现外推的任务能力(Wei 等 2022)。这一说法描述的是给定模型系列、任务与测量方式下的现象。“小模型未观察到”受到测试集大小、随机基线、提示方式和评价粒度限制,并不直接说明其相关内部表示完全缺失。
2023年 Schaeffer 等人指出,一些表面上的突跃可以由非线性或不连续的评价指标产生;改变度量方式后,部分能力曲线呈现平滑改善(Schaeffer, Miranda, 和 Koyejo 2023)。这一结果要求检验度量的影响,也没有证明所有任务变化都能用同一种解释消除。任务要求完整答案正确时,精确匹配有实际意义;但仅凭该分数的跃升,尚不能推出内部机制发生了突变。
考虑一个用于说明度量效应的构造算例:答案包含10个位置,每个位置独立且以相同概率 \(q\) 正确,则整串完全正确的概率为 \(q^{10}\)。当 \(q\) 从 \(0.5\) 增至 \(0.8\) 时,逐位置正确率从50%升至80%,整串正确率却从约0.10%升至10.74%。少量测试题上,前者可能长期测为零,随后才出现明显非零分数。此处的独立性只服务于算例,真实生成中的错误通常相关;这些数值不是语言模型实验结果。
因此,研究涌现时应同时报告严格任务指标与更细粒度的诊断指标,并在疑似转折附近增加规模点、重复实验和不确定性估计。模型之间的数据、训练目标、提示或解码方式若同时变化,观察到的差异也不能全部归因于规模。数据污染与样本记忆则需要另行排查。
平均损失及任务能力的关系
平均损失汇总大量预测位置,任务评分则可能只关心某个领域或要求多个步骤同时正确。前者平滑下降时,后者仍可能因阈值和组合要求而快速变化;平均改善也可能掩盖少数任务的退步。规模定律与涌现研究因此关注不同层次的观测。
训练计算与推理时计算也应分开记录。增加训练词元会改变参数的学习经历;增加候选采样或搜索预算则改变同一模型的使用过程。两者可以分别研究收益曲线,但不能把训练损失的幂律直接用于预测搜索成功率,更不能由任何一条曲线保证事实正确性、可靠推理或生产可用性。
1.4概率预测、学习目标及生成决策
统计估计
模型通常不能直接知道真实语言分布,只能观察有限语料。设数据集为 \(D=\{x^{(1)},\ldots,x^{(n)}\}\),一种基本学习方式是选择使观测数据似然尽可能大的参数,即最大似然估计:
将序列概率分解代入,便得到逐词元负对数概率的求和。把它写成可微计算后,优化算法可以据此调整参数。预测、损失与参数更新构成训练计算的主线。
该目标说明模型受到什么监督,却不保证所有任务属性都被显式优化。训练语料可能包含错误,某些领域可能代表不足,模型也可能无法充分拟合已有数据。因此,“能生成自然语言”与“所述事实正确”不是可以互相替代的判断。事实核验、任务约束和系统控制仍需独立处理。
自监督学习从数据自身构造目标,下一词元预测就是其中一种方式。它不要求人工为每个词元另行标注,但仍依赖数据的采集、筛选、混合与组织。是否存在人工标签,不决定数据处理是否影响模型行为。
局部决策及序列决策
得到概率后,还需要决定如何选择输出。考虑只生成两个词元的简化任务。首步只有 \(a\)、\(b\) 两个候选,其概率分别为 \(0.6\) 和 \(0.4\)。第二步候选为 \(u\)、\(v\),条件概率如下。
| 首词元 | 首步概率 | \(p(u\mid\text{首词元})\) | \(p(v\mid\text{首词元})\) |
|---|---|---|---|
| \(a\) | \(0.6\) | \(0.5\) | \(0.5\) |
| \(b\) | \(0.4\) | \(0.9\) | \(0.1\) |
由乘法规则,四条完整序列的概率为
四者之和为一。逐步选择最大条件概率的贪心策略先选择 \(a\),随后无论怎样处理第二步的并列,得到的序列概率都是 \(0.30\);联合概率最大的序列却是 \((b,u)\),其概率为 \(0.36\)。因此,局部最大选择并不保证完整序列的概率最大。
这个例子还没有给出哪条序列是任务的正确答案。概率是模型对数据规律的表达,任务正确性则由任务本身定义。即使能够精确找出最大概率序列,也仍需要检验它是否满足问题要求。采样、搜索和验证分别解决不同环节的问题。
1.5模型、算法及系统的分工
网络结构及学习过程
网络结构规定输入信息如何转为输出分数,包括表示维数、模块连接、注意力可见范围和非线性变换。训练算法规定数据如何被抽取、损失如何形成、梯度如何计算以及参数如何更新。相同结构经过不同数据和目标训练,可以获得不同能力;相同目标采用不同结构,也可能具有不同的计算和泛化特征。
Transformer 通过注意力交换位置信息,再通过逐位置非线性变换加工表示。编码器、因果解码器和编码器—解码器都可以由这些组件构成,但它们的可见性及输出目标不同。原始 Transformer 将注意力用于序列到序列建模(Vaswani 等 2017),不能将其中某个子层直接等同于一个完整语言模型。
模型规模也不是单一维度。参数数量反映所存储的可学习自由度,激活参数量描述某次计算实际使用的参数范围,上下文长度描述可接收的信息范围,而训练词元数描述训练暴露的数据量。这些量相互影响,但不能互相替代。
学习方式及结构坐标
监督学习(Supervised Learning)以给定标签或目标值约束预测;无监督学习(Unsupervised Learning)从观测中刻画分组、低维表示或分布结构;自监督学习(Self-Supervised Learning)由数据自身构造目标,例如用文本前缀预测后续词元;强化学习(Reinforcement Learning,RL)通过动作、状态转移和奖励优化决策。它们描述反馈来源和学习问题,并不分别对应一种固定网络。语言模型预训练的目标由数据自身构造,但优化时仍有明确的监督词元。
| 结构 | 核心机制 | 适用性与限制 |
|---|---|---|
| 线性模型/树模型 | 线性打分/递归划分特征空间 | 可形成表格任务基线;能力取决于特征与划分。 |
| 多层感知机(Multilayer Perceptron,MLP) | 全连接映射与逐点非线性组合 | 适合固定维度表示,不自动利用空间邻接。 |
| 卷积神经网络(Convolutional Neural Network,CNN) | 局部连接和空间共享参数 | 利用局部结构;跨远距离关系需多层或其他机制。 |
| 循环神经网络(Recurrent Neural Network,RNN) | \(h_t=f_\theta(h_{t-1},x_t)\) 的递归状态 | 顺序更新;历史压缩在状态中,路径长度随时间增长。 |
| Transformer | 内容相关注意力与逐位置变换 | 可按可见性构造不同序列模型,计算代价随连接数增长。 |
| 扩散模型(Diffusion Model) | 学习逐步去噪或对应连续动力学 | 在数据或潜空间生成;采样通常需多步计算。 |
长短期记忆是带门控状态的循环结构,使用不同路径控制记忆保留与更新;它仍保留递归时间依赖。上述坐标不是质量排名:局部连接、递归状态和注意力分别引入不同的归纳偏置(Inductive Bias),即在有限数据下偏向某些函数和信息交互方式。具体选择还要结合训练目标、数据规模和部署约束。
训练系统及应用系统
训练系统将语料变成参数,应用系统将请求变成结果。两者共享模型制品,却具有不同的状态和故障模式。训练关心数据消费、参数更新和恢复一致性;应用关心请求生命周期、响应时间、工具执行与结果有效性。
图1.1中的模型制品不仅包含权重,还包括解释权重所需的结构配置、分词器和输入输出协议。对于适配器或多模态模型,还需要相应基座、处理器及连接模块。一个能够加载的权重文件,只说明某一层面的兼容性,并不证明输入处理、任务质量或运行性能正确。
GPU 提供计算和显存,主机负责数据处理与运行控制,网络承载通信,存储保存语料、模型和检查点。任一环节供给不足,都可能使其余资源等待。因此,算力规划需要考虑端到端数据路径,不能只把设备峰值算力相加。
检索及工具扩展能力的方式
检索增强生成从外部知识库选择材料,再把材料作为回答条件。工具调用则使应用能够执行查询、计算或业务操作。前者主要改变模型可见的信息,后者改变系统可以采取的动作。智能体进一步根据中间观察选择动作顺序,因而引入规划、记忆、状态恢复和终止等问题。
这些能力依赖模型外部的执行机制。模型产生一个工具名称和参数,不意味着相应动作已经发生;执行器必须检查参数、权限和运行结果。模型生成了一个引用,也不意味着引用材料确实支持该论断。系统需要保留这些区别,才能定位错误并采取有效修正。
1.6知识体系及学习路径
共同基础围绕一次模型请求建立概念链:文本如何成为词元与张量,注意力与网络怎样计算条件分布,生成策略怎样选择与终止输出,以及效果和风险怎样检验。数学知识先支撑这些基本对象与运算,再随具体推导加深。书前阅读说明给出各方向的章节顺序。
应用智能体系统关注任务、证据和执行结果,沿上下文学习、检索与 RAG 进入领域应用,再深入智能体架构和运行系统。Harness 是其中模型之外的执行与控制部分,重点在任务状态、工具权限和失败恢复。模型训练方法关注数据怎样改变模型行为,从监督微调和参数高效适配进入预训练、强化学习、人类反馈学习;完整梯度推导和训练目标属于这一方向的前置。
训练推理系统关注模型计算的资源与执行,先建立容量预算和硬件瓶颈分析,再分别进入训练系统或推理服务。训练分支需要理解反向传播和训练状态;推理分支需要理解增量解码、缓存与请求生命周期。数据、评估、安全和多模态按各方向的对象与任务深入。
选择方向时,以要解释和验证的对象为依据。同一个应用可以使用已有模型,模型适配可以使用已有训练框架,系统优化也可以在固定模型上开展;各方向在制品、接口和证据处衔接。学习成果应体现为可解释的机制、可核查的假设和可验证的判断。
固定长度序列的分布与所有有限长度序列的分布是不同对象。后者若由逐步生成定义,还需要考虑终止概率;截断运行时间则是一项外部策略。↩︎