L大语言模型从理论到实践
阅读 PDF ↗
CHAPTER 01

绪论

语言模型研究的基本问题,是如何根据已有上下文描述后续符号出现的可能性。这个问题可以用于文本续写,也可以通过适当的输入输出表示扩展到问答、翻译、代码生成与工具选择。然而,从一个条件概率模型到可实际使用的应用,还必须经过数据构建、参数学习、生成决策、资源配置和效果验证。只有同时理解这些环节,才能解释一个模型为什么给出某种答案,以及一个应用为什么能够或不能完成任务。

本章首先建立语言建模的研究对象,再沿发展历程解释表示、结构与训练方式的变化,介绍规模定律和涌现能力,进而区分模型、学习算法与应用系统。这里出现的概率式用于表达问题结构,具体推导将在后续数学与模型章节展开。

本章问题

语言模型学习的是何种分布?技术发展怎样改变表示与学习方式?规模增长能预测什么,任务能力又应怎样验证?一个预测概率怎样转化为生成决策?这些问题决定后续各章的论述层次。

1.1语言建模的研究对象

文本序列化

文本由字符组成,模型通常处理词元(Token)序列。词元是编码规则规定的离散单元,可以对应字节、字符、词的一部分或特定控制标记。给定有限词表 \(\mathcal V\),一段文本经分词器转换为

\[ x_{1:T}=(x_1,x_2,\ldots,x_T),\qquad x_t\in\mathcal V. \tag{1.1}\]

\(T\) 是编码后的序列长度,不必等于字符数或词数。词元编号只表示其在词表中的身份;编号相邻不意味着含义接近。连续向量表示及其学习属于模型的一部分,而不是整数编号本身的性质。

例如,“学习语言模型”可以被某种编码规则分成“学习”“语言”“模型”三个单元,也可以被另一种规则分成更多字符或字节单元。两种编码可以都正确恢复原文,但词元数量、词表大小和预测任务已经不同。因此,讨论上下文长度、每词元损失和生成速度时,需要同时知道所使用的编码规则。

语言模型给序列赋予概率。设参数集合为 \(\theta\),模型分布记为 \(p_\theta\)。概率链式法则允许将联合概率分解为

\[ p_\theta(x_{1:T})=\prod_{t=1}^{T}p_\theta(x_t\mid x_{<t}), \qquad x_{<t}=(x_1,\ldots,x_{t-1}). \tag{1.2}\]

第一个位置的条件前缀为空;实际系统也可以用约定的起始标记表示初始条件。式中每一项回答同一个问题:在当前前缀已知时,下一词元的概率如何分布?模型需要在词表上给出非负且总和为一的概率,而不是只给出一个词元。

(1.2)本身是概率恒等式。用神经网络计算条件概率、限制可读取的前缀长度、在位置间共享参数,才是具体的建模选择。区分恒等关系和模型假设,有助于避免把某种网络结构误认为语言建模的唯一形式。

条件生成及任务表示

在问答或翻译中,输入条件 \(c\) 与待生成序列 \(y_{1:T}\) 具有不同职责。模型描述的是

\[ p_\theta(y_{1:T}\mid c)=\prod_{t=1}^{T}p_\theta(y_t\mid c,y_{<t}). \tag{1.3}\]

\(c\) 可以包含问题、对话历史、检索材料或经过编码的图像特征。条件的表示方式不同,网络接收信息的路径也可能不同。把图像转为视觉特征后接入语言模型,与把图像描述写成文本,并不构成相同的条件信息。

训练数据决定模型能够从哪些条件与答案的对应关系中学习。目标函数决定哪些预测受到约束。即使采用相同的网络,一个只预测回答部分的训练过程,与一个同时预测问题和回答的过程,也可能学习到不同的行为偏好。

序列通常还需要终止规则。结束词元表达模型认为回答已经结束,最大长度则是运行时的外部限制。有限词表上每步概率归一化,不足以单独保证模型必然在有限时间内生成结束词元;系统还需要给出明确的终止条件。1

1.2语言模型的发展历程

语言模型的发展贯穿三条相互影响的线索:怎样表示上下文,怎样利用语料学习,以及怎样把预测能力用于任务。下述时间节点用于定位代表工作;不同路线长期并存,结构的提出时间也不等于它在语言建模中广泛使用的时间。

分布式词表示

Shannon 在1948年的通信理论工作中讨论了英语的统计近似,为把语言序列看作概率对象提供了早期基础(Shannon 1948)。传统统计语言模型常采用\(n\)元语言模型\(n\)-gram Language Model),用最近的 \(n-1\) 个词近似完整前缀:

\[ p(x_t\mid x_{<t})\approx p(x_t\mid x_{t-n+1:t-1}). \tag{1.4}\]

这里假定已为序列开头补入适当的起始标记。给定历史 \(h\),可用计数比 \(\frac{c(h,w)}{c(h)}\) 估计下一词为 \(w\) 的概率,其中 \(c(h,w)\) 为历史后出现该词的次数,\(c(h)\) 为历史出现次数。若历史未出现,分母为零;若某种接续未出现,直接估计又会赋予零概率。平滑、回退与插值据此分配概率质量,并在长短上下文之间共享统计证据。

增加 \(n\) 可以利用更多局部信息,却也增加了需要估计的组合数量。有限语料难以覆盖大量长片段,语义相近的词也不会因整数身份不同而自动共享证据。2003年 Bengio 等人的神经概率语言模型联合学习词的连续表示与条件概率,使相似表示可以参与共享计算(Bengio 等 2003)。它仍采用有限窗口,但把部分泛化能力交给了可学习的表示与函数,而不必为每种上下文单独保存一组频数。

循环状态及长程依赖

循环神经网络(Recurrent Neural Network,RNN)将前缀逐步写入隐状态。2010年 Mikolov 等人的循环语言模型是这一方向的代表工作(Mikolov 等 2010)。状态可随序列持续更新,因而摆脱了显式固定词窗口;不过,早期信息需要经过多次状态变换才能影响远处预测,学习容易受到梯度衰减或增长的影响。

长短期记忆(Long Short-Term Memory,LSTM)结构早在1997年已经提出,通过门控和记忆路径改善跨时间步的信息与梯度传递(Hochreiter 和 Schmidhuber 1997)。它与后来循环语言模型的应用属于不同的时间节点。门控能够缓解长程学习困难,但固定维度状态仍需压缩历史,训练计算也保留沿时间推进的依赖。由此产生两个后续问题:能否直接访问相关位置,以及能否提高长序列训练的并行程度?

预训练表示及 Transformer

把无标注语料中学到的表示迁移给下游任务,使不同任务可以共享语言知识。静态词向量为同一词型提供固定表示,但一词多义需要结合上下文区分。2018年的 ELMo 使用预训练双向语言模型的内部状态构造上下文相关表示,再把这些表示交给任务模型(Peters 等 2018)

2017年的 Transformer 以注意力组织序列到序列计算,使一个位置可以直接结合其他可见位置的信息,并允许训练时并行计算多个位置(Vaswani 等 2017)。这种并行性不消除自回归生成对前一步输出的依赖;密集注意力也引入随序列长度二次增长的位置交互。它改善了信息访问和训练计算的组织方式,同时带来了新的存储与计算约束。

2018年的 GPT 工作使用生成式预训练,再针对下游任务微调(Radford 等 2018);同年公开、2019年正式发表的 BERT 使用掩码预测学习双向表示(Devlin 等 2019)。二者体现了预训练与任务适配的不同路径。BERT 的双向掩码目标与 GPT 的因果下一词预测在可见信息和概率含义上有区别,不能因共同使用 Transformer 就视为相同的语言建模目标。

规模化、上下文学习及指令交互

2020年的 GPT-3 工作系统研究了在提示中给出说明或示例、保持参数不变的任务适应方式(Brown 等 2020)。这种上下文学习(In-Context Learning,ICL)改变输入条件,与通过梯度更新参数的微调不同。它拓宽了同一预训练模型的使用方式,但效果仍取决于任务、提示格式、示例选择与训练数据;少样本表现不能直接证明模型掌握了任意任务规则。

规模化还带来资源分配问题:同一计算预算应训练更大的模型,还是让较小模型读取更多数据?2020年的 Kaplan 等人研究与2022年的 Chinchilla 工作,使这一问题可以通过损失曲线和经验拟合讨论(Kaplan 等 2020; Hoffmann 等 2022)。参数增长、数据供给、优化过程及硬件系统共同影响结果,单独比较参数量不足以解释能力差异。

面向用户的交互还要求模型理解请求、遵循格式并体现偏好。2022年的 InstructGPT 工作结合示范数据微调与人类反馈训练,展示了对预训练模型行为进行进一步塑造的路径(Ouyang 等 2022)。语言建模损失、指令完成质量和偏好评价对应不同目标;后训练改善交互行为的证据,仍需按所用评价方式解释。

推理训练、多模态及工具扩展

后续发展沿多个方向展开。2023年的视觉指令微调工作把视觉表示接入语言交互(Liu 等 2023);ReAct 将推理文本与环境动作交替组织(Yao 等 2023);2025年的 DeepSeek-R1 报告研究了通过强化学习提升推理表现的训练路径(DeepSeek-AI 2025)。这些工作分别改变可接收的信息、可执行的动作和训练反馈,不能只用模型规模解释。

在训练完成后,系统还可以为困难问题分配更多生成、搜索或验证计算。额外计算是否改善答案,取决于候选质量、验证信号与选择方式;更长的输出并不自动更可靠。模型接入工具后,实际执行、状态管理与权限控制也需要由应用系统承担。沿这条发展线索阅读后续章节,应分别追问:结构改变了哪条信息路径,训练改变了哪个目标,系统又增加了什么外部条件?

1.3规模定律及涌现能力

规模定律的适用范围

规模定律(Scaling Law)是对模型、数据、计算与测量结果之间关系的经验描述。对语言模型,常见研究对象是在可比数据分布上测得的平均验证交叉熵。一个用于理解参数与数据约束的拟合形式为

\[ L(N,D)\approx E+\frac{A}{N^{\alpha}}+\frac{B_s}{D^{\beta}}, \qquad A,B_s,\alpha,\beta>0. \tag{1.5}\]

其中 \(N\) 为参数量,\(D\) 为训练词元数,\(E\) 为拟合底座,其余系数由实验估计。式子表示:在适用范围内,扩大参数或数据可以降低相应的损失余量;只扩大其中一项,另一项仍可能限制收益。拟合底座不应直接解释为已知的真实语言熵。

Kaplan 等人报告了特定实验条件下损失随规模变化的幂律规律;Chinchilla 工作进一步研究固定训练计算下的参数与数据配置,得到其计算最优范围内两者应近似同比例增长的结论(Kaplan 等 2020; Hoffmann 等 2022)。这些结果依赖各自的训练设置与拟合范围,不能转化为适用于所有模型的固定词元参数比。模型结构、语料质量、重复使用数据及推理服务成本变化,都可能改变预算选择。

对常见密集模型的粗略训练预算,可写成 \(C\approx\kappa ND\),其中 \(C\) 是训练计算量,\(\kappa\) 汇总结构与计算口径相关的系数。在固定 \(C\) 下增加 \(N\),通常需要压缩 \(D\),因此更大模型未必带来更低损失。第23章《预训练原理》进一步推导拟合、计算最优分配和外推验证。这里需要先掌握的判断是:规模定律用于有条件的预测与规划,任务正确率仍需单独测量。

涌现能力的度量

涌现能力(Emergent Abilities)在 Wei 等人的2022年研究中,指一些在较小模型中未观察到、在较大模型中出现,且难以从小规模表现外推的任务能力(Wei 等 2022)。这一说法描述的是给定模型系列、任务与测量方式下的现象。“小模型未观察到”受到测试集大小、随机基线、提示方式和评价粒度限制,并不直接说明其相关内部表示完全缺失。

2023年 Schaeffer 等人指出,一些表面上的突跃可以由非线性或不连续的评价指标产生;改变度量方式后,部分能力曲线呈现平滑改善(Schaeffer, Miranda, 和 Koyejo 2023)。这一结果要求检验度量的影响,也没有证明所有任务变化都能用同一种解释消除。任务要求完整答案正确时,精确匹配有实际意义;但仅凭该分数的跃升,尚不能推出内部机制发生了突变。

考虑一个用于说明度量效应的构造算例:答案包含10个位置,每个位置独立且以相同概率 \(q\) 正确,则整串完全正确的概率为 \(q^{10}\)。当 \(q\)\(0.5\) 增至 \(0.8\) 时,逐位置正确率从50%升至80%,整串正确率却从约0.10%升至10.74%。少量测试题上,前者可能长期测为零,随后才出现明显非零分数。此处的独立性只服务于算例,真实生成中的错误通常相关;这些数值不是语言模型实验结果。

因此,研究涌现时应同时报告严格任务指标与更细粒度的诊断指标,并在疑似转折附近增加规模点、重复实验和不确定性估计。模型之间的数据、训练目标、提示或解码方式若同时变化,观察到的差异也不能全部归因于规模。数据污染与样本记忆则需要另行排查。

平均损失及任务能力的关系

平均损失汇总大量预测位置,任务评分则可能只关心某个领域或要求多个步骤同时正确。前者平滑下降时,后者仍可能因阈值和组合要求而快速变化;平均改善也可能掩盖少数任务的退步。规模定律与涌现研究因此关注不同层次的观测。

训练计算与推理时计算也应分开记录。增加训练词元会改变参数的学习经历;增加候选采样或搜索预算则改变同一模型的使用过程。两者可以分别研究收益曲线,但不能把训练损失的幂律直接用于预测搜索成功率,更不能由任何一条曲线保证事实正确性、可靠推理或生产可用性。

1.4概率预测、学习目标及生成决策

统计估计

模型通常不能直接知道真实语言分布,只能观察有限语料。设数据集为 \(D=\{x^{(1)},\ldots,x^{(n)}\}\),一种基本学习方式是选择使观测数据似然尽可能大的参数,即最大似然估计:

\[ \theta^*\in\argmin_\theta\left[-\sum_{i=1}^{n}\log p_\theta(x^{(i)})\right]. \tag{1.6}\]

将序列概率分解代入,便得到逐词元负对数概率的求和。把它写成可微计算后,优化算法可以据此调整参数。预测、损失与参数更新构成训练计算的主线。

该目标说明模型受到什么监督,却不保证所有任务属性都被显式优化。训练语料可能包含错误,某些领域可能代表不足,模型也可能无法充分拟合已有数据。因此,“能生成自然语言”与“所述事实正确”不是可以互相替代的判断。事实核验、任务约束和系统控制仍需独立处理。

自监督学习从数据自身构造目标,下一词元预测就是其中一种方式。它不要求人工为每个词元另行标注,但仍依赖数据的采集、筛选、混合与组织。是否存在人工标签,不决定数据处理是否影响模型行为。

局部决策及序列决策

得到概率后,还需要决定如何选择输出。考虑只生成两个词元的简化任务。首步只有 \(a\)\(b\) 两个候选,其概率分别为 \(0.6\)\(0.4\)。第二步候选为 \(u\)\(v\),条件概率如下。

首词元 首步概率 \(p(u\mid\text{首词元})\) \(p(v\mid\text{首词元})\)
\(a\) \(0.6\) \(0.5\) \(0.5\)
\(b\) \(0.4\) \(0.9\) \(0.1\)

由乘法规则,四条完整序列的概率为

\begin{align} p(a,u)&=0.6\times0.5=0.30,&p(a,v)&=0.30,\tag{1.7}\\ p(b,u)&=0.4\times0.9=0.36,&p(b,v)&=0.04. \tag{1.8}\end{align}

四者之和为一。逐步选择最大条件概率的贪心策略先选择 \(a\),随后无论怎样处理第二步的并列,得到的序列概率都是 \(0.30\);联合概率最大的序列却是 \((b,u)\),其概率为 \(0.36\)。因此,局部最大选择并不保证完整序列的概率最大。

这个例子还没有给出哪条序列是任务的正确答案。概率是模型对数据规律的表达,任务正确性则由任务本身定义。即使能够精确找出最大概率序列,也仍需要检验它是否满足问题要求。采样、搜索和验证分别解决不同环节的问题。

1.5模型、算法及系统的分工

网络结构及学习过程

网络结构规定输入信息如何转为输出分数,包括表示维数、模块连接、注意力可见范围和非线性变换。训练算法规定数据如何被抽取、损失如何形成、梯度如何计算以及参数如何更新。相同结构经过不同数据和目标训练,可以获得不同能力;相同目标采用不同结构,也可能具有不同的计算和泛化特征。

Transformer 通过注意力交换位置信息,再通过逐位置非线性变换加工表示。编码器、因果解码器和编码器—解码器都可以由这些组件构成,但它们的可见性及输出目标不同。原始 Transformer 将注意力用于序列到序列建模(Vaswani 等 2017),不能将其中某个子层直接等同于一个完整语言模型。

模型规模也不是单一维度。参数数量反映所存储的可学习自由度,激活参数量描述某次计算实际使用的参数范围,上下文长度描述可接收的信息范围,而训练词元数描述训练暴露的数据量。这些量相互影响,但不能互相替代。

学习方式及结构坐标

监督学习(Supervised Learning)以给定标签或目标值约束预测;无监督学习(Unsupervised Learning)从观测中刻画分组、低维表示或分布结构;自监督学习(Self-Supervised Learning)由数据自身构造目标,例如用文本前缀预测后续词元;强化学习(Reinforcement Learning,RL)通过动作、状态转移和奖励优化决策。它们描述反馈来源和学习问题,并不分别对应一种固定网络。语言模型预训练的目标由数据自身构造,但优化时仍有明确的监督词元。

结构 核心机制 适用性与限制
线性模型/树模型 线性打分/递归划分特征空间 可形成表格任务基线;能力取决于特征与划分。
多层感知机(Multilayer Perceptron,MLP) 全连接映射与逐点非线性组合 适合固定维度表示,不自动利用空间邻接。
卷积神经网络(Convolutional Neural Network,CNN) 局部连接和空间共享参数 利用局部结构;跨远距离关系需多层或其他机制。
循环神经网络(Recurrent Neural Network,RNN) \(h_t=f_\theta(h_{t-1},x_t)\) 的递归状态 顺序更新;历史压缩在状态中,路径长度随时间增长。
Transformer 内容相关注意力与逐位置变换 可按可见性构造不同序列模型,计算代价随连接数增长。
扩散模型(Diffusion Model) 学习逐步去噪或对应连续动力学 在数据或潜空间生成;采样通常需多步计算。

长短期记忆是带门控状态的循环结构,使用不同路径控制记忆保留与更新;它仍保留递归时间依赖。上述坐标不是质量排名:局部连接、递归状态和注意力分别引入不同的归纳偏置(Inductive Bias),即在有限数据下偏向某些函数和信息交互方式。具体选择还要结合训练目标、数据规模和部署约束。

训练系统及应用系统

训练系统将语料变成参数,应用系统将请求变成结果。两者共享模型制品,却具有不同的状态和故障模式。训练关心数据消费、参数更新和恢复一致性;应用关心请求生命周期、响应时间、工具执行与结果有效性。

训练与应用的两条数据路径。实线表示数据或制品流动,虚线表示评估反馈;反馈进入下一轮修订,不自动改变正在服务的模型。
图 1.1 训练与应用的两条数据路径。实线表示数据或制品流动,虚线表示评估反馈;反馈进入下一轮修订,不自动改变正在服务的模型。

1.1中的模型制品不仅包含权重,还包括解释权重所需的结构配置、分词器和输入输出协议。对于适配器或多模态模型,还需要相应基座、处理器及连接模块。一个能够加载的权重文件,只说明某一层面的兼容性,并不证明输入处理、任务质量或运行性能正确。

GPU 提供计算和显存,主机负责数据处理与运行控制,网络承载通信,存储保存语料、模型和检查点。任一环节供给不足,都可能使其余资源等待。因此,算力规划需要考虑端到端数据路径,不能只把设备峰值算力相加。

检索及工具扩展能力的方式

检索增强生成从外部知识库选择材料,再把材料作为回答条件。工具调用则使应用能够执行查询、计算或业务操作。前者主要改变模型可见的信息,后者改变系统可以采取的动作。智能体进一步根据中间观察选择动作顺序,因而引入规划、记忆、状态恢复和终止等问题。

这些能力依赖模型外部的执行机制。模型产生一个工具名称和参数,不意味着相应动作已经发生;执行器必须检查参数、权限和运行结果。模型生成了一个引用,也不意味着引用材料确实支持该论断。系统需要保留这些区别,才能定位错误并采取有效修正。

1.6知识体系及学习路径

共同基础围绕一次模型请求建立概念链:文本如何成为词元与张量,注意力与网络怎样计算条件分布,生成策略怎样选择与终止输出,以及效果和风险怎样检验。数学知识先支撑这些基本对象与运算,再随具体推导加深。书前阅读说明给出各方向的章节顺序。

应用智能体系统关注任务、证据和执行结果,沿上下文学习、检索与 RAG 进入领域应用,再深入智能体架构和运行系统。Harness 是其中模型之外的执行与控制部分,重点在任务状态、工具权限和失败恢复。模型训练方法关注数据怎样改变模型行为,从监督微调和参数高效适配进入预训练、强化学习、人类反馈学习;完整梯度推导和训练目标属于这一方向的前置。

训练推理系统关注模型计算的资源与执行,先建立容量预算和硬件瓶颈分析,再分别进入训练系统或推理服务。训练分支需要理解反向传播和训练状态;推理分支需要理解增量解码、缓存与请求生命周期。数据、评估、安全和多模态按各方向的对象与任务深入。

选择方向时,以要解释和验证的对象为依据。同一个应用可以使用已有模型,模型适配可以使用已有训练框架,系统优化也可以在固定模型上开展;各方向在制品、接口和证据处衔接。学习成果应体现为可解释的机制、可核查的假设和可验证的判断。


  1. 固定长度序列的分布与所有有限长度序列的分布是不同对象。后者若由逐步生成定义,还需要考虑终止概率;截断运行时间则是一项外部策略。↩︎

WORKBOOK / 习题

配套习题与解析

先独立作答,再展开参考解析。选修题保留原书标记。

习题 1.1

在本章两步生成例子中,若将 \(p(u\mid b)\) 改为 \(0.7\),最大联合概率路径是否仍经过 \(b\)?写出全部路径概率后判断。

展开参考解析

条件分布仍须归一化,故 \(p(v\mid b)=0.3\)。四条路径为 \(0.6\times0.5=0.30\)\(0.30\)\(0.4\times0.7=0.28\)\(0.4\times0.3=0.12\)。最大路径改为经过 \(a\) 的两条并列路径,不再经过 \(b\)。仅改变一个条件概率而不相应调整另一项,会破坏本题的概率模型。

习题 1.2

同一段文本被两个分词器编码为不同长度,为什么不能仅比较每词元生成速度就断定哪个系统处理文本更快?

展开参考解析

设同一文本编码长度为 \(N_i\),每秒生成 \(r_i\) 个词元,纯解码时间约为 \(\frac{N_i}{r_i}\)。较大的 \(r_i\) 可能伴随更大的 \(N_i\);还应计入分词、预填充和调度。应固定原始文本、生成质量与停止条件,比较完整请求时延、字符或字节处理量,并记录两套分词器和输入输出长度。

习题 1.3

一个知识问答系统检索到了正确文档,却给出了错误答案。应检查哪些环节?为什么仅扩大模型不能保证解决问题?

展开参考解析

依次检查正确片段是否进入实际上下文、是否被截断或错误序列化、来源版本与时间是否匹配、答案是否忠实使用证据,以及引用是否对应具体论断。针对故障可调整切分、重排、上下文编排、证据校验或拒答条件。扩大参数量不能修复丢失片段、错引用或权限过滤错误;修复后用同一问题及干扰变体回归。

习题 1.4

某次修改使训练吞吐提高,但有效监督词元减少。需要补充哪些证据才能判断这是否是同一学习目标下的加速?

展开参考解析

同时记录原始词元数、有效监督数、标签掩码、样本来源权重、批量及更新次数。若缩短序列或增加被屏蔽位置,原始词元每秒提高不代表有效学习加速。应保持目标位置和权重一致,比较有效监督词元每秒、单位更新损失及独立验证质量;若目标改变,明确作为新训练方案比较。

REFERENCES

参考文献

Bengio, Yoshua, Réjean Ducharme, Pascal Vincent, 和 Christian Jauvin. 2003. 《A Neural Probabilistic Language Model》. Journal of Machine Learning Research 3: 1137–55. https://www.jmlr.org/papers/v3/bengio03a.html.
Brown, Tom B., Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, 等. 2020. 《Language Models are Few-Shot Learners》. 2020年. https://arxiv.org/abs/2005.14165.
DeepSeek-AI. 2025. 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》. 2025年. https://arxiv.org/abs/2501.12948v2.
Devlin, Jacob, Ming-Wei Chang, Kenton Lee, 和 Kristina Toutanova. 2019. 《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》. 收入 Proceedings of NAACL-HLT. https://aclanthology.org/N19-1423.
Hochreiter, Sepp, 和 Jürgen Schmidhuber. 1997. 《Long Short-Term Memory》. Neural Computation 9 (8): 1735–80. https://doi.org/10.1162/neco.1997.9.8.1735.
Hoffmann, Jordan, Sebastian Borgeaud, Arthur Mensch, 等. 2022. 《Training Compute-Optimal Large Language Models》. 2022年. https://arxiv.org/abs/2203.15556.
Kaplan, Jared, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, 和 Dario Amodei. 2020. 《Scaling Laws for Neural Language Models》. 2020年. https://arxiv.org/abs/2001.08361.
Liu, Haotian, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee. 2023. 《Visual Instruction Tuning》. https://arxiv.org/abs/2304.08485.
Mikolov, Tomáš, Martin Karafiát, Lukáš Burget, Jan Černocký, 和 Sanjeev Khudanpur. 2010. 《Recurrent Neural Network Based Language Model》. 收入 Proceedings of Interspeech 2010, 1045–48. https://doi.org/10.21437/Interspeech.2010-343.
Ouyang, Long, Jeff Wu, Xu Jiang, 等. 2022. 《Training language models to follow instructions with human feedback》. 2022年. https://arxiv.org/abs/2203.02155.
Peters, Matthew E., Mark Neumann, Mohit Iyyer, Matt Gardner, Christopher Clark, Kenton Lee, 和 Luke Zettlemoyer. 2018. 《Deep Contextualized Word Representations》. 2018年. https://arxiv.org/abs/1802.05365v2.
Radford, Alec, Karthik Narasimhan, Tim Salimans, 和 Ilya Sutskever. 2018. 《Improving Language Understanding by Generative Pre-Training》. OpenAI. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf.
Schaeffer, Rylan, Brando Miranda, 和 Sanmi Koyejo. 2023. 《Are Emergent Abilities of Large Language Models a Mirage?》 2023年. https://arxiv.org/abs/2304.15004v2.
Shannon, Claude E. 1948. 《A Mathematical Theory of Communication》. The Bell System Technical Journal 27: 379–423, 623–56. https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf.
Vaswani, Ashish, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, 和 Illia Polosukhin. 2017. 《Attention Is All You Need》. Advances in Neural Information Processing Systems 30. https://arxiv.org/abs/1706.03762.
Wei, Jason, Yi Tay, Rishi Bommasani, Colin Raffel, Barret Zoph, Sebastian Borgeaud, Dani Yogatama, 等. 2022. 《Emergent Abilities of Large Language Models》. 2022年. https://arxiv.org/abs/2206.07682v2.
Yao, Shunyu, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, 和 Yuan Cao. 2023. 《ReAct: Synergizing Reasoning and Acting in Language Models》. 收入 International Conference on Learning Representations. https://arxiv.org/abs/2210.03629.

搜索全书

搜索全书正文、习题与解析