L大语言模型从理论到实践
阅读 PDF ↗
大语言模型:从理论到实践

中英文术语索引

中文英文缩写
$n$元语言模型$n$-gram Language Model
四比特正态浮点4-bit NormalFloatNF4
八位浮点8-bit Floating PointFP8
绝对位置嵌入Absolute Positional Embedding
拒答Abstention
准确率Accuracy
声学词元Acoustic Token
动作价值Action Value
激活重计算Activation Recomputation
激活感知权重量化Activation-Aware Weight QuantizationAWQ
激活加权低秩近似Activation-weighted Low-rank Approximation
行动者—评论家Actor--Critic
适配器注册表Adapter Registry
适配器路由Adapter Routing
自适应低秩适配Adaptive Low-Rank AdaptationAdaLoRA
自适应矩估计Adaptive Moment EstimationAdam
准入控制Admission Control
优势函数Advantage Function
仿射量化Affine Quantization
仿射变换Affine Transformation
智能体Agent
智能体执行与控制系统Agent Harness
老化Aging
全收集All-Gather
全归约All-Reduce
全互换All-to-All
全互换通信All-to-All
美国数学邀请赛American Invitational Mathematics ExaminationAIME
答案规范化Answer Canonicalization
近似最近邻搜索Approximate Nearest Neighbor SearchANN
算术强度Arithmetic Intensity
制品完整性Artifact Integrity
保障论证Assurance Case
非对称距离计算Asymmetric Distance ComputationADC
注意力机制Attention
注意力蒸馏Attention Distillation
注意力掩码Attention Mask
自回归Autoregression
自回归空白填充Autoregressive Blank Infilling
无辅助损失负载均衡Auxiliary-Loss-Free Load Balancing
平均精确率Average PrecisionAP
后门Backdoor
背压Backpressure
束搜索Beam Search
序列开始符Beginning of SequenceBOS
旧策略Behavior Policy
贝尔曼方程Bellman Equation
基准测试Benchmark
最佳匹配评分Best Matching 25BM25
多候选择优Best-of-$K$ SelectionBest-of-$K$
多候选择优Best-of-N
基于 Transformer 的双向编码表示Bidirectional Encoder Representations from TransformersBERT
双线性插值Bilinear Interpolation
双语评估替代指标Bilingual Evaluation UnderstudyBLEU
割带宽Bisection Bandwidth
偏置微调BitFit
蓝绿部署Blue–Green Deployment
自助重采样Bootstrap
自举Bootstrapping
瓶颈适配器Bottleneck Adapter
脑浮点16Brain Floating Point 16BF16
缓存淘汰Cache Eviction
金丝雀发布Canary Release
容量因子Capacity Factor
灾难性遗忘Catastrophic Forgetting
因果注意力Causal Attention
因果编码器—解码器Causal Encoder-DecoderCED
因果掩码Causal Mask
中央处理器Central Processing UnitCPU
思维链Chain of ThoughtCoT
思维链提示Chain-of-Thought PromptingCoT Prompting
变更数据捕获Change Data CaptureCDC
会话模板Chat Template
检查点Checkpoint
中文大规模多任务语言理解Chinese Massive Multitask Language UnderstandingCMMLU
Chrome 开发者工具协议Chrome DevTools ProtocolCDP
分块预填充Chunked Prefill
分类标记Classification TokenCLS
无分类器引导Classifier-Free GuidanceCFG
干净样本预测Clean Sample Prediction
裁剪Clipping
闭合环负载Closed-Loop Load
簇重采样Cluster Bootstrap
合并访存Coalesced Memory Access
科恩一致性系数Cohen's Kappa$\kappa$
集合通信Collective Communication
合并Combine
比较并交换Compare-and-SwapCAS
补偿事务Compensating Transaction
压缩稀疏注意力第二代Compressed Sparse Attention 2CSA2
计算机操作Computer Use
条件计算Conditional Computation
条件独立Conditional Independence
条件记忆Conditional Memory
置信区间Confidence IntervalCI
混淆矩阵Confusion Matrix
连接器Connector
一致性Consistency
包含率Containment
上下文压缩Context Compression
上下文并行Context ParallelismCP
上下文窗口Context Window
上下文校准Contextual Calibration
继续预训练Continued PretrainingCPT
连续批处理Continuous Batching
对比语言图像预训练Contrastive Language-Image Pre-trainingCLIP
对比学习Contrastive Learning
控制面Control Plane
协调遗漏Coordinated Omission
写时复制Copy-on-WriteCoW
余弦衰减Cosine Decay
余弦相似度Cosine Similarity
反事实评估Counterfactual Evaluation
信用分配Credit Assignment
交叉编码器Cross Encoder
交叉注意力Cross-Attention
交叉注意力融合Cross-attention Fusion
交叉编码器Cross-encoder
交叉熵Cross-EntropyCE
跨模态对齐Cross-modal Alignment
课程学习Curriculum Learning
数据增强Data Augmentation
数据契约Data Contract
数据工程Data Engineering
数据新鲜度Data Freshness
数据血缘Data Lineage
数据防泄漏Data Loss PreventionDLP
数据面Data Plane
数据投毒Data Poisoning
截止期限Deadline
增量解码Decode
仅解码器Decoder-only
解耦权重衰减Decoupled Weight Decay
纵深防御Defense in Depth
删除血缘Deletion Lineage
去噪扩散隐式模型Denoising Diffusion Implicit ModelDDIM
去噪扩散概率模型Denoising Diffusion Probabilistic ModelDDPM
稠密专家混合Dense Mixture of Experts
稠密模型Dense Model
稠密检索Dense Retrieval
反量化Dequantization
设计效应Design Effect
确定性变换Deterministic Transformation
设备亲和性Device Affinity
差分隐私Differential PrivacyDP
扩散模型Diffusion Model
扩散 TransformerDiffusion TransformerDiT
数字签名Digital Signature
直接内存访问Direct Memory AccessDMA
直接偏好优化Direct Preference OptimizationDPO
直接提示注入Direct Prompt Injection
折损累计增益Discounted Cumulative GainDCG
分发Dispatch
分布式数据并行Distributed Data ParallelDDP
领域本体Domain Ontology
双重量化Double Quantization
排空Draining
随机失活Dropout
双编码器Dual Encoder
持久性Durability
持久执行Durable Execution
动态填充Dynamic Padding
动态量化Dynamic Quantization
动态分辨率Dynamic Resolution
嵌入Embedding
涌现能力Emergent Abilities
编码器—解码器Encoder--Decoder
仅编码器Encoder-only
序列结束符End of SequenceEOS
企业资源计划Enterprise Resource PlanningERP
Entropy
情景记忆Episodic Memory
待估目标量Estimand
欧氏距离Euclidean Distance
评测污染Evaluation Contamination
评估污染Evaluation Contamination
评测运行框架Evaluation Harness
证据组装Evidence Assembly
证据忠实度Evidence Faithfulness
证据下界Evidence Lower BoundELBO
精确去重Exact Deduplication
完全匹配Exact MatchEM
精确最近邻搜索Exact Nearest Neighbor Search
恰好一次Exactly-Once
示例库Example Bank
可执行验证器Executable Verifier
执行图回放Execution Graph Replay
期望校准误差Expected Calibration ErrorECE
专家并行Expert ParallelismEP
显式拥塞通知Explicit Congestion NotificationECN
暴露偏差Exposure Bias
F1 分数F1 Score
故障域Failure Domain
伪量化Fake Quantization
漏放False Negative
假负例False Negative
误拦False Positive
逐位置前馈网络Feed-Forward NetworkFFN
隔离令牌Fencing Token
少样本提示Few-Shot Prompting
中间填充Fill-in-the-MiddleFIM
细粒度专家Fine-Grained Expert
先到先服务First-Come, First-ServedFCFS
浮点操作数Floating-point OperationsFLOPs
流匹配Flow Matching
前向边缘分布Forward Marginal Distribution
前向过程Forward Process
新鲜度Freshness
全参数微调Full Fine-TuningFFT
完全分片数据并行Fully Sharded Data ParallelFSDP
融合反量化Fused Dequantization
成组调度Gang Scheduling
门控线性单元Gated Linear UnitGLU
门控网络Gating Network
高斯误差线性单元Gaussian Error Linear UnitGELU
高斯误差线性门控单元GELU-Gated Linear UnitGEGLU
广义优势估计Generalized Advantage EstimationGAE
生成式预训练 TransformerGenerative Pre-trained TransformerGPT
全局平均池化Global Average PoolingGAP
有效吞吐Goodput
生成式模型训练后量化GPTQ
梯度累积Gradient Accumulation
梯度范数裁剪Gradient Norm Clipping
研究生级难检索问答Graduate-Level Google-Proof Question AnsweringGPQA
图编译Graph Compilation
图形处理器Graphics Processing UnitGPU
贪心解码Greedy Decoding
动作定位Grounding
组相对策略优化Group Relative Policy OptimizationGRPO
分组划分Group Split
分组量化Group-Wise Quantization
分组查询注意力Grouped-Query AttentionGQA
半精度浮点Half Precision Floating PointFP16
幻觉Hallucination
硬标签Hard Label
难负例Hard Negative
队首阻塞Head-of-Line BlockingHOL Blocking
海森矩阵Hessian Matrix
分层可导航小世界图Hierarchical Navigable Small WorldHNSW
高带宽内存High Bandwidth MemoryHBM
命中率Hit RateHit@K
人类最后的考试Humanity's Last ExamHLE
混合检索Hybrid Retrieval
幂等性Idempotency
幂等键Idempotency Key
不可变制品Immutable Artifact
重要性采样Importance Sampling
批内负例In-Batch Negative
上下文学习In-Context LearningICL
事件响应Incident Response
增量解码Incremental Decoding
索引快照Index Snapshot
间接提示注入Indirect Prompt Injection
归纳偏置Inductive Bias
InfiniBand 网络InfiniBandIB
信息熵Information Entropy
信息检索Information RetrievalIR
内激活抑制与放大适配Infused Adapter by Inhibiting and Amplifying Inner ActivationsIA$^3$
每秒输入输出操作数Input/Output Operations Per SecondIOPS
指令微调Instruction Tuning
指令遵循评估Instruction-Following EvaluationIFEval
探索不足Insufficient Exploration
意向处理分析Intention-to-Treat AnalysisITT
词元间时延Inter-Token LatencyITL
中间表示蒸馏Intermediate Representation Distillation
逆文档频率Inverse Document FrequencyIDF
倒排文件向量索引Inverted File IndexIVF
倒排索引Inverted Index
迭代检索Iterative Retrieval
Jaccard 相似度Jaccard Similarity
雅可比矩阵Jacobian Matrix
越狱Jailbreak
KeyK
键值缓存Key--Value CacheKV Cache
键值缓存Key-Value CacheKV Cache
键值缓存量化Key-Value Cache Quantization
知识蒸馏Knowledge DistillationKD
库尔贝克—莱布勒散度Kullback--Leibler DivergenceKL
标签基数Label Cardinality
潜空间扩散Latent Diffusion
潜变量Latent Variable
层归一化Layer NormalizationLayerNorm
学习率预热Learning Rate Warmup
学习排序Learning to RankLTR
最小权限Least Privilege
留一基线Leave-one-out BaselineLOO Baseline
长度分桶Length Bucketing
线性探测Linear Probing
存活探针Liveness Probe
模型评审LLM-as-a-Judge
局部敏感哈希Locality-Sensitive HashingLSH
未归一化分数Logits
长短期记忆Long Short-Term MemoryLSTM
长期记忆Long-Term Memory
损失掩码Loss Mask
损失缩放Loss Scaling
中间信息利用退化Lost in the Middle
低精度训练Low-Precision Training
低秩适配Low-Rank AdaptationLoRA
低秩分解Low-rank Factorization
宏平均Macro Average
幅值剪枝Magnitude Pruning
发布清单Manifest
制造执行系统Manufacturing Execution SystemMES
边际收益Marginal Utility
马尔可夫决策过程Markov Decision ProcessMDP
掩码语言建模Masked Language ModelingMLM
大规模多学科多模态理解Massive Multi-discipline Multimodal UnderstandingMMMU
大规模多任务语言理解Massive Multitask Language UnderstandingMMLU
矩阵吸收Matrix Absorption
最大内积搜索Maximum Inner Product SearchMIPS
最大似然估计Maximum Likelihood EstimationMLE
平均倒数排名Mean Reciprocal RankMRR
成员推断Membership Inference
元数据Metadata
元数据过滤Metadata Filtering
微平均Micro Average
最小哈希MinHash
混合精度Mixed Precision
混合专家模型Mixture of ExpertsMoE
混合增强Mixup
模态Modality
模型适配器Model Adapter
模型制品Model Artifact
级联调用Model Cascade
模型压缩Model Compression
模型上下文协议Model Context ProtocolMCP
模型提取Model Extraction
模型路由Model Routing
动量Momentum
蒙特卡洛估计Monte Carlo EstimationMC
多智能体系统Multi-Agent SystemMAS
多头注意力Multi-Head AttentionMHA
多头潜在注意力Multi-Head Latent AttentionMLA
多头潜在注意力Multi-head Latent AttentionMLA
多查询注意力Multi-Query AttentionMQA
多轮共指消解Multi-Round Coreference ResolutionMRCR
多租户隔离Multi-tenant Isolation
多词元预测Multi-Token PredictionMTP
N-gram 语言模型N-gram Language Model
命名实体识别Named Entity RecognitionNER
负缓存Negative Cache
下一句预测Next Sentence PredictionNSP
噪声预测Noise Prediction
非一致内存访问Non-Uniform Memory AccessNUMA
非易失性存储器快速接口Non-Volatile Memory ExpressNVMe
归一化折损累计增益Normalized Discounted Cumulative GainnDCG
核采样Nucleus SamplingTop-p
可观测性Observability
观测Observation
占用率Occupancy
离策略学习Off-Policy Learning
卸载Offload
在策略学习On-Policy Learning
一前向一反向调度One-Forward-One-Backward1F1B
开放权重Open Weights
开放环负载Open-Loop Load
算子融合Operator Fusion
结果奖励模型Outcome Reward ModelORM
结果监督Outcome Supervision
超售比Oversubscription Ratio
连续提示调优P-Tuning
深层提示调优P-Tuning v2
分页键值缓存Paged KV Cache
分页优化器Paged Optimizer
参数高效微调Parameter-Efficient Fine-TuningPEFT
帕累托前沿Pareto Frontier
解析失败Parse Failure
部分可观测马尔可夫决策过程Partially Observable Markov Decision ProcessPOMDP
前 $k$ 次采样通过率Pass at kpass@k
补丁Patch
补丁嵌入Patch Embedding
补丁化Patchification
逐通道量化Per-Channel Quantization
逐张量量化Per-Tensor Quantization
高速串行计算机扩展总线Peripheral Component Interconnect ExpressPCIe
排列等变性Permutation Equivariance
排列不变性Permutation Invariance
置换检验Permutation Test
困惑度PerplexityPPL
个人可识别信息Personally Identifiable InformationPII
页锁定内存Pinned Memory
流水并行Pipeline ParallelismPP
规划执行架构Plan-and-Execute Architecture
策略滞后Policy Lag
位置插值Position InterpolationPI
后置层归一化Post-Layer NormalizationPost-LN
训练后量化Post-Training QuantizationPTQ
倒排列表Posting List
电能使用效率Power Usage EffectivenessPUE
前置层归一化Pre-Layer NormalizationPre-LN
精确率Precision
精确率—召回率曲线Precision--Recall CurvePR
抢占Preemption
偏好对Preference Pair
预填充Prefill
预填充与解码分离Prefill/Decode DisaggregationP/D 分离
预填充—解码分离Prefill–Decode DisaggregationP/D 分离
前缀缓存Prefix Cache
前缀解码器Prefix Decoder
前缀融合Prefix Fusion
前缀微调Prefix Tuning
预训练Pretraining
基于优先级的流量控制Priority-based Flow ControlPFC
隐私Privacy
概率校准Probability Calibration
概率密度函数Probability Density FunctionPDF
概率质量函数Probability Mass FunctionPMF
程序性记忆Procedural Memory
过程奖励模型Process Reward ModelPRM
过程监督Process Supervision
乘积量化Product QuantizationPQ
投影器Projector
提示注入Prompt Injection
提示微调Prompt Tuning
来源跨度Provenance Span
近端策略优化Proximal Policy OptimizationPPO
剪枝Pruning
量化校准Quantization Calibration
量化尺度Quantization Scale
量化感知训练Quantization-Aware TrainingQAT
量化低秩适配Quantized Low-Rank AdaptationQLoRA
查询QueryQ
查询分解Query Decomposition
查询改写Query Rewriting
查询变换器Querying TransformerQ-Former
序列级 RAGRAG-Sequence
词元级 RAGRAG-Token
随机变量Random Variable
随机对照实验Randomized Controlled Experiment
进程序号Rank
融合以太网远程直接内存访问RDMA over Converged EthernetRoCE
重排Re-ranking
反应式架构Reactive Architecture
就绪探针Readiness Probe
推理与行动交替Reasoning and ActingReAct
推理蒸馏Reasoning Distillation
推理强度Reasoning Effort
召回率Recall
面向召回的摘要评估指标Recall-Oriented Understudy for Gisting EvaluationROUGE
受试者工作特征曲线Receiver Operating CharacteristicROC
倒数排名融合Reciprocal Rank FusionRRF
核对Reconciliation
恢复训练Recovery Training
整流线性单元Rectified Linear UnitReLU
循环神经网络Recurrent Neural NetworkRNN
红队评估Red Teaming
归约散播Reduce-Scatter
引用计数Reference Counting
参考策略Reference Policy
强化学习Reinforcement LearningRL
基于人类反馈的强化学习Reinforcement Learning from Human FeedbackRLHF
可验证奖励强化学习Reinforcement Learning with Verifiable RewardsRLVR
拒绝采样微调Rejection Sampling Fine-TuningRFT
可靠性Reliability
远程直接内存访问Remote Direct Memory AccessRDMA
回放数据Replay Data
再量化Requantization
重排序Reranking
重采样器Resampler
检索增强生成Retrieval-Augmented GenerationRAG
反向条件后验Reverse Conditional Posterior
反向过程Reverse Process
奖励投机Reward Hacking
环形缓存Ring Buffer
屋顶线模型Roofline Model
均方根归一化Root Mean Square NormalizationRMSNorm
旋转位置编码Rotary Position EmbeddingRoPE
最近舍入Round to NearestRTN
路由器Router
评分量表Rubric
行为安全Safety
采样率Sampling Rate
样本单位Sampling Unit
沙箱验证Sandbox Verification
饱和误差Saturation Error
缩放点积注意力Scaled Dot-Product Attention
规模定律Scaling Law
结构模式Schema
数据模式Schema
模式适配器Schema Adapter
得分函数Score Function
得分函数估计Score-Function Estimation
安全防护Security
自注意力Self-Attention
自一致性Self-Consistency
自监督学习Self-Supervised Learning
语义切分Semantic Chunking
语义记忆Semantic Memory
半结构化稀疏Semi-structured Sparsity
序列打包Sequence Packing
序列装箱Sequence Packing
序列并行Sequence ParallelismSP
序列级蒸馏Sequence-level Distillation
服务端发送事件Server-Sent EventsSSE
服务降级Service Degradation
影子流量Shadow Traffic
形状分桶Shape Bucketing
分片Shard
共享专家Shared Expert
连续片段Shingle
短时傅里叶变换Short-Time Fourier TransformSTFT
副作用Side Effect
Sigmoid线性单元Sigmoid Linear UnitSiLU
信噪比Signal-to-Noise RatioSNR
简化噪声损失Simplified Noise Loss
单指令多线程Single Instruction, Multiple ThreadsSIMT
奇异值分解Singular Value DecompositionSVD
正弦位置编码Sinusoidal Positional Encoding
技能Skill
切片评估Slice Evaluation
滑动窗口注意力Sliding-Window Attention
平滑量化SmoothQuant
快照清单Snapshot Manifest
软标签Soft Label
软专家混合Soft Mixture of ExpertsSoft MoE
软提示Soft Prompt
归一化指数函数Softmax
软件物料清单Software Bill of MaterialsSBOM
稀疏注意力Sparse Attention
稀疏专家混合Sparse Mixture of Experts
稀疏专家模型Sparse Mixture-of-Experts ModelMoE
稀疏检索Sparse Retrieval
稀疏奖励Sparse Reward
稀疏率Sparsity
推测解码Speculative Decoding
启动探针Startup Probe
启动风暴Startup Storm
状态机State Machine
状态价值State Value
静态批处理Static Batching
静态量化Static Quantization
直通估计器Straight-Through EstimatorSTE
流式读取Streaming
流式因果性Streaming Causality
流式多处理器Streaming MultiprocessorSM
强扩展Strong Scaling
结构化剪枝Structured Pruning
监督微调Supervised Fine-TuningSFT
监督学习Supervised Learning
监督者架构Supervisor Architecture
支持集Support
替代目标Surrogate Objective
Swish门控线性单元Swish-Gated Linear UnitSwiGLU
对称量化Symmetric Quantization
合成数据Synthetic Data
合成指令数据Synthetic Instruction Data
任务单元Task Unit
教师强制Teacher Forcing
温度缩放Temperature Scaling
温度混合Temperature-Based Mixing
时间对齐Temporal Alignment
时序差分Temporal DifferenceTD
张量核心Tensor Core
张量并行Tensor ParallelismTP
词项Term
测试污染Test Contamination
测试时计算Test-Time Compute
测试时计算Test-time Compute
威胁模型Threat Model
每输出词元时间Time per Output TokenTPOT
平均输出词元时间Time per Output TokenTPOT
首词元时延Time to First TokenTTFT
首词元延迟Time to First TokenTTFT
存活时间Time to LiveTTL
检查与使用时差Time-of-Check to Time-of-UseTOCTOU
词元 F1Token F1
词元物化Token Materialization
词元级蒸馏Token-level Distillation
删除标记Tombstone
工具调用Tool Calling
前 $k$ 项采样Top-k Sampling
总拥有成本Total Cost of OwnershipTCO
训练块Training Block
轨迹Trajectory
轨迹回放Trajectory Replay
事务发件箱Transactional Outbox
平移等变性Translation Equivariance
信任边界Trust Boundary
二维位置插值Two-Dimensional Positional Interpolation
类型化记录Typed Record
U形网络U-Net
非结构化剪枝Unstructured Pruning
无监督学习Unsupervised Learning
ValueV
信息价值Value of InformationVOI
变分自编码器Variational AutoencoderVAE
向量雅可比积Vector--Jacobian ProductVJP
速度参数化Velocity Parameterization
标签词Verbalizer
验证器Verifier
视觉 TransformerVision TransformerViT
视觉语言模型Vision-Language ModelVLM
视觉指令微调Visual Instruction Tuning
线程束Warp
弱扩展Weak Scaling
WebDriver 双向协议WebDriver BiDi
权重绑定Weight Tying
权重分解低秩适配Weight-Decomposed Low-Rank AdaptationDoRA
仅权重量化Weight-Only Quantization
威尔逊区间Wilson Interval
工作流Workflow
工作记忆Working Memory
零点Zero Point
零冗余优化器Zero Redundancy OptimizerZeRO
零样本提示Zero-Shot Prompting
零方差组Zero-variance Group

搜索全书

搜索全书正文、习题与解析