L大语言模型从理论到实践
阅读 PDF ↗
CHAPTER 14

领域应用

领域应用不是给通用模型增加一个行业名称。它需要明确要改善的工作、可依赖的知识、允许改变的业务状态,以及谁能判定结果合格。同一模型在文本归纳上表现良好,并不能推出它能独立完成合同判断、设备处置或专业决策。应用设计应从具体任务及其证据要求出发。

本章沿用第13章《检索增强生成》第16章《智能体运行系统》的机制,讨论知识服务、业务流程、工业与专业服务。NIST AI RMF 1.0 将使用情境、测量与持续管理纳入系统生命周期(National Institute of Standards and Technology 2023);本章据此强调任务级证据,而不把框架名称作为应用已合格的证明。

14.1任务定义及方法选择

业务任务定义

任务单元(Task Unit)是可计数、可验收的一次业务工作,例如从一份指定版本的合同抽取付款条件,或为一个告警建立内容完整的待审工单。任务单元需要固定输入边界、输出结构、容许失败、人工职责和结束条件。只写“提升效率”无法确定分母,也无法区分更快完成与更快产生待返工内容。

设输入为 \(x\),外部事实状态为 \(z\),系统输出或动作为 \(a\),业务损失为 \(L(a,z)\)。理想决策可写为

\[ a^*(x)=\arg\min_{a\in\mathcal A(x)}\mathbb E[L(a,z)\mid x], \tag{14.1}\]

其中 \(\mathcal A(x)\) 是权限、业务规则和资源约束允许的动作集合。概率估计、损失函数与可行动作都需要领域依据;模型生成概率不是业务正确概率,不能直接代入式(14.1)。本章主要符号见表14.1

表 14.1 领域应用的主要符号与计量对象。

符号 含义
\(x,z,a\) 输入、真实业务状态与输出或动作。
\(L(a,z),\mathcal A(x)\) 业务损失及允许动作集合。
\(Y(1),Y(0)\) 同一任务在辅助流程与原流程下的潜在结果。
\(T_0,T_a,T_r,T_w\) 原处理时间、辅助操作时间、复核时间与返工时间。
\(p,C_e,C_h\) 经校准的正确概率、错误损失与人工处置成本。
\(N,n_s,n_h\) 任务总数、合格完成数与人工干预数。

提示、检索、微调及工具的选择

表 14.2 业务缺口、候选机制及其验证边界。

主要缺口 对应机制 必须验证的边界
目标或格式不清楚 指令、示例与结构化输出 是否覆盖难例,解析有效是否伴随内容正确。
事实不在上下文或更新频繁 检索与证据组装 权限、版本、召回及逐声明支持。
稳定任务行为与表达需要适配 监督微调或参数高效微调 数据代表性、遗忘、域外表现及维护成本。
需要精确计算或实时状态 受控计算与业务查询工具 单位、对象身份、时间、新鲜度和错误传播。
需要改变业务状态 有授权的动作执行与持久运行 幂等、审批、回执、补偿与恢复。

14.2中的机制可以组合。微调能改善术语与任务行为,却不能自动替代每日变化的库存读取;检索能补充文档,却不能替代数据库约束;增加动态规划也不能修复身份映射错误。方法选择首先对应已定位的缺口,再通过对照实验判断是否必要。

14.2领域知识及数据契约

事实的时间对象及单位

同一句“库存为100”缺少物料、仓库、批次、单位、状态和时点,通常不足以驱动动作。领域数据应把这些条件作为字段,而非期望模型从上下文猜测。知识文档还需要适用范围、生效日期、废止关系和来源等级;历史有效与当前有效必须区别。

领域本体(Domain Ontology)描述实体类型及其关系;应用可以从稳定的术语映射、枚举和主数据关系开始,并不要求先建立庞大知识图谱。例如设备标识、工位、维护计划与故障代码的映射必须来自受信主数据。检索相似的设备名称不能替代精确对象解析。

表格与文档抽取要保留单位、列标题、脚注和跨页关系。金额的币种、数量的计量单位、日期的时区或业务日口径都会影响结论。计算交给具有明确输入类型与规则的工具,模型负责解释经核对的结果;工具同样可能接收错误输入,所以必须核查抽取证据及单位转换。

专家反馈的可靠性

专家标注应记录问题、证据版本、判断标准和分歧处理。同一文本在不同业务时点可能有不同答案;多数票也可能掩盖专业分工差异。首先澄清任务定义,再建立双人复核或仲裁,而不是机械合并所有意见。

训练集与评估集按文档、客户、设备或时间等真实关联单位分组,避免同一事实的不同切块跨集合泄漏。上线后的失败样本很有价值,但通常偏向被发现的问题;不能直接将其分布视为全部业务分布。主动收集成功、拒答、人工改写和未被采用的建议,才能理解完整行为。

14.3知识及文档密集型应用

(选修)

企业知识服务

知识助手应将回答拆成可以核验的声明,每项声明关联到证据的局部位置。检索到文件名并不证明具体结论得到支持。权限过滤、版本冲突和无答案路径是正常流程:若政策版本不同,应呈现适用范围与冲突,而非让模型静默混合。

可以分别测量材料召回、有效证据覆盖、声明支持、回答完整与任务完成。用户点赞同时受措辞与速度影响,不能独立作为事实准确性指标。多轮对话还应保存查询时点,避免把前轮已过时状态当作当前事实。

合同审阅及财务分析

合同应用可先把任务限定为条款定位、字段抽取、版本差异和待审问题清单。每个结果保留原文位置、条件与例外;风险标签是供专业人员复核的工作产物,不能仅凭模型置信措辞变成法律结论。条款的行业、地域、主体和生效条件可能改变适用性,因此应由领域流程确定判断标准。

财务分析首先区分已披露事实、计算所得指标和预测假设。抽取金额必须保留币种、期间、合并口径与单位;同比比较要确认基期和重述版本一致。设当期值为 \(v_1\)、基期值为 \(v_0>0\),增长率 \(\frac{v_1-v_0}{v_0}\) 的计算简单,错误常来自两个数不具有可比性。基期为零或符号变化时,应另行解释而非输出无意义百分比。

结论

对专业文档,应用职责可以限定为信息整理与证据定位,并在指定任务集上验证其可靠性;是否允许进一步作出专业判断,需要独立的任务验证和责任安排。本章讨论系统设计,不据此给出具体法律、投资或医疗处置意见。

14.4业务流程及工业应用

(选修)

客服、工单及办公流程

客服任务应区分回答政策、解释订单状态和执行退款等动作。回答正确但重复创建工单仍属于端到端失败;工单创建成功但缺少必要信息也可能增加后续处理成本。流程指标因此需要覆盖首次解决、重开、转交、返工和最终业务结果。

自动分派可先生成结构化候选,规则层检查队列范围、责任归属与服务级别,再由业务系统条件更新。办公流程中的审批人、金额阈值和组织权限来自主数据及规则系统,不应由模型臆测。跨步骤恢复机制见第16章《智能体运行系统》中的持久运行系统。

制造业知识及 ERP/MES 集成

企业资源计划(Enterprise Resource Planning,ERP)与制造执行系统(Manufacturing Execution System,MES)承载不同粒度的业务状态。大模型应用可以检索作业指导书、汇总异常记录、解释经校验的生产数据,并准备待审业务动作,但不能把自然语言建议直接等同于设备控制指令。

例如解释设备告警时,系统需要关联设备标识、固件或配置版本、告警时间、工况、维护记录和适用指导书。日志中的先后发生不自动构成因果关系,模型提出的故障假设应与已观察事实分列。若需修改工单或维护计划,使用版本条件与回执;若涉及实时控制,则必须遵循控制系统自身的确定性约束与验证边界。

领域应用以事实、受控执行和业务反馈形成闭环。
图 14.1 领域应用以事实、受控执行和业务反馈形成闭环。

14.1将知识解释与业务更新分开;只有经过授权和前置状态检查的动作才能产生业务回执,模型层不能越过执行控制层。

14.5专业服务及研发应用

(选修) 教育辅导的目标可以是解释概念、提供分层提示或帮助发现错误。直接给出答案与促进学习不是同一指标,应观察学生后续独立完成能力,而非仅观察当次对话满意度。评价需要区分年龄、先修知识、题目泄漏及帮助程度。

医疗信息辅助可限定为资料检索、记录整理和供专业人员核对的摘要。资料的适用人群、时点、证据等级和缺失信息必须保留;摘要遗漏与编造同样重要。系统是否可以参与具体决策,需要超出文本基准的场景验证,不能由一般问答准确率推导。

科研知识服务应区分论文报告、复现结果与作者推测,保留实验条件及不一致证据。引用存在不等于论点得到支持;自动文献综述应避免只收集支持最初假设的材料。生成新的研究假设可以有价值,但其身份始终是假设,必须经过独立验证。

代码研发助手的任务可包括定位、修改、测试与评审。编译通过只说明满足一部分语法或类型约束;测试通过也只支持测试实际覆盖的行为。应记录变更范围、依赖、真实运行证据和未覆盖场景。外部仓库内容与执行输出属于资料,不能扩张凭证或发布权限。

这些领域共享一个原则:将系统能力限定为可以证明的任务行为,再根据证据扩展。不同领域的责任与误差成本不相同,不能共用一个通用通过率作为所有上线门槛。

14.6业务效果的计算及归因

复核返工成本

设原流程每任务耗时 \(T_0\),辅助流程包含操作 \(T_a\)、复核 \(T_r\) 与平均返工 \(T_w\),则平均净节省为

\[ \Delta T=\mathbb E[T_0]-\mathbb E[T_a+T_r+T_w]. \tag{14.2}\]

返工为零只适用于确实没有返工的任务,不能因为日志未记录就填零。若生成节省时间,但复核更慢,总收益可能为负。

考虑一个明确的构造算例:每任务原需12分钟,辅助操作4分钟,复核3分钟,20%任务还需10分钟返工。新平均时间为 \(4+3+0.2\times10=9\) 分钟,净节省3分钟,而非仅用 \(12-4=8\) 分钟。100个任务节省300分钟;这还没有扣除维护、评估和部署投入。

自动化覆盖及错误成本

设某任务经独立校准的正确概率为 \(p\),错误成本为 \(C_e\),人工处理成本为 \(C_h\)。在简化假设“正确自动处理无额外成本,人工结果无错误”下,自动处理的期望损失为 \((1-p)C_e\),因此只有

\[ p\ge 1-\frac{C_h}{C_e} \tag{14.3}\]

时自动处理的期望成本不高于人工。若自动处理也有成本 \(C_a\)、人工仍有残余风险,则必须把两者加入比较。这是阈值机制的解释,不是可直接投入业务的通用分数门槛。

提高阈值通常降低自动覆盖率。应一起报告覆盖率与被自动处理部分的错误率,并核查被转交任务是否使人工负担更重。模型自报“90%确定”并不满足上述校准前提;需要用历史标注与独立评估建立置信估计。

对照实验及分母

\(Y_i(1),Y_i(0)\) 表示同一任务在辅助和原流程下的潜在结果,目标平均效应为 \(\mathbb E[Y(1)-Y(0)]\)。同一任务通常只能观察一种处理结果,因此简单上线前后比较还混有任务难度、人员和季节变化。随机分配或适当的配对设计有助于隔离这些因素,统计方法见第9章《模型评估》

如果同一工作人员同时接触两种流程并把学到的方法用于对照组,可能发生干预扩散;如果任务来自同一客户或设备,样本也可能相关。应按实际关联层级分组或在分析中处理相关性,不能把所有消息当作独立任务扩大样本量。

表 14.3 领域应用评估指标及其统计口径。

指标 定义 必须说明的口径
任务成功率 \(\frac{n_s}{N}\) 合格标准、拒答与放弃是否计入。
人工干预率 \(\frac{n_h}{N}\) 一次或多次干预如何计数。
平均处理时长 总任务处理时间除以任务数 是否包含等待、复核和返工。
单位合格任务成本 总流程成本除以 \(n_s\) 失败消耗与人工成本是否包含。
自动覆盖率 自动结束任务数除以 \(N\) 自动结束是否同时满足质量门槛。

14.3采用统一分母解释指标。例如提交1000项任务,700项自动结束,其中630项合格,另有270项经人工后合格、30项仍失败。自动覆盖率70%,自动部分合格率90%,整体成功率90%。若只报告“自动完成700项”,会隐去70项自动错误。这个算例说明分母如何改变解释,并不代表某系统的测量结果。

14.7失败归因及改进

失败可以来自对象识别、数据新鲜度、检索、解释、工具参数、执行、复核或任务定义。应保存最小必要证据以重建失败,不用“模型不够强”替代定位。一次改进尽量对应明确机制,并在冻结对照集上观察回归:更长上下文可能改善材料覆盖却增加错误混合,更强重排也可能压低少数来源的可见性。

算法14.1 计算过程

领域应用的证据闭环。

  1. 定义任务单元、输出契约、允许动作与业务损失,指定结果判定者。

  2. 建立带来源、版本、权限和时间的领域样本,并按关联对象与时间划分训练、开发和评估。

  3. 保留原流程基线,选择与已定位缺口对应的提示、检索、适配或工具机制。

  4. 记录端到端结果、人工干预、返工、成本及失败原因;对拒答和未知结果单独保留状态。

  5. 以对照或配对方案评估收益,同时检查关键切片和业务约束,避免用总体均值掩盖局部损害。

  6. 只在证据支持的范围内扩大使用;知识、模型、工具或流程变化后对受影响任务重新评估。

WORKBOOK / 习题

配套习题与解析

先独立作答,再展开参考解析。选修题保留原书标记。

习题 14.1

将“提升客服效率”改写为可计数任务,定义输入、输出、结束条件与失败。

展开参考解析

可定义“在授权知识范围内处理一条退换货咨询”:输入订单身份、用户问题及规则版本;输出附证据答复或需人工原因;结束为用户所需信息已核验给出或明确转交。记录每请求处理时间、首次解决、错误承诺和人工干预,超时也是失败状态。满意度可附带,但不是唯一结束判据。

习题 14.2选修

为合同条款抽取设计证据记录,说明为何仅保存文件名不足以复核。

展开参考解析

证据记录包含合同ID与哈希、修订、生效日、页码及条款位置、原文跨度、结构化字段、单位与例外、提取器版本和核验人。文件名可以重复或内容被替换,不能固定证据对象。把“自动续期”提取为布尔值时还须保存期限、通知条件及例外,否则结构虽正确却丢失法律语义。

习题 14.3选修

对库存查询列出身份、单位、状态与时间字段,并构造遗漏任一字段导致错误的例子。

展开参考解析

至少包含租户/查询者、SKU及仓库、数量单位、在库/可用/冻结等状态、业务时间和快照版本。缺身份可查到其他租户;缺单位把箱数当件数;缺状态把冻结库存当可用;缺时间把昨日余额当当前承诺。涉及实际预留还需原子条件写,查询正确不保证稍后库存仍足。

习题 14.4

根据式14.2计算辅助操作5分钟、复核4分钟、30%任务返工8分钟时,相对12分钟原流程的净收益。

展开参考解析

新期望时间为\(5+4+0.3\times8=11.4\)分钟,净节省\(12-11.4=0.6\)分钟/任务,即5%。100任务只节省60分钟,维护、评估和系统成本未计;若这些摊销超过0.6分钟等价成本则净收益可变负。不能仅比较原12与辅助5得7分钟节省。

习题 14.5

将自动与人工两种决策都加入执行成本及残余错误,重新推导自动化阈值。

展开参考解析

令自动成本\(a\)、正确概率p、错损L;人工成本\(h\)、残余错率e,暂设错损相同且正确损失为0。自动风险\(a+(1-p)L\),人工风险\(h+eL\);自动优于人工要求 \(p>1-e+\frac{a-h}{L}\),L须正,阈值超范围时作总选某行动解释。若人工错误也依案例变化,使用\(e(x)\)并逐例比较;拒答等第三动作须一并纳入。

习题 14.6选修

为制造业告警分析区分观察、统计关联、故障假设与已确认原因。

展开参考解析

观察是“14:02温度传感器读数超阈值”;关联是“历史同类告警常伴随冷却流量下降”;假设是“可能堵塞导致冷却不足”;确认原因需现场检查、控制实验或维护证据证明具体堵塞并排除替代解释。模型可组织证据和提出假设,不能将相关性自动升级为已确认故障,更不能据此绕过工业控制许可。

习题 14.7选修

为什么教育对话满意度不能直接证明学习效果?设计更贴近目标的测量。

展开参考解析

满意度受流畅、迎合和即时情绪影响,学习效果要观察知识或迁移技能的变化。可按学生随机分组或分层,使用等价前测后测、延迟保持测试和未见过的迁移题,控制教师与学习时长,按学生为独立单位。需要报告原始水平、缺失和帮助次数,不能把多轮点赞当独立学习增益。

习题 14.8选修

给出一项代码任务,说明编译、测试、评审与真实部署分别证明什么。

展开参考解析

以修复金额舍入为例:编译仅证明语法和类型满足编译器;单元/集成测试检查有限输入及接口;评审检查设计、边界和可维护性但仍有漏检;部署验证在真实依赖和流量中是否满足指标。每层应保存对应证据,测试通过不代表已发布,发布成功也不自动证明所有金额正确。

习题 14.9

构造上线前后成功率改善但实际处理能力未改善的任务分布变化。

展开参考解析

简单任务正确率0.95、困难0.50固定。上线前各占一半,总体0.725;上线后简单占80%,总体0.86。总分上升0.135而各切片能力未变。应以固定任务分布加权比较,另报告真实流量构成,避免把更容易的请求归功于模型升级。

习题 14.10选修

设计以设备为分组单位的评估划分,解释随机划分日志行的泄漏风险。

展开参考解析

将同设备全部日志放同一训练/验证/测试组,测试设备不能在训练中出现;若预测未来,还按时间留出。随机按行会让相邻传感器窗口、设备ID和同一次故障模式泄入两侧,结果可能依赖记忆而非跨设备泛化。应另测新设备和已知设备未来两个目标,不混称同一个泛化问题。

习题 14.11

在自动覆盖算例中,将所有自动错误交给人工返工,重新定义干预率与成本分母。

展开参考解析

原1000任务中300经人工,700自动含70错误。若70错误都被识别并转人工,则至少370个不同任务受干预,干预率37%;700不是最终无人工覆盖,真正完全自动且正确仅630,即63%。新增70的返工成功率与耗时题设未给,不能断言最终成功970;若其成功率r,则总成功\(900+70r\)。成本应以1000全部提交任务平均,含自动尝试后返工双重成本。

习题 14.12

为一个领域应用制定可复现失败记录,明确哪些敏感信息不需要保存原文。

展开参考解析

保留任务类别、版本化输入引用、目标与实际行为、证据版本、工具动作/回执、终止原因及最小复现条件。敏感正文可放受控存储并用短期授权引用,日志保存哈希、字段类别或脱敏片段;凭据与无关个人信息不应记录。删除/保留期限、访问审计和回归样本用途需清楚,失败可复现不等于复制全部生产数据。

习题 14.13

制造业知识助手根据维修文档给出高置信故障判断,并建议调整设备控制参数。设计从证据检索到允许执行动作的流程,区分模型置信度、操作权限和独立安全约束,并说明审计记录应包含哪些信息。

展开参考解析

先核对文档版本、设备型号与运行条件,区分观测事实、相关线索、诊断假设和已确认原因。模型置信度可作为待评估信号,不能授予操作权限或证明物理安全。业务动作应由受控接口校验身份、对象、参数范围和前置状态,按风险执行审批,并由独立的确定性安全约束与联锁限制危险控制。记录证据来源、建议、批准主体、执行前状态、实际参数、执行结果及失败处置;对重复请求与状态变化规定幂等和一致性策略。执行后的独立状态核验用于确认效果,模型生成的成功描述不能代替设备证据。

REFERENCES

参考文献

National Institute of Standards and Technology. 2023. 《Artificial Intelligence Risk Management Framework (AI RMF 1.0)》. NIST AI 100-1. National Institute of Standards; Technology. https://doi.org/10.6028/NIST.AI.100-1.

搜索全书

搜索全书正文、习题与解析