# LLM-02｜训练、推理与能力边界

核验日期：2026-10-10。学习目标：分清训练和当前会话，判断一个答案的知识来源，为自己的资产任务建立评价办法。

![训练与使用的逻辑架构图](<../../图表/LLM-02_架构.svg>)

## 1. 训练改变参数

模型参数是训练中调整的数值。训练流程为：提供样本、计算预测、与训练目标比较得到损失、计算梯度、由优化器调整参数，再处理其他样本。推理使用已经训练好的参数产生输出，通常不会在每次聊天后更新这些参数。

语言模型的常见预训练目标是利用前文预测后续 Token。目标描述了模型怎样学习；它不等于模型只会机械复述训练句子。大量数据与优化可以形成可迁移的模式，也会留下分布偏差和缺口。参数量、数据量与计算预算的取舍可参考 [Training Compute-Optimal Large Language Models](<https://arxiv.org/abs/2203.15556>)，不能只按参数量判断自己的任务效果。

## 2. 预训练与项目事实的距离

预训练可能包含语言、代码、文档和其他数据。不同产品的数据与训练配方公开程度不同。不能看到模型会写 UE 脚本，就断定它读过当前 Aipcg 仓库或知道当前资产尺寸。

最常见的工程落差是：模型知道通用 API，但项目使用特定版本、私有封装和不同字段。让 Agent 阅读项目并查询实时环境，可以补充这些事实；这属于上下文和工具使用，不等于给模型重新训练。

数据覆盖、重复、噪声和标注方式会影响学习。公开训练资料并不能保证输出没有偏差；一个流畅回答也不能反向证明某条信息来自训练集中的哪个样本。

## 3. 后训练塑造可用行为

监督微调用示范输入输出调整模型，让它更符合任务或对话形式。偏好学习利用多个回答之间的比较，调整模型的行为偏好。强化学习可以依据奖励或可核验结果进行优化。这里是常见方法的区别，不宣称所有模型采用同一流水线。

[Training language models to follow instructions with human feedback](<https://arxiv.org/abs/2203.02155>) 描述了一个具体的示范、偏好和奖励优化体系。它解释指令遵循为何可能改善，也不保证每次输出正确。用更礼貌的语言承认错误，与能稳定解决特定 API 问题，应分别评估。

对于代码、数学等可验证任务，测试结果可提供反馈；测试不充分也可能奖励“通过样例但实际不满足要求”的行为。因此奖励设计、测试覆盖和业务目标之间仍有距离。

## 4. 推理的时间与资源

一次请求可拆成上下文处理和输出生成。首字延迟衡量多久出现第一段结果；生成速度衡量之后输出的速度；总耗时还包括网络、工具、重试和人工等待。长上下文和长回答通常消耗更多资源，但实际关系取决于模型与部署。

推理预算可影响某些模型投入多少计算，不能假设所有产品都有相同开关。缓存减少重复处理，也要核对命中条件。扩大上下文、增加检索、增加推理并非免费改善：它们会改变成本、延迟和信息干扰。

对 TA 工具，应记录完整任务耗时。代码回答很快，但随后修复十次、人工检查很久，未必比一次准确实现省时间。

## 5. 四种知识来源

| 来源 | 例子 | 怎样核验 |
|---|---|---|
| 参数中的学习结果 | 常见 Python 语法、一般数学模式 | 文档或运行检查；不能据此证明项目当前状态 |
| 当前上下文 | 你提供的函数、CSV、规则 | 对照实际传入内容与版本 |
| 检索材料 | 找到某版 API 文档 | 检查出处、发布日期、适用版本和段落 |
| 工具实时结果 | 查询 UE 网格 bounds、执行脚本 | 保存工具参数、真实返回与执行环境 |

检索增强生成（RAG）通常先找相关资料，再把片段交给模型生成答案；它不能保证检索完整或引用正确。外部知识库可以跨会话维护，更新的是资料，不是基础模型参数。

例如“这栋建筑宽 12m”需要资产测量；“建筑 CSV 里的 X 是厘米”需要数据协议；“某产品现在支持视频”需要当期官方文档。用错误类型的来源回答，即使语句通顺也不能支持结论。

## 6. 失败原因需要分类

资料缺失时，补充文档可能有效；资料过时时，应查询当前版本；目标含糊时，需要明确接受标准；工具失败时，应修正参数、路径或环境；算法推导错时，需要独立计算与反例。

所谓“幻觉”常指无依据却被当成事实的生成，但工程报告最好写具体行为：虚构字段、引用不存在文件、把测试跳过写成通过、把旧模型价格写成现价。这样能找到可检查的改进点。

长上下文遗漏也不能仅靠更大窗口解决。精确的入口、字段表、失败日志和短任务状态能帮助模型定位；完整原始材料继续保留用于回查。

## 7. 为自己的任务做评价

资产清单检查可建立正常、前缀错误、空字段、重复、中文路径、大小写扩展名、缺列等样本。先人工明确答案，再运行工具或模型，不让被评估者自行修改评分规则。

| 指标 | 本地任务的计算方式 | 边界 |
|---|---|---|
| 正确性 | 输出问题的行号与规则是否匹配答案 | 不能只看问题数量 |
| 漏报／误报 | 漏掉真实问题／对正常行报错 | 样本必须包含正常行 |
| 完成率 | 能否产出要求的可读报告 | 报告存在不证明内容正确 |
| 稳定性 | 同一条件多次运行的结果差异 | 随机种子、版本与环境要记录 |
| 成本与耗时 | 整项任务的费用、工具时间和评审时间 | 不只记录模型首字速度 |
| 可追溯性 | 结论能否对应输入行与规则 | 漂亮文字不替代证据 |

公开基准衡量其特定测试条件。本地小样本衡量自己的有限条件。两者都不能自然推出“模型可以独立交付任何项目”。

## 8. API 案例：文档与执行的分工

教学故障是把 `Path.suffix == '.png'` 当成对所有 PNG 文件的检查。Python 返回的 suffix 保留大小写，`T_Rock.PNG` 被漏掉；修复为 `suffix.lower()` 后该样本通过。检查脚本保留了修复前 False、修复后 True 的 [真实结果](<../../检查记录/学习实验结果.json>)。

三种使用方式各有证据强度：凭知识回答只有建议；提供对应 API 文档能明确合同；执行最小样本能验证这个环境中的行为。此次执行的是确定性 Python 示例，没有进行三组模型响应实验，也没有据此声称模型提升了多少。

改进方法按原因选择：缺资料先查资料；接口错误做最小复现；字段与路径用代码验证；主观美术质量用明确视觉标准与人工评审。多次追问不能代替获得新的证据。

## 9. 练习与验收

为一个材质检查任务制作不少于六类输入的测试表。每类写预期结果、证据来源、评分和停止条件。对一次失败指出问题属于模型输出、资料、工具、环境还是评分标准。模型未运行时，“模型效果”留空并写未实测。

验收时应能解释：读取项目不会自动训练模型；检索片段未必完整；工具执行成功不等于业务正确；测试覆盖有限。评价表可用 [统一任务模板](<../../模板/任务与交接.md>)，当期产品能力见 [CAP-01](<../AI能力/CAP-01_当前AI能力与TA场景.md>)。

![本章思维导图](<../../图表/LLM-02_思维导图.svg>)

## 来源

[Compute-Optimal 论文](<https://arxiv.org/abs/2203.15556>)、[InstructGPT 论文](<https://arxiv.org/abs/2203.02155>) 于 2026-10-10 核对摘要、训练主题和版本；本章工程解释与测试设计由教材归纳。[Karpathy 英文讲座](<../../sources.html#ref-fae8f922a0de3d>) 的本地开场讨论上下文与训练。所有实测均来自学习实验文件，不是在线模型评测。下一章：[AG-01](<../Agent/AG-01_Agent基本工作循环.md>)。
