LLM-02 · LLM 原理

资料核验日期:2026-10-10。公开版保留整理正文与必要证据;原始资料通过来源链接回查。验证范围在正文中分别说明。

训练、推理与能力边界

核验日期:2026-10-10。学习目标:分清训练和当前会话,判断一个答案的知识来源,为自己的资产任务建立评价办法。

训练与使用的逻辑架构图

1. 训练改变参数

模型参数是训练中调整的数值。训练流程为:提供样本、计算预测、与训练目标比较得到损失、计算梯度、由优化器调整参数,再处理其他样本。推理使用已经训练好的参数产生输出,通常不会在每次聊天后更新这些参数。

语言模型的常见预训练目标是利用前文预测后续 Token。目标描述了模型怎样学习;它不等于模型只会机械复述训练句子。大量数据与优化可以形成可迁移的模式,也会留下分布偏差和缺口。参数量、数据量与计算预算的取舍可参考 Training Compute-Optimal Large Language Models,不能只按参数量判断自己的任务效果。

2. 预训练与项目事实的距离

预训练可能包含语言、代码、文档和其他数据。不同产品的数据与训练配方公开程度不同。不能看到模型会写 UE 脚本,就断定它读过当前 Aipcg 仓库或知道当前资产尺寸。

最常见的工程落差是:模型知道通用 API,但项目使用特定版本、私有封装和不同字段。让 Agent 阅读项目并查询实时环境,可以补充这些事实;这属于上下文和工具使用,不等于给模型重新训练。

数据覆盖、重复、噪声和标注方式会影响学习。公开训练资料并不能保证输出没有偏差;一个流畅回答也不能反向证明某条信息来自训练集中的哪个样本。

3. 后训练塑造可用行为

监督微调用示范输入输出调整模型,让它更符合任务或对话形式。偏好学习利用多个回答之间的比较,调整模型的行为偏好。强化学习可以依据奖励或可核验结果进行优化。这里是常见方法的区别,不宣称所有模型采用同一流水线。

Training language models to follow instructions with human feedback 描述了一个具体的示范、偏好和奖励优化体系。它解释指令遵循为何可能改善,也不保证每次输出正确。用更礼貌的语言承认错误,与能稳定解决特定 API 问题,应分别评估。

对于代码、数学等可验证任务,测试结果可提供反馈;测试不充分也可能奖励“通过样例但实际不满足要求”的行为。因此奖励设计、测试覆盖和业务目标之间仍有距离。

4. 推理的时间与资源

一次请求可拆成上下文处理和输出生成。首字延迟衡量多久出现第一段结果;生成速度衡量之后输出的速度;总耗时还包括网络、工具、重试和人工等待。长上下文和长回答通常消耗更多资源,但实际关系取决于模型与部署。

推理预算可影响某些模型投入多少计算,不能假设所有产品都有相同开关。缓存减少重复处理,也要核对命中条件。扩大上下文、增加检索、增加推理并非免费改善:它们会改变成本、延迟和信息干扰。

对 TA 工具,应记录完整任务耗时。代码回答很快,但随后修复十次、人工检查很久,未必比一次准确实现省时间。

5. 四种知识来源

来源 例子 怎样核验
参数中的学习结果 常见 Python 语法、一般数学模式 文档或运行检查;不能据此证明项目当前状态
当前上下文 你提供的函数、CSV、规则 对照实际传入内容与版本
检索材料 找到某版 API 文档 检查出处、发布日期、适用版本和段落
工具实时结果 查询 UE 网格 bounds、执行脚本 保存工具参数、真实返回与执行环境

检索增强生成(RAG)通常先找相关资料,再把片段交给模型生成答案;它不能保证检索完整或引用正确。外部知识库可以跨会话维护,更新的是资料,不是基础模型参数。

例如“这栋建筑宽 12m”需要资产测量;“建筑 CSV 里的 X 是厘米”需要数据协议;“某产品现在支持视频”需要当期官方文档。用错误类型的来源回答,即使语句通顺也不能支持结论。

6. 失败原因需要分类

资料缺失时,补充文档可能有效;资料过时时,应查询当前版本;目标含糊时,需要明确接受标准;工具失败时,应修正参数、路径或环境;算法推导错时,需要独立计算与反例。

所谓“幻觉”常指无依据却被当成事实的生成,但工程报告最好写具体行为:虚构字段、引用不存在文件、把测试跳过写成通过、把旧模型价格写成现价。这样能找到可检查的改进点。

长上下文遗漏也不能仅靠更大窗口解决。精确的入口、字段表、失败日志和短任务状态能帮助模型定位;完整原始材料继续保留用于回查。

7. 为自己的任务做评价

资产清单检查可建立正常、前缀错误、空字段、重复、中文路径、大小写扩展名、缺列等样本。先人工明确答案,再运行工具或模型,不让被评估者自行修改评分规则。

指标 本地任务的计算方式 边界
正确性 输出问题的行号与规则是否匹配答案 不能只看问题数量
漏报/误报 漏掉真实问题/对正常行报错 样本必须包含正常行
完成率 能否产出要求的可读报告 报告存在不证明内容正确
稳定性 同一条件多次运行的结果差异 随机种子、版本与环境要记录
成本与耗时 整项任务的费用、工具时间和评审时间 不只记录模型首字速度
可追溯性 结论能否对应输入行与规则 漂亮文字不替代证据

公开基准衡量其特定测试条件。本地小样本衡量自己的有限条件。两者都不能自然推出“模型可以独立交付任何项目”。

8. API 案例:文档与执行的分工

教学故障是把 Path.suffix == '.png' 当成对所有 PNG 文件的检查。Python 返回的 suffix 保留大小写,T_Rock.PNG 被漏掉;修复为 suffix.lower() 后该样本通过。检查脚本保留了修复前 False、修复后 True 的 真实结果。

三种使用方式各有证据强度:凭知识回答只有建议;提供对应 API 文档能明确合同;执行最小样本能验证这个环境中的行为。此次执行的是确定性 Python 示例,没有进行三组模型响应实验,也没有据此声称模型提升了多少。

改进方法按原因选择:缺资料先查资料;接口错误做最小复现;字段与路径用代码验证;主观美术质量用明确视觉标准与人工评审。多次追问不能代替获得新的证据。

9. 练习与验收

为一个材质检查任务制作不少于六类输入的测试表。每类写预期结果、证据来源、评分和停止条件。对一次失败指出问题属于模型输出、资料、工具、环境还是评分标准。模型未运行时,“模型效果”留空并写未实测。

验收时应能解释:读取项目不会自动训练模型;检索片段未必完整;工具执行成功不等于业务正确;测试覆盖有限。评价表可用 统一任务模板,当期产品能力见 CAP-01。

本章思维导图

来源

Compute-Optimal 论文、InstructGPT 论文 于 2026-10-10 核对摘要、训练主题和版本;本章工程解释与测试设计由教材归纳。Karpathy 英文讲座 的本地开场讨论上下文与训练。所有实测均来自学习实验文件,不是在线模型评测。下一章:AG-01。