资料核验日期:2026-10-10。公开版保留整理正文与必要证据;原始资料通过来源链接回查。验证范围在正文中分别说明。
训练、推理与能力边界
核验日期:2026-10-10。学习目标:分清训练和当前会话,判断一个答案的知识来源,为自己的资产任务建立评价办法。
1. 训练改变参数
模型参数是训练中调整的数值。训练流程为:提供样本、计算预测、与训练目标比较得到损失、计算梯度、由优化器调整参数,再处理其他样本。推理使用已经训练好的参数产生输出,通常不会在每次聊天后更新这些参数。
语言模型的常见预训练目标是利用前文预测后续 Token。目标描述了模型怎样学习;它不等于模型只会机械复述训练句子。大量数据与优化可以形成可迁移的模式,也会留下分布偏差和缺口。参数量、数据量与计算预算的取舍可参考 Training Compute-Optimal Large Language Models,不能只按参数量判断自己的任务效果。
2. 预训练与项目事实的距离
预训练可能包含语言、代码、文档和其他数据。不同产品的数据与训练配方公开程度不同。不能看到模型会写 UE 脚本,就断定它读过当前 Aipcg 仓库或知道当前资产尺寸。
最常见的工程落差是:模型知道通用 API,但项目使用特定版本、私有封装和不同字段。让 Agent 阅读项目并查询实时环境,可以补充这些事实;这属于上下文和工具使用,不等于给模型重新训练。
数据覆盖、重复、噪声和标注方式会影响学习。公开训练资料并不能保证输出没有偏差;一个流畅回答也不能反向证明某条信息来自训练集中的哪个样本。
3. 后训练塑造可用行为
监督微调用示范输入输出调整模型,让它更符合任务或对话形式。偏好学习利用多个回答之间的比较,调整模型的行为偏好。强化学习可以依据奖励或可核验结果进行优化。这里是常见方法的区别,不宣称所有模型采用同一流水线。
Training language models to follow instructions with human feedback 描述了一个具体的示范、偏好和奖励优化体系。它解释指令遵循为何可能改善,也不保证每次输出正确。用更礼貌的语言承认错误,与能稳定解决特定 API 问题,应分别评估。
对于代码、数学等可验证任务,测试结果可提供反馈;测试不充分也可能奖励“通过样例但实际不满足要求”的行为。因此奖励设计、测试覆盖和业务目标之间仍有距离。
4. 推理的时间与资源
一次请求可拆成上下文处理和输出生成。首字延迟衡量多久出现第一段结果;生成速度衡量之后输出的速度;总耗时还包括网络、工具、重试和人工等待。长上下文和长回答通常消耗更多资源,但实际关系取决于模型与部署。
推理预算可影响某些模型投入多少计算,不能假设所有产品都有相同开关。缓存减少重复处理,也要核对命中条件。扩大上下文、增加检索、增加推理并非免费改善:它们会改变成本、延迟和信息干扰。
对 TA 工具,应记录完整任务耗时。代码回答很快,但随后修复十次、人工检查很久,未必比一次准确实现省时间。
5. 四种知识来源
| 来源 | 例子 | 怎样核验 |
|---|---|---|
| 参数中的学习结果 | 常见 Python 语法、一般数学模式 | 文档或运行检查;不能据此证明项目当前状态 |
| 当前上下文 | 你提供的函数、CSV、规则 | 对照实际传入内容与版本 |
| 检索材料 | 找到某版 API 文档 | 检查出处、发布日期、适用版本和段落 |
| 工具实时结果 | 查询 UE 网格 bounds、执行脚本 | 保存工具参数、真实返回与执行环境 |
检索增强生成(RAG)通常先找相关资料,再把片段交给模型生成答案;它不能保证检索完整或引用正确。外部知识库可以跨会话维护,更新的是资料,不是基础模型参数。
例如“这栋建筑宽 12m”需要资产测量;“建筑 CSV 里的 X 是厘米”需要数据协议;“某产品现在支持视频”需要当期官方文档。用错误类型的来源回答,即使语句通顺也不能支持结论。
6. 失败原因需要分类
资料缺失时,补充文档可能有效;资料过时时,应查询当前版本;目标含糊时,需要明确接受标准;工具失败时,应修正参数、路径或环境;算法推导错时,需要独立计算与反例。
所谓“幻觉”常指无依据却被当成事实的生成,但工程报告最好写具体行为:虚构字段、引用不存在文件、把测试跳过写成通过、把旧模型价格写成现价。这样能找到可检查的改进点。
长上下文遗漏也不能仅靠更大窗口解决。精确的入口、字段表、失败日志和短任务状态能帮助模型定位;完整原始材料继续保留用于回查。
7. 为自己的任务做评价
资产清单检查可建立正常、前缀错误、空字段、重复、中文路径、大小写扩展名、缺列等样本。先人工明确答案,再运行工具或模型,不让被评估者自行修改评分规则。
| 指标 | 本地任务的计算方式 | 边界 |
|---|---|---|
| 正确性 | 输出问题的行号与规则是否匹配答案 | 不能只看问题数量 |
| 漏报/误报 | 漏掉真实问题/对正常行报错 | 样本必须包含正常行 |
| 完成率 | 能否产出要求的可读报告 | 报告存在不证明内容正确 |
| 稳定性 | 同一条件多次运行的结果差异 | 随机种子、版本与环境要记录 |
| 成本与耗时 | 整项任务的费用、工具时间和评审时间 | 不只记录模型首字速度 |
| 可追溯性 | 结论能否对应输入行与规则 | 漂亮文字不替代证据 |
公开基准衡量其特定测试条件。本地小样本衡量自己的有限条件。两者都不能自然推出“模型可以独立交付任何项目”。
8. API 案例:文档与执行的分工
教学故障是把 Path.suffix == '.png' 当成对所有 PNG 文件的检查。Python 返回的 suffix 保留大小写,T_Rock.PNG 被漏掉;修复为 suffix.lower() 后该样本通过。检查脚本保留了修复前 False、修复后 True 的 真实结果。
三种使用方式各有证据强度:凭知识回答只有建议;提供对应 API 文档能明确合同;执行最小样本能验证这个环境中的行为。此次执行的是确定性 Python 示例,没有进行三组模型响应实验,也没有据此声称模型提升了多少。
改进方法按原因选择:缺资料先查资料;接口错误做最小复现;字段与路径用代码验证;主观美术质量用明确视觉标准与人工评审。多次追问不能代替获得新的证据。
9. 练习与验收
为一个材质检查任务制作不少于六类输入的测试表。每类写预期结果、证据来源、评分和停止条件。对一次失败指出问题属于模型输出、资料、工具、环境还是评分标准。模型未运行时,“模型效果”留空并写未实测。
验收时应能解释:读取项目不会自动训练模型;检索片段未必完整;工具执行成功不等于业务正确;测试覆盖有限。评价表可用 统一任务模板,当期产品能力见 CAP-01。
来源
Compute-Optimal 论文、InstructGPT 论文 于 2026-10-10 核对摘要、训练主题和版本;本章工程解释与测试设计由教材归纳。Karpathy 英文讲座 的本地开场讨论上下文与训练。所有实测均来自学习实验文件,不是在线模型评测。下一章:AG-01。