LLM-02 · LLM

01 / 18

训练、推理与能力边界

辨别知识来自哪里,为自己的任务建立评价办法。

  • 解释参数更新与当前会话的区别。
  • 区分参数、上下文、检索与实时工具结果。
  • 按失败原因选择改进,而后用固定样本评价。

LLM-02 · LLM

02 / 18

训练、推理与外部知识架构

训练、推理与外部知识架构
训练改变模型参数;当前输入与外部工具补充事实;推理使用这些条件产生结果。

LLM-02 · LLM

03 / 18

参数更新的训练流程

01

样本进入模型,计算当前预测。

02

预测与训练目标比较,形成损失。

03

计算梯度,由优化器调整参数。

04

继续处理样本;聊天推理通常不执行这次参数更新。

LLM-02 · LLM

04 / 18

预训练的数据与目标

  • 常见目标是利用前文预测后续 Token。
  • 语言、代码与文档覆盖影响可学习的模式。
  • 数据噪声、缺口和配方会留下能力边界。
  • 会写 UE 脚本不能证明读过当前私有仓库或资产。

LLM-02 · LLM

05 / 18

监督微调

方法

  • 使用示范输入与输出调整参数。
  • 让模型更符合指定任务或对话形式。
  • 示范的质量与覆盖决定反馈条件。

评价

  • 输出格式与指令遵循可以改善。
  • 礼貌回答不能代替 API 正确性。
  • 仍需检查本地任务的具体结果。

LLM-02 · LLM

06 / 18

偏好学习与强化学习

方法反馈来源需要警惕
偏好学习多个回答的比较偏好不等于事实验证
强化学习奖励或可核验结果测试缺项可能奖励投机行为
任务测试固定输入与预期通过样例不代表全部场景

LLM-02 · LLM

07 / 18

推理的主要过程

01

组装当前上下文,处理输入序列。

02

生成回答或工具请求,继续逐步输出。

03

宿主执行工具,将结果带回后续轮次。

04

计算任务总耗时时,包含网络、工具、重试和评审。

LLM-02 · LLM

08 / 18

上下文、延迟与资源

观察衡量什么遗漏什么
首字延迟第一次显示内容前的等待后续执行与返工
生成速度输出期间的速度任务是否完成
总任务时间开始到结果被接受需记录环境和人工时间

更长输入、检索和推理预算有成本;实际关系依赖模型与部署条件。

LLM-02 · LLM

09 / 18

四类知识来源

来源例子核验办法
参数中的学习通用 Python 语法文档与运行检查
当前上下文提供的函数与规则核对实际输入和版本
检索材料某版 API 说明回查来源、日期与段落
工具实时结果UE 网格 bounds保存参数、返回与环境

LLM-02 · LLM

10 / 18

读取项目与训练模型

读取项目

  • 补充当前代码、配置和数据。
  • 修改的是输入上下文或外部资料。
  • 摘要继续链接实际源文件。

训练模型

  • 依据样本与目标更新参数。
  • 需要专门数据、计算与训练过程。
  • 不能从一次聊天自动推断已训练。

LLM-02 · LLM

11 / 18

给失败找到具体原因

问题需要补充下一项检查
资料缺失或过时当前版本文档真实出处与适用范围
目标含糊接受标准正常与失败样本
工具或环境失败参数、路径、报错最小复现
算法推导错误反例与独立计算结果是否符合约束

LLM-02 · LLM

12 / 18

评估指标与测试集

  • 用事先明确答案的正常、边界和失败输入。
  • 正确性检查行号和规则;数量相同仍可能报错位置。
  • 记录漏报、误报、完成率和可追溯性。
  • 稳定性、总成本与人工评审时间另外统计。

LLM-02 · LLM

13 / 18

API 文档与执行的证据

Path('T_Rock.PNG').suffix
# '.PNG'

原比较:suffix == '.png'
修正:suffix.lower() == '.png'
  • 此教学任务规定后缀忽略大小写。
  • 实际运行:修正前 False,修正后 True。
  • 只是 Python 行为检查,没有模型对照评测。

LLM-02 · LLM

14 / 18

按原因选择改进方法

补事实与接口

  • 缺资料:读取正确来源。
  • 旧资料:核对现行版本。
  • 参数错误:按 schema 修正。

补反馈与评价

  • 推导错误:独立复算与反例。
  • 主观质量:参考图与人工评审。
  • 指标错误:先重新明确口径。

LLM-02 · LLM

15 / 18

TA 任务评价表

样本类型预期检查对象
正常与前缀错误分别通过与报错规则、行号、误报
空字段与重复指出具体字段或记录遗漏与定位
中文路径与缺列保留文本、缺列失败编码与输入合同

大小写是否通过取决于任务政策,不能跨样例混用答案。

LLM-02 · LLM

16 / 18

练习与常见误区

  • 为资产任务建立至少六类输入与独立答案。
  • 写明失败属于模型、资料、工具、环境还是评分。
  • 模型未运行时,效果与成本字段标为未实测。
  • 公开基准与本地小样本都不保证任意项目独立完成。

LLM-02 · LLM

17 / 18

训练与能力边界思维导图

训练与能力边界思维导图
先确定知识来源,再分析失败类型,用对应证据决定是否接受结果。

LLM-02 · LLM

18 / 18

来源与核验日期

核验日期:2026-10-10。阅读项目、检索资料和缓存都不等于训练参数。