LLM-02 · LLM
01 / 18
辨别知识来自哪里,为自己的任务建立评价办法。
LLM-02 · LLM
02 / 18
LLM-02 · LLM
03 / 18
样本进入模型,计算当前预测。
预测与训练目标比较,形成损失。
计算梯度,由优化器调整参数。
继续处理样本;聊天推理通常不执行这次参数更新。
LLM-02 · LLM
04 / 18
LLM-02 · LLM
05 / 18
LLM-02 · LLM
06 / 18
| 方法 | 反馈来源 | 需要警惕 |
|---|---|---|
| 偏好学习 | 多个回答的比较 | 偏好不等于事实验证 |
| 强化学习 | 奖励或可核验结果 | 测试缺项可能奖励投机行为 |
| 任务测试 | 固定输入与预期 | 通过样例不代表全部场景 |
LLM-02 · LLM
07 / 18
组装当前上下文,处理输入序列。
生成回答或工具请求,继续逐步输出。
宿主执行工具,将结果带回后续轮次。
计算任务总耗时时,包含网络、工具、重试和评审。
LLM-02 · LLM
08 / 18
| 观察 | 衡量什么 | 遗漏什么 |
|---|---|---|
| 首字延迟 | 第一次显示内容前的等待 | 后续执行与返工 |
| 生成速度 | 输出期间的速度 | 任务是否完成 |
| 总任务时间 | 开始到结果被接受 | 需记录环境和人工时间 |
更长输入、检索和推理预算有成本;实际关系依赖模型与部署条件。
LLM-02 · LLM
09 / 18
| 来源 | 例子 | 核验办法 |
|---|---|---|
| 参数中的学习 | 通用 Python 语法 | 文档与运行检查 |
| 当前上下文 | 提供的函数与规则 | 核对实际输入和版本 |
| 检索材料 | 某版 API 说明 | 回查来源、日期与段落 |
| 工具实时结果 | UE 网格 bounds | 保存参数、返回与环境 |
LLM-02 · LLM
10 / 18
LLM-02 · LLM
11 / 18
| 问题 | 需要补充 | 下一项检查 |
|---|---|---|
| 资料缺失或过时 | 当前版本文档 | 真实出处与适用范围 |
| 目标含糊 | 接受标准 | 正常与失败样本 |
| 工具或环境失败 | 参数、路径、报错 | 最小复现 |
| 算法推导错误 | 反例与独立计算 | 结果是否符合约束 |
LLM-02 · LLM
12 / 18
LLM-02 · LLM
13 / 18
Path('T_Rock.PNG').suffix
# '.PNG'
原比较:suffix == '.png'
修正:suffix.lower() == '.png'LLM-02 · LLM
14 / 18
LLM-02 · LLM
15 / 18
| 样本类型 | 预期 | 检查对象 |
|---|---|---|
| 正常与前缀错误 | 分别通过与报错 | 规则、行号、误报 |
| 空字段与重复 | 指出具体字段或记录 | 遗漏与定位 |
| 中文路径与缺列 | 保留文本、缺列失败 | 编码与输入合同 |
大小写是否通过取决于任务政策,不能跨样例混用答案。
LLM-02 · LLM
16 / 18
LLM-02 · LLM
17 / 18
LLM-02 · LLM
18 / 18
参数、数据与训练计算预算的讨论
示范、偏好与奖励优化的具体体系
suffix 合同与最小执行样本
字段检查、扩展名与教学计算实测
含解释、案例、练习与逐项来源
来源、版本、核验日期与使用位置
核验日期:2026-10-10。阅读项目、检索资料和缓存都不等于训练参数。