# 能力卡与小型测评

用于 CAP-01 的候选选择与后续复查。先写通过条件，再执行；“官方资料已核验”和“自己的任务已测”分开记录。未执行的结果填“未测”，没有数值的质量、费用与延迟保持空缺，不能填 0。

## 能力卡

| 字段 | 填写内容 |
|---|---|
| 任务与使用者 | 谁使用什么结果；结果交给哪一步 |
| 提供方／产品／模型 | 产品名与实际模型ID分列；客户端版本不能代替模型版本 |
| 版本与核验日期 | 日期快照或稳定标识；仓库commit；后台快照不能确认时说明 |
| 适合的任务 | 本次准备使用的能力与范围 |
| 必要上下文 | 需求、样例、术语、项目版本、环境与规则 |
| 输入输出 | 文件类型、结构、单位、轴向、命名与交接位置 |
| 通过条件 | 独立参考答案、检查命令或可观察的结果 |
| 接入条件 | 账户、额度、依赖、工具、硬件与环境 |
| 已知限制 | 已观察失败与尚未验证项目分列 |
| 官方证据 | 直接官方链接、适用章节、核验日期 |
| 任务证据 | 输入与输出文件、检查日志、失败样例、哈希 |
| 成本与耗时 | 当期单价与实测费用分列；首字与完成时间分列 |
| 更新触发条件 | 型号、接口、费用、项目依赖或验收标准变化 |

## 已填写示例：帧时间统计检查

任务是检查平均帧时间计算是否遵守缺失值规则。输入采用教学数据 `[10,12,null,14,16]` ms，要求排除缺失观测，同时报告有效数与缺失数。输出为 `{有效数:4,缺失数:1,平均值_ms:13}`。

执行主体是 Python 3.12.10 的确定性计算，未调用模型。对照方案把缺失项填 0 后除以 5，结果为 10.4 ms，比正确结果低 2.6 ms，即 20%。这项实验说明检查标准可以识别错误实现；它不反映真实产品性能，也不评价在线模型。

输入与原始结果：[学习实验结果](<../检查记录/学习实验结果.json>)。本章重算记录及输入文件哈希：[能力来源核验](<../sources.html#ref-86b96bca9b9bfb>)。结构化对照行：[小型测评记录](<小型测评记录.csv>)。

## 小型测评步骤

1. 写明任务、正常输入、边界输入与一个已知失败输入。代码任务固定仓库和依赖；资产任务固定目标引擎与预算。
2. 在看到候选输出前写参考答案和通过条件。主观项目拆成可检查条目，保留判断理由。
3. 固定模型ID或快照、完整输入、工具权限与主要生成参数。只改变需要比较的一项条件。
4. 保存原始输出与每次失败。需要比较稳定性时重复执行，不能只挑选最好的一次。
5. 记录实际用量、重试、人工修订、首字延迟和整项耗时；未记录的指标保持缺失。
6. 按失败位置形成使用建议：调整上下文、换输入、修复工具、增加检查，或缩小使用范围。

## 五类任务的参考检查

| 能力 | 正常与边界输入 | 通过条件示例 |
|---|---|---|
| 文字 | 带术语的字幕；否定句；数字与跨段指代 | 原文对应；术语一致；数字和否定含义保留 |
| 代码 | 正常CSV；空输入；重复名；缺失列 | 报告行号及规则正确；退出码符合约定；数据未被修改 |
| 图像 | 单主体参考；局部编辑；透明背景 | 主体数量和轮廓符合任务；编辑保留项不变；Alpha边缘检查 |
| 3D | 单道具参考；非对称物体；目标单位 | 法线与拓扑检查；轴向尺度Pivot正确；引擎导入通过 |
| 视觉 | 清晰截图；小字；遮挡；短暂视频事件 | 字符与坐标有参考答案；目标帧可回查；不推断不可见信息 |

这些是待执行任务的检查方案，不能因为模板填写完整，就把模型状态改成“已测”。完整候选能力与当前状态见 [能力矩阵](<../sources.html#ref-26187cf52aa23b>)。
