能力卡与小型测评
用于 CAP-01 的候选选择与后续复查。先写通过条件,再执行;“官方资料已核验”和“自己的任务已测”分开记录。未执行的结果填“未测”,没有数值的质量、费用与延迟保持空缺,不能填 0。
能力卡
| 字段 | 填写内容 |
|---|---|
| 任务与使用者 | 谁使用什么结果;结果交给哪一步 |
| 提供方/产品/模型 | 产品名与实际模型ID分列;客户端版本不能代替模型版本 |
| 版本与核验日期 | 日期快照或稳定标识;仓库commit;后台快照不能确认时说明 |
| 适合的任务 | 本次准备使用的能力与范围 |
| 必要上下文 | 需求、样例、术语、项目版本、环境与规则 |
| 输入输出 | 文件类型、结构、单位、轴向、命名与交接位置 |
| 通过条件 | 独立参考答案、检查命令或可观察的结果 |
| 接入条件 | 账户、额度、依赖、工具、硬件与环境 |
| 已知限制 | 已观察失败与尚未验证项目分列 |
| 官方证据 | 直接官方链接、适用章节、核验日期 |
| 任务证据 | 输入与输出文件、检查日志、失败样例、哈希 |
| 成本与耗时 | 当期单价与实测费用分列;首字与完成时间分列 |
| 更新触发条件 | 型号、接口、费用、项目依赖或验收标准变化 |
已填写示例:帧时间统计检查
任务是检查平均帧时间计算是否遵守缺失值规则。输入采用教学数据 [10,12,null,14,16] ms,要求排除缺失观测,同时报告有效数与缺失数。输出为 {有效数:4,缺失数:1,平均值_ms:13}。
执行主体是 Python 3.12.10 的确定性计算,未调用模型。对照方案把缺失项填 0 后除以 5,结果为 10.4 ms,比正确结果低 2.6 ms,即 20%。这项实验说明检查标准可以识别错误实现;它不反映真实产品性能,也不评价在线模型。
输入与原始结果:学习实验结果。本章重算记录及输入文件哈希:能力来源核验。结构化对照行:小型测评记录。
小型测评步骤
- 写明任务、正常输入、边界输入与一个已知失败输入。代码任务固定仓库和依赖;资产任务固定目标引擎与预算。
- 在看到候选输出前写参考答案和通过条件。主观项目拆成可检查条目,保留判断理由。
- 固定模型ID或快照、完整输入、工具权限与主要生成参数。只改变需要比较的一项条件。
- 保存原始输出与每次失败。需要比较稳定性时重复执行,不能只挑选最好的一次。
- 记录实际用量、重试、人工修订、首字延迟和整项耗时;未记录的指标保持缺失。
- 按失败位置形成使用建议:调整上下文、换输入、修复工具、增加检查,或缩小使用范围。
五类任务的参考检查
| 能力 | 正常与边界输入 | 通过条件示例 |
|---|---|---|
| 文字 | 带术语的字幕;否定句;数字与跨段指代 | 原文对应;术语一致;数字和否定含义保留 |
| 代码 | 正常CSV;空输入;重复名;缺失列 | 报告行号及规则正确;退出码符合约定;数据未被修改 |
| 图像 | 单主体参考;局部编辑;透明背景 | 主体数量和轮廓符合任务;编辑保留项不变;Alpha边缘检查 |
| 3D | 单道具参考;非对称物体;目标单位 | 法线与拓扑检查;轴向尺度Pivot正确;引擎导入通过 |
| 视觉 | 清晰截图;小字;遮挡;短暂视频事件 | 字符与坐标有参考答案;目标帧可回查;不推断不可见信息 |
这些是待执行任务的检查方案,不能因为模板填写完整,就把模型状态改成“已测”。完整候选能力与当前状态见 能力矩阵。