配套资料

能力卡与小型测评

用于 CAP-01 的候选选择与后续复查。先写通过条件,再执行;“官方资料已核验”和“自己的任务已测”分开记录。未执行的结果填“未测”,没有数值的质量、费用与延迟保持空缺,不能填 0。

能力卡

字段 填写内容
任务与使用者 谁使用什么结果;结果交给哪一步
提供方/产品/模型 产品名与实际模型ID分列;客户端版本不能代替模型版本
版本与核验日期 日期快照或稳定标识;仓库commit;后台快照不能确认时说明
适合的任务 本次准备使用的能力与范围
必要上下文 需求、样例、术语、项目版本、环境与规则
输入输出 文件类型、结构、单位、轴向、命名与交接位置
通过条件 独立参考答案、检查命令或可观察的结果
接入条件 账户、额度、依赖、工具、硬件与环境
已知限制 已观察失败与尚未验证项目分列
官方证据 直接官方链接、适用章节、核验日期
任务证据 输入与输出文件、检查日志、失败样例、哈希
成本与耗时 当期单价与实测费用分列;首字与完成时间分列
更新触发条件 型号、接口、费用、项目依赖或验收标准变化

已填写示例:帧时间统计检查

任务是检查平均帧时间计算是否遵守缺失值规则。输入采用教学数据 [10,12,null,14,16] ms,要求排除缺失观测,同时报告有效数与缺失数。输出为 {有效数:4,缺失数:1,平均值_ms:13}。

执行主体是 Python 3.12.10 的确定性计算,未调用模型。对照方案把缺失项填 0 后除以 5,结果为 10.4 ms,比正确结果低 2.6 ms,即 20%。这项实验说明检查标准可以识别错误实现;它不反映真实产品性能,也不评价在线模型。

输入与原始结果:学习实验结果。本章重算记录及输入文件哈希:能力来源核验。结构化对照行:小型测评记录。

小型测评步骤

  1. 写明任务、正常输入、边界输入与一个已知失败输入。代码任务固定仓库和依赖;资产任务固定目标引擎与预算。
  2. 在看到候选输出前写参考答案和通过条件。主观项目拆成可检查条目,保留判断理由。
  3. 固定模型ID或快照、完整输入、工具权限与主要生成参数。只改变需要比较的一项条件。
  4. 保存原始输出与每次失败。需要比较稳定性时重复执行,不能只挑选最好的一次。
  5. 记录实际用量、重试、人工修订、首字延迟和整项耗时;未记录的指标保持缺失。
  6. 按失败位置形成使用建议:调整上下文、换输入、修复工具、增加检查,或缩小使用范围。

五类任务的参考检查

能力 正常与边界输入 通过条件示例
文字 带术语的字幕;否定句;数字与跨段指代 原文对应;术语一致;数字和否定含义保留
代码 正常CSV;空输入;重复名;缺失列 报告行号及规则正确;退出码符合约定;数据未被修改
图像 单主体参考;局部编辑;透明背景 主体数量和轮廓符合任务;编辑保留项不变;Alpha边缘检查
3D 单道具参考;非对称物体;目标单位 法线与拓扑检查;轴向尺度Pivot正确;引擎导入通过
视觉 清晰截图;小字;遮挡;短暂视频事件 字符与坐标有参考答案;目标帧可回查;不推断不可见信息

这些是待执行任务的检查方案,不能因为模板填写完整,就把模型状态改成“已测”。完整候选能力与当前状态见 能力矩阵。