Lauren 实践迁移:小型 TA 工具实验
这是待开展的真实 Agent 对照方案。已有 Python 学习实验只验证检查规则;它没有测量 Agent 提交速度、费用或人工评审时长。
| 任务 | 独立交付 | 固定检查 | 评审重点 |
|---|---|---|---|
| 缺列报错 | 输入合同与错误提示 | missing_columns.csv 返回缺列错误 | 提示是否指明字段,是否误处理合法输入 |
| 重复记录 | 稳定异常报告 | 重复名称样本定位正确行 | 重复判定范围、大小写、空名称 |
| 报告展示 | 可读 Markdown/HTML | 四项异常与原始行可回查 | 可读性、路径、数据是否遗漏 |
| UE 交接 | 导入接口与引擎报告 | 指定测试资产和地图实际打开 | 字段绑定、保存与真实环境依赖 |
功能地图记录入口命令、对应功能、输入输出、使用环境与检查位置。先统一 CSV 协议,再安排互不覆盖的任务;UE 任务按环境依赖另行执行。
对照记录
| 指标 | 填写口径 | 本版本状态 |
|---|---|---|
| 接受到完成时间 | 从明确任务到人工接受,不只生成代码时间 | 未执行真实 Agent 对照 |
| 一次通过比例 | 接受任务/总同类任务;报告样本量 | 未测量 |
| 返工 | 补充需求、修复、回退分别统计 | 未测量 |
| 人工评审 | 实际阅读、复查与调整分钟数 | 未测量 |
| 成本 | 模型账单、工具调用和环境维护 | 未测量 |
| 缺陷 | 接受后同时间窗口的回归与严重性 | 未测量 |
同类输入与验收固定,记录版本和任务范围。比较少量顺序任务与并行任务时,同时报告评审负担;不能仅以 PR 数量评价收益。材料来源见 LR-01。