# CAP-01｜当前 AI 能力与 TA 场景

核验日期：2026-10-10。学习目标：把任务拆为可检查的输入与输出，选择五类 AI 能力，并判断结果能否交给下一步。前置阅读：[LLM-02](<../LLM/LLM-02_训练推理与能力边界.md>) 与 [PCG-02](<../Aipcg/PCG-02_Agent辅助TA开发案例.md>)。

本章是当期能力快照。官方文档说明的功能、本项目已有历史产物和本次确定性实验分别登记；在线候选模型没有在本章进行付费对照调用。完整记录见 [AI 能力矩阵](<../../sources.html#ref-26187cf52aa23b>) 与 [能力来源核验](<../../sources.html#ref-86b96bca9b9bfb>)。

![任务、能力交接与质量检查的逻辑架构](<../../图表/CAP-01_架构.svg>)

## 1. 先定义任务，再选择能力

“做一组岩石资产”至少包含理解需求、生成方案、编辑素材、执行导入和验证结果五种工作。理解需要需求文档与术语；生成需要可选择的候选；编辑需要原件与修改范围；执行需要工具和运行环境；验证需要独立的参考答案或资产数据。它们可以由不同模型、脚本和人工环节共同完成。

先写四件事：输入是什么、输出存成什么、哪项检查决定通过、下一步怎样使用。概念参考图可以接受视觉近似，放置坐标必须满足数值规则，资产导入必须在目标引擎中打开。清楚的任务定义会直接影响模型选择，也使失败能够定位到具体阶段。

## 2. 文字能力：整理信息并保留依据

文字任务包括需求拆解、技术写作、翻译、资料问答和知识归纳。本期将 `gpt-6.1-sol` 列为候选，其官方页面列出文字输入输出、图像输入及工具调用条件。型号用于确定接入对象，适用性仍需自己的任务样本验证。[GPT-6.1 Sol 模型说明](<https://developers.openai.com/api/docs/models/gpt-6.1-sol>)

字幕学习材料应保留“时间段—英文原文—中文译文”的对应关系。检查专有名词、否定词、数字、代码标识符和跨段指代，遇到含糊语音回到视频听辨。本项目已有 13 个视频的逐段机器转写与中文翻译；[处理清单](<../../sources.html#ref-005d78ce02703a>) 记录了产物状态，不能据此推断译文经过逐句人工校对，也不能把这些结果记为 GPT-6.1 Sol 的表现。

需求归纳可用遗漏清单检查：目标平台、单位、预算、风格、交付格式是否保留。资料问答要求结论对应来源；一个看似合理的引用还需要打开原文确认。长文翻译先固定术语，再按段落处理，最后检查全篇一致性。

## 3. 代码能力：把可运行结果作为交付

解释代码需要真实文件与调用关系；定位问题需要复现输入与日志；生成脚本需要数据格式与退出码约定；修改项目需要依赖、版本和测试入口。只有修改内容能在适用环境中通过检查，才形成可交接结果。`gpt-6-astra` 的官方用途包含复杂推理与编码，但其页面上的能力描述不能替代项目测试。[GPT-6 Astra 模型说明](<https://developers.openai.com/api/docs/models/gpt-6-astra>)

Claude Code 是带文件与命令工具的工程产品。本机核验版本为 `2.1.295`；模型选择和账户接入另行记录，不能用客户端版本代替模型版本。[Claude Code 官方概览](<https://code.claude.com/docs/en/overview>)

本项目 [示例检查记录](<../../检查记录/CC-02-04_示例检查.json>) 验证了 9 项扩展名案例、7 项命令行案例与 12 项 Hook 输入案例。这是 Python 示例和配置命令的检查，未启动 Claude 模型会话或真实 MCP 连接。实际证明的是检查器能识别约定问题，并未证明某个在线模型必然能修好它。代码能力的评价应保存修改差异、测试输入和失败原因，避免只统计生成了多少行。

## 4. 图像能力：从参考图到受控编辑

文生图从文字建立视觉候选；参考图生成需要说明采用哪些结构或风格；局部编辑需要指出修改区域和应保留的细节；素材处理还涉及尺寸、透明背景与交付格式。四种任务使用不同的检查标准。

本期记录 GPT Image 2.5 的 Sunburst 与 Flare。官方定位分别侧重高要求质量与速度；Images API 提供生成和编辑，Responses API 可把图像工具放入多轮流程。这是提供方描述，本章没有测量二者在 TA 素材上的质量或延迟。[图像生成接口](<https://developers.openai.com/api/docs/guides/image-generation>)，[图像提示指南](<https://developers.openai.com/api/docs/guides/image-prompting>)

做岩石参考图时，分别检查轮廓、构图、材质方向、光照和系列一致性。编辑时用前后对照确认背景、主体数量和未指定区域是否变化。带透明背景的交付要检查 Alpha 边缘；API 的透明背景输出使用 PNG 或 WebP。矩阵保留官方列出的 `2026-09-08` 日期快照，方便后续固定版本。[Create image 参数说明](<https://developers.openai.com/api/reference/resources/images/methods/generate>)

## 5. 3D 模型与资产：检查几何和引擎状态

3D 生成先把参考输入变成形状，再生成材质，最后经过资产处理与引擎导入。本期核验 Hunyuan3D 2.1：官方仓库提供图像到形状与 PBR 纹理流程，发布公告日期为 2025-06-13；它是已核验的候选版本，不能因为资料在 2026 年收藏，就称它为当月新发布。[Hunyuan3D 2.1 官方仓库](<https://github.com/Tencent-Hunyuan/Hunyuan3D-2.1>)

资产检查要覆盖网格拓扑、法线、尺度、朝向、Pivot、UV、材质槽、贴图通道、面数与导入结果。静态展示道具和可变形角色的拓扑要求不同，预算应来自目标项目。PBR 材质仍需要在引擎中核对金属度、粗糙度和颜色空间；碰撞、LOD 与命名规则另列验收项。参考渲染图无法证明这些项目通过。

本章未下载权重或执行生成。接入前需要匹配依赖、显存、原生扩展编译和许可证条件，并记录实际环境。Aipcg 的建筑布局使用已有资产及其包围盒；这条历史路线不应记成 Hunyuan3D 的生成测试。

## 6. 视觉理解：给答案准备核验对象

视觉任务包括图像问答、OCR、界面理解、截图分析和视频内容定位。本期 `gemini-3.8-flash` 官方模型页列出文字、图像、视频、音频与 PDF 输入、文字输出；它不提供图像生成。输入图片可通过内联数据或文件接口等方式提交。[Gemini 3.8 Flash 模型页](<https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash>)，[图像理解文档](<https://ai.google.dev/gemini-api/docs/image-understanding>)

OCR 用原始字符串核对；截图位置用框坐标核对；界面状态用真实操作结果核对。小字、遮挡、透视和压缩会改变输入可辨识度，不能仅问“图片是否正确”。截图可以辅助观察悬空建筑，准确的碰撞与变换仍需要引擎数据。

视频还涉及帧间变化。官方文档说明默认静态处理按 1 FPS 提取帧，支持相应型号的动态探索模式；短暂出现的错误可能被采样遗漏。应保存视频片段范围、处理方式和目标时间点，按需求调整输入，再回到原始帧验证答案。本项目字幕链路处理的是音频转写，不能直接作为视频视觉理解的实测。[视频理解文档](<https://ai.google.dev/gemini-api/docs/video-understanding>)

## 7. 组合五类能力：让每次交接可检查

下面是一条岩石资产的候选路线，属于本章设计方案，没有宣称已经执行整条链路。

| 阶段 | 交接内容 | 通过条件与返工位置 |
|---|---|---|
| 需求 → 文字方案 | 任务卡、数量、尺寸单位、面数预算 | 信息缺失时回到需求 |
| 文字 → 图像参考 | 主体、视角、风格、保留项 | 轮廓与构图错误时修订参考图 |
| 图像 → 3D 资产 | 参考图、输入版本、网格与贴图 | 形状错误重生成，UV 与材质问题按项处理 |
| 资产 → 引擎 | 格式、单位、轴向、Pivot、材质映射 | 导入失败先检查接口与环境 |
| 引擎 → 检查报告 | 截图、网格统计、变换、测试记录 | 几何与视觉结果共同决定接受或返工 |

Aipcg 的已证历史链路则是“需求与布局数据 → 确定性算法 → 已有建筑资产 → 引擎 PCG”。本次 [离线数据核对](<../../检查记录/Aipcg数据核对.json>) 检查了 23 条历史建筑记录，包含旋转与局部包围盒中心偏移后，坐标及 CSV 与规划数据的比较误差为 0。它说明这批数据相互一致；引擎历史报告与本次离线检查必须分别标注。

## 8. 填写能力表：让型号、来源和状态对应

[完整矩阵](<../../sources.html#ref-26187cf52aa23b>) 覆盖五类能力、7 个模型或产品条目。每行保存提供方、接入标识、版本、核验日期、输入输出、官方能力、条件、任务检查办法和实测状态。

| 任务类型 | 本期候选 | 当前证据 |
|---|---|---|
| 文字 | GPT-6.1 Sol | 官方资料；在线任务未测 |
| 代码 | GPT-6 Astra；Claude Code 2.1.295 | 模型未测；本机版本与独立示例已检查 |
| 图像 | GPT Image 2.5 Sunburst／Flare | 官方接口与日期快照；任务未测 |
| 3D | Hunyuan3D 2.1 | 官方仓库；权重与引擎生成未测 |
| 视觉 | Gemini 3.8 Flash | 官方输入输出与处理说明；任务未测 |

单价与实际任务费用分列。记录输入输出用量、工具费用、重试和人工修订，才能估算一次合格交付的成本；首字延迟与整项完成耗时也要分列。未执行填“未测”，没有数据的指标保持空缺，不能填 0。版本维护同时查看弃用公告；例如 OpenAI 已公告部分旧型号的停止日期，因此旧教程中的型号需要重新核验。[弃用公告](<https://developers.openai.com/api/docs/deprecations>)

## 9. 做小型对照：先证明检查标准有效

先固定输入、参考答案和通过条件，再运行候选。覆盖正常、边界、错误和真实失败样例；多次运行用于观察稳定性。代码检查功能正确性和环境依赖；文字检查遗漏与错误；图像、3D 与视觉检查任务约定的关键项目。不要把这几种检查硬合成一个总分。

本章完成了一项可复查的确定性对照，使用教学帧时间数据 `[10, 12, null, 14, 16]` ms。正确规则是排除缺失观测并报告缺失数。4 项有效数据的平均值为 13 ms；把缺失项填 0 再除以 5 得到 10.4 ms，低估 2.6 ms，即 20%。两种计算都能返回数字，只有前者符合预先指定的数据规则。

本次使用 Python 3.12.10 重新计算并与 [学习实验结果](<../../检查记录/学习实验结果.json>) 对照，结果一致；输入、两组结果和证据哈希保存在 [核验记录](<../../sources.html#ref-86b96bca9b9bfb>)，对照行见 [小型测评记录](<../../模板/小型测评记录.csv>)。这证明评价规则能区分两种实现，未评价任何在线模型。教学数字也不代表真实 Cindy 或游戏性能。之后可以把同一输入提交给候选模型，再根据这个参考答案检查其说明与计算。

## 10. 形成能力卡并更新使用建议

能力卡包含适合任务、必要上下文、输入输出、通过条件、已知限制、证据日期和更新触发条件。可以先把文字整理用于需求归纳，把代码工具用于可复现的检查脚本，把图像用于视觉探索，把 3D 候选用于资产试制，把视觉用于辅助观察；是否扩大使用范围，由实际任务结果决定。

版本、费用规则、输入限制或项目预算变化时重跑受影响的测试，保留旧记录。更换模型后不能沿用旧分数，新增工具后也要检查交接。填写方法与可复用实例见 [能力卡与测评模板](<../../模板/能力卡与测评.md>)。

![五类能力、工程条件与评价方法的思维导图](<../../图表/CAP-01_思维导图.svg>)

## 练习与验收

为一项自己的 TA 任务填写能力卡和五类能力表；可以只选择确实需要的能力进入执行流程。准备至少一个正常输入、一个边界输入和一个失败输入，先写参考答案，再保存实际输出。没有执行的候选保持“未测”。能够说明每次返工的位置，并将官方功能、历史产物与本次实测分别找到对应证据，即完成本章练习。

## 来源与延伸阅读

本章官方资料均于 2026-10-10 读取相应页面，来源标识和所支持结论保存在 [能力来源核验](<../../sources.html#ref-86b96bca9b9bfb>)。正文提供直接官方链接，记录中不把官方能力描述换算为任务评分。跨能力工程案例继续阅读 [PCG-02](<../Aipcg/PCG-02_Agent辅助TA开发案例.md>)；评价原则继续阅读 [LLM-02](<../LLM/LLM-02_训练推理与能力边界.md>)；具体工程工具使用见 [CC-03](<../ClaudeCode/CC-03_调试测试与评审.md>)。
