AI Agent 应用指南

AI Agent 应用操作指南(通用版)

面向所有主流 AI Agent 的通用操作方法论 · 与具体电脑/厂商无关,可迁移到任何工具

面向所有主流 AI Agent 产品的通用操作方法论。不绑定任何特定电脑、私有配置或厂商工具,可迁移到 Codex、Claude Code、OpenCode、Cursor 及各类 Agent 平台。


1. 先建立正确的心智模型

Agent = 大模型 + 工具 + 上下文 + 规则。不是"更聪明的聊天框",而是能读文件、执行命令、操作浏览器、调用 API、自己决定下一步的"数字员工"。

四个关键概念:

概念 含义 你该关注什么
上下文(Context) 一次任务中模型能看到的所有信息 给它什么文件/记忆/规则,直接决定质量
工具(Tools) 模型可以调用的能力:终端、文件、搜索、浏览器等 知道它能做什么、不能做什么
约束(Constraints) 沙箱、权限、文件写入边界、审批策略 决定它能动你系统里哪些东西
验收(Acceptance) "完成"的定义与证据 不要听它说"完成",要能复现的结果

最重要的一条原则:把 Agent 当"有能力但需要明确指令的新员工",而不是"什么都知道的神"。指令模糊 → 结果随机;验收缺失 → 它总是告诉你"完成"。


2. Agent 的类型与选型

不同任务适合不同类型的 Agent。按"角色"分:

角色 典型用途 特征
协调者 / 总控(Coordinator) 拆解需求、派活、汇总、验收 强于规划与判断,不一定是写代码最强的
执行者 / 实现者(Builder) 写代码、改文件、搭页面、跑构建 强于落地,最好配单一写入边界
验证者(Verifier) 对抗性测试、边界探测、回归 独立于实现者,负责"挑毛病"
审查者(Reviewer) 代码审查、安全扫描、设计还原度核验 只读为主
研究者(Researcher) 查资料、读文档、核实事实 强于搜索与溯源,弱于动手
多模态 Agent 看图、生成图、处理音视频、操作浏览器/桌面 按能力细分(视觉/音频/浏览器/桌面)

按"能力面"分:

  • 代码型 Agent:擅长工程任务(实现、重构、调试、部署)。
  • 浏览器型 Agent:能打开网页、点击、填写、截图、抓取(适合验证页面、填表、调研)。
  • 电脑操作型 Agent(Computer Use):能像人一样操作 Windows/macOS 原生应用界面。
  • 内容型 Agent:写作、翻译、总结、生成图文、做 PPT/表格/文档。
  • 视觉/图像 Agent:读图、设计、生成与编辑图片。

选型口诀:复杂靠强模型,批量靠低成本模型,验证永远换一个独立的视角


3. 如何用不同类型 Agent 协作完成任务

3.1 三种基本协作模式

模式 A:单 Agent 深潜 一个 Agent 从头做到尾。适合小任务、探索型问题。优点是上下文连续,缺点是缺少独立校验。

模式 B:主管—子 Agent(Orchestrator + Workers) 协调者拆任务,把子任务分给多个并行 Agent,各自有明确边界,最后汇总。适合大型任务(多模块、多页面、多文件)。

模式 C:流水线(Pipeline) 固定角色依次接力:规划 → 实现 → 验证 → 验收。每个阶段换一个 Agent 视角,适合正式交付。

3.2 通用分工表(可迁移)

任务类型 建议主责角色
网页/前端/落地页/作品集 专门的实现 Agent(设计+结构+动效)
常规开发、批量修改、明确小修 低成本实现 Agent(成本优先)
复杂架构、棘手故障、性能/安全深水区 最强模型/资深实现 Agent
回归、边界探测、对抗测试 独立的验证 Agent(不要用实现者自测代替)
环境、工具链、模型路由问题 环境型 Agent
需求拆解、验收标准、最终验收、记忆 协调者

3.3 多 Agent 协作的黄金规则(与工具无关)

  1. 每次只有一个写入者:同一文件同一时间只允许一个 Agent 改;其他人只读或写隔离脚本。这是避免互相覆盖的硬规则。
  2. 共享一份"交接单":所有 Agent 开工前先读它;有进展就更新;切换前写清"已完成 / 当前步骤 / 下一步 / 证据"。
  3. 实现 ≠ 验收:让实现者自测可以,但最终验收必须由另一个视角(独立验证者或你本人)执行。
  4. 证据要可复现:要求"退出码 + 输出 + 截图 + URL 响应",而不是"看起来没问题"。
  5. 破坏性动作需人工批准:部署、外联、发布、删除数据,永远留给你确认。

4. 规划任务流程(通用方法论)

4.1 万能五步:D-I-C-E-R

Define   定义(要解决什么问题?给谁用?成功长什么样?)
Inspect  调研(先读现状:代码库/文档/竞品/约束,禁止一上来就写)
Contract 契约(写清范围、边界、验收标准,让 Agent 复述确认)
Execute  执行(按里程碑小步推进,先做最小可验证的一版)
Review   验收(独立验证 + 你亲自抽查关键结果)

4.2 任务拆解:把大需求变成小任务

一个合格任务描述应包含 6 要素:

  1. 目标:一句话说清要产出什么。
  2. 背景/上下文:相关的文件路径、代码位置、参考资料(给得越准,结果越准)。
  3. 范围与边界:明确"只改这些,不许动那些"。
  4. 验收标准:可检查的清单(不是形容词,是"能运行、能截图、console 0 报错"这类)。
  5. 约束:编码规范、语言、禁止事项(如禁止外链、禁止伪造数据)。
  6. 输出格式:要它回什么(DONE + 证据清单?diff?报告?)。

4.3 分阶段推进(防翻车)

不要一次让 Agent 做完整页/整个系统。标准节奏:

第一轮:只做"骨架 + 最有代表性的一个模块"
        ↓
你/独立验证者核验是否真的对
        ↓
通过后再扩展其余部分
        ↓
全部完成后做全量验收(桌面 + 移动 + 弱网/无障碍 + 安全)

4.4 给多 Agent 的交接单模板

# 任务交接单
状态:进行中
负责人:<Agent 名>
目标:<一句话>
验收标准:<可检查清单>
当前进度:<已完成/正在做>
下一步:<要做什么>
证据:<文件路径 / 命令输出 / 截图 / URL>
边界:<唯一写入者是谁、哪些文件不能动>

5. 功能模块与组件清单

主流 Agent 产品通常提供以下能力模块。先弄清你的 Agent 开了哪些模块(很多默认关闭或需授权)。

5.1 基础模块

模块 作用 熟练要点
会话/线程管理 多任务隔离、续接、分支 学会"一个任务一个会话";续接用 resume
文件系统 读写工作区文件 明确工作目录与可写范围
终端执行 跑命令、脚本、构建、测试 要求它贴真实输出,不要只报结论
代码检索 grep/语义搜索/读代码库 大仓库先让它"调研"再"动手"
记忆/规则 长期偏好、项目规范 项目级规则文件(如 AGENTS.md)比每次口头叮嘱可靠

5.2 感知与操作模块(常在桌面/网页产品中提供)

模块 典型能力 使用场景举例
浏览器控制(@Browser 类) 打开网页、点击、填表、截图、读取 DOM 验收网页、抓取信息、自动化填表
电脑操作(@Computer 类) 模拟键鼠操作原生桌面应用 操作本地工具、录屏演示
可视化(@Visualize 类) 对话内生成图表/流程图/可交互 HTML 把流程/架构/数据讲清楚
图像生成/编辑 文生图、图生图、抠图 做素材、示意图
文档/表格/幻灯片/PDF 读写 Office 三件套与 PDF 报告、方案、PPT、数据表
搜索/网页检索 联网搜索并附来源 核实事实、查最新资料
语音 语音对话 多任务操作场景

每类模块通常以"工具"或"插件/Skill"的形式出现。给 Agent 的指令里明确指定用哪个模块(如"打开浏览器"、"生成一张流程图"),比笼统说"帮我看看"更有效。

5.3 Skill / 插件体系

Skill(技能)= 给 Agent 的"说明书 + 流程",让它按标准做法执行特定任务(如"网页验收 Skill""写邮件 Skill")。熟练标志:

  • 知道怎么列出/启用技能(常见命令 agent skills list 或插件的管理界面);
  • 需要标准流程时主动调用对应技能,而不是让 Agent 自由发挥;
  • 技能会随项目沉淀、可复用。

6. Prompt 手册:可复用的模板与写法

6.1 结构化 Prompt 骨架

角色:你现在是 <角色>(资深前端工程师 / 独立 QA / 研究助理…)
背景:<相关文件、代码位置、已有调研结果>
任务:<要做什么,一句到三句>
范围:<只改 A/B/C,不改 D>
约束:<语言、编码、禁止事项、性能要求>
验收标准:<可检查清单>
输出:<DONE + 证据 / diff / 报告,格式是什么>

6.2 通用"约束性任务"模板(可复制)

只修改以下文件:<列表>。不要读取或改动无关内容。
所有文件使用 <编码规范>,不要出现乱码。
完成后先自检:<跑哪些命令>,保证 <console 0 报错 / 无 404 / 测试通过>。
完成时回复 DONE,并附证据清单:命令输出、退出码、截图路径、URL。

6.3 实现类任务模板

请在 <工作区> 实现 <功能>。
背景:<指向现有代码位置与调用关系>。
做法:先读相关文件再动手;用 <语言/框架>;复用现有风格。
边界:不改 <模块/文件>。
验收:<给出可执行验证步骤>。
完成后回复 DONE + 改动文件清单 + 自测证据。

6.4 验证/验收类任务模板(给独立验证者)

请独立验收 <改动/页面>,不要采信实现者的口头结论。
执行:桌面 + 移动端截图对比、交互前后帧差、无障碍/reduced-motion、
console 错误与 404、真实资源加载、键盘焦点可达。
输出:每一项 PASS/FAIL + 可复现证据;不通过就列出复现步骤退回。

6.5 调研类任务模板(防幻觉)

调研 <主题>。要求:区分「已核实事实 / 推断 / 观点」三档,
每个数字追溯原始来源并给链接;找不到就明说"未核实",
禁止把记忆或营销文案当结论。输出:要点 + 来源列表。

6.6 Prompt 写法进阶(与工具无关的通用技巧)

  • 少给形容词,多给可检查条件:不说"做好看一点",说"首屏 3 秒内出现标题 + 一个持续运动元素"。
  • 一次只让它确认一件事:先让它复述你的需求与验收标准,再开始做,减少返工。
  • 要求"展示思考依据":让它在关键决策处给出"为什么这么选"。
  • 错误恢复指令:失败时要求它"贴出真实报错 → 定位根因 → 再修",禁止盲试。
  • 上下文压缩后先复核:长任务续接时,先让它重读现状再继续,不要沿用旧结论。

7. CLI 指令速查:理解通用命令语义

不同产品命令名略有差异,但语义高度一致。理解下面这张"通用语义表",换任何工具都能快速上手:

语义 常见命令形式 干什么
交互会话 agent / 无参数启动 进入 TUI/聊天界面
一次性执行 agent exec/run "任务" 非交互跑完一个任务
续接 agent resume --last / -c 继续上一个或指定会话
分支 agent fork 从历史会话派生新线,不污染原任务
代码审查 agent review 审查未提交/某分支/某 commit 的改动
应用补丁 agent apply 把 Agent 产生的 diff 应用到工作树
选模型 -m <model> 指定模型(如低成本/旗舰/视觉)
沙箱 -s read-only / workspace-write / full 控制它能写哪里、能不能联网
工作目录 -C <dir> / --cd 告诉它工作根目录在哪
附加图片 -i <file> 传截图/示意图
输出结构化 --json / --output-schema 让输出可被程序消费
列出模型 models 查看可用模型清单
MCP 管理 mcp add/list 挂载外部工具服务
登录 login 配置厂商凭据
诊断 doctor / debug 排查安装/配置/认证问题

拿到任何新 CLI 的第一步:跑 agent --helpagent exec --help,把上面这张表"映射"到它的真实命令名上。


8. 质量与验收:怎么判断"真的做完了"

8.1 证据分级(自证无效)

E1 可复现证据:命令输出、退出码、截图文件、URL 响应——别人能重跑复现。
E2 同体系互检:另一个 Agent 复核过(附复现步骤)。
E3 自证:实现者自己说"没问题"——不能当验收。
E4 待验证:还没执行的计划。

验收最低要求 = E1:任何"完成/PASS"都要能拿出可复现证据。

8.2 通用验收检查单

□ 构建/测试通过(贴真实退出码与输出)
□ 功能按验收标准逐条核对(不是"看起来差不多")
□ 边界与回归:异常输入、空状态、断网/降级
□ 移动端/小屏表现(如适用)
□ 无障碍:键盘可达、reduced-motion
□ console 0 错误、0 资源 404
□ 真实内容已替换(无示例文字/占位图/假数据)
□ 安全扫描(密钥泄露、注入、依赖漏洞)通过

8.3 安全门禁(正式交付前)

让独立扫描工具或验证 Agent 检查:密钥是否泄露、是否存在注入/XSS、危险 API、依赖漏洞。高危项必须修复并复扫通过后才能交付;中低危记录处置决定。


9. 协作中的安全边界

  1. 凭据永不进 prompt/文件/日志:API key、token 只在环境变量或受管凭据里,明示 Agent 禁止打印。
  2. 最小权限:能用只读就不用可写;能用 workspace-write 就不用全盘。
  3. 不可逆动作 = 人工闸门:部署、发布、外联、删数据,必须由你确认后再执行,并在记录里留痕。
  4. 外链与媒体要核源:涉及外部图片/视频/字体/第三方库时,明确来源与授权,禁止为凑效果伪造。
  5. AI 生成 ≠ 事实:产品图/人物/建筑等客户可见内容必须真实或已授权,AI 图冒充真实产品是一票否决。

10. 从入门到熟练:通用练习路线

阶段 1:会对话(第 1 天)

  • 跑通交互会话与一次 exec/run
  • 学会把文件路径、截图、链接喂给它。
  • 让它做完就贴证据,养成"看证据"的习惯。

阶段 2:会派活(第 2–3 天)

  • 用 6 要素写一个任务,交出去,再独立验收。
  • 体验"先做最小一版 → 核验 → 扩展"的节奏,感受返工率下降。

阶段 3:会协作(第 3–5 天)

  • 搭一个小型流水线:你当协调者,派实现者 + 验证者两个角色,用交接单接力。
  • 故意让验证者独立挑实现者的毛病,训练"不采信自证"。

阶段 4:会用全模块(持续)

  • 逐个点亮浏览器控制、电脑操作、可视化、图像、Office/PDF 模块,各做一次小任务。
  • 建立自己的模板库:任务模板、验收模板、调研模板,存成可复用的 Skill/规则文件。

通用版指南完。本文件不依赖任何特定电脑或工具配置;命令以通用语义表呈现,换用任何主流 Agent 产品时先做一次语义映射即可。