面向所有主流 AI Agent 产品的通用操作方法论。不绑定任何特定电脑、私有配置或厂商工具,可迁移到 Codex、Claude Code、OpenCode、Cursor 及各类 Agent 平台。
1. 先建立正确的心智模型
Agent = 大模型 + 工具 + 上下文 + 规则。不是"更聪明的聊天框",而是能读文件、执行命令、操作浏览器、调用 API、自己决定下一步的"数字员工"。
四个关键概念:
| 概念 | 含义 | 你该关注什么 |
|---|---|---|
| 上下文(Context) | 一次任务中模型能看到的所有信息 | 给它什么文件/记忆/规则,直接决定质量 |
| 工具(Tools) | 模型可以调用的能力:终端、文件、搜索、浏览器等 | 知道它能做什么、不能做什么 |
| 约束(Constraints) | 沙箱、权限、文件写入边界、审批策略 | 决定它能动你系统里哪些东西 |
| 验收(Acceptance) | "完成"的定义与证据 | 不要听它说"完成",要能复现的结果 |
最重要的一条原则:把 Agent 当"有能力但需要明确指令的新员工",而不是"什么都知道的神"。指令模糊 → 结果随机;验收缺失 → 它总是告诉你"完成"。
2. Agent 的类型与选型
不同任务适合不同类型的 Agent。按"角色"分:
| 角色 | 典型用途 | 特征 |
|---|---|---|
| 协调者 / 总控(Coordinator) | 拆解需求、派活、汇总、验收 | 强于规划与判断,不一定是写代码最强的 |
| 执行者 / 实现者(Builder) | 写代码、改文件、搭页面、跑构建 | 强于落地,最好配单一写入边界 |
| 验证者(Verifier) | 对抗性测试、边界探测、回归 | 独立于实现者,负责"挑毛病" |
| 审查者(Reviewer) | 代码审查、安全扫描、设计还原度核验 | 只读为主 |
| 研究者(Researcher) | 查资料、读文档、核实事实 | 强于搜索与溯源,弱于动手 |
| 多模态 Agent | 看图、生成图、处理音视频、操作浏览器/桌面 | 按能力细分(视觉/音频/浏览器/桌面) |
按"能力面"分:
- 代码型 Agent:擅长工程任务(实现、重构、调试、部署)。
- 浏览器型 Agent:能打开网页、点击、填写、截图、抓取(适合验证页面、填表、调研)。
- 电脑操作型 Agent(Computer Use):能像人一样操作 Windows/macOS 原生应用界面。
- 内容型 Agent:写作、翻译、总结、生成图文、做 PPT/表格/文档。
- 视觉/图像 Agent:读图、设计、生成与编辑图片。
选型口诀:复杂靠强模型,批量靠低成本模型,验证永远换一个独立的视角。
3. 如何用不同类型 Agent 协作完成任务
3.1 三种基本协作模式
模式 A:单 Agent 深潜 一个 Agent 从头做到尾。适合小任务、探索型问题。优点是上下文连续,缺点是缺少独立校验。
模式 B:主管—子 Agent(Orchestrator + Workers) 协调者拆任务,把子任务分给多个并行 Agent,各自有明确边界,最后汇总。适合大型任务(多模块、多页面、多文件)。
模式 C:流水线(Pipeline)
固定角色依次接力:规划 → 实现 → 验证 → 验收。每个阶段换一个 Agent 视角,适合正式交付。
3.2 通用分工表(可迁移)
| 任务类型 | 建议主责角色 |
|---|---|
| 网页/前端/落地页/作品集 | 专门的实现 Agent(设计+结构+动效) |
| 常规开发、批量修改、明确小修 | 低成本实现 Agent(成本优先) |
| 复杂架构、棘手故障、性能/安全深水区 | 最强模型/资深实现 Agent |
| 回归、边界探测、对抗测试 | 独立的验证 Agent(不要用实现者自测代替) |
| 环境、工具链、模型路由问题 | 环境型 Agent |
| 需求拆解、验收标准、最终验收、记忆 | 协调者 |
3.3 多 Agent 协作的黄金规则(与工具无关)
- 每次只有一个写入者:同一文件同一时间只允许一个 Agent 改;其他人只读或写隔离脚本。这是避免互相覆盖的硬规则。
- 共享一份"交接单":所有 Agent 开工前先读它;有进展就更新;切换前写清"已完成 / 当前步骤 / 下一步 / 证据"。
- 实现 ≠ 验收:让实现者自测可以,但最终验收必须由另一个视角(独立验证者或你本人)执行。
- 证据要可复现:要求"退出码 + 输出 + 截图 + URL 响应",而不是"看起来没问题"。
- 破坏性动作需人工批准:部署、外联、发布、删除数据,永远留给你确认。
4. 规划任务流程(通用方法论)
4.1 万能五步:D-I-C-E-R
Define 定义(要解决什么问题?给谁用?成功长什么样?)
Inspect 调研(先读现状:代码库/文档/竞品/约束,禁止一上来就写)
Contract 契约(写清范围、边界、验收标准,让 Agent 复述确认)
Execute 执行(按里程碑小步推进,先做最小可验证的一版)
Review 验收(独立验证 + 你亲自抽查关键结果)
4.2 任务拆解:把大需求变成小任务
一个合格任务描述应包含 6 要素:
- 目标:一句话说清要产出什么。
- 背景/上下文:相关的文件路径、代码位置、参考资料(给得越准,结果越准)。
- 范围与边界:明确"只改这些,不许动那些"。
- 验收标准:可检查的清单(不是形容词,是"能运行、能截图、console 0 报错"这类)。
- 约束:编码规范、语言、禁止事项(如禁止外链、禁止伪造数据)。
- 输出格式:要它回什么(DONE + 证据清单?diff?报告?)。
4.3 分阶段推进(防翻车)
不要一次让 Agent 做完整页/整个系统。标准节奏:
第一轮:只做"骨架 + 最有代表性的一个模块"
↓
你/独立验证者核验是否真的对
↓
通过后再扩展其余部分
↓
全部完成后做全量验收(桌面 + 移动 + 弱网/无障碍 + 安全)
4.4 给多 Agent 的交接单模板
# 任务交接单
状态:进行中
负责人:<Agent 名>
目标:<一句话>
验收标准:<可检查清单>
当前进度:<已完成/正在做>
下一步:<要做什么>
证据:<文件路径 / 命令输出 / 截图 / URL>
边界:<唯一写入者是谁、哪些文件不能动>
5. 功能模块与组件清单
主流 Agent 产品通常提供以下能力模块。先弄清你的 Agent 开了哪些模块(很多默认关闭或需授权)。
5.1 基础模块
| 模块 | 作用 | 熟练要点 |
|---|---|---|
| 会话/线程管理 | 多任务隔离、续接、分支 | 学会"一个任务一个会话";续接用 resume |
| 文件系统 | 读写工作区文件 | 明确工作目录与可写范围 |
| 终端执行 | 跑命令、脚本、构建、测试 | 要求它贴真实输出,不要只报结论 |
| 代码检索 | grep/语义搜索/读代码库 | 大仓库先让它"调研"再"动手" |
| 记忆/规则 | 长期偏好、项目规范 | 项目级规则文件(如 AGENTS.md)比每次口头叮嘱可靠 |
5.2 感知与操作模块(常在桌面/网页产品中提供)
| 模块 | 典型能力 | 使用场景举例 |
|---|---|---|
| 浏览器控制(@Browser 类) | 打开网页、点击、填表、截图、读取 DOM | 验收网页、抓取信息、自动化填表 |
| 电脑操作(@Computer 类) | 模拟键鼠操作原生桌面应用 | 操作本地工具、录屏演示 |
| 可视化(@Visualize 类) | 对话内生成图表/流程图/可交互 HTML | 把流程/架构/数据讲清楚 |
| 图像生成/编辑 | 文生图、图生图、抠图 | 做素材、示意图 |
| 文档/表格/幻灯片/PDF | 读写 Office 三件套与 PDF | 报告、方案、PPT、数据表 |
| 搜索/网页检索 | 联网搜索并附来源 | 核实事实、查最新资料 |
| 语音 | 语音对话 | 多任务操作场景 |
每类模块通常以"工具"或"插件/Skill"的形式出现。给 Agent 的指令里明确指定用哪个模块(如"打开浏览器"、"生成一张流程图"),比笼统说"帮我看看"更有效。
5.3 Skill / 插件体系
Skill(技能)= 给 Agent 的"说明书 + 流程",让它按标准做法执行特定任务(如"网页验收 Skill""写邮件 Skill")。熟练标志:
- 知道怎么列出/启用技能(常见命令
agent skills list或插件的管理界面); - 需要标准流程时主动调用对应技能,而不是让 Agent 自由发挥;
- 技能会随项目沉淀、可复用。
6. Prompt 手册:可复用的模板与写法
6.1 结构化 Prompt 骨架
角色:你现在是 <角色>(资深前端工程师 / 独立 QA / 研究助理…)
背景:<相关文件、代码位置、已有调研结果>
任务:<要做什么,一句到三句>
范围:<只改 A/B/C,不改 D>
约束:<语言、编码、禁止事项、性能要求>
验收标准:<可检查清单>
输出:<DONE + 证据 / diff / 报告,格式是什么>
6.2 通用"约束性任务"模板(可复制)
只修改以下文件:<列表>。不要读取或改动无关内容。
所有文件使用 <编码规范>,不要出现乱码。
完成后先自检:<跑哪些命令>,保证 <console 0 报错 / 无 404 / 测试通过>。
完成时回复 DONE,并附证据清单:命令输出、退出码、截图路径、URL。
6.3 实现类任务模板
请在 <工作区> 实现 <功能>。
背景:<指向现有代码位置与调用关系>。
做法:先读相关文件再动手;用 <语言/框架>;复用现有风格。
边界:不改 <模块/文件>。
验收:<给出可执行验证步骤>。
完成后回复 DONE + 改动文件清单 + 自测证据。
6.4 验证/验收类任务模板(给独立验证者)
请独立验收 <改动/页面>,不要采信实现者的口头结论。
执行:桌面 + 移动端截图对比、交互前后帧差、无障碍/reduced-motion、
console 错误与 404、真实资源加载、键盘焦点可达。
输出:每一项 PASS/FAIL + 可复现证据;不通过就列出复现步骤退回。
6.5 调研类任务模板(防幻觉)
调研 <主题>。要求:区分「已核实事实 / 推断 / 观点」三档,
每个数字追溯原始来源并给链接;找不到就明说"未核实",
禁止把记忆或营销文案当结论。输出:要点 + 来源列表。
6.6 Prompt 写法进阶(与工具无关的通用技巧)
- 少给形容词,多给可检查条件:不说"做好看一点",说"首屏 3 秒内出现标题 + 一个持续运动元素"。
- 一次只让它确认一件事:先让它复述你的需求与验收标准,再开始做,减少返工。
- 要求"展示思考依据":让它在关键决策处给出"为什么这么选"。
- 错误恢复指令:失败时要求它"贴出真实报错 → 定位根因 → 再修",禁止盲试。
- 上下文压缩后先复核:长任务续接时,先让它重读现状再继续,不要沿用旧结论。
7. CLI 指令速查:理解通用命令语义
不同产品命令名略有差异,但语义高度一致。理解下面这张"通用语义表",换任何工具都能快速上手:
| 语义 | 常见命令形式 | 干什么 |
|---|---|---|
| 交互会话 | agent / 无参数启动 |
进入 TUI/聊天界面 |
| 一次性执行 | agent exec/run "任务" |
非交互跑完一个任务 |
| 续接 | agent resume --last / -c |
继续上一个或指定会话 |
| 分支 | agent fork |
从历史会话派生新线,不污染原任务 |
| 代码审查 | agent review |
审查未提交/某分支/某 commit 的改动 |
| 应用补丁 | agent apply |
把 Agent 产生的 diff 应用到工作树 |
| 选模型 | -m <model> |
指定模型(如低成本/旗舰/视觉) |
| 沙箱 | -s read-only / workspace-write / full |
控制它能写哪里、能不能联网 |
| 工作目录 | -C <dir> / --cd |
告诉它工作根目录在哪 |
| 附加图片 | -i <file> |
传截图/示意图 |
| 输出结构化 | --json / --output-schema |
让输出可被程序消费 |
| 列出模型 | models |
查看可用模型清单 |
| MCP 管理 | mcp add/list |
挂载外部工具服务 |
| 登录 | login |
配置厂商凭据 |
| 诊断 | doctor / debug |
排查安装/配置/认证问题 |
拿到任何新 CLI 的第一步:跑
agent --help和agent exec --help,把上面这张表"映射"到它的真实命令名上。
8. 质量与验收:怎么判断"真的做完了"
8.1 证据分级(自证无效)
E1 可复现证据:命令输出、退出码、截图文件、URL 响应——别人能重跑复现。
E2 同体系互检:另一个 Agent 复核过(附复现步骤)。
E3 自证:实现者自己说"没问题"——不能当验收。
E4 待验证:还没执行的计划。
验收最低要求 = E1:任何"完成/PASS"都要能拿出可复现证据。
8.2 通用验收检查单
□ 构建/测试通过(贴真实退出码与输出)
□ 功能按验收标准逐条核对(不是"看起来差不多")
□ 边界与回归:异常输入、空状态、断网/降级
□ 移动端/小屏表现(如适用)
□ 无障碍:键盘可达、reduced-motion
□ console 0 错误、0 资源 404
□ 真实内容已替换(无示例文字/占位图/假数据)
□ 安全扫描(密钥泄露、注入、依赖漏洞)通过
8.3 安全门禁(正式交付前)
让独立扫描工具或验证 Agent 检查:密钥是否泄露、是否存在注入/XSS、危险 API、依赖漏洞。高危项必须修复并复扫通过后才能交付;中低危记录处置决定。
9. 协作中的安全边界
- 凭据永不进 prompt/文件/日志:API key、token 只在环境变量或受管凭据里,明示 Agent 禁止打印。
- 最小权限:能用只读就不用可写;能用 workspace-write 就不用全盘。
- 不可逆动作 = 人工闸门:部署、发布、外联、删数据,必须由你确认后再执行,并在记录里留痕。
- 外链与媒体要核源:涉及外部图片/视频/字体/第三方库时,明确来源与授权,禁止为凑效果伪造。
- AI 生成 ≠ 事实:产品图/人物/建筑等客户可见内容必须真实或已授权,AI 图冒充真实产品是一票否决。
10. 从入门到熟练:通用练习路线
阶段 1:会对话(第 1 天)
- 跑通交互会话与一次
exec/run。 - 学会把文件路径、截图、链接喂给它。
- 让它做完就贴证据,养成"看证据"的习惯。
阶段 2:会派活(第 2–3 天)
- 用 6 要素写一个任务,交出去,再独立验收。
- 体验"先做最小一版 → 核验 → 扩展"的节奏,感受返工率下降。
阶段 3:会协作(第 3–5 天)
- 搭一个小型流水线:你当协调者,派实现者 + 验证者两个角色,用交接单接力。
- 故意让验证者独立挑实现者的毛病,训练"不采信自证"。
阶段 4:会用全模块(持续)
- 逐个点亮浏览器控制、电脑操作、可视化、图像、Office/PDF 模块,各做一次小任务。
- 建立自己的模板库:任务模板、验收模板、调研模板,存成可复用的 Skill/规则文件。
通用版指南完。本文件不依赖任何特定电脑或工具配置;命令以通用语义表呈现,换用任何主流 Agent 产品时先做一次语义映射即可。