结合任务目标与当前信息,模型提出操作。
应用调用可用、获准的工具,读取资料或生成文件。
查看实际结果或错误,再决定如何继续。
智能体(Agent):围绕目标推进任务、根据过程结果决定后续步骤的 AI 系统,通常结合模型、工具和运行环境。 可以先理解为:它不仅生成一段回答,还能在可用能力的范围内尝试推进任务。
例如准备教案时,它先读取资料,发现缺少学生基础,补齐条件后整理内容;如果生成的文件打不开,就根据错误继续处理。能推进多少、哪些步骤需要确认,由具体系统决定。
看一次任务怎样往下走
下面是教学示意,用来解释过程,不是某个产品的真实操作日志。
| 发生了什么 | 合理的下一步 | 可以看到的依据 |
|---|---|---|
| 收到“准备初一 40 分钟丝绸之路教案” | 确认材料与最终产出 | 明确的要求和可用资料 |
| 读取资料,获得 M01—M03 | 根据资料组织教案 | 实际返回的资料内容 |
| 发现示例安排合计 60 分钟 | 调整环节,重新核对时长 | 新的时间分配与合计 |
| 文件生成工具报错 | 处理错误,或说明目前只能交付文字 | 工具错误与后续结果 |
| 要求与产出核对完成 | 交付并指出仍需检查的事实 | 可打开的材料和具体检查结果 |
如果资料读取失败,却仍然回答“已经结合资料完成”,就没有正确利用过程中的结果。任务可能需要换一种读取方式、补充材料或停止等待条件,不能把失败当作成功。
模型、工具和应用各自做什么
**模型(Model)**处理输入,并可以提出下一步动作。**工具(Tool)执行具体操作,例如读取文件或生成演示文稿。你打开的AI 应用(AI App)**把这些能力与执行环境组织起来。
模型提出“读取课程资料”,不等于它已获得系统访问权。应用或运行环境要落实调用,相关服务要返回结果,权限也必须允许。
在本站地图中,这些关系应读成:应用可提供 Agent 能力;Agent 调用模型判断下一步,并通过执行环境调用工具。它们是职责关系,不是一张固定的软件安装清单。
怎样配合 Agent 完成任务
给出目标、相关资料、允许的操作范围和完成标准。以这次备课为例:
请根据指定资料准备 40 分钟教案。先检查年级、学生基础和材料是否齐全,再整理内容。交付教案文字与两页 PPT 节选;如果没有生成或查看 PPT 的能力,说明当前完成到哪里。文件能打开、时间合计正确之外,还要核对资料依据和页面可读性。
任务有多个环节时,可以先确认关键结果,再继续后面的步骤。例如先确定教案内容,再制作演示节选,减少在错误方向上反复排版。
检查的是实际产物与过程证据。“我已完成检查”只是声明;应能指出检查了哪份资料、哪个文件或哪些渲染页面。检查也应有合理范围,不能因为还能继续修改就永远不结束。
Agent 不等于一直自动运行
有聊天框的应用也可能提供 Agent 能力;名字里写着 Agent,也不能据此断定它会执行所有操作。是否具备某项能力,要看工具、环境、权限与执行结果。
**工作流(Workflow)**是有先后关系的步骤安排。固定流程可以规定“读资料 → 生成表格 → 检查”;Agent 可以在其中需要判断的环节决定下一步。两者可以组合,简单任务也可能用普通程序或一次对话就足够。
**技能(Skill)**提供可复用的方法和材料;MCP规范应用与外部服务的通信。它们都不是使用 Agent 的必备安装项。
再深入一点:为什么工具结果很重要
一个常见运行循环是:整理当前信息 → 模型提出下一步 → 环境执行 → 获取结果 → 继续、调整或结束。
执行返回的可能是数据,也可能是错误。后续判断需要参考真实结果,否则整个过程容易建立在错误假设上。系统还可能限制次数、运行时间或操作范围,防止没有完成标准的反复尝试。这是常见模式,不表示所有 Agent 实现完全一致。
想一想
Agent 已经生成两页 PPT,却没有查看任何渲染页面,就说“没有文字重叠”。这项结论缺少什么证据?
参考判断: 缺少实际成品的视觉检查。读取文本、文件保存成功和页面布局正常是不同的结论;需要打开或渲染页面检查,发现问题再修改。
下一步
先看 PPT 四项能力的对照,再按需要了解 Skill 怎样复用方法 或 MCP 怎样接入资料。
来源与适用范围
参考 OpenAI Agents SDK 与 Anthropic Building effective agents,核验日期:2026-09-09。后者发表于 2024-12-19,这里引用其工作流、Agent 与环境反馈的架构解释,不据此介绍当前产品操作。本站采用上文教学口径,Agent 自主程度和使用方式因应用而异。