文章总结: 本文梳理了Agent架构从2020年至今的五个演进阶段:单模型推理、ReAct工具调用、规划与记忆分离、多智能体协作及开放协议运行时。核心趋势是自主性增强、协作性提升和协议标准化,未来竞争点在于可靠性与可控性。
综合评分: 85
文章分类: AI安全,安全建设,技术标准
Agent 架构演进:从单模型推理到多智能体协作
Khan安全团队
2026年9月25日 14:56
广东
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
以下文章来源于威胁情报Z分析
,作者Z
威胁情报Z分析
.
国际网络安全威胁情报,地缘政治事件分析。
Agent 架构的演进不是一次技术替代,而是一条不断补全能力短板的叠加路线。从最初把大模型当作黑盒问答引擎,到如今多智能体通过标准协议互相调用工具与协作,每一代架构都在解决上一代暴露的核心瓶颈。本文梳理五个关键阶段的核心突破、代表系统与结构特征。
演进总览
下图展示 Agent 架构从 2020 年至今的五个主要阶段,横轴为时间,颜色深度反映架构复杂度的递增。
整体演进方向可以概括为三条主线:自主性从被动响应走向主动规划;协作性从单实例走向多角色分工;通用性从绑定单一模型走向开放协议与生态。
五个阶段详解
Prompt Engineering:单模型推理阶段
**时间:**2020 – 2022 年 **代表:**GPT-3 / InstructGPT / ChatGPT 早期
这一阶段 Agent 的”架构”几乎只有一个 LLM。所有能力都通过提示词工程(Prompt Engineering)注入:few-shot 示例、思维链(Chain-of-Thought)指令、角色设定。模型直接接收输入并输出结果,没有工具调用、没有持久记忆、没有外部状态。
**核心突破:**证明了足够大的语言模型可以通过提示引导完成复杂推理任务,思维链(CoT)显著提升了多步推理的准确率。
**局限:**无法访问实时信息、无法执行计算或操作外部系统;任务长度受限于上下文窗口;一旦推理链出错没有自我纠错机制。
ReAct & Tool Use:推理-行动循环
**时间:**2022 – 2023 年 **代表:**ReAct 论文、OpenAI Function Calling、Toolformer
ReAct(Reasoning + Acting)把模型的输出从”直接回答”改成”推理 → 行动 → 观察”的循环。模型在每一步先思考下一步该做什么,然后调用一个工具(搜索、计算器、数据库查询),拿到观察结果后再继续推理,直到得出最终答案。
这一阶段的关键架构变化是引入了外部工具接口。Function Calling 让模型以结构化格式输出函数名和参数,由运行时执行后将结果回填给模型,形成闭环。Agent 从”只读文本”变成了”可以操作世界”。
**核心突破:**模型可以访问实时信息并执行确定性操作,解决了幻觉和计算错误问题。
**局限:**缺乏全局规划,容易在长任务中走偏;每一步都依赖模型决策,token 消耗大;没有跨任务的记忆积累。
Plan-Execute & Memory:规划与记忆分离
**时间:**2023 年 **代表:**LangChain Plan-and-Execute、BabyAGI、Reflexion
这一阶段把 Agent 拆成两个职责明确的模块:**Planner(规划器)**负责把复杂目标分解成有序子任务列表,**Executor(执行器)**逐个执行子任务。规划在任务开始时一次性完成,执行过程中可以根据结果回溯重规划。
同时,记忆模块成为独立组件:短期记忆保存当前会话的上下文窗口内容,长期记忆通过向量数据库持久化历史交互和知识,供后续检索。Reflexion 进一步加入了”反思”环节——执行失败后自动总结错误教训,调整下一步策略。
**核心突破:**长任务可控性大幅提升;规划与执行解耦后各自可以独立优化;记忆让 Agent 具备跨会话的学习能力。
**局限:**规划质量高度依赖模型能力,错误的全局规划会导致整体走偏;多模块系统的复杂度和延迟上升。
Multi-Agent Collaboration:多智能体协作
**时间:**2023 – 2024 年 **代表:**AutoGen、CrewAI、MetaGPT、LangGraph
当单个 Agent 难以同时胜任多种角色时,架构转向多智能体系统。每个 Agent 被赋予明确的角色定义(如研究员、写作者、审核员)和独立的系统提示,通过消息传递进行协作。常见模式包括:
**管理者-工人模式:**Orchestrator 负责任务分解和结果汇总,多个 Worker 并行或串行执行子任务。
**对话协作模式:**多个 Agent 通过多轮对话讨论和辩论,互相补充和质疑,最终收敛结论。
**流水线模式:**Agent 按固定顺序串联,前一个的输出是后一个的输入,类似软件流水线。
LangGraph 等框架引入了图(Graph)结构来显式定义 Agent 之间的状态流转和分支条件,把协作流程从”自由对话”变成”可编程的状态机”。
**核心突破:**复杂任务可以拆分给专长不同的 Agent 处理;协作辩论提升了输出质量;并行执行缩短了端到端延迟。
**局限:**多 Agent 间的上下文传递效率低,容易信息丢失;调试和排错复杂度指数级上升;缺乏统一的互操作标准。
Agentic OS & Protocols:开放协议与运行时
**时间:**2024 – 2025 年 **代表:**MCP(Model Context Protocol)、A2A(Agent2Agent)、OpenAI Operator、Claude Computer Use
最新阶段的核心变化是从”每个框架自定义一套私有协议”走向标准化开放协议。MCP 定义了 Agent 与外部工具/数据源的统一连接方式,任何遵循 MCP 的工具都可以被任何支持 MCP 的 Agent 调用。A2A 则定义了 Agent 之间互相发现、通信和协作的标准。
与此同时,Computer Use类 Agent 直接操作桌面环境和浏览器:看屏幕截图、移动鼠标、点击按钮、输入文本,像人一样使用通用软件。这把 Agent 的能力边界从”API 调用”扩展到了”操作任意 GUI 应用”。
架构上,Agent 正在从”一个应用”变成”一个运行时”:底层有协议层连接工具和其他 Agent,中间有状态管理和记忆,上层有规划和执行策略。
**核心突破:**工具生态从碎片化走向可插拔;跨厂商 Agent 协作成为可能;直接操作 GUI 消除了”需要专门 API”的限制。
架构结构对比
下图横向对比五个阶段的内部结构,从左到右组件数量和连接复杂度递增:
演进规律总结
| 演进维度 | 从 | 到 |
| — | — | — |
| 组件结构 | 单体 LLM,一切内聚在提示词中 | 分层架构:规划、执行、记忆、工具、协作各司其职 |
| 决策方式 | 一次性输出,无中间状态 | 循环推理、全局规划、反思重规划 |
| 外部连接 | 仅文本输入输出 | 函数调用、MCP 工具生态、GUI 操作、A2A 协作 |
| 实例数量 | 单 Agent 处理一切 | 多 Agent 角色分工,管理者调度 |
| 协议标准 | 各框架私有接口 | MCP / A2A 等开放标准,跨厂商互操作 |
趋势展望
当前架构演进的三个方向值得关注:
**一是协议层收敛。**MCP 正在成为工具接入的事实标准,类似云计算时代的 REST API;A2A 类协议则在定义 Agent 之间的”HTTP”。协议标准化后,Agent 应用的开发重点将从”连接工具”转向”编排策略”。
**二是从文本到屏幕。**Computer Use 类 Agent 绕开了”每个软件都要提供 API”的前提,直接操作界面。这意味着 Agent 可以使用任何已有软件,而不需要软件厂商主动适配——通用性大幅提升,但也对视觉理解和操作精度提出了更高要求。
**三是可靠性与可控性。**随着架构复杂度上升,长链路任务的失败概率也在累积。下一代架构的竞争点可能不再是”能做什么”,而是”出错时如何检测、回滚和修正”——可观测性、审批节点和人机协作接口会成为 Agent 系统的标配组件。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:Khan安全团队 《Agent 架构演进:从单模型推理到多智能体协作》