AI Agent 开发工程师导论
模式、框架与场景选型
一份写给 AI Agent 开发工程师的全景指南——11 种主流模式、流程图、GitHub 仓库、场景矩阵、起步路径,从「是什么」一路讲到「怎么选、怎么落地」。
2026 年,关于 Agent 的讨论已经不再停留在"它能不能干活"。讨论的焦点变成了三件事:用哪种模式编排、用哪个框架落地、用什么场景落地最快。LangChain、AutoGen、CrewAI、LangGraph、Letta、Smolagents……开源项目一年比一年多,但工程师真正卡住的不是选框架,而是不理解模式之间的本质区别。
这篇文章的目的是帮你建立一张"全景地图"——看完之后,你能在任何业务场景下,快速判断该用哪种模式、该选哪个框架、该从哪里开始写第一行代码。
理解模式比记住框架更重要——框架会变,模式是底层规律。
一句话答案:什么是 Agent
Agent 是一个能够感知环境、自主决策、执行动作并循环迭代以达成目标的程序系统。它和普通 LLM 应用的核心区别在于:
- 自主循环:不止一次对话,能多轮决策直到目标完成
- 工具调用:能调用外部函数、API、代码执行、数据库等
- 状态记忆:能记住上下文、失败教训、用户偏好
- 目标驱动:以"完成目标"为终止条件,而非生成固定长度文本
最简化的 Agent 公式:
Agent = LLM(大脑)
+ Memory(记忆)
+ Tools(手脚)
+ Planning(决策)
+ Loop(迭代循环)
这五个组件的不同组合方式,就是所谓的"模式"。下面我们先看模式,再看框架。
Agent 的 5 层解剖
无论模式怎么变,Agent 实例都由这 5 层组成。理解清楚每层的职责,才能看懂模式之间的差异。
每一层的职责
- L1 大脑(LLM)接收输入、做推理、输出决策。负责"思考"。
- L2 记忆(Memory)保存会话上下文、用户偏好、历史经验。负责"不忘事"。
- L3 工具(Tools)调用外部能力——API、数据库、代码执行、文件操作。负责"做事"。
- L4 规划(Planning)把目标拆成子任务,决定执行顺序。负责"想清楚再动手"。
- L5 循环(Loop)状态推进、终止判断、错误恢复。负责"持续推进直到完成"。
所有的"模式",本质上就是这 5 层在不同时机、不同顺序、不同强度上的组合。掌握这 5 层,看模式就像看乐高积木组合。
11 种主流模式深度解析
下面逐一拆解 11 种主流模式。每种模式都包含:核心思想 / 流程示意 / 适用场景 / 优缺点 / 典型框架。
① ReAct:推理 + 行动交织
核心思想:让 LLM 在每一轮交替进行"思考"(Reasoning)和"行动"(Acting),把推理轨迹和工具调用交织在同一个 prompt 里,直到目标达成。这是最经典、最广泛使用的 Agent 模式,2022 年 Yao et al. 提出后成为几乎所有 Agent 框架的默认范式。
- 优点:实现简单、可解释强(每步都有 reasoning)、适合开放性问题
- 缺点:每步都要 LLM 推理,token 消耗大;复杂任务容易陷入循环
- 适用:客服问答、信息检索、简单工具链(2-5 步)、教学入门
- 典型框架:LangChain AgentExecutor、Smolagents(CodeAct 变体)、所有 Agent 框架默认支持
② Plan-and-Execute:先规划后执行
核心思想:把"规划"和"执行"分离——第一步让 LLM 生成完整任务计划(可能是 DAG 或有序步骤列表),第二步按计划逐步执行,遇到失败时触发 Replan。这解决了 ReAct 在多步任务中"走一步看一步"导致的视野短视问题。
- 优点:全局视野、Token 效率高(规划只需一次)、失败可回滚到规划层
- 缺点:规划质量决定一切;初始规划可能漏掉关键步骤
- 适用:复杂多步任务、研究报告生成、跨系统数据流转、需要审批的中长流程
- 典型框架:LangGraph(Planner/Executor 节点)、AgentScope(Plan-Execute-Reflect)
③ ReWOO:解耦推理与观察
核心思想:把"思考用什么工具"和"实际执行工具"彻底解耦——Planner 一次性生成完整的"工人蓝图"(Worker Blueprint),每个 Worker 写好要调什么工具、用什么输入;然后 Executor 批量并行执行,不再需要 LLM 介入中间观察。Token 消耗比 ReAct 降低 5-10 倍。
- 优点:Token 节省 5-10×、天然支持并行、适合静态可枚举的工具流
- 缺点:无法处理依赖中间结果的动态分支;对实时观察反馈无能为力
- 适用:批量数据采集、多文档并行摘要、跨多个独立 API 拉数据
- 典型框架:LangGraph(自实现)、DSPy(自动优化)、社区 LangGraph ReWOO 实现
④ LLMCompiler:把计划编译为并行 DAG
核心思想:把 ReWOO 的思想再推一步——LLM 不仅生成计划,还显式声明每个调用的依赖关系(哪些步骤可以并行,哪些必须串行)。然后一个调度器根据依赖图并行执行所有"ready"节点,最大化并发。ICML 2024 论文提出,在函数调用密集场景下提速显著。
- 优点:最大化并行度、延迟最优、对工具密集型任务提速明显
- 缺点:LLM 必须能正确输出依赖图;调度器实现复杂
- 适用:并行 API 调用、批量数据 ETL、研究类多源信息整合
- 典型框架:LLMCompiler(SqueezeAILab 开源)、LangGraph(手动编排)
⑤ Reflection / Reflexion:自我反思迭代
核心思想:让 Agent 在生成结果后,对自己的输出做"自我批评",发现错误并迭代改进。Reflexion(2023 NeurIPS)扩展为"加入外部反馈 + 自我反思 + 经验写入长期记忆"。本质是把 LLM 当成"既是作者又是审稿人"。
- 优点:显著提升输出质量、对代码/文案类任务效果好、能从失败中学习
- 缺点:每次反思都要一次 LLM 调用,成本翻倍;可能陷入"自我循环"
- 适用:代码生成、报告写作、复杂文档摘要、需要质量把控的任务
- 典型框架:LangGraph(自实现循环)、CrewAI(带反思角色)、Reflexion 原型
⑥ Tree of Thoughts(ToT):思维树搜索
核心思想:把单链推理拓展为"思维树"——在每一步生成多个候选思维,用一个评估器打分,保留最有希望的 k 条路径。借鉴了 AlphaGo 的 MCTS 思想。NeurIPS 2023 论文证明 ToT 在 24 点游戏、创意写作、迷你填字游戏上显著优于 Chain-of-Thought。
- 优点:探索能力强、能处理需要回溯的复杂问题
- 缺点:Token 消耗爆炸(kᵈ 路径)、需要好的评估器
- 适用:数学证明、24 点、密码破解、复杂策略规划
- 典型框架:Tree of Thoughts 原型实现、DSPy + 自定义、LangGraph
⑦ Tool Use / Function Calling:扩展 LLM 的手脚
核心思想:让 LLM 在生成 response 时,能"决定调用"预定义的函数。模型输出结构化的 JSON(函数名+参数),外部执行器真正调用,再把结果返回给 LLM。这是 Agent 之所以能"做事"的基础设施层能力——几乎所有上层模式都依赖它。
- 协议层:OpenAI Function Calling、Anthropic Tool Use、MCP(Model Context Protocol)、OpenAPI、JSON Schema
- 优点:结构化、可校验、可观测、与传统代码无缝衔接
- 缺点:工具 schema 描述质量决定调用准确率;参数构造是常见失败点
- 适用:所有需要"做事"的 Agent(数据库查询、API 调用、文件操作)
- 典型实现:OpenAI/Anthropic 原生支持、LangChain @tool、FastMCP、LangGraph ToolNode
⑧ Multi-Agent Collaboration:多智能体协作
核心思想:把复杂任务交给多个专精 Agent 协作完成。每个 Agent 扮演特定角色(研究员、工程师、审核员),通过消息总线互相沟通。这是把"组织行为"复刻到 AI 系统的尝试——一个 Agent 做不了的事,多个分工协作可以。
Multi-Agent 又可细分为 4 种协作模式:
- 优点:能处理超复杂任务、可解释性提升(看谁做了什么)、易模块化
- 缺点:通信开销大、Token 消耗 N 倍、易陷入"无意义的来回辩论"
- 适用:软件公司模拟(PM+开发+测试)、深度研究、复杂报告、跨领域协同
- 典型框架:AutoGen(GroupChat)、CrewAI(角色流水线)、LangGraph(Supervisor)、Swarm(轻量 handoff)
⑨ Hierarchical Agent:分层编排
核心思想:把 Multi-Agent 的"监督模式"扩展为多层——顶层 Strategic Planner 只关心"做什么",中层 Tactical Planner 决定"谁来做",底层 Worker 真正"做"。这是从单体 Agent 走向企业级 Agent 平台的标准结构。
- 优点:每层可独立替换、可治理、可审计;适合大规模企业部署
- 缺点:实现复杂、跨层通信设计难、初期投入大
- 适用:企业级 Agent 平台、SaaS 多租户、复杂 SOP 自动化
- 典型框架:LangGraph(嵌套子图)、Microsoft Magentic-One(Orchestrator+专家)、自研
⑩ Memory-Augmented Agent:有记忆的 Agent
核心思想:让 Agent 拥有分层记忆系统——短期上下文(最近 N 轮)、工作记忆(当前任务)、情节记忆(重要事件摘要)、长期记忆(用户偏好/事实向量库)、语义记忆(RAG 知识)。这是从"健忘对话"走向"个性化助手"的关键模式。Letta(MemGPT)借鉴操作系统虚拟内存思想是代表性实现。
- 优点:跨会话保持状态、个性化、能记住事实/偏好/历史
- 缺点:记忆更新冲突、隐私/合规风险、检索质量决定效果
- 适用:个人 AI 助手、客服(记住用户)、长期项目管理、教育辅导
- 典型框架:Letta(MemGPT)、Mem0、CrewAI 长期记忆、LangGraph + 外部向量库
⑪ Human-in-the-Loop:人在环中
核心思想:在 Agent 决策链的关键节点插入人工审核/确认/纠正——Agent 不是完全自主,而是在高风险/低置信/决策边界时"举手问人"。这是从 demo 走向生产的关键模式,没有它大多数企业级 Agent 上不了线。
- 优点:可控、可审计、降低生产风险、可渐进自动化
- 缺点:降低自主性、引入延迟、需要状态可序列化/可恢复
- 适用:高风险决策(金融/医疗/法律)、合规场景、生成内容对外发布、初始上线灰度
- 典型实现:LangGraph(interrupt_before / interrupt_after 原生支持)、AutoGen user_proxy、Copilot 模式
11 种模式不是孤立选项——ReAct 和 Reflection 是几乎所有 Agent 的"基本动作",Tool Use 是基础设施,Plan-and-Execute 和 Multi-Agent 是"宏观策略",Memory 和 HITL 是"走向生产的关键补丁"。
模式组合:2026 年工程共识
生产级 Agent 几乎从不是单一模式——它们是多个模式的有意识组合。
2026 年的工程共识是:与其争论"哪种模式最好",不如问"哪种组合最匹配当前任务的结构特征"。下面给出一个被反复验证的"生产配方":
实战配方选择表
| 业务特征 | 推荐组合 | 关键点 |
|---|---|---|
| 简单工具问答 (2-5 步) | ReAct + Tool Use + Memory | 极简实现,能解决 80% 场景 |
| 多步研究/报告 | Plan-and-Execute + Reflection + HITL | 先规划,再反思,关键节点审核 |
| 批量数据采集 | ReWOO / LLMCompiler + Tool Use | 解耦推理与观察,并行执行 |
| 复杂代码工程 | Multi-Agent (PM+Dev+QA) + HITL + Memory | 角色分工,关键决策由人把关 |
| 长期个性化助手 | ReAct + Memory-Augmented + Reflection | 记忆系统是核心资产 |
| 高风险企业流程 | Hierarchical + HITL + Reflection | 分层治理,每层可审计 |
| 数学/逻辑难题 | Tree of Thoughts + Self-Consistency | 探索而非线性推理 |
先选 1-2 个主模式当骨架,再用 Tool Use / Memory / HITL 等"基础设施模式"装配——这就是 2026 年最务实的 Agent 架构方法论。
开源框架与 GitHub 仓库
主流框架按"擅长模式"分组,全部开源、可直接上手。下面给一个全景矩阵。
框架全景速查
| 框架 | 核心范式 | 擅长模式 | GitHub | Stars |
|---|---|---|---|---|
| LangChain | 链式组合 | ReAct · Tool Use · RAG | langchain-ai/langchain | ★★★★★ |
| LangGraph | 图状态机 | Plan-Execute · HITL · Multi-Agent · Reflection | langchain-ai/langgraph | ★★★★★ |
| Microsoft AutoGen | 对话式群聊 | Multi-Agent · GroupChat | microsoft/autogen | ★★★★★ |
| Microsoft Agent Framework | AutoGen 演进版 | 企业级 Multi-Agent | microsoft/agent-framework | ★★★★ (新) |
| CrewAI | 角色流水线 | Multi-Agent (Sequential/Hierarchical) | crewAIInc/crewAI | ★★★★★ |
| OpenAI Swarm | 轻量 handoff | Multi-Agent (教学级) | openai/swarm | ★★★ |
| Magentic-One | 通用多 Agent 套装 | Orchestrator + 4 专家 | microsoft/magentic-one | ★★★★ |
| Semantic Kernel | 企业 SDK | Planning · Tool Use · HITL | microsoft/semantic-kernel | ★★★★★ |
| LlamaIndex | RAG 优先 | RAG Agent · Query Planning | run-llama/llama_index | ★★★★★ |
| Haystack | NLP Pipeline | RAG · Pipeline Agent | deepset-ai/haystack | ★★★★ |
| Letta (MemGPT) | 分层记忆 | Memory-Augmented Agent | letta-ai/letta | ★★★★ |
| Mem0 | 通用记忆层 | Memory Layer (独立服务) | mem0ai/mem0 | ★★★★ |
| Smolagents | 极简 Code Agent | ReAct (CodeAct 变体) | huggingface/smolagents | ★★★★ |
| Pydantic AI | 类型安全 Python | Tool Use · 结构化输出 | pydantic/pydantic-ai | ★★★★ |
| Atomic Agents | 原子化组合 | Multi-Agent · 严格结构化 | BrainBlend-AI/atomic-agents | ★★★ |
| AgentScope (阿里) | Plan-Execute-Reflect | 教学 · 原型 | modelscope/agentscope | ★★★ |
| DSPy | 编程而非提示词 | 任意模式的自动优化 | stanfordnlp/dspy | ★★★★★ |
| LLMCompiler | 并行函数调用 | LLMCompiler 模式 | SqueezeAILab/LLMCompiler | ★★★ |
| ReWOO | 解耦推理 | ReWOO 模式 | billxbf/ReWOO | ★★★ |
| Tree of Thoughts | 思维树搜索 | ToT 模式 | princeton-nlp/tree-of-thought-llm | ★★★ |
| Reflexion | 自我反思 | Reflexion 模式 | noahshinn/reflexion | ★★★ |
| LangFlow | 可视化拖拽 | 所有模式的可视化 | langflow-ai/langflow | ★★★★★ |
| Flowise | 可视化拖拽 | LangChain 可视化 | FlowiseAI/Flowise | ★★★★★ |
| OpenFANG (2026 新) | Rust Agent OS | 高吞吐多 Agent | RightNow-AI/openfang | ★★★ (新) |
选型速查
| 维度 | 首选 | 备选 |
|---|---|---|
| 复杂流程编排 | LangGraph | AutoGen / CrewAI |
| 角色流水线 | CrewAI | LangGraph (Sequential) |
| 多 Agent 探索/辩论 | AutoGen | Microsoft Agent Framework |
| RAG 优先 | LlamaIndex | Haystack |
| 长期记忆 | Letta | Mem0 |
| 代码 Agent | Smolagents | AutoGen Code Executor |
| 类型安全 | Pydantic AI | LangGraph (Pydantic State) |
| 企业 .NET 集成 | Semantic Kernel | Microsoft Agent Framework |
| 可视化拖拽 | LangFlow | Flowise / Dify |
| 模式自动优化 | DSPy | — |
| 生产性能 | OpenFANG (Rust) | LangGraph + 优化 |
| 学术原型 | ReWOO / LLMCompiler / ToT / Reflexion 原仓库 | — |
LangGraph 拿下"复杂流程 + 回放审计"主战场;AutoGen 在"多 Agent 探索"补位;CrewAI 抢"快速搭建";LlamaIndex 守 RAG;Letta 管记忆。剩下都是垂直工具,按需引入。
场景 → 模式 → 框架 实战映射
下面是 10 个最常见的落地场景,每个都给出:典型实现、推荐模式、首选框架。
模式:RAG Agent + Memory + Reflection(验证引用准确)
模式:ReAct + Tool Use + HITL(高风险操作)+ Memory
模式:Multi-Agent (Planner+Coder+Tester) + Reflection + Tool Use
模式:Plan-and-Execute + Reflection + RAG
模式:ReAct + Tool Use (SQL 执行) + Reflection (校验)
模式:Plan-and-Execute + HITL + Reflection
模式:Memory-Augmented + ReAct + Reflection
模式:ReWOO / LLMCompiler + Reflection + Multi-Agent (创意+审核)
模式:Tree of Thoughts + Self-Consistency
模式:Multi-Agent (流水线) + HITL + Reflection
选场景 → 找相似案例 → 套模式组合 → 选对应强项的框架。不要从框架开始选——场景决定模式,模式决定框架。
从 0 到 1 起步路径
如果你刚开始接触 Agent 开发,下面是一条被反复验证、坑最少的学习路径。
7 周路线:ReAct → RAG/Memory → LangGraph → Plan+Reflect → Multi-Agent → 可观测 → 抽象接口。每一步都在前一步基础上加新模式,而不是推翻重来。
可观测 / 评估 / 工程化
模式选对了只是开始。把 Agent 真正跑进生产,还需要四件配套基础设施。
① 可观测性(Observability)
- Trace:每一次 LLM 调用、Tool 调用、状态切换都要可追踪。Langfuse / LangSmith / Phoenix / OpenTelemetry 都是主流方案。
- Token & Cost:每次 run 的 token 数、费用、单步成本,是控制 ROI 的基础。
- Replay:能把任意一次 run 完全回放,便于 debug。LangGraph 的 checkpoint 原生支持。
- 实时监控:失败率、超时率、单步耗时分布,按用户/任务类型切片。
② 评估(Evaluation)
- 离线评测集:构造 50-500 个典型 case,每个 case 有标准答案或评分标准。
- LLM-as-Judge:用更强的模型当裁判打分(注意 bias)。
- 人工标注:定期抽样人工评估,校准 LLM judge。
- A/B 框架:同一任务跑两套模式/参数对比。
③ 护栏(Guardrails)
- 输入侧:Prompt Injection 防御、PII 检测、越权请求拦截。
- 输出侧:内容安全审查、敏感词过滤、结构化校验(Pydantic)。
- 资源侧:最大 token、超时、最大工具调用次数、最大循环次数。
- 合规侧:审计日志、操作留痕、可解释性。
④ 模型路由与降级
- 多模型路由:按任务路由(代码→DeepSeek、长文→Claude、快答→GPT-4o-mini)。
- 降级策略:主模型失败自动切备;429/5xx 切换;用户级熔断。
- 成本控制:每用户/每任务限额,超额降级到小模型。
| 维度 | 推荐工具 |
|---|---|
| Trace / 可观测 | Langfuse · LangSmith · Phoenix · OpenTelemetry |
| 评估框架 | DSPy Evaluate · LangSmith Evals · Promptfoo |
| 护栏 | Guardrails AI · NeMo Guardrails · Pydantic Validation |
| LLM 路由 | LiteLLM · OpenRouter · Portkey · 自研 Gateway |
| Prompt 管理 | LangSmith Hub · PromptLayer · Vellum |
可观测是地基,评估是方向盘,护栏是刹车,模型路由是变速箱——少一个都跑不快、跑不远。
常见陷阱与反模式
下面 7 个坑是 Agent 开发新手最常踩的——避开它们能节省几周时间。
Agent 失败 90% 不是"AI 不够聪明",而是循环没收敛、工具太多、没观测、没护栏——这些是工程问题,不是模型问题。
结语:选模式的元方法
最后留一个三步选模式法,无论场景多新都能用:
- 拆任务结构问自己:任务是单步还是多步?是确定流程还是开放探索?需不需要并行?需不需要长期记忆?
- 匹配骨架单步/短流程→ReAct;多步确定→Plan-and-Execute;多步不确定/需探索→Multi-Agent;需长期→加 Memory。
- 装配基础设施任何模式都需要 Tool Use;任何生产 Agent 都需要 HITL + 可观测 + 护栏。
模式是骨架,工具是血肉,记忆是灵魂,HITL 是刹车,可观测是仪表盘——缺一不可。
2026 年的 Agent 开发,已经不再是"调 API 写 prompt"那么简单。它是模式选择 + 框架落地 + 工程治理的综合体。理解模式、看清框架、把握工程——这是 AI Agent 开发工程师的三大基本功。
看完这份指南,你应该能做到:
- 看到任何业务场景,能在 5 分钟内画出模式图
- 说出至少 3 个主流框架的 GitHub 仓库地址和擅长场景
- 清楚"为什么"选这个模式,而不是凭感觉
- 知道生产上线前还要补哪几件配套
剩下的,就是写第一行代码。
· ReAct (Yao et al. 2022) · Reflexion (Shinn et al. 2023 NeurIPS) · ReWOO · LLMCompiler (ICML 2024) · Tree of Thoughts (NeurIPS 2023)
· LangGraph · AutoGen · CrewAI · Microsoft Agent Framework · LlamaIndex · Letta · Smolagents · Pydantic AI · DSPy
· 本指南持续更新,欢迎反馈补充。
· · · · ·