← 卡片墙 / 多智能体 AI 工具平台 · 技术底座与框架选型
技术评审 · Technical Review

多智能体 AI 工具平台
技术底座与框架选型

构建一组可协作的 AI Agent,把所有 AI 能力以"工具"形式挂载,对上层应用提供统一、可观测、可治理的智能体服务。这是一份从架构、选型、关键模块、运维、风险五个维度展开的技术评审稿。


5
ARCH LAYERS
4
AGENT FRAMEWORKS
4
CORE MODULES
3
MILESTONES

今天要回答的 5 个问题

围绕"我们要建什么样的平台",按以下五个问题逐层展开:

PART 01 · BACKGROUND

背景与价值:为什么是"多 Agent + 工具集"

单 Agent 工具站、SaaS 工具集、纯 RAG 助手各有局限

多 Agent 协作 + 工具可插拔是当前唯一可扩展的形态。

4 大核心能力 · 决定我们要选什么、怎么搭

这 4 个能力象限决定了我们选什么、怎么搭、能不能撑住企业级落地。

技术栈决策轴 企业可治理 + 工具可插拔 统一注册中心 + 协议适配 → FastAPI / TS 网关 + JSON Schema 模型可路由 多 LLM 动态路由 / 降级 → LiteLLM + 自研 Gateway Agent 可协作 4 种协作模式 / 任务拆解 → LangGraph / AutoGen + 消息总线 可观测可调试 Trace / Token / Replay / Eval → Langfuse / OTel + Replay Store
4 大核心能力象限 · 每个能力都直接落到具体的技术栈决策上
  1. 工具可插拔统一工具注册中心与协议适配层(Function Calling / MCP / OpenAPI),新增工具不改核心代码。决定技术栈:FastAPI / TS 工具网关 + JSON Schema。
  2. 模型可路由多 LLM 厂商(OpenAI / Anthropic / 通义 / DeepSeek)按成本、延迟、能力动态路由,模型升级无感。决定技术栈:LiteLLM / 自研 Gateway + 降级策略。
  3. Agent 可协作监督 / 对等 / 流水线 / 任务市场 4 种协作模式,复杂任务拆解为可独立执行的子任务流。决定技术栈:LangGraph / AutoGen 编排 + 消息总线。
  4. 可观测可调试全链路 Trace、Token 用量、工具调用日志、Replay 回放、A/B 评估;让 Agent 行为可解释、可回滚。决定技术栈:Langfuse / OpenTelemetry + Replay Store。
一句话小结

单 Agent、SaaS 工具集、纯 RAG 助手各有天花板;多 Agent + 工具可插拔 + 统一治理,是当前企业级落地唯一可扩展的形态。

PART 02 · ARCHITECTURE

整体架构:5 层解耦 + 协议分层

自上而下分层,每层独立演进;层间通过明确定义的协议(HTTP / JSON-RPC / gRPC)解耦。

L1 · 交互层
Web / IDE / IM / API
React 工作台 VSCode 插件 飞书 / Slack Bot REST / gRPC API
L2 · Agent 编排层
多 Agent 协作与状态机
LangGraph 状态机 AutoGen 群聊 Planner / Executor Memory Manager Task Scheduler
L3 · 工具生态层
工具注册 + 协议适配 + 执行沙箱
Function Calling 网关 MCP Server 集群 OpenAPI Adapter Tool Registry Sandbox Runtime
L4 · 模型层
LLM 路由 + 推理优化
LiteLLM Gateway OpenAI / Anthropic 通义 / DeepSeek / GLM Embedding 模型 vLLM 自托管
L5 · 基础设施层
存储 / 消息 / 可观测 / 部署
PostgreSQL Redis / Kafka Milvus / pgvector MinIO / S3 Kubernetes Langfuse / OTel
5 层架构 · 自上而下分层,每层独立演进,层间通过协议解耦

每一层的职责边界

一句话小结

5 层架构不是"再多拆几层好看",而是把变更频率不同的能力物理隔离——模型层可以月月换,工具层可以周周加,基础设施层几乎不动。

PART 03 · FRAMEWORK

Agent 框架选型:LangGraph 主选 · AutoGen 辅助

主流 4 个框架各有侧重;从工程可控性、社区成熟度、编排能力三方面看,LangGraph 为主、AutoGen 为辅是当前最务实的组合。

维度 LangGraph 推荐主选 AutoGen 辅助 CrewAI MetaGPT
编排模型图状态机(DAG + 循环)群聊 + GroupChat 路由角色 + 任务流(Crew)SOP 流水线
状态管理显式 Checkpoint,支持回放对话历史为主,无显式状态任务级状态,轻量文档产物驱动
人机协作原生 interrupt / resumeuser_proxy agent需自实现不支持
工具接入任意 Python 函数 + ToolNodeFunction Calling 包装Tool 类封装Action 类
学习曲线(需理解图论概念)
生态成熟度★★★★★ LangChain 系★★★★ 微软系★★★ 独立社区★★ 学术导向
生产案例Replit、Uber、LinkedInMicrosoft 内部多项目中小团队研究 / Demo
适用场景复杂长流程 / 需回放审计开放探索 / 多角色辩论轻量角色协作模拟软件公司

抽象一层 AgentRuntime 接口,未来可平滑替换底层框架。

选型结论:以 LangGraph 作为主编排框架(显式状态、人机协作、可观测性强);针对需要开放群聊探索的场景引入 AutoGen 作为辅助;抽象一层 AgentRuntime 接口,未来可平滑替换底层框架。

一句话小结

LangGraph 拿下"复杂流程 + 回放审计"的主战场,AutoGen 在"开放辩论 + 多角色探索"补位,抽象 Runtime 让两者可共存、可替换。

PART 04 · CORE MODULES

Agent 编排层 4 大核心模块

每个 Agent 实例由这 4 个模块组合而成;接口标准化后可被多个上层 Agent 复用。

Planner · 任务规划器

把目标拆解为可执行子任务 DAG。

// Planner 接口
interface Planner {
  plan(goal: Goal, ctx: Context): Promise<TaskDAG>
  replan(dag: TaskDAG, feedback: Feedback): Promise<TaskDAG>
}

Executor · 任务执行器

驱动 LLM 调用、工具调用、状态推进。

// Executor 接口
interface Executor {
  run(node: TaskNode, state: AgentState): AsyncIterable<StepEvent>
  cancel(runId: RunId): Promise<void>
}

ToolSelector · 工具选择器

从工具库中匹配最相关工具 + 构造参数。

// ToolSelector 接口
interface ToolSelector {
  retrieve(query: string, k: number): Promise<Tool[]>
  invoke(tool: Tool, args: JsonSchema): Promise<ToolResult>
}

MemoryManager · 记忆管理器

短期 / 长期 / 语义记忆三层。

// MemoryManager 接口
interface MemoryManager {
  shortTerm: SlidingWindowStore     // 最近 N 轮
  longTerm:  VectorStore            // 用户画像 / 偏好
  domain:    RAGRetriever           // 领域知识
}
一句话小结

Planner / Executor / ToolSelector / MemoryManager 四件套构成 Agent 实例的最小骨架;接口标准化后才能在多 Agent 之间复用与替换。

PART 05 · LLM & TOOLS

LLM 统一接入 + 工具协议适配

LLM Gateway · 关键能力

屏蔽厂商差异,提供统一路由、降级、限流、计费;自研薄壳 + LiteLLM 适配层是性价比最高的方案。

多模型路由

容灾降级

限流与计费

Function Calling 抽象

// 统一 OpenAI 兼容协议,屏蔽各厂商差异
type ChatRequest = {
  model: string                  // 逻辑模型名,如 "smart" / "fast" / "code"
  messages: Message[]
  tools?: ToolSpec[]            // JSON Schema
  tool_choice?: 'auto' | 'required' | { name: string }
  stream?: boolean
  // 扩展:路由策略、计费标记、SLA 等级
  __meta?: { tenant: string; priority: number; cost_center?: string }
}

选型建议:LiteLLM(已支持 100+ 模型、含路由 / 重试 / fallback)作为基座,外层用 FastAPI 薄壳包一层做:租户限流、计费埋点、Prompt 注入检测、敏感词过滤。关键指标:P99 延迟增加 ≤ 50ms,故障切换时间 ≤ 3s。


工具协议:3 种并存,按场景选

内部工具走 OpenAPI 包装;外部生态走 MCP;高频原子能力走原生 Function Calling。

Tool Registry · 工具注册中心

每个工具在注册中心维护 4 类元数据:

一句话小结

LiteLLM + FastAPI 薄壳解决"模型异构"问题;Function Calling / MCP / OpenAPI 三种协议分工覆盖内置 / 外部 / 存量系统。

PART 06 · MEMORY & COLLABORATION

三层记忆 + 向量库选型 + 4 种协作模式

三层记忆架构

不同生命周期 / 语义粒度的记忆需要分层存储;向量库选型在精度、规模、运维成本间权衡。

向量库选型对比

维度 pgvector Milvus Qdrant Elasticsearch
部署形态PG 扩展,零额外组件独立集群,K8s 原生独立服务,单二进制独立集群
数据规模≤ 1M 向量≥ 100M≥ 10M≥ 10M
运维成本极低(复用 PG)(需专门团队)
混合检索需自实现支持(Hybrid Search)支持(稀疏 + 稠密)原生
推荐阶段M1 起步(< 100w 向量)M3 规模上量后M2 中期已有 ES 栈时

Agent 协作 · 4 种模式

没有万能模式;按任务结构、容错要求、并行度需求选择,必要时可混合编排。

① 监督式 · Supervisor

主 Agent 分配任务、子 Agent 汇报。

Supervisor ──┬──→ Researcher
             ├──→ Coder
             └──→ Reviewer
        ↑___________________|
            (汇总 → 决策 → 派发)

适用:任务结构清晰、需集中决策的中等复杂度流程。

② 对等辩论 · Debate

多 Agent 立场对辩,投票/裁判收敛。

Pro  Agent ──┐
            ├──→ 共享消息总线 ──→ Judge
Con  Agent ──┘
    (轮次 N,直至 Judge 给出结论)

适用:开放性决策、风险评估、方案评审(牺牲成本换质量)。

③ 流水线 · Pipeline

DAG 严格顺序,前置产出为后置输入。

[需求解析] → [架构设计] → [编码] → [单测] → [评审]
   ↓ JSON      ↓ Spec      ↓ Code   ↓ Diff    ↓ OK/NOK
              (任一失败可触发重试/回退)

适用:SOP 明确的工程任务(软件开发、数据 ETL)。

④ 任务市场 · Marketplace

任务发布到消息队列,Agent 自由接单。

TaskBoard (Kafka)
  ├── Agent A (空闲) ──claim──→ 任务1
  ├── Agent B (空闲) ──claim──→ 任务2
  └── Agent C (忙碌)           ← 任务3 等待
        (按能力 + 负载匹配)

适用:大规模并发、独立子任务(如批量内容生成、批量数据分析)。

一句话小结

短期 / 长期 / 领域知识三层记忆各司其职;向量库按规模与运维成本三阶段切换;4 种协作模式覆盖从集中决策到开放探索的全部形态。

PART 07 · WORKBENCH & INFRA

工作台、可观测与基础设施

前端工作台 · IDE 风格而非聊天框

不是聊天框,是 IDE 风格的工作台;让用户看清 Agent 在做什么、能改、能暂停。

核心视图

技术栈选型

设计原则

透明优先 · 每个 LLM 输出、工具调用、状态变更都可见;

可控优先 · 关键决策点提供"暂停 / 改写 / 重试";

可复盘 · 整段对话可导出 JSON / Markdown,便于团队复盘与训练数据沉淀。


可观测 · 5 项能力

Agent 系统的可观测 ≠ 传统 APM;必须把"推理过程"作为一等公民记录下来。

端到端 Trace 示例(伪代码)

// 一次完整对话的 Span 树
user.request              1200ms
└─ agent.run              1180ms
   ├─ planner.plan         320ms   // tokens: 850 in / 120 out
   ├─ executor.step[1]     180ms   // tool: web_search
   ├─ executor.step[2]     240ms   // tool: code_interpreter
   ├─ llm.generate         410ms   // model: gpt-4o, 2300 in / 380 out
   └─ evaluator.score      30ms    // score: 0.87

部署与基础设施

云原生优先;无状态服务容器化,有状态中间件用托管或 Operator,Agent 执行节点需要弹性伸缩。

运行时

消息 & 存储

CI / CD & GitOps

可观测体系

一句话小结

前端 IDE 风格工作台 + 5 项可观测能力 + 云原生底座,三者缺一不可——少一项企业级可治理就站不住。

PART 08 · SECURITY

安全与合规设计

Agent 调用工具等同于给 LLM 颁发"操作权限";必须从认证、授权、审计、注入防护、数据脱敏五个维度构建。

身份与鉴权

细粒度授权

Prompt 注入防护

审计与合规

一句话小结

工具调用 ≈ 操作权限,5 个维度一起做:身份、授权、注入防护、审计、脱敏——单点失守 = 全面失守。

PART 09 · RISKS & ROADMAP

4 类关键风险 + M1 / M2 / M3 里程碑

不回避问题;明确暴露 + 可执行缓解是评审通过的前提。

风险与缓解

¥成本失控
长链路任务可能产生数十次 LLM 调用,单次任务成本可达 $1+;多 Agent 协作与工具循环放大了这一风险。
缓解① 任务级预算(用户可设上限)
② 单步 / 单任务熔断
③ 自动路由到小模型做预处理
④ 缓存常见子任务结果
死循环 / 无限调用
Agent 反复调用同一工具、相互等待、推理路径无收敛;尤其是"工具输出 → LLM → 工具输出"形成环。
缓解① 全局步数上限(默认 20,可配)
② 检测循环模式(最近 N 步哈希)
③ Supervisor 节点强制收敛
④ 用户可随时中断 + 回滚到上一步
?不可解释 / 不可信
多 Agent 决策链对用户黑盒;出问题时难以归因;在企业场景下不可接受。
缓解① 强制 ReAct 风格 + 思考链必显
② 每个决策点提供"为什么"的 LLM 自解释
③ 完整 Trace + Replay 可视化
④ 高风险决策保留人类确认环节
工具故障 / 副作用
工具 API 故障可能产生半完成状态;写操作类工具(DB / 文件)出错代价高。
缓解① 写工具必须幂等 + 支持事务回滚
② Saga 模式:补偿操作预定义
③ 工具调用前后状态快照
④ 故障注入测试常态化(Chaos)
4 类关键风险 · 每条都有具体的工程级缓解动作

迭代路径 · M1 / M2 / M3

M1 · 8 周 M2 · 12 周 M3 · 12 周
阶段目标交付物
M1 · FOUNDATION 单 Agent + 工具集 LangGraph 编排 + LiteLLM 接入;10 个核心工具(搜索 / SQL / HTTP / 文件);pgvector + PostgreSQL 起步;前端工作台 MVP;基础 Trace + Token 计量
M2 · COLLABORATION 多 Agent 协作 + 治理 4 种协作模式上线;MCP Server 框架 + 5 个外部工具;Milvus 切换 + RAG 质量评估;Replay / Eval / 权限系统;10 个种子用户内测
M3 · ECOSYSTEM 生态开放 + 规模化 工具市场(外部开发者上架);Agent 模板市场 + 分享;亿级向量 + 分布式检索;SOC 2 启动 / 数据合规;公测发布 + 商业化探索
一句话小结

M1 跑通单 Agent + 工具集,M2 上多 Agent 协作与治理,M3 开放生态与规模化——三阶段节奏清晰,每阶段都有可交付、可验证的里程碑。


Q&A · 谢谢,期待你的反馈与挑战。

· · ·
联系方式
· Owner · Platform Team
· Repo · github.com/your-org/agent-platform
· Slack · #agent-platform
· 版本 · v0.1 Draft · 2026 / 06 / 05