第 1 章
执行摘要
生成式 AI 回答问题;AI Agent(智能体)解决问题。
对各行各业的企业而言,Agent 能以现有自动化难以企及的方式扩展运营:开放式问题解决、动态决策,以及路径事先无法预定的复杂多步骤流程。
各组织已在生产环境中从自主 Agent 获得显著成果。例如,管理季度交易量达 2260 亿美元 的领先加密货币交易所 Coinbase,基于 Claude 构建了智能体式客户支持系统。其 Claude 驱动的 Agent 每小时处理数千条消息,同时保持 99.99% 的可用性——这对客户需要随时访问资金的场景至关重要。该平台已催生 35–50 个内部 AI 应用,改变了公司服务全球数百万用户的方式。
面向安全与 IT 团队的工作流编排与自动化平台 Tines,用 Claude 构建了智能体式工作流系统。其 Agent 在执行过程中动态处理工作流逻辑,将复杂的多步骤安全运营压缩为单 Agent 操作,对应约 100 倍 的价值实现时间(time-to-value)提升。
为金融服务构建客户运营 Agent 的 Gradient Labs,部署了基于 Claude 的客户支持 Agent:能在上下文中理解客户查询并执行标准操作流程。在达到 80%–90% 解决率的同时,其 Agent 能以有限人工介入处理复杂工作负载,使员工得以聚焦关系建设与其他战略工作。
AI Agent 为各类规模与行业的组织打开了无数可能,但落地需要审慎考虑架构模式、成本管理与运营治理。
为何需要 AI Agent
可以把 AI Agent 理解为能独立工作的智能数字助手:通过连接真实业务系统的工具,解决复杂业务问题。本质上,AI Agent 是大语言模型的进阶形态——能自主指挥自身流程与工具使用,以完成复杂任务。
传统自动化依赖事先写好、每一步都映射清楚的刚性脚本。Agent 则不同:它们评估任务、选择合适工具、尝试路径、评估结果,并按需调整策略——很像熟练员工面对陌生项目时的做法。例如,处理客户支持升级的 Agent 可以阅读问题、核对账户历史、查阅知识库、起草个性化回复并接入专家,全程无需人工介入。
这些系统真正强大之处,在于自主推理与工具选择能力,以及从错误中恢复、朝目标持续推进的能力。与由预定义代码路径编排 AI 交互的传统工作流不同,Agent 对自己的决策过程保持动态控制,并根据环境反馈与中间结果自适应。
因此,它们特别适合扩展那些无法预先确定精确步骤的复杂运营,例如事件响应、数据分析、客户入职流程,或通过自动化测试形成迭代反馈环的开发工作流。
组织正在取得的成果
部署 Agent 的组织正在看到真正重要的数字。
例如,某零售银行用 AI Agent 改造了信用风险备忘录的撰写:过去关系经理需要数周、人工审阅十余个数据源;如今带来 20%–60% 的生产力提升,并将信贷周转时间缩短 30%。
本指南涵盖:
- 来自生产环境运行这些系统的团队的实践洞察
- 从单 Agent 到多智能体编排(multi-agent orchestration)的架构模式,以及如何将具体问题匹配到合适模式的清晰指引
- 技术要求:包括 API 能力、工具集成与内存管理,以构建真正可规模化运行的生产级 Agent
- 安全与合规框架:在保护敏感数据的同时,管理自主系统带来的独特风险
- 实施策略:建设能随模型能力提升而扩展的团队与基础设施(而非与之对抗)
- 面向未来的指标:帮助你构建随底层模型变强而更强——却不必更复杂——的系统
下面开始深入。
第 2 章
AI Agent 常见用例与应用
要理解 Agent 在何处真正创造业务价值,不妨看看组织今天如何部署它们。真实落地揭示出可指导战略决策的模式,并帮助你在组织内识别最高影响力的机会。
编程(Coding)
企业系统上的加速开发: Augment Code 在 Google Cloud 的 Vertex AI 上使用 Claude,帮助开发者在拥有数百万行相互依赖代码的复杂代码库中导航。某企业客户在 2 周 内完成了 CTO 预估需要 4–8 个月 的项目;开发者入职也从数周缩短到 1–2 天。该平台帮助团队更快理解复杂软件系统,从而更高效地编写、文档化与维护代码。
数据分析
对话式可观测性数据探索: Grafana 使用 Claude 驱动智能助手,使从 CTO 到初级工程师的各技能水平团队,都能通过自然语言解锁可观测性数据。用户可以提问如「我的结账服务请求延迟是多少?」,Claude 会自动找到相关指标并构造合适的 PromQL 与 LogQL 查询。
客户支持与运营
规模化、高解决率的自动化支持: Intercom 由 Claude 驱动的 Fin AI Agent,在超过 25,000 名客户中实现高达 86% 的解决率,并以接近人工质量的回复响应。该平台开箱平均解决率达 51%(定制前),将响应时间从 30 分钟 降至数秒,并支持超过 45 种语言。
AI 增强的人工支持协同: Assembled 用 Claude 驱动其 Assist 平台,客户满意度提升 20%,同时降低支持开支;升级减少超过 50%;每小时解决案例提升超过 30%。其重点是解决复杂的 Tier 2+ 问题,而非仅分流简单查询。
法律
规模化企业法律知识: Thomson Reuters 在 Amazon Bedrock 中使用 Claude 驱动 CoCounsel,将 3,000+ 位主题专家与超过 150 年权威内容的专业知识交付给法律与税务专业人士。平台通过专家校验,以严谨准确度处理复杂合同与税务文件;客户反馈其「很容易看到时间减半,甚至更多」,并称 CoCounsel 的效率「惊人」——使专业人士得以「聚焦更高层次、更战略的工作」。
指令遵循出色的灵活法律 AI: Legora 用 Claude 驱动整个法律平台,在其专有大型法律评测集的复杂任务上实现 18% 更高的表现。Claude Sonnet 的优势来自「在大型任务与文档上保持一致性,并准确遵循复杂指令」,使 Legora 能构建适应不同执业领域与客户需求的灵活智能体工作流,帮助律师「精准审阅与研究、更聪明地起草,并无缝协作」。
营销
规模化、多平台自动化广告: Advolve 用 Claude 编排整个数字化获客流程,在多平台同时管理数百万条广告,并具备实时数据校验与动态预算分配。系统实现运营工时减少 90%、广告支出回报率(ROAS)提升 15%;对管理超过 1 亿美元 广告预算的大型企业客户,其平台可在 30 天内 达到「管理数百万美元预算时的人类水平 ROAS」。
垂直聚焦:金融服务
自动化欺诈检测与风险评估: Inscribe 用 Claude 驱动 AI 风险 Agent,将欺诈审阅时间缩短 20 倍——从 30 分钟 到 90 秒——并在客户案例中将产出提升 70 倍。AI 欺诈分析师可在图像与 PDF 中检测欺诈,通过 KYC 与 KYB 核验申请人信息,发现风险交易,并在约 90 秒 内提供可审计的风险报告。这使金融机构能扩大对「薄档案、无银行账户、信用不可见」等信用合格但服务不足人群的覆盖。
第 3 章
常见架构模式
上述用例展示了 Agent 跨行业的巨大潜力,但成功落地完全取决于选择正确的模型、技术与架构路径。处理常规查询的客服 Agent,与分析复杂数据集的多领域研究系统,需要截然不同的设计。
理解这些架构模式,有助于将技术复杂度与业务需求对齐,避免过度工程化——那种抬高成本却无法带来相称价值的做法。
我们先从指导成功 AI Agent 落地的基础设计原则开始。
Agent 设计最佳实践
从简单开始,智能扩展。 正如《Building Effective AI Agents》中所讨论的,我们建议团队从做好一件事的单一用途 Agent 起步,再随着需求演进逐步发展为更复杂的系统。简单系统运行成本更低(更少 token、更少算力),出问题时更易调试,并能给出真正与业务结果挂钩的清晰指标。
为任务选择合适的模型。 市面上模型众多、能力各异,选对模型至关重要。
关键是在三项因素间取得平衡:能力、速度与成本。就像从工具箱选工具:你不会用大锤钉相框,也不会用小钉锤拆墙。例如,若在构建多智能体编程框架或做复杂金融分析,你会想要最强能力的模型;但若处理数千条简单客服工单或从表单抽取数据,更轻、更快的模型同样能胜任,且成本只是零头。
性能光谱从为最复杂推理任务优化的模型,延伸到为高吞吐、直截了当应用设计的模型。这意味着你可以把具体用例匹配到合适能力层级。用高端模型跑简单任务不仅浪费,在规模化时也会更慢、更贵。当你处理成百上千请求时,这些差异会迅速累积。
践行模块化设计。 这一领域变化很快,新能力与功能不断涌现。把系统设计为模块化,以便演进 Agent 能力时无需彻底重做基础设施。你的架构应随进步而弯折,而非在其下断裂。
Agent 模块化例如可采用组合模式:
- Prompt 定义在集中式配置文件或库中
- 工具作为离散、可复用的模块
- 按需定义 Agent,仅使用完成其任务所需的工具与资源
这种组合模式可拥有分别用于网页搜索、数据库查询与邮件撰写的模块,以及面向不同推理风格(分析型、创意型、技术型)或不同角色的 prompt 模板。遵循该模式,可在开发中快速定义所需 Agent,并按需选用预定义资源。
这类模块化 Agent——尤其是基于 LangGraph 或 Mastra 等框架构建的——可以有机扩展。当新 AI 能力出现时,组件化 Agent 架构提供自然集成点,无需系统级重构。你可以轻松把新工具接入模块化 Agent 框架,并更新中央配置,以将增强的 prompting 技术推广到所有 Agent。
用 Agent Skills 扩展能力。 Agent Skills 提供一种结构化方式,为 Agent 配备超出基线能力的专业知识、工作流与工具集成。与其把全部领域专长直接编码进 prompt,Skills 更像 Agent 可按需调用的模块化能力包。
可组合架构: Skills 可在复杂任务上协同,并按需调用其他 Skills。例如,合规 Skill 可能调用文档分析 Skill,后者再使用专用抽取 Skill。这种可组合性让你在不制造单体实现的前提下,构建能力层级。
何时使用 Skills:
- 领域专长(金融分析、法律审阅、科学研究)
- 组织已打磨成熟的标准化工作流
- 专用工具集成(数据库、API、内部系统)
- 行业最佳实践与合规要求
实施路径: Skills 可与单 Agent 与多智能体架构无缝集成。在单 Agent 系统中,Skills 扩展 Agent 基线能力;在多智能体系统中,不同 Agent 可按专长配置不同 Skills——金融分析 Agent 可能使用风险评估 Skills,客服 Agent 使用 CRM 集成 Skills。
这种模块化方式意味着你可以独立更新 Skills 而无需重写 Agent 逻辑,在多个 Agent 间共享 Skills,并随组织需求演进扩展能力。
构建能自我解释的可观测系统。 AI 应用常像黑盒,而 Agent 又增加了复杂性。除结构化日志、集中监控与分布式追踪等标准实践外,AI 应用还引入了传统 APM 工具未针对设计的独特可观测性挑战。
核心问题在于:AI 系统是非确定性的,推理过程不透明。当 AI Agent 失败或行为异常时,你不能只看堆栈跟踪——你需要看到 prompt 链、模型决策路径、检索上下文、token 消耗以及整个推理工作流。当核心逻辑发生在神经网络内部时,传统调试往往力不从心。
关键洞见是:调试 AI 应用不仅要知道发生了什么,还要理解模型为何做出特定决策,以及上下文如何在多步推理链中流动。
在这些基础原则之上,我们来看它们如何应用于具体架构模式。我们从适用于大多数企业用例的最简方法开始,再推进到能通过可衡量性能收益证明其复杂度的更复杂模式。
单 Agent 系统(Single-agent systems)
在单 Agent 系统中,AI 驱动的 Agent 在连续循环中运行:感知环境、决定下一步、采取行动以完成目标。
与 Agent 交互通常遵循如下模式:
- 用户向 Agent 下达任务。
- Agent 制定计划,基于可用工具执行动作,观察结果,并根据反馈调整方法。
- Agent 重复该循环,直到任务完成,或触及停止条件(例如「在此暂停以供人工审阅」)。
架构概览: 单 Agent 系统的核心组件包括:作为推理引擎的 AI 模型、定义 Agent 角色与能力的 prompt,以及使其能与外部系统交互并执行特定功能的集成工具包。Skills 还提供额外能力层,为 Agent 配备超出基线训练的专业领域知识、工作流与最佳实践,使单个 Agent 能处理原本可能需要多个专职 Agent 的复杂任务。
何时使用: 单 Agent 擅长处理一开始路径并不清晰的开放式问题。你无法预先确定解决方案,因为不知道需要多少步骤,或沿途会出现何种障碍。
何时避免: 当你需要第一次就得到完美答案、且必须 100% 如此时。单 Agent 很强大,但要处理复杂问题或追求最高准确度,你会想利用多智能体架构。不过,在扩展到多智能体之前,先考虑是否通过为单 Agent 增加专用 Skills,就能更高效地达到准确度要求。
示例
示例:单 Agent 研究助手
你部署一个研究 Agent,并通过模型上下文协议(Model Context Protocol, MCP)将其连接到各类系统,包括内容库、业务工具与开发环境。以下展示单个 Agent 如何借助多种工具处理相对复杂的任务。
- 用户查询: 员工向研究 Agent 提出:「调研工程团队正在采用的远程工作效率工具,并看看是否有任何工具与我们的内部生产力指标相关。」
- 初步分析: Claude 评估用户查询:
- 思考:「该查询需要两个不同数据源:关于生产力工具的外部研究,以及内部公司指标。由于外部研究最初不依赖内部数据,我应分解为并行搜索。最后需要将发现关联起来。」
- Skills 发挥作用: 该研究 Agent 利用专用 Skills,包括:
- 指导系统性文献综述的研究方法论 Skills
- 提供识别有意义模式框架的数据关联 Skills
- 确保洞察与组织优先级对齐的商业智能 Skills
这些 Skills 使 Agent 能应用已验证框架,而非从第一性原理推理,从而提升准确度与效率。
- 任务分解与规划: 基于思考分析,Claude 规划方法:
- 外部网页搜索:生产力工具采用趋势
- 内部数据库查询:公司生产力指标
- 并行工具执行以优化效率
- 用于综合的关联方法论
- 并行工具执行: Claude 利用原生并行工具调用能力同时执行多个工具:
- 网页搜索工具(经 MCP):搜索远程工作效率工具与采用数据
- SQL 数据库工具(经 MCP):跨团队与时间段查询内部生产力指标
两工具并发执行,显著缩短总响应时间。
- 迭代分析与精炼: 处理初步结果后,Claude 使用 think 工具做更深分析:
- 思考:「网页搜索返回了全面的工具类别与一般采用趋势,但需要更具体的工程团队偏好数据。数据库查询成功——已有基线生产力指标。需要针对定量采用数据与团队特定反馈的精炼搜索。」
Claude 基于此分析执行后续查询:
- 网页搜索工具:针对工程特定采用模式的精炼搜索
- SQL 数据库工具:将工具实施时段与生产力变化相关联的定向查询
- 数据综合与关联: 使用 think 工具做全面分析:
思考:「外部研究显示开发工具、项目管理平台与沟通系统的清晰采用趋势。内部指标揭示各团队与季度间的生产力差异。将实施时间线与绩效数据交叉对照,以在考虑外部因素的同时识别潜在关联。」
- 结果生成: Claude 利用扩展上下文能力保持完整对话上下文,综合发现并给出汇总结果:
「研究发现若干类被工程团队显著采用的远程工作效率工具:开发环境工具……」
多智能体系统(Multi-agent systems)
多智能体架构协调多个专职 Agent,以应对超出单个通才系统能力的复杂问题。不是由一个 AI 模型包办一切,而是将任务分解、分发并跨多个 Agent 执行——往往各自擅长特定类型查询——再将多 Agent 结果综合为连贯答复。
Anthropic 内部研究表明,对于需要同时沿多个独立方向推进的复杂任务,多智能体系统比单 Agent 系统高出 90.2%。关键洞见是:智能达到某个阈值后,「多智能体系统成为扩展性能的关键方式」,因为「Agent 群体能完成远超个体」的工作——很像人类组织。
架构概览: 多个具备专长的 Agent 朝共同目标协作。这可能涉及编排器向专家委派,或由高级 Agent 管理子 Agent 的层级结构。通信可在 Agent 间直接发生,或通过共享内存与消息队列协调。Agent Skills 也可战略性地分布到各 Agent,以形成深度专长。
何时使用: 当单 Agent 触及根本极限时,多智能体系统表现出色。在以下情况选择多智能体架构:(1)任务涉及难以预先预测所需步骤的开放式问题,并需要在调查展开时灵活转向或探索旁支关联;(2)你需要会压垮通才 Agent 的专业能力——研究表明,当存在两个或更多干扰领域时,单 Agent 表现急剧下降;或(3)问题需要同时沿多个独立方向推进的广域查询,并行处理能带来显著性能收益。它们尤其适合复杂研究、跨多学科的综合分析,或需在多元知识领域中持续自主运行的场景。
实施考量: 多智能体系统对复杂任务威力十足,但复杂度与运营成本也成正比。多智能体架构会快速消耗 token,需要业务价值足以支撑更高性能成本的任务。设计系统时,应按需扩展投入——简单查询不应触发昂贵的多智能体工作流。
可观测性变得更加关键。如前所述,传统调试方法会失效,因为 Agent 做动态决策,且各次运行间是非确定性的。在 Agent 决策成倍增加的多智能体架构中,必须实施追踪——不仅捕获单个 Agent 行为,还要捕获决策模式与交互结构,以便在协调失败时诊断根因。若缺少对 Agent 如何通信、委派任务与综合结果的全面可观测性,当复杂交互产生涌现行为时,调试几乎不可能。
考虑多智能体落地时,先清晰定义目标,并构建满足需求的最简方案。从一开始就为模块化与可扩展性设计;当你需要增加新能力或扩展现有能力时,会感谢这一基础。
架构模式细分
多智能体系统围绕两个基本协调概念组织:中心化与去中心化架构,各自应对不同的协调挑战与用例。
中心化系统采用层级模式:中央监督者智能地将任务委派给专职 Agent,形成清晰的责任链,镜像高效的人类组织结构。这类层级系统有多种名称,如监督式(supervisory)、编排器(orchestrator)或路由(router)模式,各自代表中心化控制的略有不同变体——有的侧重任务委派,有的侧重路由决策,有的侧重对 Agent 交互的全面编排。
去中心化系统采用协作模式:自主 Agent 以点对点方式直接通信,动态协商角色,并通过分布式智能解决复杂问题。协作系统有时被称为群体(swarm)或联邦(federated)架构,强调涌现式协调而非强加控制。
支撑这些架构模式的是智能体工作流(agentic workflows):为多步骤流程提供结构化编排,定义 Agent 在分布式环境中执行任务的顺序与条件。
核心区别在于协调哲学:中心化控制 vs. 分布式自主 vs. 结构化编排。组织常组合这些模式,以创建匹配其业务需求的稳健、可扩展方案。
层级 / 监督式系统(Hierarchical / supervisory)
层级系统通过中央控制器,以智能任务委派协调多个角色专职 Agent。监督 Agent 分析入站请求、路由到合适专家并综合答复,形成随组织复杂度有效扩展的清晰责任链。
在层级系统中,各个子 Agent 被当作工具:监督 Agent 使用工具调用模型决定调用哪些 Agent 工具。该模式镜像高效人类团队:专家聚焦领域,协调者负责任务分配与整合。子 Agent 也可拥有自己的子 Agent;这些组别对监督 Agent 抽象,监督者只与子 Agent 团队负责人交互,而不感知更深层委派。
尽管 token 用量更高,经济性仍偏向这一路径。多智能体系统比单次交互消耗显著更多 token,但对需要专业知识或超出单 Agent 上下文限制的高价值复杂任务,性能收益能证明成本合理。
实施变体在协调开销与响应质量之间的平衡上有所不同:
- 全面编排系统:对用户交互与任务执行保持完整监督控制
- 侧重路由的实现:专长于委派决策,可能将用户沟通交给专家 Agent
- 混合协调方法:根据任务复杂度有选择地引入监督者
关键挑战:上下文管理
编排 Agent 可能面临根本问题:上下文变得过于复杂,单个 Agent 难以有效管理,从而在扩展交互中造成性能瓶颈。这种上下文复杂度表现为上下文窗口溢出、推理性能下降,以及 Agent 间协调失败。
成功落地需要扎实的上下文管理策略:上下文编辑(context editing) 在接近 token 上限时自动清理陈旧工具调用与结果,同时保持对话流畅;内存工具 让 Agent 通过跨会话持久的基于文件的系统,在上下文窗口外存储与检索信息。还应考虑让工具支持分页、范围选择、过滤与截断,并设合理默认值,将响应限制在可管理大小(例如约 25,000 token),以防上下文耗尽。
示例:多智能体层级工作流——营销活动开发
营销机构部署层级多智能体系统,由监督 Agent 协调专家 Agent,在确保战略对齐的同时,在活动各组成部分中利用深度领域专长。
- 活动简报提交: 客户提交包含目标、受众、预算约束、时间线与品牌指南的营销活动简报。
- 营销总监 Agent(监督者): 分析活动需求,识别关键交付物,确定资源分配,并创建将具体任务映射到合适专家 Agent 的战略执行计划。
- 市场研究 Agent: 接受监督者指令,开展目标受众分析、竞争格局研究与市场机会评估,并将发现汇报给营销总监 Agent。
- 创意设计 Agent: 由监督者指派,基于市场研究洞察与品牌指南开发视觉概念、品牌资产与设计框架;监督者审阅并批准创意方向。
- 文案 Agent: 接受监督者任务,创建全渠道信息策略、广告文案与内容,确保与先前 Agent 确立的创意方向与市场定位一致。
- 媒介策划 Agent: 由监督者指导,基于受众洞察与创意要求,制定媒介组合建议、渠道选择、跨平台预算分配与时机策略。
- 活动整合与批准: 营销总监 Agent 综合所有专家输出,确保战略连贯,解决专家建议间的冲突,并准备整合后的活动提案。
- 提交全面活动策略: 将含创意资产、媒介计划、预算分配、时间线与成功指标的最终整合营销活动交付给客户。
协作式系统(Collaborative systems)
协作式系统使多个专职 Agent 通过复杂协调机制实时协作,共享信息并协调行动,以实现超出单个 Agent 能力的结果。与有中央控制的层级系统不同,协作模式强调点对点交互:Agent 直接通信、动态协商角色,并通过分布式智能集体解决复杂问题。
在协作系统中,Agent 作为自主实体运行,通过多种机制通信、协调与协作,以实现集体目标。这种方式镜像人类团队:专家贡献专长,同时保持对更广目标的觉察。关键区别在于:协调从 Agent 交互中涌现,而非由中央权威强加。
实施变体在 Agent 如何协调与共享上下文上有所不同:
- 群聊编排(group chat orchestration): 多个 Agent 通过参与共享对话线程协作讨论,以解决问题、做决策或校验工作
- 事件驱动协调: 以事件为共享语言,作为结构化更新,使 Agent 能解释指令、共享上下文并协调任务
- 黑板架构(blackboard): 提供共享知识库,所有 Agent 可读可写,作为集体记忆
关键挑战:通信复杂度与涌现行为的不可预测性
协作系统在管理 Agent 间通信与预测系统行为方面面临根本挑战。Agent 间频繁通信导致计算成本与复杂度上升;多智能体系统还会出现未经特定编程的涌现行为,微小变化可能不可预测地影响 Agent 表现。成功需要定义劳动分工、解题方法与投入预算的协作框架,而非僵硬指令。其他挑战包括防止 Agent 无限来回推诿任务,以及实施稳健的冲突解决机制。
示例:多智能体协作工作流——竞争情报收集
战略咨询公司部署协作式多智能体情报系统:专职分析 Agent 实时协作,交叉核对发现,并通过集体智能构建超出单个 Agent 能力的全面竞争格局。
- 情报请求启动: 客户请求全面竞争分析,触发所有专职分析 Agent 的协同情报收集。
- 协同数据收集: 客户请求进入队列。定价、产品、营销、财务、社交媒体与战略情报 Agent 建立通信渠道并划分监测职责,以避免重复。
- 跨 Agent 协作: Agent 实时持续共享发现——定价 Agent 向产品 Agent 提示功能—价格关联,营销 Agent 与财务 Agent 共享活动数据,社交媒体 Agent 向战略 Agent 提供情绪洞察。
- 情报校验: 所有 Agent 交叉核对发现,识别矛盾,跨多数据源验证,并建立经多方佐证的竞争对手画像。
- 集体综合: Agent 协作整合多维洞察,评估市场机会,并形成关于竞争对手战略动向的预测性情报。
- 战略情报报告: 报告 Agent 基于集体智能,撰写含经验证发现、预测洞察与战略建议的全面竞争格局分析。
- 提交情报报告: 将含指标的最终整合情报报告交付给客户。
智能体工作流(Agentic workflows)
智能体工作流定义 Agent 如何运行的结构,包括如何通信、交接任务,以及如何朝共享目标协作。与单个 Agent 的动态行为不同,工作流是预定义且相对静态的。两种常见 Agent 工作流模式是顺序式与层级式。
顺序工作流(Sequential workflows)
顺序工作流使用预定义控制流与明确执行路径,确保可预测的 Agent 转换,适合可重复流程,如文档审批链或合规检查。这些工作流提供清晰审计轨迹与确定性行为,非常适合过程一致性与可追溯性至关重要的监管环境。
顺序工作流可利用软件定义的决策点(例如基于任务结果或系统状态变化的条件逻辑),或由模型根据中间结果与上下文因素决定应用控制流的 AI 驱动路由。这种混合方法既保有预定义路径的可靠性,又能基于内容分析或动态条件灵活适应。
主要优势是运营可预测性:你可以画出完整流程、估算执行成本,并通过检查特定工作流阶段来调试问题。但这种可预测性的代价是:处理边缘案例或不适合预定义结构的新颖场景时灵活性不足。
何时使用: 当任务可干净地分解为固定子任务时使用顺序工作流。主要目标是以延迟换更高准确度——让每次 AI 调用成为更简单、更聚焦的任务。
在这些场景考虑顺序编排:具有清晰线性依赖与可预测进展的多阶段流程;每阶段为下一阶段增加特定价值的数据转换管道;无法并行化的工作流阶段;以及草稿—审阅—润色等渐进精炼需求。
当你了解管道中每个 Agent 的可用性与性能特征,且某一 Agent 的失败或延迟对整体任务完成可接受时,使用顺序模式。
有效示例包括:先生成营销文案再翻译成不同语言;先写文档大纲、校验大纲是否符合特定标准,再基于批准大纲撰写全文。
何时避免: 仅含少数阶段且单 Agent 即可有效完成的流程;Agent 需要协作而非交接的工作;或需要回溯与迭代的工作流。
示例:多智能体顺序工作流——自动化数据科学洞察
公司部署多智能体工作流方案,自动化数据分析请求,在不阻塞数据科学团队的情况下快速生成洞察。
- 分析请求: 利益相关方通过系统提交数据分析请求(例如「按区域分析 Q4 销售表现」或「识别客户流失风险因素」)。
- 范围界定 Agent: 分析入站请求,确定分析类型(描述性、诊断性、预测性或规范性),识别所需数据源与方法,评估复杂度,并路由到合适分析路径。
- 数据工程 Agent: 根据范围输出从相关来源(数据仓库、API、数据库)抽取数据,清洗与校验,处理缺失值与异常值,工程化相关特征,并准备可分析数据集。
- 分析 Agent: 接手准备好的数据,执行合适分析工作流——运行统计检验、构建模型、生成可视化、识别关键模式与洞察——或将需人工数据科学家介入的复杂请求连同详细交接包一并标记。
- 审阅 / 升级: 分析结果或自动校验并批准分发,或排队供高级数据科学家做质量保证与解读精炼。
- 交付洞察: 最终分析产出(报告、仪表盘、模型预测或建议)经利益相关方偏好渠道打包交付。
并行工作流(Parallel workflows)
并行工作流将独立任务同时分发给多个 Agent,结果再合并或并发处理。当任务需要多元视角或专长时,该模式表现出色,能通过并发处理显著提速。
并发编排模式让多个 Agent 同时在同一任务上运行,使每个 Agent 从其独特视角或专长提供独立分析。这类似 fan-out/fan-in 云设计模式——结果常被聚合,但并非必须。
该模式针对需要对同一问题获得多元洞察或方法的场景。所有 Agent 并行工作,而非顺序处理,从而缩短总体运行时间并覆盖更全面的问题空间。每个 Agent 可在工作负载内独立产出结果,例如调用工具或更新不同数据存储。
Agent 彼此独立运行、不相互交接结果,尽管某一 Agent 可用自己的编排方式再调用其他 Agent。该模式既支持对所有已注册 Agent 的确定性调用,也支持基于任务需求的动态选择。
何时使用: 当划分子任务可同时处理以提速,或需要多视角以获得更高置信结果时使用并行化。对有多重考量的复杂任务,AI 模型通常在每次调用专注一个方面时表现更好。
有用示例包括分节方法:实现护栏——一个模型处理用户查询,另一个筛查不当内容;或自动化评测——每次调用评估模型表现的不同方面。投票模式适合用若干不同 prompt 审查代码漏洞,或用不同投票阈值评估内容适宜性,以平衡假阳性与假阴性。
何时避免: 当 Agent 需要相互建立结果或要求按特定顺序累积上下文时;当任务要求特定操作顺序或确定性结果时;或当模型配额等资源约束使并行处理低效时。也不要在 Agent 无法可靠协调对共享状态或外部系统的并发变更、没有清晰冲突解决策略处理矛盾结果,或结果聚合逻辑过于复杂乃至降低结果质量时使用并行模式。
示例:多智能体并行工作流——金融风险评估
金融机构部署多智能体并行工作流,评估贷款申请与投资机会,在跨关键维度保持全面风险分析的同时加快决策。
- 风险评估请求: 贷款申请或投资提案提交给系统,进行全面风险评价。
- 数据聚合 Agent: 从内外部数据源收集信用报告、财务报表、市场数据、监管备案与历史绩效指标等相关信息。
- 并行 Agent(各自使用工具):
- 3a. 信用风险 Agent: 同时分析借款人信用资质、债务收入比、支付历史与抵押品质量,生成信用风险评分与违约概率计算。
- 3b. 市场风险 Agent: 并发评估市场波动、利率敏感性、行业敞口与经济指标,评估市场波动与经济下行可能导致的损失。
- 3c. 运营风险 Agent: 并行检查内部流程风险、欺诈指标、合规缺口与处理交易的运营能力,识别潜在运营失败或不规则情况。
- 3d. 监管合规 Agent: 同时审阅监管要求、反洗钱检查、了解你的客户(KYC)合规与司法管辖限制,确保全面合规。
- 风险聚合与决策引擎: 所有并行风险评估按机构政策加权汇总,并综合为含可操作建议的全面风险画像。
- 提交风险评估结果: 将含批准 / 拒绝建议、风险评分与详细分析报告的最终多智能体风险评价交付给决策者。
评估者—优化者(Evaluator-optimizer)
评估者—优化者工作流使用两个 AI 系统进行迭代循环:一个生成内容,另一个评估并提供反馈,直至达到质量标准。正确实施时该模式可带来显著改进,但伴随更高 token 成本。
该模式通过结构化反馈环运行:生成器创建初始响应并纳入反馈以逐步改进;评估者按预定义标准评估内容并给出可操作指导。这类似作者—编辑协作,修订稿中纳入具体建议。
何时使用: 当存在清晰评估标准,且通过 AI 反馈环的迭代精炼能证明价值时使用。该模式擅长需要细腻把握的内容创作,如文学翻译、有安全要求的代码生成、语气重要的专业沟通,以及需要多步推理与校验的研究任务。
何时避免: 当首次尝试质量已满足要求、评估标准主观或不清,或时间与成本约束超过质量改进时。不要用于需要即时响应的实时应用、基础分类等简单例行任务,或有严格 token 预算的资源受限环境。当存在确定性方案、评估者工作流缺乏做出有意义反馈的领域专长,或性能下降超过收益时也宜避免。
示例:多智能体评估者工作流——API 文档生成器
软件开发组织部署评估者—优化者工作流,从代码库自动生成全面 API 文档,通过迭代精炼循环确保技术准确与开发者可用性,消除手动文档瓶颈。
- 代码输入: 开发团队将 API 代码库提交给文档生成系统。
- 生成器 Agent: 分析代码库并创建初始文档,包括端点描述、参数、示例与认证要求。
- 技术评估者 Agent: 对照实际代码实现校验文档准确性,检查参数类型、端点覆盖与示例正确性。
- 精炼循环: 生成器纳入两位评估者的反馈,迭代改进文档直至满足所有标准。
- 发布文档: 最终润色后的 API 文档自动发布到开发者门户,含交互示例与全面参考材料。
该过程通常运行 2–4 个循环,在保持技术准确的同时显著提升文档质量。
新兴模式
随着组织不断拓展 AI Agent 的可能边界,若干实验性模式正从研究实验室走向早期落地。以下重点介绍部分新兴模式。
Agent 模式:动态 Agent 生成(Dynamic agent generation)
动态 Agent 生成是一种蓬勃发展的实验方法,将模块化推到逻辑终点:在运行时从 prompt、工具与配置库组装组件创建 Agent,任务完成后解散。目前尚无生产系统实现真正的动态创建,但技术基础已存在于多个研究项目与 AutoGen、Semantic Kernel 等实验框架中。
该模式在资源优化与任务特定性能方面颇具吸引力;系统可分析入站请求并自动实例化具备精确所需能力的 Agent,任务完成后释放资源,而非维护预配置 Agent。然而,围绕上下文管理复杂度、涌现行为风险与动态创建开销等重大挑战仍在。当前对多智能体协调与事件驱动架构的研究提供了基础,但组织应将其视为实验领地。
架构模式:网络 / 点对点系统
网络架构代表多智能体协调的重大演进:通过「任意 Agent 可与任意其他 Agent 直接通信」的多对多通信,消除层级瓶颈。早期基准显示,「群体架构整体略优于监督架构」,因为 Agent 可直接协作,无需监督翻译层。
决策框架:何种用例选何种模式
理解架构模式只是第一步。工程领导者的关键挑战是为你的具体约束选择正确方法:预算、时间线、复杂度与风险容忍度。成功落地不是按技术精巧程度选择,而是通过系统评估三个关键维度,将架构复杂度与业务价值匹配。
三个关键问题
在深入具体模式前,每个企业团队需要回答这些根本问题:
1. 你需要何种控制水平?
- 高控制要求(监管合规、金融交易、安全关键运营)→ 从单 Agent 或顺序工作流起步
若你需要向审计师、监管者或高管精确解释系统为何做出某决策,你需要可预测、可追溯的行为。带清晰决策标准的单 Agent 处理贷款审批,远比三个不同 AI 模型协作给出建议的多智能体系统更易审计。
- 中等控制要求(客户支持、内容创作、数据分析)→ 考虑层级多智能体系统
当你需要灵活性但仍要监督时,层级系统两全其美:监督 Agent 可执行业务规则,专家 Agent 处理复杂性。
- 低控制要求(研究、头脑风暴、复杂分析)→ 协作式多智能体系统变得可行
当目标是探索可能性或处理真正复杂的问题时,协作 Agent 的不可预测性成为特性而非缺陷。
2. 你的问题域有多复杂?
- 单领域问题(回答产品问题、处理退货、生成报告)→ 单 Agent 高效处理
不要过度工程化。若工作涉及直截了当、可重复的任务,一个设计良好的单 Agent 往往足够。
- 多领域但可预测的问题(员工入职、合规工作流、标准分析任务)→ 顺序或并行工作流
当你能画出流程步骤但每阶段需要不同专长时,工作流提供结构而不会过度复杂。
- 复杂、开放式问题(战略分析、研究项目、系统排障)→ 多智能体架构
这些问题需要拆解为更小部分并采用不同方法。若工作受益于多视角或专用 Skills,多智能体系统可能合理。
3. 你的资源约束是什么?
- 有限预算 / token → 单 Agent 或精心设计的并行工作流
多智能体系统大约使用单 Agent 的 10–15 倍 token。在承诺复杂架构前,先按预期量做数学计算。
- 上市时间压力 → 从单 Agent 起步,规划演进路径
你可以在数周内部署单 Agent;多智能体系统要数月才能做对。先构建能用的东西,再增强。
- 长期战略举措 → 为模块化演进设计
若这是多年举措,用支持后续加入更多 Agent 的接口构建第一个单 Agent。从一开始为演进设计:在需求增长时,保持一致的用户体验,同时为后端架构变更建设能力。
4. 你需要深度领域专长吗?
- 具有既定工作流的单领域 → 配备专用 Skills 的单 Agent
在跳向多智能体之前,先考虑配备领域 Skills 的单 Agent 能否解决问题。Skills 在无多智能体协调复杂度的情况下提供深度专长。
- 需要协调的多个不同领域 → 配备专用 Skills 的多智能体系统
当领域必须协作时(例如法律审阅与金融分析协调),每个 Agent 具备合适 Skills 的多智能体系统可同时提供专长与协调。
示例:合同审阅系统可能从使用法律 Skills 的单 Agent 起步。随复杂度增长,可演进为多智能体系统——分别处理合同分析、风险评估与合规检查的 Agent,各有专用 Skills。
模式选择指南
这些约束转化为清晰的架构建议:
单 Agent 最适合:
- 定义良好产品类别的客服流程
- 有清晰业务规则的文档处理
- 代码审阅与基础开发任务
- 例行分析与报告
顺序工作流最适合:
- 多步审批流程
- 内容创作管道(草稿 → 审阅 → 发布)
- 数据转换与校验
- 多标准合规检查
并行工作流最适合:
- 多视角提升质量
- 独立分析可同时运行
- 速度比协调开销更重要
- 风险评估需要多元观点
多智能体系统最适合:
- 需要多元专长的复杂解题
- 研究与分析项目
- 跨越多个系统的动态客户交互
- 战略规划与决策支持
示例
真实演进:某电商平台的旅程
- 阶段 1: 用于客户咨询的单 Agent(证明价值)
- 阶段 2: 将订单状态、产品问题、投诉分流的路由模式
- 阶段 3: 各类别专职 Agent,共享上下文
- 阶段 4: 含库存、支付与物流协调的多智能体系统
- 阶段 5: 用于质量保证与持续改进的评估者 Agent
关键在于:架构应随需求演进。从简单开始,度量一切,仅在带来可衡量价值时增加复杂度。最好的架构是满足今日要求、同时为明日能力提供路径的最简方案。
记住,你不受限于简单架构模式。当业务需求证明额外复杂度合理时,战略性地组合模式可解锁单一方法无法达到的能力。
混合架构策略
决策框架提供清晰起点,但生产系统常演进为战略组合多种模式的混合架构。理解这些组合可避免架构死胡同,并实现系统化扩展。
常见混合模式:
带并行处理的层级系统
- 监督 Agent 向专家 Agent 委派;专家 Agent 协调并行工作流。例如,金融风险评估监督者可向信用、市场与运营风险 Agent 委派,各自在领域内运行并行分析。
带动态路由的顺序工作流
- 根据中间结果调用不同类型 Agent 的线性流程。客服工作流可能从分类开始,再按问题复杂度路由到简单解决 Agent 或复杂多智能体研究团队。
带多智能体升级的单 Agent
- 简单 Agent 处理例行任务,但在遇到边缘案例时自动触发复杂多智能体系统。这在优化成本的同时,保持处理复杂场景的能力。
第 4 章
展望:构建 AI Agent 的未来
在本指南中,我们审视了 AI Agent 落地的完整光谱——从处理聚焦任务的单 Agent 系统,到应对复杂、多领域挑战的精密多智能体架构。我们看到了跨行业的真实用例,探讨了架构模式及其权衡,并最终建立了做出明智实施决策的框架。有了这一基础,你可以自信地构建解决真实问题、交付真实结果的 AI Agent。
成功实施 AI Agent,需要把技术复杂度与业务价值对齐,而非追逐你能构建的最复杂架构。若从单 Agent 起步以证明 ROI,从第一天起构建可观测系统,并根据数据告诉你的内容演进架构,你会看到最佳结果。采取这种审慎路径的组织,一贯优于一开始就过度工程化的组织。我们覆盖的框架与模式给你坚实基础,但具体落地取决于你的风险容忍度、资源约束,以及组织对自主系统的准备程度。
能随业务需求演进、在简单与复杂方法之间快速迭代的组织,才是能赢的组织。无论你部署单个客服 Agent,还是编排多智能体研究系统,北极星必须是:模块化设计、全面可观测性,以及直接连接业务结果的清晰成功指标。
工具已就绪,手册已写就。现在是时候解决真实世界的问题了。
第 5 章
下一步
准备好开始构建了吗?通过 Claude Developer Platform 入手,获取 AI Agent 落地所需的模型、工具与技术文档。无论你在原型化第一个单 Agent 系统,还是扩展到多智能体架构,这些资源都将加速你的开发:
- 在 Claude Developer Platform 上开始构建 Agent — 获取全面的 API 文档、实施指南与 prompt 工程技巧。
- 探索 Agent Skills — 学习如何为 Agent 配备专业知识、工作流与工具集成。
- 观看《Building the future of agents with Claude》 — 与构建 Claude Developer Platform 的领导者一起,深入先进架构与新兴模式。
- 探索 Anthropic Engineering Blog — 关于 Agent 开发、上下文工程与生产部署策略的技术文章。
联系我们的销售团队了解更多,或立即注册 Claude Developer Platform。
平台入口:https://www.claude.com/platform/api
内容译自 Anthropic 白皮书《Building Effective AI Agents: Architecture Patterns and Implementation Frameworks》,供学习与参考使用。原文副标题:Accelerate your enterprise AI transformation with proven strategies from Anthropic's customers and internal teams.