打造高效的人机协作团队:Anthropic 的 Multiplayer Agents 实践
过去,使用 AI 意味着「一个人对着一个聊天窗口」。随着时间推移,AI 处理复杂长时任务的能力越来越强——写代码、做研究、金融分析……于是我们看到了各种新的使用方式:从终端、IDE,到表格、PPT。
但直到最近,这些工作仍然是「单人游戏」:一个人 + 一个 Agent,完成一件件独立任务。
这一切正在因为 Claude Tag 这类工具的发布而改变。现在,人和 Agent 可以在同一个工作空间里协作,围绕团队共同目标推进工作。 工作模式正在变得更像一场「多人游戏」——由人类团队制定战略,由 Claude 负责执行。
这带来了全新的协作方式。过去几个月,Anthropic 一直在内部测试让「人机团队」高效运转所需的技术。这篇文章将分享:什么是 multiplayer agents,以及我们在实践中学到的 4 条关键经验。

什么是 Multiplayer Agents?
所谓 multiplayer agents(多人协作型 Agent),指的是能够同时与多个人协作的 AI 模型。
和普通 Agent 一样,它们拥有自己的 记忆(memory) 和 技能(skills)。但它们在很多方面完全不同:
- 它们拥有属于自己的 身份凭证(credentials)
- 它们活在工作真实发生的地方——在 Anthropic,就是 Slack 这样的团队协作工具中
下面是一个 Anthropic 内部案例,人和 Agent 在 Slack 里协作分析一份数据集:

要让 Agent 能够在团队频道中真正产生价值,它必须具备三项能力:
- 持久化记忆——能够记住团队目标,并围绕目标持续优化执行
- 独立于人的身份凭证——在安全、可预测的边界内行动
- 持续、广泛的信息访问权限——理解组织如何运作,从而能够主动执行任务
这些能力构成了「Agent 融入团队」的技术基础。但让人机团队真正成功,光有技术还不够——团队还需要新的工作方式和共享共识。
经验 1:把工作放在阳光下,给 Agent 足够宽广的上下文
Anthropic 的团队会主动、开放地共享信息。当团队里有 Agent 参与时,这一点尤其重要——因为 Agent 完全依赖团队可搜索的文本来构建对世界的理解:Slack、代码、文档、会议纪要。
私聊消息、走廊闲聊、访问受限的文档,都无法给 Agent 提供上下文。
对 Agent 来说:没写下来、无法访问 = 不存在。
与其一份文档、一个频道地决定「Agent 能不能看」,我们的做法是:在整个 Slack 工作区、会议纪要库、文档库层面,定义清晰的安全边界。
在同一个安全边界内,上下文对每一位队友(无论人还是 AI)自由流动。 这样做的好处:
- 大幅扩展了 Agent 和人可访问的信息范围
- 减少了「这条信息能不能分享」的决策疲劳
人也好,Agent 也罢,都不擅长处理「逐项配置的软边界」——这个频道该公开还是私密?这份文档可以分享给他吗?这个 Agent 能不能看那个 thread? 一小组清晰的、工作区级别的边界,能大幅减轻日常工作的心智负担。
高度透明的回报是巨大的:
- 能读到团队会议纪要的 Agent,不会再建议已经被砍掉的项目
- 能访问其他团队产品规格的 Agent,能推荐已被验证有效的模式
- Agent 阅读文本的速度远超人类,它们常常能挖出人类会错过的关键信息
我们在 Anthropic 高度依赖 Agent 来在这个快节奏、信息爆炸的行业里保持同步。
「把工作放在阳光下」在 Anthropic 具体是这样的:
- 选择公司层面为数不多的几条安全边界,并让工作区和文档共享设置与之对齐
- 新建的沟通频道默认对组织内部公开,确保决策落到频道、文档、会议纪要中
- 文档要写给 Agent 也能看的形式——Agent 已经是团队文档的主要消费者
- 确保 AI 有权访问完成工作所需的工具和信息
把「组织内公开」设为默认值需要文化上的转变。但「有上下文的人机团队」和「没上下文的人机团队」之间的差距,大到让你无法忽视。
当然,有些事项本身敏感,需要 1v1 地进行。这种场景下,你可以给 @Claude 发私信,或者使用现有的 Claude.ai 和 Claude Cowork 产品,通过你的个人 MCP 连接器让 Claude 访问私密信息,确保对话和分享内容保持私密。
经验 2:每个人和 Agent 都有明确的角色和顺手的工具
人机团队共享同一个花名册、同一套产出物、同一个工作空间。
Agent 有自己的 身份凭证、技能 和工具权限。不同 Agent 承担不同角色:
- 一个 Agent 负责项目的数据分析
- 另一个 Agent 守护并执行设计规范
- 第三个 Agent 负责用户研究综合
项目启动时,人类会先和这些 Agent 聊一聊——决定谁来担任什么角色、人和 Agent 之间如何协作。

一旦人和 Agent 的分工明确了,一个 Agent 还可能动态派生出其他 Agent——确保具体任务由具备正确记忆和权限的 Agent 处理。
重要的是,每个 Agent 都要有完成工作所需的全部工具访问权限:
- 做数据分析的 Agent 可能需要访问 BigQuery
- 做 QA 的 Agent 可能需要访问 Playwright MCP
清晰的角色和职责是人机团队成功的前提。
人往往会和 Agent 泡在同一个 thread 里,但人保留只有人能承担的角色——确保关键决策由人类判断力来把关。没有清晰的角色分工,人们最终会各自跑一堆「个人 AI」,重复劳动、割裂团队上下文。
指标追踪就是一个典型例子: 一个多人 Agent 做一次就好,让全团队看到同一份数据。
在 Anthropic,「清晰的角色分工」具体是:
- 达成共识的任务集:团队里的人和 Agent 都清楚「谁负责什么」
- 人和 Agent 在同一批 thread 里协作,任何人都能在别人停下的地方接着做
- 人和 Agent 都能访问到完成各自工作所需的工具
- 明确写下每个 Agent 的角色描述和边界

Claude Agents 共同维护一个代码库的日常事务:分诊反馈、规划、编写代码、审查变更、汇报状态。每个 Agent 拥有明确的任务,按自己的节奏工作;人类设定目标并审查产出。
Anthropic 的一支工程团队开始为「人 + Agent」编制花名册,因为这让工作推进变得更简单、更具体。他们早期发现的几件事:
- 明确角色也让人类更容易追踪责任归属,无论是单个任务还是整个团队的职责范围
- 用 技能文件(skill files) 定义 Agent 角色,让「专业化」变得容易,公司里其他人也能快速搭出同类 Agent
- 项目变复杂时,团队会新增 Agent 覆盖新领域——比如他们后来加入了一个「Release Manager Agent」专门负责软件发布
这些方法让人类「对人机团队的心智模型」能够随 Agent 数量增长而 scale。
经验 3:设定「北极星」,让 Agent 更主动
Anthropic 的一些 Agent 只完成分配好的任务,但最有价值的 Agent 会主动建议新的项目和工作流。
这通常发生在——一个已经拥有丰富上下文和明确角色的团队,再增加一样东西的时候:
一颗「北极星(North Star)」。
北极星是雄心勃勃、覆盖面广的目标,帮助团队判断哪些任务和工作流是「值得做的」。在 Anthropic,北极星永远由人类设定,并根植于业务的使命和目标。
当北极星被清晰地写下来后,人类会把它分享给团队中的 Agent。然后,重要的一步——由人类决定哪些 Agent 有权主动提议新的工作流。(并不是所有 Agent 都具备主动提议工作所需的技能和信任度。)
一个例子:
某个内部工具团队的北极星是「让产品 onboarding 更有帮助」。团队里的一个 Agent 主动建议修改 onboarding 流程中报错信息的措辞。这些修改在下一周的数据里,可衡量地提升了 onboarding 成功率。
在 Anthropic,设定北极星的样子是:
- 让人类讨论、辩论、书面沉淀一个雄心勃勃的团队北极星,并根植于公司使命和业务目标
- 把北极星分享给团队中的 Agent,并明确指定「哪些 Agent 可以主动推荐新工作流」
- 把「高价值人类时间」保护在日历上——让会议聚焦在最重要的工作上
一颗清晰的北极星,给了 Agent 一个持续对齐的方向,也给了它们「主动支持团队工作」的有意义的机会。
经验 4:随着时间建立信任
Anthropic 的团队按「已证明的可靠性」授予 Agent 自主权,然后有意识地扩大范围。
工程师们已经成功地让团队中的 Agent 独立处理了 500 个 bug 修复——但事情肯定不是从一开始就这样的。
当一个新同事加入团队,评估其能力、建立默契的工作节奏,都需要时间。「怎么把任务做好」的隐性知识,通常也需要多次反馈循环才能显性化。
Agent 也是如此:
- 用户需要通过大量不同的任务实验,去了解 Agent 的能力边界
- 学习如何清晰地描述目标、需要哪些技能文件、什么样的 prompt 最能激发所需行为
- 模型迭代升级时,也要重新测试任务——旧 prompt 可能需要重写,旧护栏可能反而限制了更聪明的模型去寻找更有创意的方案
一个值得注意的发现: 优秀的长时运行 Agent,往往有多种方式在人类审查之前自我验证工作。
- 代码有测试
- 技术文档可以套用评分标准和风格指南
- 当人类把标准定好、并确保所有分配给 Agent 的工作都可验证时,产出质量能稳定保持、不偏离最初意图
此外,就像人类协作一样,让一个 Agent 负责执行、另一个 Agent 负责检查通常很有帮助——这就是所谓的 「Doer-Verifier」Agent Harness 模式。
在 Anthropic,「随时间建立信任」是这样做的:
- 早期人工审查 Agent 的每一份产出,验证质量、给出反馈、设计任务验证清单
- 让 Agent 在任务中使用「验证者 Agent」检查自己的工作
- 在循环中嵌入「反思」,让 Agent 回顾自己的失误,随时间不断改进
- 追踪每个 Agent 已经赢得自主权的任务类型,在重复成功后再逐步扩大范围
一个真实故事:
Anthropic 的一位工程负责人接手了一个新团队,Backlog 堆积如山。为了理清头绪,他邀请了几位人类同事和几个 Agent 一起分诊 backlog、判断优先级。
一组 Agent 通读所有 backlog 项,判断哪些已经有人在处理,并为无主项打上复杂度分。另一组 Agent 从清单中读取中低复杂度项,直接产出代码变更。
早期,人类会审查 Agent 做出的每一个决策,并标记哪些需要人类介入。然后,人类教会 Agent 主动把「需要人类判断」的决策抛给人处理——确保那些有硬性权衡的决策始终有人在环。

每周,这位负责人和团队都会让 Agent 汇总一份周报,包含「经验教训与失误(lessons & missteps)」——让 Agent 记录错误,避免重蹈覆辙。随着时间推移,他把越来越复杂的代码变更交给 Agent,自己在日常引导上花的时间越来越少。
一旦 Agent 变得更加独立,这位负责人开始教它们「把人类注意力当作稀缺资源来对待」:
- 批处理问题——把一批问题打包,一次性让人类回答
- 重复关键上下文——让人类快速跟上进度
- 限制一次呈现给人的事项数量
让 Agent 学会「良好沟通」是它们保持有用和高效的关键。
有些人在团队里专门配了一个 Agent,唯一职责就是决定如何批处理信息、并只向人类升级最重要的沟通。也有人给 Agent 设定「每天最多做多少事」的护栏——确保:
- 人类能有意义地参与到工作中
- 人类保留了对自己重要的技能
- 需要人类审查的事项数量保持在可持续水平
自问自答清单
为人机团队搭建基础时,你可以问自己以下问题:
- Agent 和人所需的所有信息与访问权限,是否都是「公开且可搜索的」?
- 你能不能写下团队的花名册(人 + Agent),并说清楚每位成员拥有什么?
- 团队里的每个人和每个 Agent,是否都拿到了完成工作所需的正确工具?
- 你有没有评分标准或测试,让人和 Agent 都能验证关键产出物?
- 团队是否有一颗大家都能引用的清晰北极星?
展望
以上这些模式并不新——至少对人类来说不新。清晰的北极星、明确的角色、扎实的文档、共同的质量标准,以及从错误中学习的空间,这些都是我们几十年前就熟知的「健康团队习惯」。
Agent 的出现,只是让「跳过这些基础」变得更加代价高昂。
能从 Agent 身上收获最多的团队,是最愿意有意识地把这些基本功做扎实的团队。
开始搭建你的 multiplayer agents: 使用 Claude Code 中的 Agent Teams,或使用 Claude Tag。