# Sierra产品负责人:多智能体是个陷阱
我承认,我是被标题党看了这期播客。多智能体是个陷阱是原题图标题。来自LangChain播客Max Agency 6月18日的一期节目。
Sierra大家可能不太熟悉,它的产品形态是一套完整的智能体操作系统Agent OS:企业在上面构建面向终端消费者的AI智能体,一个智能体代表一个品牌,处理从售前咨询、下单支付到售后服务的全生命周期交互,同时覆盖语音和文字渠道。
这家公司更出名的是创始人,由现OpenAI董事长、前Salesforce联席CEO Bret Taylor和前Google Labs负责人Clay Bavor于2023年创立,2026年5月完成9.5亿美元E轮融资,估值158亿美元,截至2026年2月ARR已超过1.5亿美元(第三方数据源估计截至5月已达2亿美元),服务超过40%的财富50强企业。
本期嘉宾Zack Reneau-Wedeen是Sierra的产品负责人,此前在Google担任Google Lens和Google Podcasts的创始产品经理,之后在Robinhood和CoinTracker做过产品负责人。
Sierra的语音智能体在处理英国北部口音时,会同时跑两个转录模型。一个转录质量最高但在安静时会产生幻觉,另一个能准确识别沉默。系统的判断逻辑只有一句话:如果模型B说对方沉默了,信它;如果没说沉默,信模型A。这个细节来自Sierra在60种语言上的实战经验,它揭示了一件事:当下最有效的智能体工程,靠的是在一个智能体内部调度多个专精模型各司其职,而不是把任务拆给多个智能体。模型可以多,智能体应该少。
---
## 一、平台架构:从模型星座到无代码Journeys
1、**三层栈:Agent OS、Agent SDK、Journeys**
Sierra的技术栈分三层。最底层是Agent OS,管理着Sierra所说的"模型星座",负责把平台上的任务翻译成提示词,分发给不同模型。一次普通的对话轮次会调用10到15个不同的模型:几个前沿模型做核心推理,一批分类器做路由和判断,再加上一批用于推测执行的模型来保证低延迟。
中间层是Agent SDK,基于代码的智能体编排和上下文管理层。Sierra最初就是从这一层起步的,但过去18个月,几乎所有智能体开发都转移到了顶层的无代码层Journeys。
Journeys的核心设计是声明式的:你描述希望智能体在什么条件下解锁什么行为,走什么方向。它介于标准操作规程和领域专用语言之间,比纯文本提示词更结构化,比传统流程图更灵活。它和Agent SDK之间的转换是确定性且同构的,也就是说无代码编译成代码后可以再编译回来,内容一致。这让运营团队和工程团队可以在同一个智能体上协作,各用各的工具。
2、**Ghostwriter:用智能体构建智能体**
Ghostwriter是Sierra在2026年3月推出的智能体构建工具,定位类似Codex或Claude Code,但专门用于构建客户体验智能体。关键在于,Ghostwriter输出的不是代码,而是直接写Journeys。用户可以用自然语言描述需求,比如"我要做航班预订"或"我要处理退货",Ghostwriter已经理解这些业务概念,能直接生成可审查的Journey。
这个设计选择有实际原因:如果让Ghostwriter同时擅长写代码和写Journeys,质量会有折中。而平台上绝大多数活动发生在Journeys层,所以把Ghostwriter的能力集中在这里,回报最大。
3、**从"显式编排"到"声明式约束":Agent SDK的演进**
Agent SDK已经被重写了两到三次。早期版本是流程导向的:你必须在智能体的结构里显式规定操作顺序,比如"先收集用户的邮箱地址,再告诉用户会发送确认邮件"。现在不需要这样了。你只需在Journey中声明"调用发送确认邮件这个工具的前置条件是拥有用户邮箱",智能体自己知道该怎么向用户索要邮箱。
这个转变是模型推理能力提升和平台编排能力增强共同推动的。模型在每一步都有更大的推理空间,平台则通过模型选择、评估和提示词工程来确保可靠性。
4、**80%的时间应该迁就模型,而不是反过来**
在设计智能体开发的抽象层时,Sierra面对一个持续的张力:用对模型最友好的抽象,还是用对业务最准确的抽象?Zack的经验是80/20原则。
80%的情况下,应该把问题重新表达成模型已经擅长的形式。编程智能体对文件系统、Git、grep这些结构特别在行,那就把数据和流程物化到这些结构里,让编程智能体直接上手。
剩下20%的情况,业务逻辑确实没有办法硬塞进模型已有的认知框架,这时候才值得投入资源去教模型理解你的抽象方式。但这里有个陷阱:如果抽象做到一半,既不是模型完全熟悉的,也不是完全陌生的,模型反而会过度自信或困惑。要么全部迁就模型,要么完全走自己的路,中间状态最危险。
## 二、语音引擎:并行化思考、倾听和说话
Sierra的大部分对话流量来自语音渠道。Zack说语音是他职业生涯中最有意思的项目,也是Sierra最早和客户SiriusXM(美国最大的卫星广播和流媒体音频订阅服务)合作时就确认的方向。
1、**模块化架构的早期押注**
Sierra在语音领域做了一个早期决策:采用模块化架构,对任何语言、任何客户、任何场景,都能在转录、合成和端到端语音模型之间灵活切换供应商组合。Zack说没有哪家供应商在所有方面都是最好的,尤其当你要支持近60种语言、服务全球品牌时。
这个决策的回报在多个维度显现。从语言适配看,不同语言的最佳转录供应商不同。从容量规划看,Sierra需要为黑色星期五和网络星期一这样的流量尖峰做准备。Zack提到他们做过负载测试,按年化换算相当于数十亿次对话的并发量。多供应商支持让他们在某个供应商宕机时有兜底能力。多供应商策略的首要驱动力是容量,其次才是成本。
2、**转录模型的Ensembling实战**
转录层的ensembling,即同时运行多个转录模型并融合结果,是模块化架构的典型产出。以英国北部口音为例:有一个模型转录质量最高,但在静音时会产生幻觉文本;另一个模型在静音检测上更可靠。Sierra同时运行两个模型,用一套逻辑决定何时取哪个的结果。
类似的原理也用在多语言场景。比如匈牙利语,单个最佳转录供应商的词错误率可能高达20%,通过多供应商ensembling可以把错误率拉下来,做到比任何单一模型都好。
Sierra在2026年5月18日发布了转录平台的技术博客,同年4月20日发布了μ-Bench,一个基于真实客服电话的多语言转录基准测试。
3、**语音智能体的核心突破:并行化三件事**
Zack说语音智能体领域长期存在一个失衡:用大约50行Python代码,主要是Silero这个开源语音活动检测库,来决定何时说话;然后用万亿参数的大模型来决定说什么。这个比例不对。人类在对话中花在"决定何时开口"上的脑力和"决定说什么"大致是五五开。
Sierra语音智能体的关键突破,是把思考、倾听和说话三个过程并行化。当智能体在倾听时,已经在思考可能的回应;当它在说话时,同时在监听打断信号。这不只是工程优化,而是产品设计层面的根本转变。
此外,进度指示也是语音智能体容易被忽略的细节。比如说"请稍等,我帮您查一下账户",这类话术在文字聊天中是可选的,但在语音场景中如果1到2秒内没有响应,用户就会困惑。
4、**端到端语音模型:尚在早期,但方向明确**
端到端语音模型,即直接从音频输入到音频输出、不经过中间文本转换的模型,Sierra已经有在生产环境运行的案例。但Zack给出了几个限制条件:这些模型目前只在英语上达到了可信赖的可靠性;成本比传统管线贵了接近一个数量级;在工具调用和指令遵循方面不如文字模型可靠。因此,端到端模型目前只用在业务流程相对简单、自然度要求特别高的场景。
被问到何时超过50%的流量会由端到端语音模型承载时,Zack的回答是:24个月是他的个人猜测分界线,他倾向于赌"超过24个月"。多语言支持是最大的瓶颈,只要还需要覆盖60种语言,模块化架构在可预见的未来都不可少。
## 三、Agentic Commerce:支付基础设施和商业前景
1、**智能体商务将大于电子商务**
Zack提出了一个判断:agentic commerce的规模最终会超过e-commerce。他的逻辑是,用户的操作习惯正在从"去网站上点击"变成"让Codex或Claude替我做事"。管理订阅、订购日用品、预订餐厅,这些行为迁移到智能体上只是时间问题。仅美国的电子商务规模已达数千亿美元,占GDP的几个百分点。
Sierra为这个未来做了具体的基础设施投入。2026年4月,Sierra成为首个通过PCI DSS Level 1认证的对话式AI平台。PCI DSS是支付卡行业数据安全标准,Level 1是其中最严格的等级,Sierra的认证经Visa全球服务提供商注册处验证。这意味着用户在和语音智能体通话时可以直接完成支付,不需要转接到另一个系统。
2、**隔离式支付基础设施**
PCI认证的技术核心是:支付信息走独立的、经过PCI认证的基础设施,不进入Sierra的核心平台,也不发送给外部大语言模型。原因很简单:目前没有任何LLM提供商通过了PCI认证。在安全支付模式下,提示词遵循预设的、服务器验证的序列,不是由LLM生成的。
落地这套方案意味着要启动一个独立的计算集群,通过独立的安全评估师审核,确保所有运营流程符合标准。Zack坦言Sierra"在支付领域的投入比当时看起来合理的时间更早",但这是为了抢占agentic commerce的先机。
3、**智能体作为ChatGPT应用**
Sierra智能体已经可以作为MCP服务器暴露给ChatGPT。Redfin,美国最大的在线房产搜索平台之一,是一个具体例子:访问redfin.com的AI搜索功能,底层是Sierra智能体在返回房源列表并与用户对话,这个智能体同样可以在ChatGPT中通过@引用调用。
Zack认为品牌的智能体交互大多数最终会从用户的个人智能体(如Claude、ChatGPT)发起,因为用户的使用时间已经大量集中在这些平台上。品牌需要在"对面"做好准备,确保自己的产品展示正确、结账流程顺畅,无论面对的是人类还是另一个智能体。
一个相关的新兴模式:开发者工具公司Sentry在保留传统API的同时,额外提供了一个可以直接向智能体提问的端点。越来越多的公司开始把智能体而非API本身作为外部交互的接口。Zack坦言他也不确定哪种模式会胜出,但这个趋势本身值得关注。
4、**但我们仍处于非常早期**
被问到这个领域有多早,Zack直截了当:"我个人还没有用Codex订过纸巾。"他也没有用过Alexa做类似的事。他觉得最可能先落地的场景是管理订阅:让Codex或Claude Co-worker访问浏览器,自动取消不再使用的流媒体订阅。现有的订阅管理应用要求用户手动输入所有信息、逐个决定取消哪个,流程太重。如果给智能体浏览器权限,让它自己去查哪些流媒体账号已经不登录了,直接取消并通知你,这个产品他作为消费者有真实需求。
## 四、上下文工程、模型管理和RL
1、**上下文工程的核心原则:该给的都给,多余的不给**
Sierra对上下文工程的理解可以浓缩为一句话:给智能体看它做正确决策所需的一切,但不多给一个字节。随着模型变聪明,"一切"的精确度要求在降低,"不多给"的严格程度也在放松。
Zack用吃饭做了个类比:早期需要"喂饭",把上下文逐条喂给模型;现在是"摆盘",把正确的信息组合放在模型面前;未来可能连摆盘都不用那么精细了。
具体到技术细节,有一个叫"渐进式揭示"的概念:不要在信息变得相关之前就塞进提示词,但一旦塞进去了,又不能随便抽走,因为抽走会造成不一致。做提示词压缩时,如果压缩是有损的,历史记录中残留的内容和系统提示词不一致,智能体的行为就会出问题。
"任何时候你觉得模型太笨了,其实大概率是你的问题。"这是Zack在Sierra学到的核心教训。绝大多数幻觉的根因是提示词的一部分说了A,另一部分说了B。
2、**多模型管理:好的评估让模型切换变简单**
Sierra的客户对使用哪些云、哪些模型有各种限定要求。服务财富20强就意味着必须支持多模型。Zack说,如果评估写得好、架构设计得好,在相同智能水平的模型之间切换并不难。本质上是延迟、质量、成本三个变量的权衡。
切换时改什么?主要是提示词,让它适应每个模型的特点。工具一般尽量不改,因为改工具的下游影响难以控制。有些任务只能跑在特定模型上,有些可以多模型候选。
3、**Prompt caching:质量优先,不做狂热信徒**
Sierra对prompt caching的态度是:不会为了没有理由的场景去打破缓存,但当质量需要时毫不犹豫。Zack说他们"绝对不是prompt caching的狂热分子"。原因是,当智能体交付的outcome足够有价值时,你有资格不把成本作为首要考量。一次对话可能卖出一个100美元的产品或者一个终身价值1000美元的会员,这个价值量级让质量几乎总是第一位的。
4、**RL的两个承诺和三个限制**
Sierra对RL做了大量探索。RL的两个承诺是:提升模型质量上限,以及让较弱的模型做到接近前沿模型的表现。Zack的实际观察是,企业级RL更多实现的是第二个承诺,即用开源模型逼近前沿模型的性能。
三个限制因素:第一,RL训练的结果是非确定性的,如果训练数据中包含你不希望模型复述的内容,就存在"回吐风险",Sierra对此零容忍。第二,前沿模型进步太快,你在某个任务上做的RL优化,3到6个月后可能就是前沿模型的误差范围。第三,准备训练数据本身就是一项大工程。
Sierra在知识检索领域做了自研模型,因为他们确实在这个方向推动了技术前沿。但在不推动前沿的方向上,他们尽量保持灵活,不被RL锁死。
另外,Sierra大量投入多供应商支持的首要驱动力其实不是成本,而是容量。零售客户的黑色星期五流量尖峰需要巨大的模型调用容量,任何单一供应商都可能出现容量不足或宕机。
## 五、Agent Data Platform、多智能体的陷阱与记忆
1、**Agent Data Platform:结构化数据 + LLM即时共情**
大语言模型天生擅长"此刻的共情"。Zack用酒店服务做类比:你走进一家服务好的酒店,前台一眼就看出你是刚下长途飞机,或者你迟到了十分钟因为堵车。LLM在Sierra这样的平台上也有这个能力。
但LLM不知道你作为客户的长期偏好。上一代AI系统,比如推荐引擎,恰恰擅长这件事。Agent Data Platform的设计就是把两者结合起来:把客户数据平台、内部系统中的结构化数据(知道该推荐什么)和LLM的当下语境理解(知道该怎么推荐)接在一起。
一个销售场景的例子:结构化数据知道当前应该给这个客户推哪个offer,但如果只靠结构化数据直接输出推荐,用户体验会生硬——"我不知道你为什么要给我看这个"。LLM的作用是理解如何呈现offer,在对话上下文中权衡两个候选offer选出更合适的那个,把推荐变成自然对话的一部分。
2、**多智能体系统多数时候弊大于利**
Zack自称"单体忠诚者"。他列举了几种常见的多智能体误区:
如果拆分智能体是因为让一个团队管一个,那你不过是在用技术架构复刻你的组织架构。如果拆分是因为分开想问题更舒服,那你在优化你的舒适度,不是在优化效果。
更具体的技术危害:如果一个智能体做分诊,另一个做任务,拆成两个系统会让任务智能体拿不到分诊阶段的信息,同时分诊智能体也看不到任务的流程细节。这种信息隔离通常是"价值毁灭性的"。
Zack的判断标准是:如果你在做好上下文工程,多数情况下不需要多智能体,因为你不会把错误的上下文暴露给错误的智能体。真正适合多智能体的场景是两个任务之间确实完全可分离,第一个任务的上下文对第二个任务没有任何用途。截至2026年5月18日(播客录制时间),他认为这种情况非常少见。
3、**记忆:重要但技术上不难**
Sierra从Agent Data Platform上线起就把记忆作为平台的一等原语。每次对话中都可以识别客户身份、隐式或显式地保存记忆,未来的对话可以提取这些记忆。
记忆存储有三种方式:在Journey构建时指定"我关心哪些信息"(比如"记住客户的生日");在对话中的某个轮次手动标记"保存到记忆";让智能体自行判断什么值得记住。
Sierra在实践中已经看到记忆对核心指标的提升:用客户的名字打招呼、记住上次通话的内容、知道昨天客户在电话上等了一个小时体验很差,这些细节直接拉高了解决率和转化率。
但Zack提出了一个反直觉的观点:记忆在技术上并不难。原因是,一个客户的记忆量级比知识库小三个数量级。知识库的检索和排序是真正复杂的问题,而个人记忆的检索问题相对简单。用知识图谱、向量库还是文件系统来存,在目前的系统中区别不大。
不过记忆有一个容易被低估的门槛:身份认证。如果有人打电话进来,你不一定能从电话号码100%确认是本人。一个办公网络可能共享同一个电话号码,一个家庭可能共用一条线路。每个品牌都需要定义自己的策略:哪些记忆可以在身份确认前使用,哪些属于敏感信息必须验证后才能提取。"嘿Harrison,感谢再次来电"大概没问题,但"你是来查你的社保号码吗"就完全是另一个安全等级了。
4、**为什么没有独立的记忆公司成功?**
Zack认为核心原因正是身份认证:卖记忆就意味着要同时卖身份认证。Claude和ChatGPT这类产品已经获得了用户信任,所以它们可以做记忆。一个独立的B2B记忆公司不仅要卖记忆产品,还要让客户信任你做身份验证,这比表面看起来要重得多。
## 六、评估体系、持续改进和outcome-based pricing
1、**Simulations:高维空间里的智能体测试**
Sierra为客户评估智能体构建了Simulations产品。它支持设定不同的persona(模拟不同性格和需求的用户)、加入背景噪音(语音场景)、模拟对抗性用户,然后在所有组合上运行测试。Zack说判断一个人是否在认真构建智能体,看他有没有好的simulations就够了。
内部的Agent OS评估和客户的评估问题并不相同。内部评估更像一般应用AI公司的任务评估;客户的评估牵涉对话的多维复杂性,一段对话可能走向的方向太多了。
2、**Monitors和"用更多AI解决AI的问题"**
Sierra内部有句话:"所有AI问题的解决方案都是更多的AI。"你有一个90%准确的东西,用另一个AI去验证90%的情况,再用另一个AI验证那个……叠三到四层之后就能达到三到四个九的可靠性。
Monitors是平台上的常驻评估器,在每次对话上运行,标记需要人工审查或需要创建工单的问题。好处是客户运营团队不需要每天早上试图读完一万次对话,只需要审查五次标记出来的对话。
3、**持续改进的置信度分级:FYI vs Approval**
目前Sierra的持续改进流程是:Monitor自动检测问题,Ghostwriter自动建议修复方案,人类审查后推送到智能体。人始终在环中。
Zack说近期会出现第一批智能体自我改进的案例。关键设计是按置信度分级:如果知识库里的一篇文章和网站上的信息矛盾,智能体可以自行核实网站内容,确认正确答案后直接修复,只给人类发一个FYI通知。这和人类的工作方式一样:有些事需要请示审批,有些事做完知会一声就行。
所有的技术原语已经到位,瓶颈在于客户对自动化的信任程度。Sierra不想把未来拉得太快,而是跟着客户的节奏走。
4、**τ-Bench系列:让行业有共同的衡量标准**
Sierra Research发布了一系列开源基准测试,形成了一个"τ宇宙":τ-Bench评估工具调用和流程遵循,τ²-Bench评估智能体和用户共同控制环境下的协作能力,τ³-Bench在2026年3月扩展到知识检索和语音,τ-Voice在2026年5月专门评估实时语音智能体在真实音频条件下的任务完成率,μ-Bench在2026年4月推出,针对多语言转录质量。
这些基准测试主要用于评估供应商而不是评估智能体本身。比如有一个新的转录模型来Sierra办公室做演示,Sierra会说"看起来不错,但请先跑一下μ-Bench"。正是通过μ-Bench,他们发现了那个"北英国口音下模型A转录好但静音幻觉多、模型B静音检测准"的规律。
5、**Outcome-based pricing:Sierra的首要竞争力**
Zack把outcome-based pricing称为Sierra成功的"可能是第一的运营原因或商业原因"。当你的智能体完成一个100美元的销售,你拿走一部分,所有人都在朝同一个方向划桨。这切穿了企业合作中常见的优先级争论和资源分配困局。
并非所有outcome价值相同。排查复杂设备故障可能需要20轮对话,单次outcome对应的价值高;查询银行余额很快就完成了,outcome比较commoditized。同一个客户内部的不同任务也可能有不同的outcome价值。但Sierra在执行中不追求精确到每个场景的完美定价,而是追求激励对齐的大方向。"如果你不理解outcome-based pricing的价值,你的outcome大概也没那么值钱。"
## 七、人才和组织:F1赛车需要更多进站
1、**产品判断成了瓶颈,而不是工程产能**
Zack用了一个F1赛车的类比:一级方程式赛车比现代轿车跑得快得多,但需要更频繁地换轮胎。编程智能体让代码的编写和审查都快了很多,但产品判断和客户直觉这类能力反而需要更高频地介入。
"更快的车需要更多的进站"意味着:一个人能独立带着产品判断和技术能力闭环的人,进入了一个极好的正反馈循环。而需要一个人提供判断、另一个人写代码的分工模式,则需要更紧密的协作,更多的每日站会、更频繁的对齐。
2、**Forward-deployed agent builder画像**
Zack的个人评估框架包含六个维度:客户直觉、agency即面对模糊地带时的主动性和掌控感、产品判断力、技术深度、沟通能力、强度。再加上一个稍显模糊但同样关键的:领导力,在活动量大增时把方向拉对的能力。
最成功的人通常同时做过产品经理和工程师。Sierra的工程负责人Arya之前做过产品经理,许多工程师也有产品经理背景。这种跨学科能力比以往任何时候都重要。GPT-5.5不具备深度的客户直觉,这是人类在AI时代最不可替代的能力之一。
3、**AI-native面试:在几小时内端到端构建一个产品**
Sierra改变了面试流程,引入了AI-native面试。候选人在几个小时内端到端构建一个产品,然后和团队一起评审。在这个过程中可以观察到:这个人认为什么是"不在我的职责范围内",他会不会主动把看似超出范围的机会拉进来。
这和agency直接相关。编程智能体扩大了个人的控制范围,如果你能意识到"我现在能做更多事了"并据此行动,这种品质在AI-native面试中会自然显现。
发布于 日本
