Guardrails 2.0 icon

Guardrails 2.0

Guardrails 2.0 是 ElevenLabs 为 ElevenAgents 提供的控制层,帮助 AI 语音代理保持话题聚焦、符合政策,并更安全地部署到生产环境,适用于支持、销售、营销、前台和内部流程团队。

Guardrails 2.0

概述

Guardrails 2.0 是 ElevenLabs 为 ElevenAgents 提供的控制层,旨在让语音代理与团队的指令、安全规则和运营目标保持一致。它在代理行为周围增加多层检查,帮助团队减少偏离、捕捉操控尝试,并在违规回复到达用户之前进行拦截。

该产品面向支持、销售、营销和内部流程中的生产级语音代理部署。其控制项可以在代理设置中配置,也可以通过 API 配置;页面将其定位为企业部署中更广泛的信任与安全栈的一部分,包括 conversation analytics、可选的 zero-retention 模式,以及面向符合条件客户的通话后脱敏。

核心能力

系统提示加固

加固的系统提示提供基础政策,而 Focus Guardrail 会在整个对话中强化这些指令,以减少长时间或复杂交互中的偏离。

用户输入验证

会检查用户输入是否存在提示注入和覆盖指令的尝试,并可选择终止构成安全风险的对话。

代理回复验证

每条回复都会在到达用户之前接受已配置政策的评估,从而实时拦截不安全或偏题输出。

自定义 guardrails

Custom Guardrails 允许团队用自然语言编写特定领域规则,并通过 block-or-allow 决策在每次通话中自动执行。

可配置的执行行为

执行模式、退出策略、内容敏感度以及按 guardrail 的开关,让团队能够控制执行有多严格,以及触发后会发生什么。

日志记录与通话后脱敏

触发器和动作会记录在 conversation analytics 中,敏感信息还可在通话结束后从转录、录音和 webhook payload 中脱敏。

适用场景

  • 让代理保持话题聚焦

    当语音代理需要在冗长或复杂的通话中保持按脚本执行时使用 Guardrails 2.0,例如支持或入门引导对话,这类场景中的偏离可能导致错误答案。

  • 降低提示注入风险

    在面向客户的工作流中应用操控和回复检查,因为用户可能尝试覆盖指令,或诱导模型进入不安全行为。

  • 执行领域政策

    使用自定义 guardrails 来执行公司特定政策,例如升级规则、禁用话题或受监管的语言要求。

  • 微调实时通话行为

    为实时语音交互配置退出策略和敏感度级别,当团队希望对低风险和高风险问题采用不同处理方式时尤其有用。

  • 支持审查与脱敏流程

    将日志记录和脱敏与通话后的 QA 流程结合,在保留转录和录音以供审查的同时,从存储产物中移除敏感细节。

Pros and Cons

Pros

  • 使用多层检查,而不是只依赖系统提示。
  • 覆盖三个常见风险点:行为偏离、提示注入和不安全回复。
  • 支持用自然语言编写自定义、特定领域的规则。
  • 允许团队选择执行行为、退出策略和敏感度级别。
  • 通过 conversation analytics 和触发日志提供可见性。

Cons

  • 某些控制项,包括对话历史脱敏和 Zero Retention Mode,被说明为仅限企业版。
  • 页面没有列出每种 guardrail 类型支持的全部集成,也没有展示各类型的详细限制。
  • 由于 guardrails 可以在不同的执行模式下运行,更严格的设置可能会比允许回复立即流式输出带来更高延迟。

FAQ

如何启用 Guardrails 2.0?

Guardrails 2.0 配置在 ElevenAgents 中。页面说明,你可以在代理设置的 Security 选项卡中开启它们,或通过 API 进行配置。

Guardrails 2.0 实际上做什么?

页面将其描述为三个层级:系统提示加固、用户输入验证和代理响应验证。这些机制协同工作,用于强化指令、检测操控尝试,并在回复发送前拦截违反政策的内容。

我可以定义自己的 guardrail 规则吗?

页面说明,自定义 guardrails 允许你用自然语言定义特定领域的政策,并在每次通话中自动执行。一个轻量级模型会评估每个回复,并返回 block 或 allow 决策。

Guardrails 如何处理政策违规?

可以。页面说明,执行模式让你可以选择让 guardrails 与回复并行运行以实现接近零延迟,或者在回复完全通过检查前先暂存。它还提到,你可以定义退出策略,例如结束对话、转接到另一个代理、升级给人工,或使用纠正性指令重新尝试。

脱敏和零保留功能对所有人都可用吗?

对话历史脱敏和 Zero Retention Mode 被描述为企业客户可用。页面引导客户联系销售获取访问权限。

Quick Facts

类别
AI 语音代理 / 安全
平台
ElevenAgents
主要用户
为支持、销售、营销和内部流程部署语音代理的团队
来源域名
elevenlabs.io
可用性
在 ElevenAgents 中以 alpha 版提供;可在代理设置中或通过 API 配置
定价
页面未列出单独价格;ElevenLabs 提供付费方案和企业联系销售选项