Skip to main content
AI Guardrails使企业管理员能够为整个组织中用户与 Devin 的交互定义安全边界。护栏会自动筛查传入的用户消息——包括初始消息、后续消息以及拉取请求 (pull request,PR) 评论——在 Devin 处理之前检测提示词注入、数据外泄企图和策略违规行为。

概览

护栏作为一层额外的监督机制,用于发送给 Devin 的消息。它们会实时分析用户消息,并且可以:
  • 记录 可疑消息以供审查 (log_only)
  • 警告 用户,在继续处理消息的同时显示可见横幅 (warn_user)
  • 阻止 违反组织策略的消息 (block_message)

配置护栏

拥有 管理企业设置 权限的管理员可在企业级 设置 > 护栏 中配置护栏。每项护栏设置均适用于企业中的所有组织——护栏无法按组织单独配置,组织设置中也没有单独的“护栏”页面。 该页面包含两个选项卡:
  • 护栏 — 按 数据控制与隐私可接受使用 等类别分组的预设护栏。选择护栏可查看其说明和示例消息。
  • 违规 — 展示一段时间内违规情况的图表,以及已记录违规的表格;可按护栏和企业内的组织进行过滤。每一行均链接到相应的来源会话,便于调查。
每项护栏都有一个下拉菜单,可同时启用护栏并设置发生违规时采取的操作:
发生违规时终止会话 (kill_session) 不是可配置的操作。该值仍可能出现在其可配置期间记录的历史违规中。

护栏事件

当护栏被触发时,Devin 会记录该事件及其详细信息,包括:
  • 触发护栏的用户消息
  • 匹配到的护栏规则
  • 所采取的操作 (log_only, warn_user, or block_message)
  • 事件发生所在会话的链接
护栏事件会以 ai_guardrail_violation 操作类型显示在审计日志中,从而支持自动化监控和告警。你还可以通过护栏违规 API以编程方式检索护栏事件。

使用场景

常见的防护栏配置包括:
  • 检测提示注入 (prompt injection) — 识别并拦截试图覆盖 Devin 指令或操控其行为的用户消息
  • 防止数据外泄 — 标记或拦截试图指示 Devin 将敏感数据发送到未授权目标的消息
  • 强制执行策略合规 — 审核用户请求,确保其符合组织的安全和使用政策
AI Guardrails 是一项企业版功能。请联系您的客户团队,了解如何为您的组织启用防护栏。