产品体系
一套闭环,三个关键时刻
每一个Agent都在同一条生命周期上运行:上线前完成验收,运行中持续守护,发生变化时重新验证。
| 阶段 | Sentinel能力 | 核心问题 | 主要输出 |
|---|---|---|---|
| 上线前 | Sentinel Verify | 这个Agent整体上安全到可以上线吗? | 独立红队测试、安全评级、风险边界、整改建议 |
| 运行中 | Sentinel Guard | 这一次具体行动安全吗? | 允许 / 拒绝 / 人工确认 / 风险告警与审计证据 |
| 发生变化 | Sentinel Live | 模型或环境变化后,现在还安全吗? | 影响评估、自动复测、安全证据与等级更新 |
01. 上线前
Sentinel Verify:第三方独立安全验收
Verify的核心角色类似企业采购关键软件、芯片或安全设备时的第三方验收:站在业务企业一侧、独立于Agent供应商,回答"这个系统是否达到可以被赋予真实权限的安全水平"。
评测逻辑
- 明确评测边界:固定模型版本、系统提示词、工具接口、权限、知识库与关键业务流程。
- 定义威胁模型:攻击者能力、可访问的信息、预算、查询次数、攻击模型能力与可复用性。
- 自动化与人工结合执行对抗测试,覆盖恶意输入、Prompt Injection、目标劫持、工具误用、越权、敏感数据泄露等场景。
- 不只报告"攻击成功/失败",而是量化在给定威胁模型下攻破系统所需的成本、能力与证据。
你将获得
- 安全评级:可量化、可比较,作为上线决策的依据。
- 清晰的风险边界:权限使用、敏感操作、工具调用与数据访问边界。
- 可执行的整改建议:具体修复方案,并将复测纳入同一闭环。
- 可复用的威胁模型:作为Guard配置的基础。
02. 运行中
Sentinel Guard:上线后的实时安全裁决
Verify的安全结论本质上仍然是针对既定威胁模型和测试分布的统计性证据,不可能保证未来每一次行为都绝对安全。当Agent正式进入生产环境后,Sentinel Guard将持续观察高风险动作并在执行前做安全裁决。
输入侧
检测恶意输入、间接Prompt Injection、内容篡改和异常上下文。
决策侧
判断当前行为是否符合任务目标、历史轨迹和已验收的安全边界。
权限侧
判断工具调用、数据访问和外部动作是否越权或超出业务规则。
执行侧
低风险允许执行;高风险拦截、降权或要求人工确认,并向负责人汇报。
软件时代,杀毒软件守护文件、进程和网络;Agent时代,Sentinel守护AI被赋予的数据权、工具权和决策执行权。
03. 发生变化
Sentinel Live:为什么安全必须持续更新
Agent是高度动态的软件系统。模型升级、Prompt修改、RAG数据变化、MCP/工具新增、权限调整甚至攻击模型能力提升,都可能改变原有安全结论。Sentinel将安全证据与具体配置绑定。
变化检测
持续追踪模型、Prompt、RAG、工具、权限与攻击能力的变化。
影响评估
在问题进入生产环境之前,评估每一次变化对既有评级边界的影响。
自动复测
自动生成测试用例执行复测;Guard的真实拦截数据反哺下一轮Verify。
更多Verify
→
更多攻击轨迹
→
更强的Guard
→
更多生产环境证据
→
更准确的Verify
→
更低的评测成本