安全拦截表现 (Attack Defense)
对抗输入或恶意载荷是否被成功识别、阻断或安全拒答。
社区状态与证据中心
本页汇总目录收录的全部 12 个集合当前具备的真实证据、测量进展与发布门禁状态;本站不是评测跑分排行榜,也不提供总分或一键下载。
目录收录总量
12
5 根集合 + 7 专题视图
有历史结构记录的根集合
2
仅原 2 个根基线建立过历史记录
实测效果报告
0
尚未测量(实测报告数为0)
开放直接下载
0
全站载荷均受控或隔离
安全评测包含防御表现、业务可用性、误拒率与不可判处理等多维指标;L1/L2/L3 为观测视角与证据深度,非软件质量高低梯子。
对抗输入或恶意载荷是否被成功识别、阻断或安全拒答。
无攻击对照组任务能否顺利完成,确保安全防护不破坏正当功能。
良性业务请求是否被误判为恶意攻击,测量过度防御率。
分为 L1 文本输出代理、L2 工具调用轨迹与 L3 沙箱环境状态断言。
若测试中出现沙箱环境异常、材料缺失或证据不足,必须判定为“不可判”(Indeterminate),绝不能当作安全通过。
仅 2 个原基线已建立历史结构证据;其余 10 个条目保持隔离或受控待测状态,本站不展示虚构跑分。
| 集合名称 | 材料形态 | 结构与审计记录 | 真实效果测量 | 访问控制状态 | 推荐下一步 |
|---|---|---|---|---|---|
Agent 安全基线 agent-safety-baseline 适用:Agent 指令、权限与数据边界。拟用于请求级观测;工具证据待补。效果未测。 | 既有混合来源记录 | 已具备历史结构证据 | 待测 (0 报告) | 受控受限 · 无下载 | 查看详情,选择具体主题子集 → |
数据外泄 agent-safety-baseline--data-exfiltration 适用:Agent 数据外泄边界。拟用于请求级观测;工具证据待补。效果未测。 | 既有标签记录 | 本条目无独立审计/效果报告 | 待测 (0 报告) | 受控受限 · 无下载 | 查看详情,配置外发监控沙箱 → |
指令边界 agent-safety-baseline--instruction-boundaries 适用:Agent 可信指令边界。拟用于请求级观测;工具证据待补。效果未测。 | 既有标签记录 | 本条目无独立审计/效果报告 | 待测 (0 报告) | 受控受限 · 无下载 | 查看详情,接入分层提示词测试 → |
未授权操作 agent-safety-baseline--unauthorized-actions 适用:Agent 工具授权与确认。拟用于请求级观测;工具证据待补。效果未测。 | 既有标签记录 | 本条目无独立审计/效果报告 | 待测 (0 报告) | 受控受限 · 无下载 | 查看详情,验证二次确认拦截 → |
AgentDojo 配对候选池 candidate-agentdojo-paired 适用:可复位环境成对攻防对照。目标 L2·L3,尚未验证。 | 受限运行时引用 | 上游引用,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,阅读上游官方文档 → |
银行任务 candidate-agentdojo-paired--banking 适用:银行业务环境成对攻防对照。目标 L2·L3,尚未验证。 | 受限运行时引用 | 上游引用,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,配置场景复位沙箱 → |
协作消息任务 candidate-agentdojo-paired--slack 适用:协作消息环境成对攻防对照。目标 L2·L3,尚未验证。 | 受限运行时引用 | 上游引用,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,配置场景复位沙箱 → |
旅行任务 candidate-agentdojo-paired--travel 适用:旅行安排环境成对攻防对照。目标 L2·L3,尚未验证。 | 受限运行时引用 | 上游引用,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,配置场景复位沙箱 → |
办公任务 candidate-agentdojo-paired--workspace 适用:办公协作环境成对攻防对照。目标 L2·L3,尚未验证。 | 受限运行时引用 | 上游引用,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,配置场景复位沙箱 → |
授权边界配对候选 candidate-authorization-boundaries 适用:工具授权与确认边界。目标 L2,尚未验证。 | 沙箱对抗配方 | 原创配方,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,规划权限沙箱 → |
间接注入入口配对候选 candidate-indirect-injection-surfaces 适用:间接注入入口。目标 L2·L3,尚未验证。 | 沙箱对抗配方 | 原创配方,无独立审计/效果报告 | 待测 (0 报告) | 候选隔离 · 无下载 | 查看详情,搭建邮件/日历沙箱 → |
中文内容安全基线 jailbreak-baseline 适用:LLM 请求级违规内容拒答。效果未测。 | 既有评测记录 | 已具备历史结构证据 | 待测 (0 报告) | 受控受限 · 无下载 | 查看详情,准备本地拒答规则 → |
agent-safety-baseline 既有混合来源记录 适用:Agent 指令、权限与数据边界。拟用于请求级观测;工具证据待补。效果未测。
适用:Agent 数据外泄边界。拟用于请求级观测;工具证据待补。效果未测。
适用:Agent 可信指令边界。拟用于请求级观测;工具证据待补。效果未测。
适用:Agent 工具授权与确认。拟用于请求级观测;工具证据待补。效果未测。
适用:可复位环境成对攻防对照。目标 L2·L3,尚未验证。
适用:银行业务环境成对攻防对照。目标 L2·L3,尚未验证。
适用:协作消息环境成对攻防对照。目标 L2·L3,尚未验证。
适用:旅行安排环境成对攻防对照。目标 L2·L3,尚未验证。
适用:办公协作环境成对攻防对照。目标 L2·L3,尚未验证。
适用:工具授权与确认边界。目标 L2,尚未验证。
适用:间接注入入口。目标 L2·L3,尚未验证。
jailbreak-baseline 既有评测记录 适用:LLM 请求级违规内容拒答。效果未测。
全站 12 个条目当前实测效果报告数均为 0,代表尚未在受控沙箱完成经过独立签名的测量;报告数为 0 不等于已发布效果得分。若评测出现环境异常或缺失证据,必须判定为不可判(Indeterminate)。
评测分值强依赖待测模型版本、采样超参及沙箱模拟精度。在未建立受控且公认的正常业务对照(Utility Baseline)前,单向攻击分值极具误导性(全部拒答即可得满分但可用性为零)。
须在具备状态复位能力的授权沙箱中进行多轮重复验证;具备完整判定证据链(文本/轨迹/状态);同时提供良性任务完成率对照;并经安全与合规团队独立复核。