社区状态与证据中心

集合质量、证据与测量就绪度报告

本页汇总目录收录的全部 12 个集合当前具备的真实证据、测量进展与发布门禁状态;本站不是评测跑分排行榜,也不提供总分或一键下载。

目录收录总量

12

5 根集合 + 7 专题视图

有历史结构记录的根集合

2

仅原 2 个根基线建立过历史记录

实测效果报告

0

尚未测量(实测报告数为0)

开放直接下载

0

全站载荷均受控或隔离

如何读懂安全报告维度

安全评测包含防御表现、业务可用性、误拒率与不可判处理等多维指标;L1/L2/L3 为观测视角与证据深度,非软件质量高低梯子。

1

安全拦截表现 (Attack Defense)

对抗输入或恶意载荷是否被成功识别、阻断或安全拒答。

2

正常业务效用 (Normal Utility)

无攻击对照组任务能否顺利完成,确保安全防护不破坏正当功能。

3

误拒与边界控制 (Over-refusal Control)

良性业务请求是否被误判为恶意攻击,测量过度防御率。

4

判定证据来源 (Evidence Source)

分为 L1 文本输出代理、L2 工具调用轨迹与 L3 沙箱环境状态断言。

5

异常与不可判维度 (Indeterminate / Unjudgeable)

若测试中出现沙箱环境异常、材料缺失或证据不足,必须判定为“不可判”(Indeterminate),绝不能当作安全通过。

仅 2 个原基线已建立历史结构证据;其余 10 个条目保持隔离或受控待测状态,本站不展示虚构跑分。

集合名称 材料形态 结构与审计记录 真实效果测量 访问控制状态 推荐下一步
Agent 安全基线 agent-safety-baseline

适用:Agent 指令、权限与数据边界。拟用于请求级观测;工具证据待补。效果未测。

既有混合来源记录 已具备历史结构证据 待测 (0 报告) 受控受限 · 无下载 查看详情,选择具体主题子集 →
数据外泄 agent-safety-baseline--data-exfiltration

适用:Agent 数据外泄边界。拟用于请求级观测;工具证据待补。效果未测。

既有标签记录 本条目无独立审计/效果报告 待测 (0 报告) 受控受限 · 无下载 查看详情,配置外发监控沙箱 →
指令边界 agent-safety-baseline--instruction-boundaries

适用:Agent 可信指令边界。拟用于请求级观测;工具证据待补。效果未测。

既有标签记录 本条目无独立审计/效果报告 待测 (0 报告) 受控受限 · 无下载 查看详情,接入分层提示词测试 →
未授权操作 agent-safety-baseline--unauthorized-actions

适用:Agent 工具授权与确认。拟用于请求级观测;工具证据待补。效果未测。

既有标签记录 本条目无独立审计/效果报告 待测 (0 报告) 受控受限 · 无下载 查看详情,验证二次确认拦截 →
AgentDojo 配对候选池 candidate-agentdojo-paired

适用:可复位环境成对攻防对照。目标 L2·L3,尚未验证。

受限运行时引用 上游引用,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,阅读上游官方文档 →
银行任务 candidate-agentdojo-paired--banking

适用:银行业务环境成对攻防对照。目标 L2·L3,尚未验证。

受限运行时引用 上游引用,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,配置场景复位沙箱 →
协作消息任务 candidate-agentdojo-paired--slack

适用:协作消息环境成对攻防对照。目标 L2·L3,尚未验证。

受限运行时引用 上游引用,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,配置场景复位沙箱 →
旅行任务 candidate-agentdojo-paired--travel

适用:旅行安排环境成对攻防对照。目标 L2·L3,尚未验证。

受限运行时引用 上游引用,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,配置场景复位沙箱 →
办公任务 candidate-agentdojo-paired--workspace

适用:办公协作环境成对攻防对照。目标 L2·L3,尚未验证。

受限运行时引用 上游引用,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,配置场景复位沙箱 →
授权边界配对候选 candidate-authorization-boundaries

适用:工具授权与确认边界。目标 L2,尚未验证。

沙箱对抗配方 原创配方,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,规划权限沙箱 →
间接注入入口配对候选 candidate-indirect-injection-surfaces

适用:间接注入入口。目标 L2·L3,尚未验证。

沙箱对抗配方 原创配方,无独立审计/效果报告 待测 (0 报告) 候选隔离 · 无下载 查看详情,搭建邮件/日历沙箱 →
中文内容安全基线 jailbreak-baseline

适用:LLM 请求级违规内容拒答。效果未测。

既有评测记录 已具备历史结构证据 待测 (0 报告) 受控受限 · 无下载 查看详情,准备本地拒答规则 →

全站 12 个条目当前实测效果报告数均为 0,代表尚未在受控沙箱完成经过独立签名的测量;报告数为 0 不等于已发布效果得分。若评测出现环境异常或缺失证据,必须判定为不可判(Indeterminate)。

为什么当前没有公布攻击成功率或防御分值?

评测分值强依赖待测模型版本、采样超参及沙箱模拟精度。在未建立受控且公认的正常业务对照(Utility Baseline)前,单向攻击分值极具误导性(全部拒答即可得满分但可用性为零)。

未来公布真实效果报告需满足哪些条件?

须在具备状态复位能力的授权沙箱中进行多轮重复验证;具备完整判定证据链(文本/轨迹/状态);同时提供良性任务完成率对照;并经安全与合规团队独立复核。