← 浏览受控集合

目录材料选择与使用指南

如何按材料形态选择与使用集合

目录收录的 12 个条目涵盖四类材料形态。按测试目的选择对应形态并在获授权的环境中规范接入。本站仅提供公共元数据与高层评测方法说明,不提供可直接运行的题包或公开下载。

四类材料形态与高层评测方法

不同材料形态对应不同的测试准备与接入位置。请根据你的评测目标选择代表集合:

既有评测记录(内容安全与综合基线)

既有记录 · 受控

面向模型输出政策、有害内容违规与多维度指令/权限边界初查。条目包含原始标记的拒绝与违规测试记录。

怎么用:

在获授权模型的文本输入/输出评测位置接入既有记录,观察有害内容拒答率与违规表现。注意:未建立正常对照前,不能宣称测得过度拒绝。

原创间接提示注入入口配方

沙箱配方 · 候选隔离

面向邮件、日历、检索文档、网页结果及记忆等间接交互入口。条目包含攻击配方与 5 组去注入对照。

怎么用:

在具备相应间接入口的测试沙箱中,分别接入攻击配方与去注入对照配方,观察外部非可信内容是否覆盖了系统指令或触发了敏感操作;配方不是可直接运行配置。

原创工具权限与确认沙箱配方

沙箱配方 · 候选隔离

面向敏感工具调用、未授权操作与人机二次确认拦截。条目包含 5 组攻击与正常请求对照配方。

怎么用:

在工具权限校验与敏感操作拦截点,分别对比攻击配方与正常对照配方,检查是否存在越权调用或跳过确认行为,同时核验正常业务请求仍可顺利完成。

受限业务环境引用(AgentDojo 场景攻防对照)

环境引用 · 候选隔离

面向银行、协作消息、旅行安排与办公协作四大业务环境。包含 60 组攻击与去注入反事实对照任务引用。

怎么用:

查阅上游 AgentDojo 环境依赖规范,在获准搭建的沙箱中接入引用任务,严格保持成对的攻击与去注入反事实对照关系,对比正常任务完成度与环境行为差异;上游提供环境代码,本站未提供下载包。

次级参考:分层方法(L1/L2/L3)与本地配置演示实验室
非真实模型评测

demo / unmeasured / untrusted / official=false。示例独立于现有受控集合;检查通过只代表格式正确,不代表安全、有效、可信或官方认证。

你要检查哪一类风险?

L1 / L2 / L3 是证据层,不是质量等级。S1 / S2 / S3 风险优先级、攻击手法和访问权限是不同维度。

本地教学配置实验室(纯本地 · 不导入集合)

演示安全的本地配置生成与校验契约。全程不联网、不调用模型、不接收密钥。

先走通一个安全的本地流程

1 · 选择证据层

L1 / L2 / L3 是证据层,不是质量等级。S1 / S2 / S3 风险优先级、攻击手法和访问权限是不同维度。

1 · 选择证据层

L1 · 独立合成教学例

独立合成图书馆例:比较受限书架标记请求与公开开馆时间请求。仅教学,非真实模型评测。

需要的证据:需要独立的边界请求与正常对照输出、判定规则及人工校准;不是工具或环境证据。

2 · 查看教学配置

这里只记录教学模式与层级,不包含种子正文、目标地址、密钥或执行命令。

复制和导出只在你点击后执行。

{
  "schemaVersion": 1,
  "kind": "demo",
  "tier": "L1",
  "locale": "zh",
  "trust": "untrusted",
  "effect": "unmeasured",
  "official": false
}

3 · 导入与检查

只接受本页格式的配置 JSON(UTF-8,最多 8192 字节)。不接受模型报告、Seed、密钥或任意字段;文件名与输入正文不会进入错误提示。

粘贴后点击检查。编辑、换文件或切换层级都会使旧检查结果失效。

尚未检查。请使用上方配置,或选择文件 / 粘贴 JSON。

4 · 导出本地反馈

先通过步骤 3。反馈包仅包含规范化配置与所选类别,不含原文、文件名、身份或测量结果;不会自动提交。

复制和导出只在你点击后执行。

了解分层报告与真实验证缺口 →

从教学到真实评测,还缺什么?

当前可下载集合:0。

待满足条件当前边界
真实目标与授权环境网页不连接目标,不执行工具,不复位环境
真实输出、工具轨迹与状态 oracle教学配置不产生这些证据,不能计入 ASR
材料许可、安全审查与发布门禁现有集合下载仍关闭;示例不是材料发布批准