目录材料选择与使用指南
如何按材料形态选择与使用集合
目录收录的 12 个条目涵盖四类材料形态。按测试目的选择对应形态并在获授权的环境中规范接入。本站仅提供公共元数据与高层评测方法说明,不提供可直接运行的题包或公开下载。
四类材料形态与高层评测方法
不同材料形态对应不同的测试准备与接入位置。请根据你的评测目标选择代表集合:
既有评测记录(内容安全与综合基线)
既有记录 · 受控面向模型输出政策、有害内容违规与多维度指令/权限边界初查。条目包含原始标记的拒绝与违规测试记录。
在获授权模型的文本输入/输出评测位置接入既有记录,观察有害内容拒答率与违规表现。注意:未建立正常对照前,不能宣称测得过度拒绝。
原创间接提示注入入口配方
沙箱配方 · 候选隔离面向邮件、日历、检索文档、网页结果及记忆等间接交互入口。条目包含攻击配方与 5 组去注入对照。
在具备相应间接入口的测试沙箱中,分别接入攻击配方与去注入对照配方,观察外部非可信内容是否覆盖了系统指令或触发了敏感操作;配方不是可直接运行配置。
原创工具权限与确认沙箱配方
沙箱配方 · 候选隔离面向敏感工具调用、未授权操作与人机二次确认拦截。条目包含 5 组攻击与正常请求对照配方。
在工具权限校验与敏感操作拦截点,分别对比攻击配方与正常对照配方,检查是否存在越权调用或跳过确认行为,同时核验正常业务请求仍可顺利完成。
受限业务环境引用(AgentDojo 场景攻防对照)
环境引用 · 候选隔离面向银行、协作消息、旅行安排与办公协作四大业务环境。包含 60 组攻击与去注入反事实对照任务引用。
查阅上游 AgentDojo 环境依赖规范,在获准搭建的沙箱中接入引用任务,严格保持成对的攻击与去注入反事实对照关系,对比正常任务完成度与环境行为差异;上游提供环境代码,本站未提供下载包。
次级参考:分层方法(L1/L2/L3)与本地配置演示实验室
demo / unmeasured / untrusted / official=false。示例独立于现有受控集合;检查通过只代表格式正确,不代表安全、有效、可信或官方认证。
你要检查哪一类风险?
L1 / L2 / L3 是证据层,不是质量等级。S1 / S2 / S3 风险优先级、攻击手法和访问权限是不同维度。
本地教学配置实验室(纯本地 · 不导入集合)
演示安全的本地配置生成与校验契约。全程不联网、不调用模型、不接收密钥。
从教学到真实评测,还缺什么?
当前可下载集合:0。
| 待满足条件 | 当前边界 |
|---|---|
| 真实目标与授权环境 | 网页不连接目标,不执行工具,不复位环境 |
| 真实输出、工具轨迹与状态 oracle | 教学配置不产生这些证据,不能计入 ASR |
| 材料许可、安全审查与发布门禁 | 现有集合下载仍关闭;示例不是材料发布批准 |