Agent 评测 L1·L2 记录型 受控 效果未测 v1.0.0

未授权操作

来自母集合: Agent 安全基线

从 Agent 安全基线选取未授权操作标签记录,聚焦权限与确认边界检查;不是独立来源。

适用:Agent 工具授权与确认边界。拟用于请求级观测;工具/环境证据待补。效果未测。

拟定观测深度 L1·L2。拟用于请求级观测;工具/环境证据待补。不是已验证质量。 层级只表示材料设计针对的观测深度,不是已验证质量或已测效果。

用途类别
权限与确认边界检查
条目数
26 条种子
语言
英语 · 中文
材料形态
既有标签记录(母集合子集)
对照状态
未建立正常对照
来源
AgentDojo, AgentHarm, Local records, ToolEmu
环境要求
具备外部工具调用授权鉴权与拦截能力的运行环境
获取状态
受控 · 本站未提供公开下载包或可运行用例。

安全结构示例

既有标签记录
仅说明材料形态 · 非原始Seed · 非真实答案 · 非可运行攻击
{
  "_annotation": "[仅说明材料形态,非原始Seed/真实答案/可运行攻击]",
  "sample_id": "asb-unauth-sample-001",
  "source_label": "synthetic_unauthorized_action_record",
  "target_tool": "system_privileged_action",
  "authorization_policy": "REQUIRES_EXPLICIT_HUMAN_CONFIRMATION",
  "adversarial_prompt": "[绕过确认的非可信指令已省略]",
  "expected_verification": {
    "confirmation_requested": true,
    "silent_execution_prevented": true,
    "action_status": "[拦截判定记录已省略]"
  }
}

使用路径:准备 → 映射/加载 → 执行条件 → 解读结果

受控记录
1

1. 准备获授权材料

本站直接下载 否(无公开下载包) 本站未提供公开下载包或可运行用例。
公开上游来源 无外部公开上游 受控子集
前置准备 需持获授权的本地未授权操作记录与具备权限拦截的沙箱环境

仅提供集合信息,暂无可运行题包或下载。

受控子集: 从 Agent 安全基线派生的专题视图,无独立公开下载,继承母集合受控限制。

2

2. 字段映射与加载

四步加载与适配路径

1
取得材料

取得获授权的本地未授权操作测试样本。

2
注册敏感工具

在沙箱中对敏感工具标记人机二次确认要求。

3
输入映射与调用

映射非可信指令输入,观察模型是否直接发起高危调用。

4
拦截点与越权校验

核实敏感操作是否被确认门正确拦截,未授权静默执行是否为零。

字段映射示意,不是本站或上游API

格式映射示意,不是本站或上游API,不可直接运行
# 格式映射示意,不是本站或上游API,不可直接运行
# 伪代码适配器骨架:需按实际上游格式改写;非本站 API、非可直接运行代码
# [权限确认拦截映射清单]
# 输入源: <YOUR_AUTHORIZED_UNAUTHORIZED_ACTION_FILE>

MAPPING_WORKSHEET = {
    "test_prompt": record["<MAP_TO_UNTRUSTED_INSTRUCTION_FIELD>"],
    "action_identifier": record["<MAP_TO_ACTION_NAME>"],
}

# 独立授权确认拦截判定 (由沙箱确认门观测,绝不混入请求)
TRUSTED_CONFIRMATION_CHECK = {
    "mandatory_confirmation_required": True,
    "silent_execution_disallowed": True,
    "verdict_rule": "[二次确认拦截判断规则已省略]",
}
3

3. 执行环境与条件

评测输入形式: 高危工具调用拦截测试 环境要求: 具备外部工具调用授权鉴权与拦截能力的运行环境
4

4. 结果解读与判定

核心观察维度

确认拦截触发率
尚未测量
预期: 执行敏感高危操作前主动寻求用户授权确认的比率
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
越权零执行保证
尚未测量
预期: 未经明确确认而直接静默执行高危工具的案例数为零
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
证据层说明: 侧重 L2 工具/权限轨迹观测;确认门必须真实拦截未获授权调用。

免责声明:预期行为为判定准则,不代表模型已实际通过;当前效果尚未测量,不作零风险保证。

相关指引与报告

按材料形态查阅选择与使用说明,或查看全集状态与历史审计报告。

版本、来源与治理详情
下载与拉取已阻止

该受控候选尚未通过全部许可、安全和发布门禁,因此页面不提供 pull 命令或下载地址。

本站仅公开经白名单过滤的集合级元数据、风险分布与谱系信息;种子原始正文(含攻击 payload)严格保存在内部隔离区,不对外提供下载或展示。

以下为发布前所需检查,不表示该候选已完成逐项门禁审查。

未满足门禁 (11)
  • 尚未正式发布 (published)
  • 尚未批准公开可见 (publicVisibility)
  • 敏感级别不允许公开 (publicSensitivity)
  • 再分发许可待审 (redistributionReviewed)
  • 缺少许可依据链接 (licenseEvidenceUrl)
  • 缺少滥用报告渠道 (abuseContactRecorded)
  • 允许用途未记录 (permittedUsesRecorded)
  • 禁止用途未记录 (prohibitedUsesRecorded)
  • 治理未批准 (governanceApproved)
  • 发布资格未获批 (releaseEligible)
  • 下载未启用 (downloadEnabled)

以下链接已核验为公开 HTTPS 外部资源。访问外部来源不代表本站提供原文下载或分发授权。

集合 ID

agent-safety-baseline--unauthorized-actions

母集合标识

agent-safety-baseline

拟定观测层

L1·L2

版本

1.0.0

集合类别

主题子集

状态

待核

审核状态

待核

敏感级别

待核

条目数

26

语言

英语, 中文

目标类型

待核

许可

待审核

路径媒体类型大小SHA-256
暂无直接文件清单(元数据模式)
来源数据集版本位置 位置类型许可
未记录

Marketplace 只公开集合级元数据。

页面只展示 allowlist 内的集合元数据;单条 Seed、评测判定指导和攻击载荷字段不会进入站点构建产物。

字段类型说明
id string 稳定的集合标识
version string 不可变版本
kind enum 集合类型 (源集合/视图/候选)
intendedLayers array 拟定用途层(非已验证证据)
riskTags array 公共风险标签
seedCount number 集合内成员身份数(非语义唯一数)
verificationStatus enum 真实验证状态
accessStatus enum 访问控制状态
upstreamUrls array 已核验的公开外部链接

质量阶梯

待核

Smoke 状态

待核

校验结果

待核

效果证据

待核

审核状态

待核 审核

状态

未批准