Agent 评测 L1·L2 记录型 受控 效果未测 v0.1.0

Agent 安全基线

覆盖指令边界、未授权操作与数据外泄的既有混合来源记录;可按主题查看,不代表效果已验证。

适用:Agent 指令、权限与数据边界。拟用于请求级观测;工具/环境证据待补。效果未测。

拟定观测深度 L1·L2。拟用于请求级观测;工具/环境证据待补。不是已验证质量。 层级只表示材料设计针对的观测深度,不是已验证质量或已测效果。

用途类别
Agent 指令、权限与数据边界(综合基线)
条目数
110 条种子
语言
英语 · 中文
材料形态
既有混合来源记录
对照状态
未宣称已建立正常对照
来源
AgentDojo, AgentHarm, InjecAgent, Local records, ToolEmu
环境要求
按选定主题适配的 Agent 运行时检查环境
获取状态
受控 · 本站未提供公开下载包或可运行用例。

安全结构示例

既有混合来源记录
仅说明材料形态 · 非原始Seed · 非真实答案 · 非可运行攻击
{
  "_annotation": "[仅说明材料形态,非原始Seed/真实答案/可运行攻击]",
  "composite_index": "asb-sample-composite-001",
  "thematic_domain": "multi_turn_composite_boundary",
  "thematic_subsets": ["instruction_override", "unauthorized_action", "data_exfiltration"],
  "evaluation_checkpoint": {
    "observation_target": "[跨轮次上下文边界测试已省略]",
    "trusted_boundary_policy": "STRICT_HUMAN_CONFIRMATION_REQUIRED",
    "simulated_context_trace": "[多轮交互追踪摘要已省略]"
  },
  "trusted_verifier_boundary": {
    "isolation_level": "strict_observer",
    "verdict_dimensions": ["instruction_following", "action_authorization", "data_containment"]
  }
}

使用路径:准备 → 映射/加载 → 执行条件 → 解读结果

受控记录
1

1. 准备获授权材料

本站直接下载 否(无公开下载包) 本站未提供公开下载包或可运行用例。
公开上游来源 无外部公开上游 查看主题子集
前置准备 需持获授权的混合来源本地记录;元数据不足以指定统一导入器

仅提供集合信息,暂无可运行题包或下载。

查看主题子集: 综合基线建议通过下方具体主题子集理解和使用;本站未提供整包下载。

2

2. 字段映射与加载

四步加载与适配路径

1
选择主题子集

按评测目的选择指令边界、未授权操作或数据外泄主题子集。

2
核验授权边界

核对材料授权范围与本地沙箱权限,确保具备安全拦截能力。

3
按子集结构映射

各主题子集格式不同,按实际记录单元映射,仅当材料明确有顺序时保留顺序。

4
分层观察评测

分别观测指令遵循、权限二次确认与数据流向,不使用单一指标代替。

字段映射示意,不是本站或上游API

格式映射示意,不是本站或上游API,不可直接运行
# 格式映射示意,不是本站或上游API,不可直接运行
# 伪代码适配器骨架:需按实际上游格式改写;非本站 API、非可直接运行代码
# [综合基线说明: 公共元数据不足以指定统一导入器,请按具体主题子集分别映射]
# 输入源: <YOUR_AUTHORIZED_SUBSET_FILE>

# 结构映射示意 (按所选主题子集分别提取):
SUBSET_MAPPING_WORKSHEET = {
    "instruction_subset": {
        "context": record["<MAP_TO_CONTEXT_FIELD>"],
        "user_query": record["<MAP_TO_INPUT_FIELD>"],
    },
    "authorization_subset": {
        "target_action": record["<MAP_TO_ACTION_NAME>"],
        "confirmation_gate": "[确认门拦截规则已省略]",
    },
    "exfiltration_subset": {
        "monitored_sink": record["<MAP_TO_DESTINATION>"],
        "sensitive_signal": "[敏感数据特征已省略]",
    },
}
3

3. 执行环境与条件

评测输入形式: 按实际记录单元映射,仅当材料明确有顺序时保留顺序 环境要求: 按选定主题适配的 Agent 运行时检查环境
4

4. 结果解读与判定

核心观察维度

指令层级隔离度
尚未测量
预期: 系统设定与不可信外部上下文冲突时,系统指令是否被稳定执行
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
权限与确认边界
尚未测量
预期: 敏感工具调用是否触发人机确认,高危操作是否被及时阻断
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
敏感数据隔离度
尚未测量
预期: 受限环境中的私密数据是否通过隐蔽通道被带出
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
证据层说明: 需按各主题子集独立测量;综合基线不提供单一聚合打分。

免责声明:预期行为为判定准则,不代表模型已实际通过;当前效果尚未测量,不作零风险保证。

相关指引与报告

按材料形态查阅选择与使用说明,或查看全集状态与历史审计报告。

版本、来源与治理详情
下载与拉取已阻止

该受控候选尚未通过全部许可、安全和发布门禁,因此页面不提供 pull 命令或下载地址。

本站仅公开经白名单过滤的集合级元数据、风险分布与谱系信息;种子原始正文(含攻击 payload)严格保存在内部隔离区,不对外提供下载或展示。

未满足门禁 (10)
  • 尚未正式发布 (published)
  • 敏感级别不允许公开 (publicSensitivity)
  • 再分发许可待审 (redistributionReviewed)
  • 缺少许可依据链接 (licenseEvidenceUrl)
  • 缺少滥用报告渠道 (abuseContactRecorded)
  • 允许用途未记录 (permittedUsesRecorded)
  • 禁止用途未记录 (prohibitedUsesRecorded)
  • 治理未批准 (governanceApproved)
  • 发布资格未获批 (releaseEligible)
  • 下载未启用 (downloadEnabled)

以下链接已核验为公开 HTTPS 外部资源。访问外部来源不代表本站提供原文下载或分发授权。

集合 ID

agent-safety-baseline

拟定观测层

L1·L2

版本

0.1.0

集合类别

源集合

状态

staging

审核状态

automated

敏感级别

controlled

条目数

110

语言

英语, 中文

目标类型

agent, coding-agent, http-agent

许可

LicenseRef-Promptbeat-Seed-Collection-Review (待审核)

路径媒体类型大小SHA-256
seeds.jsonl application/x-ndjson 185638 e6e811f6ef2309eafeec64f032a01e913802361e02b4539c5a0eab7fb38d8011
bundle.tar.gz application/gzip 26367 87933a6f42296e6cd66df8d95a654795fe6f7f376f68a99d2f5816a58d4f452b
来源数据集版本位置 位置类型许可
agent-safety-v0.1 0.1.0 examples/agentdojo-derived-redteam-v0.1/datasets/derived/agent-safety-v0.1/cases.jsonl 源码仓库路径(不是公开 URL) Composite source license review pending

标注为源码仓库路径的位置只是内部来源引用,不是公开下载地址。

Marketplace 只公开集合级元数据。

页面只展示 allowlist 内的集合元数据;单条 Seed、评测判定指导和攻击载荷字段不会进入站点构建产物。

字段类型说明
id string 稳定的集合标识
version string 不可变版本
kind enum 集合类型 (源集合/视图/候选)
intendedLayers array 拟定用途层(非已验证证据)
riskTags array 公共风险标签
seedCount number 集合内成员身份数(非语义唯一数)
verificationStatus enum 真实验证状态
accessStatus enum 访问控制状态
upstreamUrls array 已核验的公开外部链接

质量阶梯

candidate

Smoke 状态

passed_wave1_mock_trace_smoke

校验结果

待核

效果证据

unmeasured

重复率

0% (110 / 110 来自上游)

Smoke 证据

synthetic_smoke · 27 通过 · 3 失败 · 0 错误

校验结果

110 条已检查 · 0 个问题

审核状态

automated 审核

状态

未批准

风险类型条目数
数据外泄 13
指令边界 71
未授权操作 26
ASI ID名称条目数
ASI01 Agent Goal Hijacking 68
ASI02 Tool Misuse and Exploitation 29
ASI03 Identity and Privilege Abuse 7
ASI04 Agentic Supply Chain Vulnerabilities 1
ASI05 Unexpected Code Execution 1
ASI06 Memory and Context Poisoning 1
ASI09 Human-Agent Trust Exploitation 3