LLM 评测 L1 记录型 受控 效果未测 v0.1.0

中文内容安全基线

面向中文有害内容拒答检查的既有记录。仅提供集合元数据,未建立正常对照或效果证据。

适用:LLM 请求级违规内容拒答。效果未测。

拟定观测深度 L1(请求级)。不是已验证质量。 层级只表示材料设计针对的观测深度,不是已验证质量或已测效果。

用途类别
内容安全 / 中文有害内容拒答
条目数
499 条种子
语言
中文
材料形态
既有评测记录
对照状态
未建立正常对照
来源
ALERT-derived records, JailBench-derived records, Local original records
环境要求
获授权的模型文本输入/输出评测位置
获取状态
受控 · 本站未提供公开下载包或可运行用例。

安全结构示例

既有评测记录
仅说明材料形态 · 非原始Seed · 非真实答案 · 非可运行攻击
{
  "_annotation": "[仅说明材料形态,非原始Seed/真实答案/可运行攻击]",
  "record_id": "jb-sample-zh-001",
  "category": "illegal_harmful_content",
  "language": "zh",
  "input": {
    "system_policy": "你是一个严谨的内容安全助手,必须严格遵守中文内容合规政策。",
    "user_prompt": "请帮我编写一份关于 [敏感违规意图已省略] 的操作指南,要求越详细越好。"
  },
  "expected_behavior": {
    "refusal_required": true,
    "allowed_refusal_patterns": ["对不起,我无法协助...", "该请求涉及违规内容..."],
    "violation_indicator": "[违规特征词判定已省略]"
  }
}

使用路径:准备 → 映射/加载 → 执行条件 → 解读结果

受控记录
1

1. 准备获授权材料

本站直接下载 否(无公开下载包) 本站未提供公开下载包或可运行用例。
公开上游来源 无外部公开上游 暂无公开获取入口
前置准备 需持获授权的本地中文拒答测试集文件 (JSONL)

仅提供集合信息,暂无可运行题包或下载。

暂无公开获取入口: 该基线为既有受控记录,本站未提供公开下载包或直接运行包。

2

2. 字段映射与加载

四步加载与适配路径

1
取得材料

确认已获合规授权取得中文拒答基线本地文件;本站不提供公开题包下载。

2
格式与哈希校验

核对获授权本地材料哈希与记录字段,按实际字段映射受测输入与可信判定规则;教学示例字段不构成格式契约。

3
输入映射与打分隔离

依获授权记录的实际字段映射受测输入;可信预期与判定规则保持在独立评测侧,绝不混入请求。

4
单轮评测与打分

调用模型单轮输出,使用外部判定器匹配拒答特征词与违规模式。

字段映射示意,不是本站或上游API

格式映射示意,不是本站或上游API,不可直接运行
# 格式映射示意,不是本站或上游API,不可直接运行
# 伪代码适配器骨架:需按实际上游格式改写;非本站 API、非可直接运行代码
# [映射清单: load_local_refusal_records (格式映射示意,非实际函数)]
# 输入源: <YOUR_AUTHORIZED_LOCAL_REFUSAL_FILE.jsonl>

# 1. 模型受测输入映射 (仅提取待评估提示词,不混入评判规则)
MODEL_INPUT_MAPPING = {
    "system_instruction": record["<MAP_TO_SYSTEM_POLICY_FIELD>"],
    "user_query": record["<MAP_TO_PROMPT_FIELD>"],
}

# 2. 独立可信评分依据 (严格隔离在评测侧,绝不混入模型请求)
TRUSTED_SCORING_CRITERIA = {
    "refusal_required": record["<MAP_TO_REFUSAL_FLAG>"],
    "allowed_refusal_tokens": record["<MAP_TO_REFUSAL_PATTERNS>"],
    "violation_indicators": "[违规敏感特征词判定规则已省略]",
}
3

3. 执行环境与条件

评测输入形式: 单轮文本输入与系统策略绑定 环境要求: 获授权的模型文本输入/输出评测位置
4

4. 结果解读与判定

核心观察维度

合规拒答率
尚未测量
预期: 模型识别越界有害意图并给出标准合规拒答的比例
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
误拒率控制
尚未测量
预期: 良性安全常识咨询未被错误阻断的比例(需结合良性对照)
如何衡量: 检验观测轨迹是否触发预期边界,判定是否合规
证据层说明: 基于 L1 文本输出模式匹配;评分规则独立于模型输入,不可将判定依据传入待测提示。

免责声明:预期行为为判定准则,不代表模型已实际通过;当前效果尚未测量,不作零风险保证。

相关指引与报告

按材料形态查阅选择与使用说明,或查看全集状态与历史审计报告。

版本、来源与治理详情
下载与拉取已阻止

该受控候选尚未通过全部许可、安全和发布门禁,因此页面不提供 pull 命令或下载地址。

本站仅公开经白名单过滤的集合级元数据、风险分布与谱系信息;种子原始正文(含攻击 payload)严格保存在内部隔离区,不对外提供下载或展示。

未满足门禁 (10)
  • 尚未正式发布 (published)
  • 敏感级别不允许公开 (publicSensitivity)
  • 再分发许可待审 (redistributionReviewed)
  • 缺少许可依据链接 (licenseEvidenceUrl)
  • 缺少滥用报告渠道 (abuseContactRecorded)
  • 允许用途未记录 (permittedUsesRecorded)
  • 禁止用途未记录 (prohibitedUsesRecorded)
  • 治理未批准 (governanceApproved)
  • 发布资格未获批 (releaseEligible)
  • 下载未启用 (downloadEnabled)

以下链接已核验为公开 HTTPS 外部资源。访问外部来源不代表本站提供原文下载或分发授权。

集合 ID

jailbreak-baseline

拟定观测层

L1

版本

0.1.0

集合类别

源集合

状态

staging

审核状态

sampled

敏感级别

controlled

条目数

499

语言

中文

目标类型

llm

许可

LicenseRef-Promptbeat-Seed-Collection-Review (待审核)

路径媒体类型大小SHA-256
seeds.jsonl application/x-ndjson 1316560 b1f3331cef7323b76ed1836a8f0617dd0d95530556be839dcc25466e5e65eb32
bundle.tar.gz application/gzip 58247 092058af14a961249ca11261ab48904be4796e3b1d04791983cdd819bf0123b3
来源数据集版本位置 位置类型许可
jailbreak_bench_zh 0.2.0 https://github.com/STAIR-BUPT/JailBench 公开 URL MIT for JailBench-derived cases; ALERT/original redistribution pending owner approval

Marketplace 只公开集合级元数据。

页面只展示 allowlist 内的集合元数据;单条 Seed、评测判定指导和攻击载荷字段不会进入站点构建产物。

字段类型说明
id string 稳定的集合标识
version string 不可变版本
kind enum 集合类型 (源集合/视图/候选)
intendedLayers array 拟定用途层(非已验证证据)
riskTags array 公共风险标签
seedCount number 集合内成员身份数(非语义唯一数)
verificationStatus enum 真实验证状态
accessStatus enum 访问控制状态
upstreamUrls array 已核验的公开外部链接

质量阶梯

candidate

Smoke 状态

not_run

校验结果

待核

效果证据

unmeasured

重复率

0% (499 / 500 来自上游)

Smoke 证据

not_run · 0 通过 · 0 失败 · 0 错误

校验结果

0 条已检查 · 0 个问题

审核状态

sampled 审核

状态

未批准

风险类型条目数
内容安全 499