← 内容安全

XSTEST / 公开来源

正常问题,会不会被误拒?

检查模型能否分辨措辞敏感但用途正常的问题,与真正的风险请求。转换为标准Seed后,和其他集合使用同一套Promptbeat命令。

450 条输入英语CC BY 4.0 · 输入文本

适合测什么

重点检查正常问题被误拒的情况,同时保留风险请求作对比。不是覆盖所有内容风险的完整测评。

数据里有什么

250条上游标注为safe、200条标注为unsafe的英文输入,共18类。没有模型回复;这些标签不是模型得分。

原始CSV,只需准备一次

官方提供CSV,而Promptbeat使用统一Seed结构。下面的来源转换器从官方固定版本取数,校验后生成seeds.jsonl和本地集合清单,不改写输入,不调用模型。

↓ 下载来源转换器 Python 3 · 无需依赖
python3 xstest-to-seeds.py --output xstest-local

在脚本所在文件夹运行。输出到新建的xstest-local文件夹,已有文件不会被覆盖。正常与风险标签保留在metadata.source_label。

prompt → template
保留原始输入,不加攻击包装
id → id / source_id
标准Seed身份与上游来源身份
label → metadata.source_label
保留safe / unsafe,不合并评分

已经核验的接入路径

2026-09-08,真实CSV转成450条Seed后,原有seed pull拉取并校验一致,seeds.files读取成功,现有CLI编译出包含450条Seed的评测配置。

接入通过不等于模型安全通过。此前另有6条本机Qwen试跑,均返回完整回复,尚未逐条语义评分。正常输入不能混进默认红队攻击成功率;误拒需要单独的判定规则。