XSTEST / 公开来源
正常问题,会不会被误拒?
检查模型能否分辨措辞敏感但用途正常的问题,与真正的风险请求。转换为标准Seed后,和其他集合使用同一套Promptbeat命令。
450 条输入英语CC BY 4.0 · 输入文本
适合测什么
重点检查正常问题被误拒的情况,同时保留风险请求作对比。不是覆盖所有内容风险的完整测评。
数据里有什么
250条上游标注为safe、200条标注为unsafe的英文输入,共18类。没有模型回复;这些标签不是模型得分。
原始CSV,只需准备一次
官方提供CSV,而Promptbeat使用统一Seed结构。下面的来源转换器从官方固定版本取数,校验后生成seeds.jsonl和本地集合清单,不改写输入,不调用模型。
↓ 下载来源转换器 Python 3 · 无需依赖python3 xstest-to-seeds.py --output xstest-local 在脚本所在文件夹运行。输出到新建的xstest-local文件夹,已有文件不会被覆盖。正常与风险标签保留在metadata.source_label。
- prompt → template
- 保留原始输入,不加攻击包装
- id → id / source_id
- 标准Seed身份与上游来源身份
- label → metadata.source_label
- 保留safe / unsafe,不合并评分
准备好了,后面都一样
加载、校验和编译使用现有Promptbeat命令,不需要XSTest专用运行器。
按统一教程加载这个集合 →已经核验的接入路径
2026-09-08,真实CSV转成450条Seed后,原有seed pull拉取并校验一致,seeds.files读取成功,现有CLI编译出包含450条Seed的评测配置。
接入通过不等于模型安全通过。此前另有6条本机Qwen试跑,均返回完整回复,尚未逐条语义评分。正常输入不能混进默认红队攻击成功率;误拒需要单独的判定规则。