功能概述
该算子用于检测图像的NSFW(Not Safe For Work 不适宜在工作场所观看的内容)分数,过滤掉高分值的图像。支持多种过滤策略:
any: 任意一张图像符合条件即保留all: 所有图像都符合条件才保留
核心参数
| 参数 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
| input_path | string | 是 | - | 输入数据文件路径 (JSON/JSONL格式) |
| output_path | string | 是 | - | 输出数据文件路径 (JSONL格式) |
| hf_nsfw_model | string | 否 | 'Falconsai/nsfw_image_detection' | HuggingFace上的NSFW检测模型 |
| max_score | float | 否 | 0.5 | 最大NSFW分数阈值(0-1之间,低于此值保留) |
| any_or_all | string | 否 | 'any' | 过滤策略:'any' 或 'all' |
| num_proc | int | 否 | 1 | 并行处理的进程数 |
输入数据格式
输入文件应为 JSON 或 JSONL 格式,每行包含一个样本,样本需包含 images 字段:
{"images": ["/path/to/image1.jpg", "/path/to/image2.jpg"]}
输出数据格式
输出为 JSONL 格式,每行一个符合条件的样本。
使用示例
命令行调用
python scripts/run_image_nsfw_filter.py \
--input_path /path/to/input.jsonl \
--output_path /path/to/output.jsonl \
--max_score 0.0005 \
--any_or_all any
参数说明
--input_path: 输入文件路径--output_path: 输出文件路径--hf_nsfw_model: NSFW检测模型(默认:Falconsai/nsfw_image_detection)--max_score: 最大NSFW分数阈值(默认0.5,值越低越严格)--any_or_all: 过滤策略,默认any--num_proc: 并行进程数,默认1
注意事项
- 输入文件中的图像路径应为有效且可访问的文件路径
- 该算子需要加载HuggingFace模型,首次运行会下载模型,可能需要较长时间
- 依赖 torch,请确保已安装
- 处理大量数据时可适当增加 num_proc 提高效率