Maximum Line Length Filter

最大行长度过滤器。过滤器将最大行长度的样本保持在特定范围内。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到最大行长度过滤、文本行长筛选、最长行过滤、按行长度过滤等需求时使用此skill。

cas-bigdatalab fd7a4be 5 files · 33.8 KB Updated

File contents

功能概述

该算子用于过滤最大行长度在指定范围内的文本样本。

核心参数

参数 类型 必填 默认值 说明
input_path string - 输入数据文件路径 (JSON/JSONL格式)
output_path string - 输出数据文件路径 (JSONL格式)
min_len int 10 最小行长度(字符数)
max_len int 2147483647 最大行长度(字符数)
batch_size int 1 批处理大小
num_proc int 1 并行处理的进程数
text_key string text 要操作的文本字段名

输入数据格式

输入文件应为 JSON 或 JSONL 格式,每行包含一个样本,样本需包含 text_key 指定的字段(默认 text):

{"<text_key>": "第一行文本\n第二行文本\n第三行文本"}

输出数据格式

输出为 JSONL 格式,每行一个符合条件的样本,仅包含 text 字段。

使用示例

命令行调用

python scripts/run_maximum_line_length_filter.py \
  --input_path /path/to/input.jsonl \
  --output_path /path/to/output.jsonl \
  --min_len 10 \
  --max_len 20

参数说明

  • --input_path: 输入文件路径
  • --output_path: 输出文件路径
  • --min_len: 最小行长度(默认10)
  • --max_len: 最大行长度(默认不限制)
  • --batch_size: 批处理大小(默认1)
  • --num_proc: 并行进程数,默认1
  • --text_key: 要操作的文本字段名(默认text)

注意事项

  1. 该算子计算文本中所有行的最大长度
  2. 长度按字符数计算,不是字节数
  3. 处理大量数据时可适当增加 batch_size 和 num_proc 提高效率

cas-bigdatalab/piflow/tree/main/workspace/skills/maximum_line_length_filter commit fd7a4be45a

Frequently asked questions

npx skillmds@latest add cas-bigdatalab/maximum-line-length-filter