# Lowinfo Filter

> lowinfo_filter 低信息量过滤

- Skill: `cas-bigdatalab/lowinfo-filter` (Agent Skill, multi-file: 4 files)
- Install (CLI): `npx skillmds@latest add cas-bigdatalab/lowinfo-filter`
- Raw SKILL.md: https://api.skillmd.com/api/skills/cas-bigdatalab/lowinfo-filter/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: cas-bigdatalab (https://skillmd.com/u/cas-bigdatalab)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/cas-bigdatalab/lowinfo-filter

---


# lowinfo_filter 低信息量过滤

## 功能概述
- 按字符数/行数上下限过滤低/高信息样本。
- 支持多列检测，默认所有字符串列。

## 参数说明

| 参数 | 必填 | 默认值 | 说明 |
|------|------|--------|------|
| `--input_path` | 是 |  | 输入文件路径（支持CSV/TSV/Excel等） |
| `--output_path` | 是 |  | 输出文件路径（过滤后的文件） |
| `--text_columns` | 否 |  | 需检测的文本列，逗号分隔；不填默认全部字符串列 |
| `--min_chars` | 否 |  | 最小字符数，默认 10 |
| `--max_chars` | 否 |  | 最大字符数（0 表示不限），默认 2000 |
| `--min_lines` | 否 |  | 最小行数，默认 1 |
| `--max_lines` | 否 |  | 最大行数（0 表示不限），默认 200 |

## 使用方法
```bash
python scripts/lowinfo_filter.py \
  --input_path <输入文件> \
  --output_path <输出文件> \
  [--text_columns col1,col2] \
  [--min_chars 10] [--max_chars 2000] \
  [--min_lines 1] [--max_lines 200]
```

## 输出说明
- 仅保留满足阈值的行；过滤掉的行不输出。
- 控制台提示输出行数与原始行数。

## 注意事项
- 合理设置 min/max，避免过度过滤。
- 若需保留原因，可调整脚本保留 filter_reason 列（当前实现剔除）。

