← all publishers

cas-bigdatalab

@cas-bigdatalab source repo

194 published skills · page 2 of 2

  1. Time Window Sampler · cas-bigdatalab bundle
    时间窗口采样算子。读取JSONL时间序列记录,按指定时间窗口分组后在每个窗口内均匀抽取样本。 当用户提到按天抽样、按小时抽样、周期性抽样、时间窗口采样等需求时使用此skill。 即使用户没有明确说出"时间窗口采样",只要任务涉及按时间粒度分组后抽样,就应该使用此skill。 不负责时间字段清洗、时间聚合统计或异常检测。
    0
    installs
  2. Dc1 Blank Line Clean · cas-bigdatalab bundle
    空行清洗工具。读取结构化数据文件(CSV、TSV、Excel等),删除所有列为空的行(空行), 然后输出为相同格式的文件。当用户提到空行清洗、清理空行、删除空行、处理空白行、净化数据文件等需求时使用此skill。 即使用户没有明确说出"空行清洗",只要任务涉及读取结构化文件并删除空行,就应该使用此skill。
    0
    installs
  3. Flagged Words Filter · cas-bigdatalab bundle
    敏感词过滤器。过滤文本中包含敏感词/标记词比例超过指定阈值的样本。 当用户提到敏感词过滤、脏词过滤、违禁词过滤、内容审核、敏感词检测等需求时使用此skill。 即使用户没有明确说出"敏感词",只要任务涉及过滤包含特定敏感词的文本内容, 就应该使用此skill。
    0
    installs
  4. Gaussian Chk To Fchk · cas-bigdatalab bundle
    使用 Gaussian 的 formchk 工具将 chk 检查点文件转换为 fchk 波函数文本文件。
    0
    installs
  5. Meta Tags Aggregator · cas-bigdatalab bundle
    元标签聚合工具。合并意思相近的元标签,将多个相似标签归类到统一的标签下。 当用户提到标签聚合、合并标签、归类标签、标签映射、标签合并、整理标签等需求时使用此skill。 即使用户没有明确说出"聚合"或"合并",只要任务涉及将多个相似标签归类统一, 就应该使用此skill。
    0
    installs
  6. Number Noise Cleaner · cas-bigdatalab bundle
    无用数字字符清理工具。读取结构化文本数据,对指定或全部文本字段移除无语义的独立数字字符,输出清理后的结构化文件。 当用户提到无用数字字符清理、数字噪声删除、文本中的杂散数字清理等需求时使用此skill。 即使用户没有明确说出"number_noise_cleaner",只要任务涉及从文本中删除无业务意义的数字字符,就应该使用此skill。 不负责数值规整、字段校验或通用正则替换。
    0
    installs
  7. PDF Metadata Extract · cas-bigdatalab bundle
    提取PDF文件的元数据(标题、作者、主题、页数等),输出为JSON格式。当用户需要查看PDF文档信息时使用此skill。
    0
    installs
  8. Qc10 Timeconsistency · cas-bigdatalab bundle
    时间一致性检查工具。读取被检验表,按时间序列检查数据的时间一致性, 判断相邻时间点的数据变化是否在合理范围内,识别并标记异常数据,最后输出为相同格式的文件。 当用户提到时间一致性检查、时间序列校验、数据变化检查、时序一致性等需求时使用此skill。 即使用户没有说出"时间一致性",只要任务涉及检查数据的时间序列一致性,就应该使用此skill。
    0
    installs
  9. Qc15 Timechangerange · cas-bigdatalab bundle
    最大变化范围检验工具。读取时间序列数据,检查在特定时间窗口内,数据是否出现了异常剧烈波动, 即在任意两个读数之间,其差值(变化量)的绝对值超出了预设的容忍阈值,识别并标记异常数据,最后输出为相同格式的文件。 当用户提到最大变化范围检验、变化范围检验、时间序列波动检验、窗口变化检测等需求时使用此skill。 即使用户没有说出"最大变化范围",只要任务涉及检查时间序列数据在时间窗口内的变化幅度是否异常,就应该使用此skill。
    0
    installs
  10. Tab Space Normalizer · cas-bigdatalab bundle
    Tab/空格规范化工具。读取结构化数据文件,执行制表符展开、行尾空格清理与可选公共缩进去除,输出空白已统一的结构化数据文件。 当用户提到Tab转空格、制表符转空格、缩进规范化、行尾空格清除、公共缩进去除等需求时使用此skill。 即使用户没有明确说出"tab_space_normalizer",只要任务涉及文本中的Tab/空格归一,就应该使用此skill。 不负责文本内容改写、拼写纠错、重复标点合并或其他非空白字符清理。
    0
    installs
  11. V1 Formatconsistency · cas-bigdatalab bundle
    格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。
    0
    installs
  12. Document Deduplicator · cas-bigdatalab bundle
    文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本。 当用户提到文档去重、删除重复文档、样本去重、文本去重、去除重复内容、 清洗重复数据、整理文档集合等需求时使用此skill。 即使用户没有明确说出"去重",只要任务涉及从多个文档中识别和删除重复内容, 就应该使用此skill。
    0
    installs
  13. Missing Value Remover · cas-bigdatalab bundle
    Missing Value Remover 缺失值删除 Skill
    0
    installs
  14. Naive Reverse Grouper · cas-bigdatalab bundle
    将批处理的样本拆分为独立样本。当用户提到样本拆分、拆分批次、批处理展开、反向分组等需求时使用此skill。 即使用户没有明确说出"拆分",只要任务涉及将批处理数据(字段值为数组)展开为独立样本,就应该使用此skill。
    0
    installs
  15. Privacy Token Remover · cas-bigdatalab bundle
    隐私标识移除工具。读取结构化文本数据,按用户选择的类别删除或替换邮箱、IPv4 地址、电话号码等文本中的隐私标识。 当用户提到移除邮箱、清洗 IP、替换电话、从文本里剔除隐私 token 等需求时使用此 skill。 它只处理文本中的 token 清理,不做字段级遮蔽,也不负责图片脱敏、音频脱敏、结构化字段加密或假数据生成。
    0
    installs
  16. Text Fragment Remover · cas-bigdatalab bundle
    指定文本片段删除工具。读取结构化数据中的文本字段,删除用户显式给出的固定片段并保留其他字段不变。 当用户提到删除固定词、固定占位符、固定水印短语、固定噪声片段等需求时使用此skill。 即使用户没有明确说出 skill 名,只要任务是按明确片段从文本字段中移除内容,就应该使用此skill。 不负责按类别自动识别 HTML、URL、emoji、数字、标点、控制字符等内容,这些应交给专用清洗 skill。
    0
    installs
  17. Calibrate Query Mapper · cas-bigdatalab bundle
    基于参考文本校准问答对中的查询(问题)。当用户提到校准问题、校准查询、语言风格校准、问题优化等需求时使用此skill。 即使用户没有明确说出"校准",只要任务涉及根据参考文本调整问答对中的问题,就应该使用此skill。
    0
    installs
  18. Chinese Convert Mapper · cas-bigdatalab bundle
    在繁体中文、简体中文和日语汉字之间转换中文。当用户提到中文繁简转换、中文转换、简体转繁体、繁体转简体、中日文转换等需求时使用此skill。 即使用户没有明确说出"转换",只要任务涉及中文繁简转换或中日文转换,就应该使用此skill。
    0
    installs
  19. Clean Copyright Mapper · cas-bigdatalab bundle
    清理版权注释开头的文本样本。当用户提到清理版权、删除版权注释、清理代码注释、去除版权信息等需求时使用此skill。 即使用户没有明确说出"版权",只要任务涉及清理文本开头的注释或版权信息,就应该使用此skill。
    0
    installs
  20. Geotrans Main Operator · cas-bigdatalab bundle
    几何识别与图像分割结果地理转换算子。用户提到图像分割分析、遥感分割定位、地理坐标映射时优先调用。
    0
    installs
  21. Image Watermark Filter · cas-bigdatalab bundle
    图像水印过滤器。过滤器以保持其图像没有水印的样本具有高概率。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像水印检测、图片无水印过滤、水印去除、检测图片水印等需求时使用此skill。
    0
    installs
  22. Invisible Char Cleaner · cas-bigdatalab bundle
    不可见字符清洗工具。移除零宽空格、BOM、软连字符、双向文本控制符、C0控制字符等 63 个码点 的不可见/干扰字符。当用户提到不可见字符、零宽空格、BOM 清除、控制字符清洗等需求时使用此skill。
    0
    installs
  23. Numeric Format Cleaner · cas-bigdatalab bundle
    数值格式清洗工具。读取 JSONL 结构化数据,按字段规则统一单位、数值格式、范围和空值表达,输出规整后的 JSONL 和统计文件。 当用户提到数值格式化、单位统一、千分位、科学计数法、空值填充、数值规整等需求时使用此skill。 即使用户没有明确说出"数值格式清洗",只要任务涉及按字段规则整理数值表达,就应该使用此skill。 不负责文本去重、标点清洗、字段校验或非数值内容整理。
    0
    installs
  24. Piflow Skill Generator · cas-bigdatalab bundle
    PiFlow 技能生成器。当用户完成了一次完整并成功的数据处理任务时调用,根据当前 skills/generated 的本地约定和 references/piflow_skill_template.md 通用模板创建、更新或校验 PiFlow-compatible skill,包括 UTF-8 编码的 SKILL.md、DAG 可读的 input_params/output_params、version/tag 元数据、skill.json、scripts/references/assets 资源目录,以及本地校验脚本。仅在用户明确要求生成或保存 skill,或某次数据处理任务已经完成并需要把已验证成功的操作流程沉淀为 skill 时使用;默认不要因为“可能需要 skill”或“当前能力不足”而优先触发此 skill。
    0
    installs
  25. Punctuation Normalizer · cas-bigdatalab bundle
    Punctuation Normalizer 文本标点规范化 Skill
    0
    installs
  26. Ray Image Deduplicator · cas-bigdatalab bundle
    Ray分布式图像去重工具。使用图像哈希精确匹配在文档级别删除重复样本,基于Ray分布式框架。 当用户提到图像去重、删除重复图片、分布式去重、大规模图像去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模图像去重处理, 就应该使用此skill。
    0
    installs
  27. Ray Video Deduplicator · cas-bigdatalab bundle
    Ray分布式视频去重工具。使用精确匹配(MD5哈希)在文档级别删除重复视频,基于Ray分布式框架。 当用户提到视频去重、删除重复视频、分布式去重、大规模视频去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模视频去重处理, 就应该使用此skill。
    0
    installs
  28. Read File And Multiply · cas-bigdatalab bundle
    Multiply all numbers in a text file by 10 and save to a new file. Use when user mentions multiply numbers by 10, process number file, batch calculation.
    0
    installs
  29. Smart Quote Normalizer · cas-bigdatalab bundle
    智能引号/排版字符规范化工具。将弯引号、长破折号、省略号等排版字符转为标准 ASCII 形式, 适配 Word/PDF/网页文本的后处理清洗。当用户提到智能引号、弯引号转直引号、排版字符规范化、 长破折号等需求时使用此skill。
    0
    installs
  30. Specified Field Filter · cas-bigdatalab bundle
    指定字段过滤器。根据指定的字段信息进行筛选。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到字段过滤、字段值筛选、元数据过滤、指定字段过滤、按字段值过滤等需求时使用此skill。
    0
    installs
  31. Stacked Symbol Cleaner · cas-bigdatalab bundle
    -、~~~~、* * * * *、
    0
    installs
  32. Word Repetition Filter · cas-bigdatalab bundle
    单词重复比例过滤器。过滤器将单词级n-gram重复比率的样本保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到单词重复过滤、文本重复比例过滤、n-gram重复过滤、清理重复内容等需求时使用此skill。
    0
    installs
  33. Citation Marker Remover · cas-bigdatalab bundle
    Citation Marker Remover 文献引用标记移除 Skill
    0
    installs
  34. Image Aesthetics Filter · cas-bigdatalab bundle
    图像美学过滤器。过滤美学评分不在指定范围内的图像样本。 当用户提到图像美学、图像质量过滤、图片评分筛选、图像质量评估、过滤低质量图像等需求时使用此skill。 即使用户没有明确说出"美学评分",只要任务涉及根据图像美学质量来筛选数据, 就应该使用此skill。
    0
    installs
  35. Image Face Count Filter · cas-bigdatalab bundle
    图像人脸数量过滤器。过滤以保持样本的面数在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、识别人脸、人脸数量检测、图片人脸筛选、按人脸数量过滤等需求时使用此skill。
    0
    installs
  36. Image Face Ratio Filter · cas-bigdatalab bundle
    图像人脸面积比例过滤器。过滤以保持面面积比在特定范围内的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到过滤图片、人脸占比、面部面积比例、图片人脸区域筛选、按人脸占比过滤等需求时使用此skill。
    0
    installs
  37. Qc12 Constantfieldcheck · cas-bigdatalab bundle
    特定字段恒定下的其他字段不一致检查工具。读取被检验表,当某些字段(恒定字段)的值相同时, 检查其他指定字段(差异字段)是否存在多个不同的值,如果存在则标记为异常数据,最后输出为相同格式的文件。 当用户提到恒定字段检查、字段一致性检查、分组内差异检查等需求时使用此skill。 即使用户没有说出"恒定字段",只要任务涉及检查分组内字段是否存在不一致,就应该使用此skill。
    0
    installs
  38. Qc5 Batchthresholdcheck · cas-bigdatalab bundle
    批量阈值检验工具。读取被检验表和阈值表,将数据列的值与阈值表中定义的上下限进行比对, 识别并标记超出允许范围(包括上限和下限)或为空值的数据点,最后输出为相同格式的文件。 当用户提到批量阈值检验、阈值表校验、多字段阈值检查、范围校验等需求时使用此skill。 即使用户没有明确说出"批量阈值",只要任务涉及根据阈值表进行多字段范围校验,就应该使用此skill。
    0
    installs
  39. Result Storage Operator · cas-bigdatalab bundle
    分析结果落盘算子。用户提到结果保存、导出CSV、结果存储时调用。
    0
    installs
  40. Unique Constraint Check · cas-bigdatalab bundle
    唯一性约束校验工具。检查指定字段的值是否在全表中唯一,标记重复出现的值所在行 (保留首次出现),支持空值跳过。当用户提到唯一性检查、重复值检测、主键约束等需求时使用此skill。
    0
    installs
  41. Dataspace File Sink Stop · cas-bigdatalab bundle
    Dataspace 文件输出终止算子。用于接收上游算子的单个文件输出,按指定相对目录上传到 Dataspace 空间目录中,实际文件名自动沿用输入文件名。该算子必须作为 DAG 的终止节点使用。
    0
    installs
  42. Duplicate Detector Exact · cas-bigdatalab bundle
    精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录,速度快、无额外依赖。 当用户提到精确去重、完全重复检测、数据去重等需求时使用此skill。
    0
    installs
  43. Duplicate Detector Fuzzy · cas-bigdatalab bundle
    模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。 当用户提到模糊去重、近似重复检测、相似度去重、文本去重等需求时使用此skill。
    0
    installs
  44. Language Id Score Filter · cas-bigdatalab bundle
    语言识别分数过滤器。过滤器以保留置信度得分大于特定最小值的特定语言的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到语言识别过滤、语言检测、文本语言筛选、按语言过滤等需求时使用此skill。
    0
    installs
  45. PDF Ocr Artifact Cleaner · cas-bigdatalab bundle
    pdf_ocr_artifact_cleaner PDF/OCR伪影清洗Skill
    0
    installs
  46. Qc11 Fieldnullvaluecheck · cas-bigdatalab bundle
    字段空值检查工具。读取被检验表,检查指定字段是否存在空值(NULL/NA), 识别并标记存在空值的数据点,最后输出为相同格式的文件。 当用户提到空值检查、字段空值校验、缺失值检查、NULL值检查等需求时使用此skill。 即使用户没有说出"空值检查",只要任务涉及检查数据字段是否为空,就应该使用此skill。
    0
    installs
  47. Qc13 Timeequivalentvalue · cas-bigdatalab bundle
    等值检验(连续数值无变化检查)工具。读取时间序列数据,检查在连续的时间段内, 某个关键指标的数值是否长时间保持不变(久无变化检查),识别并标记异常数据,最后输出为相同格式的文件。 当用户提到等值检验、连续无变化检查、久无变化检查、时间序列恒定值检查等需求时使用此skill。 即使用户没有说出"等值检验",只要任务涉及检查时间序列数据是否长时间保持不变,就应该使用此skill。
    0
    installs
  48. Qc4 Associationrulecheck · cas-bigdatalab bundle
    数值关联规则校验工具。读取被检验表,根据用户自定义的条件表达式(类似Hive SQL规则)进行数据校验, 具有关联关系的数据项需满足特定约束条件。不满足条件的数据会标记质控标识并输出异常数据。 当用户提到关联规则校验、数据约束校验、自定义规则校验、条件表达式校验等需求时使用此skill。 即使用户没有说出"关联规则",只要任务涉及根据自定义条件表达式进行数据校验,就应该使用此skill。
    0
    installs
  49. Quality Flag Field Check · cas-bigdatalab bundle
    质量标识字段检测工具。检查数据表是否配置质量标识字段,验证标识字段的存在性、值规范性 (是否为预定义合法值)、非空完整性,标记不合格数据。 当用户提到质量标识检查、QC字段检测、标识字段合规等需求时使用此skill。
    0
    installs
  50. Time Currency Normalizer · cas-bigdatalab bundle
    时间/货币归一工具。读取结构化文本数据,将常见日期格式统一为YYYY-MM-DD,将$、€、¥/¥前缀金额转换为USD/EUR/CNY数值表达。 当用户提到统一日期格式、标准化货币金额、清洗时间表述等需求时使用此skill。 即使用户没有明确说出skill名,只要任务涉及日期或货币符号的归一化,就应该使用此skill。 不负责汇率换算、时区转换或非前缀货币单位解析。
    0
    installs
  51. Calibrate Response Mapper · cas-bigdatalab bundle
    基于参考文本校准问答对中的响应。当用户提到校准回答、校准响应、语言风格校准、回答优化等需求时使用此skill。 即使用户没有明确说出"校准",只要任务涉及根据参考文本调整问答对中的回答,就应该使用此skill。
    0
    installs
  52. Image Aspect Ratio Filter · cas-bigdatalab bundle
    图像长宽比过滤器。过滤图像长宽比不在指定范围内的样本。 当用户提到图像长宽比、图片比例过滤、图像尺寸筛选、图像宽高比等需求时使用此skill。 即使用户没有明确说出"长宽比",只要任务涉及根据图像宽高比来筛选数据, 就应该使用此skill。
    0
    installs
  53. Ingest Archive 7z Preview · cas-bigdatalab bundle
    7z 压缩包内容预览工具。递归扫描目录内 .7z 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 7z 预览、7z 压缩包内容查看、7z 文件清单等需求时使用此 skill。 即使用户没有明确说出"7z 预览",只要任务涉及在解压前先查看 7z 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 zip、rar、tar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。
    0
    installs
  54. Qc2 Enumerationfieldcheck · cas-bigdatalab bundle
    公共基础项枚举校验工具。读取被检验表和标准词典文件,将被检验表中的属性项值与标准词典进行比对, 检查是否超出词典规定的固有词表枚举值范围,超出范围的记录会标记质控标识并输出异常数据。 当用户提到枚举校验、枚举值检查、属性项校验、词表校验等需求时使用此skill。 即使用户没有明确说出"枚举校验",只要任务涉及将被检验数据与标准词典进行比对,就应该使用此skill。
    0
    installs
  55. Ray Document Deduplicator · cas-bigdatalab bundle
    Ray分布式文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本,基于Ray分布式框架。 当用户提到文档去重、删除重复文档、样本去重、分布式去重、大规模数据去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模文档去重处理, 就应该使用此skill。
    0
    installs
  56. Special Characters Filter · cas-bigdatalab bundle
    特殊字符过滤器。过滤器将具有特殊字符比率的样品保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到特殊字符过滤、特殊字符比例过滤、文本特殊字符检测、清理乱码文本等需求时使用此skill。
    0
    installs
  57. Time Gradual Change Check · cas-bigdatalab bundle
    时序平缓性检测工具。检测时序数据是否符合渐变规律,包括突变跳点检测(相邻点变化超阈值) 和方向振荡检测(窗口内反复升降),对应功能说明(八)模块中的平缓性检测维度。 当用户提到时序平缓性、渐变规律、突变跳点、方向振荡等需求时使用此skill。
    0
    installs
  58. Average Line Length Filter · cas-bigdatalab bundle
    平均行长度过滤器。过滤文本平均行长度不在指定范围内的样本。 当用户提到行长度过滤、平均行长度、文本行长度筛选、按行筛选等需求时使用此skill。 即使用户没有明确说出"平均行长度",只要任务涉及根据文本中每行的平均长度来筛选数据, 就应该使用此skill。
    0
    installs
  59. Dataspace File Source Stop · cas-bigdatalab bundle
    Dataspace 文件输入源算子。用于根据 Dataspace 数据源实例 ID 和空间内文件路径下载单个文件,并将该文件作为工作流输入提供给下游算子。该算子没有上游输入,必须作为 DAG 的起始节点使用。
    0
    installs
  60. Duplicate Fragment Cleaner · cas-bigdatalab bundle
    文本内部重复片段模糊清理工具。读取 JSONL 文本数据,按文本字段删除近似重复的段落、句子或连续片段,保留首次出现内容并输出清理后的样本。 当用户提到清理重复片段、删除重复段落、去掉近似重复内容等需求时使用此 skill。 即使用户没有明确说出 "duplicate_fragment_cleaner",只要任务涉及同一文本内部的重复片段清理,就应该使用此 skill。 不负责跨记录去重、摘要改写或语义重写。
    0
    installs
  61. Image Text Matching Filter · cas-bigdatalab bundle
    图像文本匹配过滤器。过滤器将图像和文本之间的匹配分数保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文本匹配过滤、图片文字匹配度、文图匹配检测、图像文本相关性过滤等需求时使用此skill。
    0
    installs
  62. Ingest Archive Rar Preview · cas-bigdatalab bundle
    RAR 压缩包内容预览工具。递归扫描目录内 .rar 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 rar 预览、rar 压缩包内容查看、rar 文件清单等需求时使用此 skill。 即使用户没有明确说出"rar 预览",只要任务涉及在解压前先查看 rar 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 zip、7z、tar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。
    0
    installs
  63. Ingest Archive Tar Preview · cas-bigdatalab bundle
    TAR 压缩包内容预览工具。递归扫描目录内 .tar / .tar.gz / .tar.bz2 / .tar.xz 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 tar 预览、tar.gz 预览、tar 压缩包内容查看、tar 文件清单等需求时使用此 skill。 即使用户没有明确说出"tar 预览",只要任务涉及在解压前先查看 tar 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 zip、7z、rar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。
    0
    installs
  64. Ingest Archive Zip Preview · cas-bigdatalab bundle
    ZIP 压缩包内容预览工具。递归扫描目录内 .zip 文件,列出内部文件清单并按需输出文本片段预览,供后续采集流程判断是否需要解压处理。 当用户提到 zip 预览、压缩包内容查看、zip 文件清单、压缩包预检等需求时使用此 skill。 即使用户没有明确说出"zip 预览",只要任务涉及在解压前先查看 zip 压缩包内部文件结构和内容片段,就应该使用此 skill。 不负责 7z、rar、tar 等其他压缩格式的预览(各有独立 skill),也不负责解压或归档打包。
    0
    installs
  65. Maximum Line Length Filter · cas-bigdatalab bundle
    最大行长度过滤器。过滤器将最大行长度的样本保持在特定范围内。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到最大行长度过滤、文本行长筛选、最长行过滤、按行长度过滤等需求时使用此skill。
    0
    installs
  66. Numeric Distribution Check · cas-bigdatalab bundle
    字段分布校验工具。读取结构化数据文件(CSV、TSV、Excel等),按模式检查数值字段统计特征或分类字段频率分布是否合理。 数值模式用于检查均值、标准差、中位数、分位数等统计量;分类模式用于检查类别数上限和单类占比是否异常。 当用户提到分布校验、统计特征验证、类别频率检查、类别倾斜检测等需求时使用此skill。 即使用户没有明确说出"分布校验",只要任务涉及验证字段整体分布是否偏移或失衡,就应该使用此skill。
    0
    installs
  67. Character Repetition Filter · cas-bigdatalab bundle
    字符重复比例过滤器。过滤文本中字符级n-gram重复比例不在指定范围内的样本。 当用户提到字符重复、重复比例过滤、文本重复过滤、清理重复内容等需求时使用此skill。 即使用户没有明确说出"字符重复",只要任务涉及根据文本中字符重复的程度来筛选数据, 就应该使用此skill。
    0
    installs
  68. Entity Attribute Aggregator · cas-bigdatalab bundle
    实体属性聚合工具。从多个文档中提取并总结给定实体的特定属性信息。 当用户提到从文档中提取实体信息、总结人物属性、聚合实体特征、提取文档中的实体信息、 根据文档总结实体属性(如总结某人物的主要经历、身份背景、成就等)等需求时使用此skill。 即使用户没有明确说出"聚合"或"实体",只要任务涉及从多个文档中提取和总结某个主题/人物/实体的 特定属性,就应该使用此skill。
    0
    installs
  69. Ingest Archive 7z Extractor · cas-bigdatalab bundle
    7z 压缩包解压工具。递归扫描目录内 .7z 文件及分卷(.7z.001 等),解压并输出解压清单。依赖 py7zr 库。不负责 zip、rar 等其他格式的解压。
    0
    installs
  70. Overlap Dam Select Operator · cas-bigdatalab bundle
    淤地坝候选叠加筛选算子。用户提到淤地坝识别、坝体候选筛选、叠加过滤时优先调用。
    0
    installs
  71. Referential Integrity Check · cas-bigdatalab bundle
    引用完整性校验工具。读取子表及参考表,检查外键值是否存在于参考键集合中,标记孤立记录行并输出结果文件。 当用户提到外键检查、引用完整性、孤立记录、父子表引用等需求时使用此skill。 即使用户没有明确说出“引用完整性”,只要任务涉及检查字段值是否能在参考表中找到,就应该使用此skill。 不负责重复行、空值、列存在性、字段格式等其他校验任务。
    0
    installs
  72. Spelling Variant Normalizer · cas-bigdatalab bundle
    拼写变体标准化工具。统一英美拼写差异(colour→color、analyse→analyze 等),内置 153 词条 (含屈折形式 covered/covering 等),支持自定义词典扩展。当用户提到英美拼写统一、拼写变体、 British/American spelling 等需求时使用此skill。
    0
    installs
  73. Text Pair Similarity Filter · cas-bigdatalab bundle
    文本对相似度过滤器。过滤器将文本之间具有相似性的文本对保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到文本对相似度过滤、文本对过滤、双文本相似度、文本配对过滤等需求时使用此skill。
    0
    installs
  74. Cross Field Comparison Check · cas-bigdatalab bundle
    跨字段比较校验工具。读取结构化数据文件(CSV、TSV、Excel等),检查两个字段之间的逻辑约束关系 是否满足(如 start < end、min ≤ max、price >= cost),支持六种比较运算符,多约束可组合使用。 当用户提到跨字段校验、字段间比较、逻辑约束检查、大小关系验证等需求时使用此skill。 即使用户没有明确说出"跨字段",只要任务涉及验证两个字段值之间的逻辑关系,就应该使用此skill。
    0
    installs
  75. Image Pair Similarity Filter · cas-bigdatalab bundle
    图像对相似度过滤器。过滤器将图像之间具有相似性的图像对保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像相似度检测、图像对过滤、双图相似度、图片相似度筛选、图像pair过滤等需求时使用此skill。
    0
    installs
  76. Image Text Similarity Filter · cas-bigdatalab bundle
    图像文本相似度过滤器。过滤器将图像和文本之间的相似性保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文本相似度过滤、图片文字相似度、文图相似度检测、图文相关性过滤等需求时使用此skill。
    0
    installs
  77. Ingest Archive Rar Extractor · cas-bigdatalab bundle
    RAR 压缩包解压工具。递归扫描目录内 .rar 文件及分卷(.part1.rar/.part2.rar 等),解压并输出解压清单。依赖 rarfile 库及系统 unrar 工具。不负责 zip、7z 等其他格式的解压。
    0
    installs
  78. Ingest Archive Tar Extractor · cas-bigdatalab bundle
    TAR 压缩包解压工具。递归扫描目录内 .tar / .tar.gz / .tar.bz2 / .tar.xz 文件,解压并输出解压清单。不负责 zip、7z、rar 等其他格式的解压。
    0
    installs
  79. Ingest Archive Zip Extractor · cas-bigdatalab bundle
    ZIP 压缩包解压工具。递归扫描目录内 .zip 文件及分卷(.z01/.z02 等),合并分卷后解压并输出解压清单。当用户需要批量解压 zip 或分卷 zip 时使用此 skill。不负责 7z、rar 等其他格式的解压。
    0
    installs
  80. Qc7 Batchinputthresholdcheck · cas-bigdatalab bundle
    批量阈值检验-输入框工具。读取被检验表,将数据列的值与输入阈值条件中定义的上下限进行比对, 识别并标记超出允许范围(包括上限和下限)或为空值的数据点,最后输出为相同格式的文件。 当用户提到批量阈值检验、输入框阈值检验、多字段阈值检查、范围校验等需求时使用此skill。 即使用户没有明确说出"批量阈值输入框",只要任务涉及根据输入的阈值条件进行批量范围校验,就应该使用此skill。
    0
    installs
  81. Statistical Outlier Detector · cas-bigdatalab bundle
    统计与机器学习异常值检测工具。读取结构化表格数据,使用 IQR、Z-score、IsolationForest 或分组标准差一致性方法识别异常值,输出带异常标记、删除异常行或裁剪异常值后的结果文件。 当用户提到异常值检测、离群值识别、IQR、Z-score、IsolationForest、按实验组/分类组检查数值一致性等需求时使用此skill。 即使用户没有明确说出“statistical_outlier_detector”,只要任务涉及结构化数值字段异常识别或分组均值标准差一致性检查,就应该使用此skill。 不负责字段固定阈值上下限校验、枚举值校验、时间序列缺失/频率校验或格式转换。
    0
    installs
  82. Table Schema Structure Check · cas-bigdatalab bundle
    格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。
    0
    installs
  83. Hydro Susceptibility Operator · cas-bigdatalab bundle
    Hydro Susceptibility Operator
    0
    installs
  84. PDF Metadata Extract Restored · cas-bigdatalab bundle
    提取 PDF 文件元数据并输出 JSON 结果。 当用户提到把这次流程沉淀成 skill、保存为 skill等需求时使用此 skill。
    0
    installs
  85. Qc3 Numericdatathresholdcheck · cas-bigdatalab bundle
    数值数据阈值检验工具。读取结构化数据文件(CSV、TSV、Excel等),检查数值字段是否在指定的门限范围内,不允许超出门限值之外,最后输出为同格式的文件。当用户需要对数据进行阈值检验、数值范围检查、数据质量控制等操作时使用此skill。
    0
    installs
  86. Text Entity Dependency Filter · cas-bigdatalab bundle
    文本实体依赖过滤器。识别文本中与其他令牌独立的实体,并对其进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到实体依赖过滤、文本实体检测、依存关系过滤、实体独立性过滤等需求时使用此skill。
    0
    installs
  87. Missing Operator Stop · cas-bigdatalab bundle
    用于 Workflow Planning 阶段的占位算子。当前 Skill 库不存在满足用户需求的业务 Skill 时,使用本算子保持 DAG 数据流完整,等待后续生成真实 Skill 后替换。
    0
    installs
  88. Fullwidth Halfwidth Normalizer · cas-bigdatalab bundle
    全角/半角字符规范化工具。读取结构化数据文件,将文本中的全角ASCII字符(字母、数字、标点)转换为半角形式, 并可按需执行指定 Unicode 正规化。适用于中日韩混排科研文本的统一预处理,不负责空白行删除、拼写纠错或重复标点合并。 当用户提到全角转半角、半角规范化、全半角统一、全角字母数字转换等需求时使用此skill。
    0
    installs
  89. Specified Numeric Field Filter · cas-bigdatalab bundle
    指定数值字段过滤器。根据指定的数值字段信息进行筛选。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到数值字段过滤、字段范围筛选、数值范围过滤、元数据数值过滤、按数值过滤等需求时使用此skill。
    0
    installs
  90. Pi Addmonotonicallyincreasingid · cas-bigdatalab bundle
    添加单调递增ID工具。读取结构化数据文件,检查是否存在指定的ID字段(默认为ID0000), 如果不存在则添加从1开始的单调递增ID字段,并将其放在第一列,最后输出为相同格式的文件。 当用户提到添加ID、添加自增ID、添加序号、添加行号等需求时使用此skill。 即使用户没有明确说出"添加ID",只要任务涉及给数据添加自增ID,就应该使用此skill。
    0
    installs
  91. LLM File Transform Stop · cas-bigdatalab bundle
    LLM 文件转换算子。用于读取一个文本文件,按照给定指令调用大模型进行内容转换,并输出新的文本文件。
    0
    installs
  92. Most Relevant Entities Aggregator · cas-bigdatalab bundle
    最相关实体聚合工具。从文档中提取与给定实体最相关的指定类型实体,并按重要性排序。 当用户提到提取相关人物、查找相关实体、排序实体、分析实体关系、提取主要角色等需求时使用此skill。 即使用户没有明确说出"最相关实体",只要任务涉及从文档中分析并提取与目标相关的实体, 就应该使用此skill。
    0
    installs
  93. Qc6 Singlefieldmultithresholdcheck · cas-bigdatalab bundle
    单字段多条件阈值检验工具。读取被检验表和阈值表,将指定字段的属性项值与阈值表中定义的多条件门限进行比对, 检查是否在门限范围内,不允许超出门限值(包括上限和下限)。不满足条件的数据会标记质控标识并输出异常数据。 当用户提到单字段阈值检验、多条件阈值检验、单字段多条件检查等需求时使用此skill。 即使用户没有说出"单字段多条件",只要任务涉及根据多个条件进行单字段阈值校验,就应该使用此skill。
    0
    installs
  94. Piflow Skill Generator Planner · cas-bigdatalab bundle
    PiFlow 技能生成器。当用户完成了一次完整并成功的数据处理任务时调用,根据当前 skills/generated 的本地约定和 references/piflow_skill_template.md 通用模板创建、更新或校验 PiFlow-compatible skill,包括 UTF-8 编码的 SKILL.md、DAG 可读的 input_params/output_params、version/tag 元数据、skill.json、scripts/references/assets 资源目录,以及本地校验脚本。仅在用户明确要求生成或保存 skill,或某次数据处理任务已经完成并需要把已验证成功的操作流程沉淀为 skill 时使用;默认不要因为“可能需要 skill”或“当前能力不足”而优先触发此 skill。
    0
    installs