cas-bigdatalab
- 194 skills
- 0 followers
- 8 hours ago last updated
- ▌ CSV Formatter 2 · cas-bigdatalab bundleCSV格式化器。用于加载和格式化csv类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到CSV格式化、CSV数据加载、读取CSV文件、CSV转JSONL等需求时使用此skill。
- ▌ PDF Crop · cas-bigdatalab bundle裁剪PDF页面边距。通过指定边界坐标(left,bottom,right,top)来裁剪页面区域。当用户需要裁剪PDF页面时使用此skill。
- ▌
- ▌
- ▌
- ▌
- ▌
- ▌ Gjf Editor · cas-bigdatalab bundle用于编辑或创建 Gaussian 输入文件(.gjf),支持添加 Link 0 指令(%chk、%oldchk、%nprocshared、%mem)、Route 行关键词、电荷和多重度。可对已有 gjf 文件进行参数填充,也可从零创建新的 gjf 文件。
- ▌ PDF Create · cas-bigdatalab bundle从零创建PDF文件工具。使用reportlab库生成专业PDF文档,支持自定义页面大小、标题、作者、 以及通过JSON配置内容结构(标题、段落、表格等)。当用户需要生成PDF报告、文档时使用此skill。
- ▌
- ▌
- ▌
- ▌
- ▌ Data Masking · cas-bigdatalab bundle数据脱敏工具。对结构化数据中的敏感字段进行字符遮蔽脱敏,保留字段位置并用遮蔽字符替换手机号、身份证、姓名、邮箱、银行卡等内容。 当用户提到数据脱敏、隐私保护、敏感字段遮蔽、PII 处理等需求时使用此 skill。 与 privacy_token_remover 区分开:本 skill 负责字段级遮蔽,不负责删除文本中的隐私标识,也不负责生成假数据。
- ▌ Dc3 Roundoff · cas-bigdatalab bundle四舍五入数据处理工具。读取结构化数据文件和标准配置文件,根据配置对数字型字段进行四舍五入处理, 然后输出为相同格式的文件。当用户提到四舍五入、数字取整、保留小数位、数据舍入等需求时使用此skill。 即使用户没有明确说出"四舍五入",只要任务涉及根据配置文件对数据进行舍入处理,就应该使用此skill。
- ▌ Pipeline Add · cas-bigdatalab bundle将用户输入的整数加10并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。
- ▌ Bdbe Cellanno · cas-bigdatalab bundle本skill是用于单细胞测序数据分析的专用技能,首先需要用户上传需要处理的单细胞测序数据,再对经过预处理的单细胞表达数据进行自动化细胞类型注释。它通过基因比对、数据标准化、降维等一系列流程,将细胞聚类结果与已知参考数据库进行匹配,从而为每个细胞分配生物学功能标签。
- ▌ Chemdb Search · cas-bigdatalab bundle用于检索化学物质详细信息的技能。当用户希望检索化学物质详细信息、查看化学物质详细信息、检索化学物质基础数据库等情况时触发。该技能通过输入化学分子式(必要参数)以及分页(可选参数)、分页大小(可选参数)调用外部化学物质基础数据库搜索服务,并按字段含义格式化展示查询结果以及SVG化学分子式结构。
- ▌ CSV Formatter · cas-bigdatalab bundleCSV格式化器。用于加载和格式化csv类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到CSV格式化、CSV数据加载、读取CSV文件、CSV转JSONL等需求时使用此skill。
- ▌ Data Splitter · cas-bigdatalab bundleJSONL比例切分工具。读取JSONL数据集,按给定比例拆成多个子集,支持随机切分和按字段分层切分。 当用户明确提到按比例拆分JSONL、训练集/验证集/测试集切分、分层保持类别分布等需求时使用此skill。 即使用户没有明确说出"切分",只要任务是把一份JSONL按比例分成多个子集,就应该使用此skill。 不负责按固定条数均匀分块,不负责按份数切块,也不负责处理非JSONL输入。
- ▌
- ▌ Naive Grouper · cas-bigdatalab bundle将所有样本分组为一批样品。当用户提到样本合并、合并所有样本、一批分组、全部聚合等需求时使用此skill。 即使用户没有明确说出"合并",只要任务涉及将多个样本合并为单个批次,就应该使用此skill。
- ▌ Suffix Filter · cas-bigdatalab bundle后缀过滤器。过滤器以保留具有指定后缀的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到后缀过滤、文件类型过滤、按文件后缀筛选等需求时使用此skill。
- ▌ Text Splitter · cas-bigdatalab bundle长文本规则切分工具。将超长文本按照段落、句子、固定字符长度、非空行或科研论文章节标题进行自动切分,生成粒度均匀的短文本片段。 当用户提到文本切分、长文本拆分、按段落分割、按句子分割、文本分块、论文章节切分等需求时使用此skill。 适用于科研论文、实验综述、长篇文稿等资料的粒度拆分需求。 不负责采样、清洗、格式转换或PDF解析。
- ▌ Tsv Formatter · cas-bigdatalab bundleTSV格式化器。用于加载和格式化tsv类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到TSV格式化、TSV数据加载、读取TSV文件、TSV转JSONL等需求时使用此skill。
- ▌
- ▌ Content Parser · cas-bigdatalab bundle内容解析预处理工具。读取采集后的 JSONL、JSON 或 TXT 文本记录,执行轻量内容解析,输出带标题、段落结构和内容类型的统一解析记录文件。 当用户提到接入内容解析、采集后预处理、提取标题和段落、识别 plain/markdown/html 内容结构等需求时使用此 skill。 即使用户没有明确说出"内容解析",只要任务涉及把已采集文本内容解析成统一结构,就应该使用此 skill。 不负责文件采集、表格抽取、内容清洗、质量校验、过滤筛选或格式转换。
- ▌
- ▌ Multiwfn Skill · cas-bigdatalab bundle使用 Multiwfn 波函数分析程序读取 Gaussian 生成的 .fchk 文件,提取 HOMO/LUMO、原子电荷、分子表面分析等信息。
- ▌ Pi Datasorting · cas-bigdatalab bundle数据排序工具。读取结构化数据文件,根据指定字段进行升序或降序排序,最后输出为相同格式的文件。 当用户提到数据排序、升序排列、降序排列、按某字段排序等需求时使用此skill。 即使用户没有明确说出"排序",只要任务涉及对数据进行排序,就应该使用此skill。
- ▌ Pipeline Minus · cas-bigdatalab bundle将用户输入的整数减去5并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。
- ▌ Random Sampler · cas-bigdatalab bundleJSONL 随机采样工具。读取 JSONL 数据集,按抽样数量或抽样比例无放回抽取样本,输出保留原字段结构的采样结果。 当用户提到随机采样、按数量抽样、按比例抽样、JSONL 抽样筛查等需求时使用此skill。 即使用户没有明确说出"random_sampler",只要任务涉及对 JSONL 记录做无放回随机抽取,就应该使用此skill。 不负责分层采样、领域均衡采样、表格采样或其他格式转换。
- ▌
- ▌ Text Collector · cas-bigdatalab bundle纯文本文件采集工具。读取单个文本文件或目录中的 txt、md、rst、log、text 文件,执行文件正文采集,输出结构化文本记录文件。 当用户提到文本文件采集、读取纯文本语料、汇总 Markdown/RST/日志文本、把本地文本文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"文本采集",只要任务涉及把本地纯文本文件内容收集成统一记录,就应该使用此 skill。 不负责文档解析、图片解析、表格读取、文本清洗或质量过滤。
- ▌ Abbrev Expander · cas-bigdatalab bundle领域缩略语展开 Skill:按内置或外部词典将独立缩略语替换为全称,可选在全称后保留原缩写。 适用于技术文本、论文摘要和业务记录中的缩写清洗;不负责模糊缩写消歧或大小写无关替换。
- ▌ Batch Collector · cas-bigdatalab bundle批量文件清单采集器。扫描一个或多个本地文件/目录,或从任务列表加载路径, 按支持的扩展名生成文件元信息清单,供后续文本、表格、文档、图像等采集流程继续处理。 当用户需要批量盘点待采集文件、生成本地文件 manifest、统计输入文件类型或为后续采集算子准备文件清单时使用此 skill。
- ▌ Clean Ip Mapper · cas-bigdatalab bundle清除文本示例中的IPv4和IPv6地址。当用户提到清理IP、删除IP地址、去除IP、清理网络地址等需求时使用此skill。 即使用户没有明确说出"IP",只要任务涉及从文本中删除或替换IP地址,就应该使用此skill。
- ▌ Data Merge Join · cas-bigdatalab bundle数据横向关联工具。读取多个结构化数据文件,按指定键进行横向关联(JOIN),输出关联后的合并文件。 当用户提到数据关联、表连接、横向合并、键合并、JOIN等需求时使用此skill。 即使用户没有明确说出"关联",只要任务涉及按某个字段将多个表的数据关联在一起,就应该使用此skill。 不负责数据纵向拼接(concat)、数据去重、或字段值聚合(GROUP BY)。
- ▌ Data Normalizer · cas-bigdatalab bundle数值标准化工具。读取JSONL数据,按指定字段执行Z-score或Min-Max标准化,并保留原始值与变更标记。 当用户提到数值标准化、归一化、字段规整、范围映射等需求时使用此skill。 即使用户没有明确说出"data_normalizer",只要任务涉及对某个数值字段做标准化处理,就应该使用此skill。 不负责四舍五入/小数位统一(见DC3_RoundOff)、文本清洗、类别编码或多字段联合统计分析。
- ▌ Empty Formatter · cas-bigdatalab bundle空数据格式化器。用于创建空数据。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到创建空数据集、生成空数据、初始化数据集、测试用空数据等需求时使用此skill。
- ▌ En Text Cleaner · cas-bigdatalab bundle英文文本基础清洗工具。读取英文科研文本,展开常见缩写、修正常见拼写错误并可选规范大小写,输出整理后的 JSONL 数据。 当用户提到英文文本清洗、英文缩写展开、英文拼写纠正、英文文本规整等需求时使用此skill。 适合外文论文、英文实验记录的基础规整,不负责翻译、语法改写或跨语言语义修复。
- ▌ Format Detector · cas-bigdatalab bundle接入资源格式识别工具。读取单个文件或目录中的接入资源,识别文本、表格、文档、图像、HTML、数据或未知类型,输出带推荐处理路由的格式识别结果文件。 当用户提到格式识别、资源类型预判、采集入口分流、为文本/表格/文档/图像/HTML 选择后续处理路径等需求时使用此 skill。 即使用户没有明确说出"格式识别",只要任务涉及在采集入口判断文件类型并分配推荐处理路由,就应该使用此 skill。 不负责读取正文内容、提取图像元信息、表格采集、文档解析、格式转换或实际执行后续处理。
- ▌ Language Filter · cas-bigdatalab bundle语种过滤工具。对指定或全部文本列进行语言检测,可选择保留或剔除目标语种, 输出过滤后的数据并附带 detected_lang 列。
- ▌ Local Formatter · cas-bigdatalab bundle本地格式化器。类用于从本地文件或本地目录加载数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到加载本地数据集、读取本地文件、格式化本地数据、数据集加载等需求时使用此skill。
- ▌ Openbabel Skill · cas-bigdatalab bundle分子格式转换工具。支持在 .smi、.mol、.xyz、.gjf、.sdf 等格式之间转换,并可从 SMILES 或 2D 结构生成带坐标的 3D 结构。 当用户提到分子格式转换、3D构象生成、openbabel等需求时使用此skill。
- ▌
- ▌ Table Collector · cas-bigdatalab bundle表格文件采集工具。读取单个表格文件或目录中的 csv、tsv、xlsx、xls 文件,执行行记录采集,输出统一结构化表格记录文件。 当用户提到表格采集、读取科研数据表、汇总 CSV/TSV/Excel 表格、把本地表格文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"表格采集",只要任务涉及把本地结构化表格文件内容收集成统一记录,就应该使用此 skill。 不负责表格清洗、空行删除、字段去空格、格式校验、字段过滤或格式转换。
- ▌
- ▌ Mineru Url Parse · cas-bigdatalab bundleMinerU URL解析算子。通过远程调用MinerU接口,解析在线文档URL(支持PDF、DOC、PPT、Excel、图片等格式),获取文件解析结果(内容、公式、图片等),最终返回ZIP压缩包。 本SKILL依赖requests库,请确保已安装。
- ▌
- ▌ Qc16 Timemissing · cas-bigdatalab bundle数据时序完整性检查工具。读取时间序列数据,设定数据记录频率(如每2分钟、30分钟或60分钟), 以此频率为基准遍历数据的时间范围,检查数据时序是否完整,发现缺失与多余数据点,最后输出为相同格式的文件。 当用户提到时序完整性检查、时间序列缺失检查、时间点完整性、数据遗漏检验等需求时使用此skill。 即使用户没有说出"时序完整性",只要任务涉及检查时间序列数据是否有遗漏或多余的时间点,就应该使用此skill。
- ▌ Remote Formatter · cas-bigdatalab bundle远程格式化器。用于从huggingface hub的存储库加载数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到加载HuggingFace数据集、远程数据集加载、HuggingFace Hub等需求时使用此skill。
- ▌ Schema Validator · cas-bigdatalab bundle显式 schema 校验工具。读取结构化数据与用户提供的 schema,检查字段存在性、字段类型、枚举、范围、长度、正则格式、日期格式、表级行数与缺失率约束,并输出校验报告。 当用户提到 schema 校验、结构校验、模式校验、字段存在性检查、字段类型检查、枚举校验、范围校验、格式校验、表头结构校验等需求时使用此 skill。 即使用户没有明确说出"schema_validator",只要任务是在检查结构化数据是否符合明确 schema 规则,就应该使用此 skill。 不负责数据清洗、去重、业务合理性判断、跨字段一致性、参照完整性、分布异常分析或数据转换。
- ▌ Stopwords Filter · cas-bigdatalab bundle停用词过滤器。过滤以保持停止词比率大于特定最小值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到停用词过滤、停用词比例过滤、文本质量过滤、停用词占比检测等需求时使用此skill。
- ▌ Token Num Filter · cas-bigdatalab bundleToken数量过滤器。筛选器将总令牌数的样本保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到token数量过滤、文本token数筛选、按token数过滤、文本分词过滤等需求时使用此skill。
- ▌ Weighted Sampler · cas-bigdatalab bundle加权采样算子。读取JSONL记录,按数值型权重字段执行随机采样,支持有放回和无放回两种模式。当用户提到加权抽样、按权重抽样、优先级采样、重要性重采样等需求时使用此skill。即使用户没有明确说出“加权采样”,只要任务涉及按记录权重选择样本,就应该使用此skill。不负责按类别分层均衡、普通随机采样或文本内容过滤。
- ▌ Words Num Filter · cas-bigdatalab bundle单词数量过滤器。过滤器,以保持总字数在特定范围内的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到单词数量过滤、文本字数筛选、按单词数过滤、按字数过滤等需求时使用此skill。
- ▌ Bdbe Sexdetermine · cas-bigdatalab bundle本skill是用于单细胞样本性别判定的专用技能,首先需要用户上传需要处理的单细胞样本数据,再判定未标注性别的样本,或纠正标注错误的性别信息,生成最后的修正文件。
- ▌ Clean HTML Mapper · cas-bigdatalab bundle清理文本示例中的HTML代码。当用户提到清理HTML、去除HTML标签、HTML转文本、提取网页文本等需求时使用此skill。 即使用户没有明确说出"HTML",只要任务涉及从HTML代码中提取纯文本,就应该使用此skill。
- ▌ Data Merge Concat · cas-bigdatalab bundle数据纵向拼接工具。读取多个具有相同列结构的结构化数据文件,执行按行纵向追加合并(concat),输出单一合并文件。 当用户提到数据拼接、纵向合并、行合并、数据追加、文件合并等需求时使用此skill。 即使用户没有明确说出"拼接",只要任务涉及将多个同构数据文件上下合并为一个,就应该使用此skill。 不负责横向关联(join/merge on key)、字段级合并或非结构化文档聚合。如需按键值关联请使用其他skill。
- ▌ Dc2 Spacecleaning · cas-bigdatalab bundle字符串空格清理工具。读取结构化数据文件(CSV、TSV、Excel等),检查所有字符串类型(object)字段, 删除字段值前后多余的空格,然后输出为相同格式的文件。当用户提到空格清理、去除空格、trim、清理字符串空格等需求时使用此skill。 即使用户没有明确说出"空格清理",只要任务涉及读取结构化文件并删除字符串字段的前后空格,就应该使用此skill。
- ▌
- ▌ Gaussian Executor · cas-bigdatalab bundle使用 Gaussian 软件执行量子化学计算,包括 DFT 结构优化、频率分析和单点能计算。生成 .log 和 .chk 文件,并将所有输出打包为 zip 压缩包。
- ▌ Image Nsfw Filter · cas-bigdatalab bundle图像NSFW内容检测过滤器。过滤器保留图像具有低nsfw分数的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图片安全检测、NSFW过滤、不良内容过滤、图片审核、图像内容过滤等需求时使用此skill。
- ▌ Image Size Filter · cas-bigdatalab bundle图像文件大小过滤器。保留图像大小 (以字节/KB/MB/... 为单位) 在特定范围内的数据样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像文件大小过滤、图片大小筛选、图像尺寸KB/MB过滤、按文件大小过滤等需求时使用此skill。
- ▌ Key Value Grouper · cas-bigdatalab bundle根据给定键中的值将样本分组为批处理样本。当用户提到样本分组、按键值分组、批处理样本、按键聚合、分组聚合等需求时使用此skill。 即使用户没有明确说出"分组",只要任务涉及将多个样本按某个字段/键的值进行归类合并,就应该使用此skill。
- ▌ Keyword Extractor · cas-bigdatalab bundle关键词提取标注工具。读取包含文本字段的表格或JSONL语料,为每条记录提取核心关键词并写入新增关键词字段。 当用户提到关键词提取、关键词抽取、文本关键词、标签提取等需求时使用此skill。 即使用户没有明确说出"keyword_extractor",只要任务涉及从文本内容中提取重要词汇或短语作为标签,就应该使用此skill。 不负责按预置领域关键词库做相关性筛选、文本清洗、分词结果展开或章节切分。
- ▌ Markdown Stripper · cas-bigdatalab bundleMarkdown标记清除工具。读取Markdown文件,去除Markdown语法标记(标题#、加粗**、斜体*、链接[]()、代码块```、引用>、列表标记等),输出纯文本文件。 当用户提到Markdown清洗、去除MD标记、MD转纯文本等需求时使用此skill。 适用于Markdown文件的语法净化,不负责CSV/表格数据的结构清洗。
- ▌ Mineru File Parse · cas-bigdatalab bundleMinerU文件解析算子。通过远程调用MinerU接口,解析本地文件(支持PDF、DOC、PPT、Excel、图片等格式),获取文件解析结果(内容、公式、图片等),最终返回ZIP压缩包。 本SKILL依赖requests库,请确保已安装。
- ▌ Mixture Formatter · cas-bigdatalab bundle混合格式化器。该类通过从每个数据集中随机选择样本并合并它们来混合多个数据集,然后将合并的数据集导出为新的混合数据集。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到混合数据集、合并多个数据集、数据集混合、数据融合等需求时使用此skill。
- ▌ Mojibake Repairer · cas-bigdatalab bundle乱码修复工具。自动检测并修复因编码错误解释导致的乱码文本(Mojibake),支持 GBK/UTF-8、Latin-1/UTF-8、 Big5、Shift_JIS 等 11 种编码链自动尝试,通过字符合理度评分自动选择最佳修复结果。 当用户提到乱码修复、编码修复、mojibake、文字乱码、编码错误等需求时使用此skill。
- ▌ Nested Aggregator · cas-bigdatalab bundle嵌套聚合工具。将多个文档碎片整合成一个连贯的文档总结。 当用户提到文档摘要、整合文档、文档聚合、碎片整合、长文总结等需求时使用此skill。 即使用户没有明确说出"嵌套"或"聚合",只要任务涉及将多个短文档整合成一个总结, 就应该使用此skill。
- ▌ Parquet Formatter · cas-bigdatalab bundleParquet格式化器。用于加载和格式化parquet类型的文件。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到Parquet格式化、Parquet数据加载、读取Parquet文件、Parquet转JSONL等需求时使用此skill。
- ▌
- ▌ Perplexity Filter · cas-bigdatalab bundle困惑度过滤器。过滤以保留困惑度分数小于特定最大值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到困惑度过滤、文本困惑度检测、语言模型分数过滤、文本质量过滤等需求时使用此skill。
- ▌ Pipeline Multiply · cas-bigdatalab bundle将用户输入的数字乘以10并返回结果。当用户提到「流水线」关键词时并提供数字时使用,并且此方法是「流水线」系列技能之一,能与其他技能之间传递结果。
- ▌ Qc8 Datatypecheck · cas-bigdatalab bundle数据类型检查工具。读取被检验表,检查指定数值型字段的数据类型是否正确(是否能转换为数值型), 并标记不合格的数据点,最后输出为相同格式的文件。 当用户提到数据类型检查、数值类型校验、字段类型检查、数据格式校验等需求时使用此skill。 即使用户没有说出"数据类型检查",只要任务涉及检查数据字段类型是否正确,就应该使用此skill。
- ▌ Read File And Add · cas-bigdatalab bundleadd all numbers in a text file by 10 and save to a new file. Use when user mentions read a file add numbers by 10, process number file, batch calculation.
- ▌ V9 Markfieldcheck · cas-bigdatalab bundle标识符字段检查工具。读取结构化数据文件,检查是否存在指定的质量标识符字段(默认为QC0000), 如果不存在则添加该字段,最后输出为相同格式的文件。当用户提到标识符字段检查、添加质量标识符、QC字段检查等需求时使用此skill。 即使用户没有明确说出"标识符字段",只要任务涉及检查或添加质量标识符字段,就应该使用此skill。
- ▌ Bracket Normalizer · cas-bigdatalab bundle括号类型统一工具。读取结构化数据文件,执行中文/全角括号到 ASCII 半角括号的映射,输出括号已统一的结构化数据文件。 当用户提到括号统一、全角括号转半角、中文括号转换、括号规范化等需求时使用此skill。 即使用户没有明确说出"bracket_normalizer",只要任务涉及括号类符号统一,就应该使用此skill。 不负责全角字母数字转换、Unicode正规化或其他通用全半角处理。
- ▌ Clean Email Mapper · cas-bigdatalab bundle清理文本样本中的电子邮件。当用户提到清理邮件、删除邮箱、去除邮件地址、清理个人信息等需求时使用此skill。 即使用户没有明确说出"邮件",只要任务涉及从文本中删除或替换邮箱地址,就应该使用此skill。
- ▌ Clean Links Mapper · cas-bigdatalab bundle清理文本中的链接(HTTP/HTTPS/FTP)。当用户提到清理链接、删除URL、去除超链接、清理网页链接等需求时使用此skill。 即使用户没有明确说出"链接",只要任务涉及从文本中删除或替换URL链接,就应该使用此skill。
- ▌ Encoding Converter · cas-bigdatalab bundle多编码文本统一转换工具。读取文本文件或目录,自动识别源编码并转换为目标编码(默认 UTF-8),输出转换后的文件。 当用户提到编码转换、乱码修复、GBK 转 UTF-8、统一文件编码等需求时使用此 skill。 即使用户没有明确说出“编码转换”,只要任务涉及把文本文件转成指定编码,就应该使用此 skill。 不负责非文本二进制文件处理、内容清洗或格式转换。
- ▌ Image Deduplicator · cas-bigdatalab bundle图像去重工具。使用图像哈希精确匹配在文档级别删除包含重复图像的样本。 当用户提到图像去重、删除重复图片、图片去重、清理重复图像等需求时使用此skill。 即使用户没有明确说出"图像去重",只要任务涉及从包含图像的数据中删除重复图片, 就应该使用此skill。
- ▌ Image Shape Filter · cas-bigdatalab bundle图像形状过滤器。过滤器保持样品的图像形状 (w,h) 在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到图像尺寸过滤、图片宽高筛选、图像分辨率过滤、按图片大小过滤、图像形状限制等需求时使用此skill。
- ▌ Qc14 Timepeakvalue · cas-bigdatalab bundle尖峰检验(连续剧烈变化检测)工具。读取时间序列数据,识别在连续N次的相邻读数之间的差值(变化量)的绝对值都高于预设阈值的异常数据,最后输出为相同格式的文件。 当用户提到尖峰检验、连续剧烈变化检测、峰值检测、时间序列突变检查等需求时使用此skill。 即使用户没有说出"尖峰检验",只要任务涉及检查时间序列数据的剧烈变化,就应该使用此skill。
- ▌ Scichem Normalizer · cas-bigdatalab bundle科学公式/化学式规整 Skill:统一文本列中的数学符号、Unicode 上下标、化学反应箭头、全角 ASCII 和多余空格。 适用于实验记录、论文摘录、化学反应式和科学公式文本;不负责公式语义解析、单位换算或化学配平。
- ▌ Stratified Sampler · cas-bigdatalab bundle结构化数据分层采样工具。读取 JSONL、JSON、CSV、TSV、XLSX、XLS 等结构化数据,按指定字段分层后无放回抽取样本,输出保留原字段结构的采样结果。 当用户提到分层采样、类别平衡采样、按标签抽样、训练集分层划分等需求时使用此skill。 即使用户没有明确说出"stratified_sampler",只要任务涉及按字段分层并进行代表性抽样,就应该使用此skill。 不负责随机采样、领域均衡采样、批量切分、时间窗口抽样或格式转换。
- ▌ Systematic Sampler · cas-bigdatalab bundle系统采样算子。按照固定间隔从数据中进行系统采样,适用于时间序列数据或需要均匀分布样本的场景。 当用户提到系统采样、等距抽样、按间隔取样、均匀抽样等需求时使用此skill。 即使用户没有明确说出"系统采样",只要任务涉及从有序数据中按固定步长抽取样本,就应该使用此skill。 不负责分层采样或随机采样。
- ▌ Text Action Filter · cas-bigdatalab bundle文本动作词过滤器。过滤以保留文本中包含操作的文本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到动作词过滤、动词检测、文本动作过滤、文本操作词过滤等需求时使用此skill。
- ▌ Video Deduplicator · cas-bigdatalab bundle视频去重工具。使用精确匹配(MD5哈希)在文档级别删除重复视频样本。 当用户提到视频去重、删除重复视频、清理重复视频等需求时使用此skill。 即使用户没有明确说出"视频去重",只要任务涉及从包含视频的数据中删除重复视频, 就应该使用此skill。
- ▌ Alphanumeric Filter · cas-bigdatalab bundle字母数字比例过滤器。过滤文本中字母/数字比例不在指定范围内的样本。 当用户提到文本过滤、比例筛选、字母比例、数字比例、清理乱码文本等需求时使用此skill。 即使用户没有明确说出"过滤",只要任务涉及根据文本中字母或数字的比例来筛选数据, 就应该使用此skill。
- ▌ Batch Data Splitter · cas-bigdatalab bundle批量数据均匀分片工具。读取json/jsonl/csv输入,按份数或固定条数切成多个子文件,输出一个清单JSON供下游节点消费。 当用户提到数据分割、批量拆分、数据分片、均匀分块等需求时使用此skill。 即使用户没有明确说出"分片",只要任务是把整份批量数据均匀拆成多个文件,就应该使用此skill。 不负责按字段分组导出或随机采样。
- ▌ Calibrate QA Mapper · cas-bigdatalab bundle基于参考文本校准问答对。当用户提到问答校准、校准QA、语言风格校准、问答对优化等需求时使用此skill。 即使用户没有明确说出"校准",只要任务涉及根据参考文本调整问答对使其更符合特定风格,就应该使用此skill。
- ▌ Data Split By Field · cas-bigdatalab bundle按字段拆分数据工具。根据指定字段的值将结构化表格拆分为多个文件,每个唯一值对应一个输出文件。 当用户提到数据拆分、按字段分组导出、分类导出、数据分片、按某列值分割文件等需求时使用此skill。 即使用户没有明确说出"拆分",只要任务涉及将结构化表格按某字段值分成多个文件,就应该使用此skill。 不负责字段聚合统计、行级过滤或跨表关联合并。
- ▌ Data Type Converter · cas-bigdatalab bundle数据类型转换工具。转换数据字段的类型,支持数值、字符串、日期等类型互转。 当用户提到类型转换、数据格式转换、字段类型修改等需求时使用此skill。 即使用户没有明确说出"类型转换",只要任务涉及改变字段的数据类型,就应该使用此skill。
- ▌ Duplicate Row Check · cas-bigdatalab bundle结构化表格重复行检测工具。仅检查CSV/TSV/Excel等表格型数据中的完全重复记录或指定列子集重复, 标记后续重复行并保留首次出现;不处理文本片段清理、文档去重或其他字段质控。
- ▌
- ▌ Read File And Minus · cas-bigdatalab bundleMinus all numbers in a text file by 5 and save to a new file. Use when user mentions read a file minus numbers by 15, process number file, batch calculation.
- ▌ Time Anomaly Marker · cas-bigdatalab bundle时序/数值异常标记工具。对指定或全部数值列进行 Z-Score 异常和差分突变检测, 输出 anomaly_flag 与 anomaly_reasons,不删除数据,适用于时序稳态/突变异常识别。