数据预处理R语言

完备严谨的统计学数据预处理流程(默认 R 语言,无 R 时可降级为"生成可本地运行脚本"或 Python 分支)。支持两种模式:完整全流程(10 步)或轻量局部模式(只执行用户指定的若干步骤)。10 步:分布探查→描述统计与交叉表→数据清洗(缺失/异常/一致性)→数据变换(防泄漏)→变量编码与重赋值→衍生变量与分组分层→平稳性检验(非时序跳过)→多重共线性与降维→数据集划分→结果验证。每步输出代码、配图、UTF-8 with BOM CSV;阈值(VIF>10、|偏度|>1)为默认值、可由用户覆盖;关键决策点(异常取舍、缺失填补方案)会暂停与用户确认。本技能是底层业务工具,可由 math-modeling 内部按需加载;仅做局部清洗/编码等单步处理或明确要求 Python 时按轻量模式执行,避免与 math-modeling 同时顶层触发两套流程。

jsChen-biostat Updated

File contents

jsChen-biostat/math-modelCN/tree/main/skill-prework commit c936456e4e

Frequently asked questions

npx skillmds@latest add jschen-biostat/r