# Wc Organize

> 将短视频文案 CSV 整理成保留各项原始数据的 Markdown 断行稿，按口播气口换行、分出开局/交付/收束，并用片段对照表标出首拍截停机制。用户要求整理短视频 CSV、转换带数据的断行版时使用；不处理 Markdown 输入、账号拆解或文案创作。

- Skill: `rivo2026/wc-organize` (Agent Skill, multi-file: 4 files)
- Install (CLI): `npx skillmds@latest add rivo2026/wc-organize`
- Raw SKILL.md: https://api.skillmd.com/api/skills/rivo2026/wc-organize/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Data & Analytics
- Author: Rivo2026 (https://skillmd.com/u/rivo2026)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/rivo2026/wc-organize

---


# wc-organize：短视频语料整理

只做一件事：把短视频 CSV 变成方便阅读、仍能核对每项数据的 Markdown 断行稿。

## 输入与范围

- 输入必须是 CSV，并且有短视频正文列。用 CSV 解析器读取引号、逗号和字段内换行，不能按文本行拆记录。
- 默认处理全部记录，不自动截取高赞前 50。用户指定范围时，在临时目录提取准确子集，临时 CSV 名称包含原文件名及范围（如 `原名·高赞前10.csv`），再按同一流程转换；脚本据此在成品文件头标明来源及范围。输出仍放回用户指定的原语料目录。
- 每个 CSV 对应一个 `{CSV文件名去扩展名}·断行整理版.md`，放在源文件同目录，用户指定位置时从其要求。已有同名成品先读回；只有已获更新授权才覆盖，否则使用不冲突的新文件名。
- 正文、标题、点赞字段根据实际列名识别。正文列有多个候选或含义不明确时，只问必要的字段映射；点赞字段缺失时保留源顺序，否则按点赞数降序稳定排列。
- 全部非正文字段直接从 CSV 取原字段名与原值：ID、作者、标题、发布时间、播放/点赞/评论/收藏/分享、时长、各类链接、来源和额外字段都保留。零值不是缺失值；不把数字字符串转换后写回，不猜时长单位，不把空值填成零。
- 空正文记录照常保留数据，只写“正文为空，未做断行。”，不编造开局或机制。
- 收到 MD、XLSX、账号分析、写标题或改写文案的任务时，说明本工具的 CSV 转换范围；不擅自扩展工作或把其他材料伪装为 CSV。

## 清洗与断行

原始 CSV 始终保持不变。仅修正能由同篇上下文、标题、专名复现或明确固定表达证实的转写错字；已校对文本不重复清洗。无法确定的词、年份、人名、标点或疑似背景声保留原样，不用猜测消除疑点。实际改动仅写入临时转换计划，用于重建校验，不生成清洗清单或其他交付文件。

断行只增加换行与段落，不移动、改写、删减或补充正文字符和标点：

1. 默认 `。？！` 是强边界，逗号是候选边界，标点留在原处。按口播中一次功能完整的气口断行，不机械一逗号一行。
2. 顿号列举及收尾、被引用的示范文案、报幕加短口诀、紧密排比、不可拆的动宾或修饰关系通常合成一拍。不能为了把后面的成绩或承诺算进首拍而强行合句。
3. “我说真的／说实话／老实说”如果只修饰紧随判断，合在同一拍；“问你个问题／你先听我说”本身能独立召唤观众，按真实结构分拍。
4. 无标点长句按语义单元补换行，不补标点。孤立人名/称谓后才接动作时可单独一拍；连续多个“数字＋单位”的完整数据块可分别断行，不能拆坏限定关系。
5. 以源文本能支持的语义停顿为准，不声称已核对未提供的音视频。拿不准时保留较完整的功能单元。

## 分区与首拍标记

- **开局**：建立问题、悬念或承诺，尚未正式给出答案的部分。
- **交付**：从第一次明确给答案、讲方法、演示或推进核心事件的位置开始。每个完整的“提出缺口到兑现”循环成一段，用空行分隔；新招式/步骤报幕优先放在新段首。
- **收束**：最后一项内容兑现之后的总结、号召、签名或互动。

按真实功能定界，不按固定句数或比例切割。开局和收束内部每拍换行，不另拆小段。原文直接开始交付，或在叙事中结束时，可以没有独立开局或收束；省略不存在的区间，不补写正文，不强行把最后一句挪为收束。

整理第一拍后，阅读 [references/first-beat.md](references/first-beat.md) 判定截停机制。只将**首拍中逐字存在的原文片段**与机制配对，允许复合，但同一片段与机制不重复登记。表格放在开局正文下方，使用“对应片段｜截停机制”两列。不输出载体分类、抽象模板或判断解释。七种机制均不成立时不生成空表；没有开局的记录也不额外添加机制表。

## 成品样式

每篇顺序固定：文章标题 → 数据表 → 开局正文及首拍机制表 → 交付正文 → 收束正文。以下为自拟教学示例：

```markdown
## 001｜衬衫收纳

| 数据项 | 原值 |
| --- | --- |
| 作者 | 示例作者 |
| 点赞数 | 00120 |
| 播放量 | 0 |

### 开局

今天我们来试试怎样把衬衫叠得不容易起皱。

| 对应片段 | 截停机制 |
| --- | --- |
| 今天我们来试试 | 强制对话 |
| 怎样 | 发问 |
| 把衬衫叠得不容易起皱 | 价值承诺 |

### 交付

先把衬衫平铺好，
把袖子顺着衣身收进去。

### 收束

下次收行李时试试看。
```

上例只展示版式。实际数据表保留每个非正文字段，正文保留各自原文，不能套用示例内容。段内使用 Markdown 硬换行，让预览也保持一行一拍。

最终仅交付 Markdown。文件头只简记来源、范围与排序，不复述方法论。正文之外不新增下列内容，也不换名称、移到脚注或文件头重新输出：

- 转写标点存疑、段界/区间/截停存疑及其他待裁决表。
- 清洗改动清单、首拍判断说明、机械校验摘要及同类附录或报告。
- `<details>` 折叠区、原始数据 JSON、冗余的原文全文副本。

这些限制约束执行者新增的包装；源文或源字段中本来有同名文字时，照常保留并转义为普通文字，不删除数据。

## 执行与校验

使用随附的 Python 3 标准库脚本完成 CSV 读取、数据排版和校验，人工语义判断保存在临时计划里。计划格式与命令见 [references/conversion-plan.md](references/conversion-plan.md)。

1. `inspect` 读取输入和原值，确认字段与范围。
2. 逐篇阅读完整正文，整理气口、分区与首拍片段，填写临时计划；批量可分给 subagent，最后统一按源记录编号合并。
3. `render` 验证计划覆盖全部记录，按声明的清洗改动重建正文，逐字核对断行拼回结果，再从源 CSV 生成数据表与 Markdown。
4. `check` 读回实际成品，检查与经过验证的转换结果一致。临时计划不放在语料目录，也不作为交付物。
5. 抽查头部、末篇、清洗记录、空正文、复合机制和无机制记录，确认语义判断合理；机械一致不代表断句或机制一定正确。发现问题先改计划，再重新生成、校验。

任一步失败，不交付半成品或用报告代替修复。确实缺少必要输入时，简短指出受影响记录与缺失信息，不伪称完成。最终回复只给文件、完成范围和必要的未完成说明。

