wc-organize:短视频语料整理
只做一件事:把短视频 CSV 变成方便阅读、仍能核对每项数据的 Markdown 断行稿。
输入与范围
- 输入必须是 CSV,并且有短视频正文列。用 CSV 解析器读取引号、逗号和字段内换行,不能按文本行拆记录。
- 默认处理全部记录,不自动截取高赞前 50。用户指定范围时,在临时目录提取准确子集,临时 CSV 名称包含原文件名及范围(如
原名·高赞前10.csv),再按同一流程转换;脚本据此在成品文件头标明来源及范围。输出仍放回用户指定的原语料目录。 - 每个 CSV 对应一个
{CSV文件名去扩展名}·断行整理版.md,放在源文件同目录,用户指定位置时从其要求。已有同名成品先读回;只有已获更新授权才覆盖,否则使用不冲突的新文件名。 - 正文、标题、点赞字段根据实际列名识别。正文列有多个候选或含义不明确时,只问必要的字段映射;点赞字段缺失时保留源顺序,否则按点赞数降序稳定排列。
- 全部非正文字段直接从 CSV 取原字段名与原值:ID、作者、标题、发布时间、播放/点赞/评论/收藏/分享、时长、各类链接、来源和额外字段都保留。零值不是缺失值;不把数字字符串转换后写回,不猜时长单位,不把空值填成零。
- 空正文记录照常保留数据,只写“正文为空,未做断行。”,不编造开局或机制。
- 收到 MD、XLSX、账号分析、写标题或改写文案的任务时,说明本工具的 CSV 转换范围;不擅自扩展工作或把其他材料伪装为 CSV。
清洗与断行
原始 CSV 始终保持不变。仅修正能由同篇上下文、标题、专名复现或明确固定表达证实的转写错字;已校对文本不重复清洗。无法确定的词、年份、人名、标点或疑似背景声保留原样,不用猜测消除疑点。实际改动仅写入临时转换计划,用于重建校验,不生成清洗清单或其他交付文件。
断行只增加换行与段落,不移动、改写、删减或补充正文字符和标点:
- 默认
。?!是强边界,逗号是候选边界,标点留在原处。按口播中一次功能完整的气口断行,不机械一逗号一行。 - 顿号列举及收尾、被引用的示范文案、报幕加短口诀、紧密排比、不可拆的动宾或修饰关系通常合成一拍。不能为了把后面的成绩或承诺算进首拍而强行合句。
- “我说真的/说实话/老实说”如果只修饰紧随判断,合在同一拍;“问你个问题/你先听我说”本身能独立召唤观众,按真实结构分拍。
- 无标点长句按语义单元补换行,不补标点。孤立人名/称谓后才接动作时可单独一拍;连续多个“数字+单位”的完整数据块可分别断行,不能拆坏限定关系。
- 以源文本能支持的语义停顿为准,不声称已核对未提供的音视频。拿不准时保留较完整的功能单元。
分区与首拍标记
- 开局:建立问题、悬念或承诺,尚未正式给出答案的部分。
- 交付:从第一次明确给答案、讲方法、演示或推进核心事件的位置开始。每个完整的“提出缺口到兑现”循环成一段,用空行分隔;新招式/步骤报幕优先放在新段首。
- 收束:最后一项内容兑现之后的总结、号召、签名或互动。
按真实功能定界,不按固定句数或比例切割。开局和收束内部每拍换行,不另拆小段。原文直接开始交付,或在叙事中结束时,可以没有独立开局或收束;省略不存在的区间,不补写正文,不强行把最后一句挪为收束。
整理第一拍后,阅读 references/first-beat.md 判定截停机制。只将首拍中逐字存在的原文片段与机制配对,允许复合,但同一片段与机制不重复登记。表格放在开局正文下方,使用“对应片段|截停机制”两列。不输出载体分类、抽象模板或判断解释。七种机制均不成立时不生成空表;没有开局的记录也不额外添加机制表。
成品样式
每篇顺序固定:文章标题 → 数据表 → 开局正文及首拍机制表 → 交付正文 → 收束正文。以下为自拟教学示例:
## 001|衬衫收纳
| 数据项 | 原值 |
| --- | --- |
| 作者 | 示例作者 |
| 点赞数 | 00120 |
| 播放量 | 0 |
### 开局
今天我们来试试怎样把衬衫叠得不容易起皱。
| 对应片段 | 截停机制 |
| --- | --- |
| 今天我们来试试 | 强制对话 |
| 怎样 | 发问 |
| 把衬衫叠得不容易起皱 | 价值承诺 |
### 交付
先把衬衫平铺好,
把袖子顺着衣身收进去。
### 收束
下次收行李时试试看。
上例只展示版式。实际数据表保留每个非正文字段,正文保留各自原文,不能套用示例内容。段内使用 Markdown 硬换行,让预览也保持一行一拍。
最终仅交付 Markdown。文件头只简记来源、范围与排序,不复述方法论。正文之外不新增下列内容,也不换名称、移到脚注或文件头重新输出:
- 转写标点存疑、段界/区间/截停存疑及其他待裁决表。
- 清洗改动清单、首拍判断说明、机械校验摘要及同类附录或报告。
<details>折叠区、原始数据 JSON、冗余的原文全文副本。
这些限制约束执行者新增的包装;源文或源字段中本来有同名文字时,照常保留并转义为普通文字,不删除数据。
执行与校验
使用随附的 Python 3 标准库脚本完成 CSV 读取、数据排版和校验,人工语义判断保存在临时计划里。计划格式与命令见 references/conversion-plan.md。
inspect读取输入和原值,确认字段与范围。- 逐篇阅读完整正文,整理气口、分区与首拍片段,填写临时计划;批量可分给 subagent,最后统一按源记录编号合并。
render验证计划覆盖全部记录,按声明的清洗改动重建正文,逐字核对断行拼回结果,再从源 CSV 生成数据表与 Markdown。check读回实际成品,检查与经过验证的转换结果一致。临时计划不放在语料目录,也不作为交付物。- 抽查头部、末篇、清洗记录、空正文、复合机制和无机制记录,确认语义判断合理;机械一致不代表断句或机制一定正确。发现问题先改计划,再重新生成、校验。
任一步失败,不交付半成品或用报告代替修复。确实缺少必要输入时,简短指出受影响记录与缺失信息,不伪称完成。最终回复只给文件、完成范围和必要的未完成说明。