# Author Methodology Analysis

> 基于多篇作者、博主、公众号或品牌内容的正文，进行全面、可解释、可复核的数据分析，覆盖样本质量、发布节奏、选题结构、关键词概念、标题策略、篇章结构、论证方式、证据体系、案例实体、语言风格、情绪立场、读者收益、行动引导、视觉使用、时间演化和维度关联，并进一步提炼作者定位、内容资产、选题系统、分析框架、判断标准、表达模板、案例库、金句风格、内容机会和写作 SOP。默认生成本地 Markdown 报告、独立文案框架、HTML 看板并同步飞书；只有用户明确关闭时才跳过 HTML 或飞书。

- Skill: `freestylefly/author-methodology-analysis` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add freestylefly/author-methodology-analysis`
- Raw SKILL.md: https://api.skillmd.com/api/skills/freestylefly/author-methodology-analysis/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Web & Frontend
- Author: freestylefly (https://skillmd.com/u/freestylefly)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/freestylefly/author-methodology-analysis

---


# 作者内容方法论分析

## 输入契约

调用方应提供：

- `input_dir` 或明确的文件列表/文档内容
- `output_dir`
- 作者或账号名
- 可选的文章清单，最好包含标题、链接和发布时间
- `generate_html`：默认 `true`
- `sync_lark`：默认 `true`

输入不足时先寻找工作区内可发现的内容；仍无正文样本才询问用户。不得只看标题分析。

支持格式与处理边界：

- Markdown/TXT：使用内置解析器。
- DOCX：优先使用 `python-docx`；不可用时明确报错。
- 可提取文本的 PDF：优先使用 `pypdf`；扫描 PDF 无文本时标记需要 OCR，不伪造正文。
- 飞书文档：先按当前 `lark-doc` skill 读取，再把正文作为输入。
- 多种格式混合时统一转换为文章记录，但保留原始文件路径和来源类型。

## 输出契约

始终写入调用方提供的 `output_dir`：

```text
<output_dir>/
  <博主>-方法论报告.md
  <博主>-文案框架.md
  <博主>-分析数据.json
  <博主>-文章特征.csv
  <博主>-方法论看板.html                  # 默认生成的学习者视角看板
  <博主>-飞书同步.json                    # 成功同步后生成
  <博主>-竞品标题样本.json                # 提供竞品样本时生成
```

所有根目录产物统一使用“`<博主>-<功能>.<扩展名>`”命名。`<博主>-分析数据.json` 和 `<博主>-文章特征.csv` 是可审计交付物，不是临时文件。报告、HTML 和飞书内容必须使用同一份分析数据。只有用户明确要求“不生成 HTML”或“不同步飞书”时才关闭对应步骤。

本 skill 自行根据 `references/copywriting-framework-template.md` 生成文案框架，不依赖名为 `creator-copywriting-framework` 的外部 skill。

## 工作流

### 1. 建立样本清单

- 运行确定性分析脚本：

  ```bash
  python3 scripts/analyze_corpus.py \
    --input "<input_dir>" \
    --output "<output_dir>"
  ```

- 脚本负责格式解析、去重、图片引用保留、基础统计和文章级特征。
- 少于 5 篇时只做描述性分析并明确低稳定性；少于 3 篇时不得输出趋势、演化或稳定风格结论。
- 超过 50 篇时优先全量做基础统计；只有上下文或处理成本明显过高时才抽样，并披露抽样方法。

### 2. 预处理正文

- 删除导航、广告和版权尾注等噪声。
- 图片 Markdown 从纯文本分析副本中移除，但必须在文章记录中保留原始位置、相对路径和相邻文本，供视觉分析使用。
- 保留标题层级、列表、引用、案例、数据和结论段。
- 区分原文片段与模型归纳，保留证据到文章标题的映射。

### 3. 详细数据分析

先读取 `<博主>-分析数据.json` 和 `<博主>-文章特征.csv`，再按 `references/data-analysis-framework.md` 完成解释性分析。确定性指标不得由模型重新估算。默认覆盖：

- 样本质量与数据完整性
- 发布频率、周期、连续性和时间分布
- 篇幅、段落、句子、图片和结构复杂度
- 主题、母题、对象、场景、问题与内容类型分布
- 关键词、术语、概念组合和语义关联
- 标题长度、钩子、句式、对象、承诺和标题正文一致性
- 开头、正文、转折、结论、CTA 和常见叙事路径
- 观点、事实、因果、对比、反例、边界和建议等论证单元
- 数据、引用、实测、案例、权威来源和经验等证据类型
- 人物、公司、产品、技术、事件、行业、地点和模型等实体网络
- 强弱判断、确定性、时间尺度、风险态度和价值取向
- 词汇、句长、节奏、修辞、口语化、专业度和可读性
- 目标读者、使用场景、痛点、内容承诺和读者收益
- 评论、领取资料、购买等正文行动引导（仅作为写作结构观察）
- 图片密度、图文位置和视觉内容作用（数据可得时）
- 主题、表达和判断随时间的演化（发布时间可得时）
- 主题与标题、结构、证据、篇幅、CTA 等维度的交叉关系
- 异常样本、内容缺口、过度集中和可系列化机会
- 不分析平台后台的阅读、分享、点赞、收藏、关注或转化表现
- 标题方法拆解：整体统计数字具体、悬念问题、痛点冲突、热点时效、收益明确；代表标题解释公式、原因、仿写方法和适用条件
- 文章结构示范：用开头任务、中段任务、结尾任务解释节奏，并提供学习者可执行的练习
- 更新节奏怎么学：用发布日、星期分布、同日多篇和文章间隔观察作者的内容供给方式，再按学习者的时间、证据积累速度和创作阶段设计可持续节奏
- 竞品选题雷达：公开搜索同行标题并记录来源链接、选题类型和样本边界

数据和代表样本只用于解释作者的方法，不能把看板写成评分、自检、通过/不通过或改进作者的报告。平台后台表现指标不进入看板。其他不能计算的内容不得估算或编造。词频不能直接等同于作者态度；主题、金句、情绪和立场等主观标签必须说明分类规则与证据。

默认采用学习者视角输出，而不是只评价博主。每个核心模块都要说明：

- 这个博主具体怎么做；
- 为什么这种方法有效；
- 哪些能力值得学习；
- 学习者可以执行什么练习；
- 哪些依赖个人经历、资源或平台条件，不能直接照搬；
- 如何判断方法已经迁移成自己的能力，而不是只模仿表面风格。

主观标签需要写入 `<博主>-分析数据.json` 的 `annotations`，每条包含：

```text
dimension,label,article_ids,evidence,rule,confidence
```

这样报告中的主题、立场、读者和金句结论可回溯到文章。

### 4. 提炼方法论

主报告使用 `references/report-template.md`。数据章节引用 `<博主>-分析数据.json` 中的指标和文章 ID，不重复制造第二套数字；方法论章节负责解释数据事实，至少包含：

报告“样本说明”必须写入 `dataset_sha256`，供一致性校验。

1. 作者定位与内容人设
2. 读者画像与内容收益
3. 内容资产地图
4. 选题系统
5. 分析框架
6. 判断标准
7. 表达模板
8. 案例库
9. 金句风格
10. 内容缺口与选题机会
11. 可复用写作 SOP
12. 风险与边界
13. 样本清单

每个关键结论尽量引用 2-5 篇文章标题、短片段或案例。原文摘录保持必要且简短；抽象模板必须标注“抽象模板”，结构化示例必须标注“非作者原文”。

### 5. 生成独立文案框架

使用 `references/copywriting-framework-template.md` 生成 `<博主>-文案框架.md`。模板只规定结构，不预置任何作者风格句式；所有公式必须从样本证据归纳，包括：

- 选题脚手架
- 8-15 条标题公式
- 多类开头模板
- 至少 3 套正文结构
- 段落句式和转场句
- 金句句式生成器
- 结尾 CTA
- 1-2 个换主题、换案例、换措辞的结构化示例
- 发布前检查清单与禁用边界

只学习结构，不复刻作者独特表达，不冒充作者。

### 6. 自动生成 HTML

HTML 看板是本 skill 的标准交付物，不是可选的聊天附属内容。生成时必须读取
`references/interactive-dashboard-template.md`，并直接使用本 skill 内置的
`scripts/generate_dashboard.py`，不得临时改用另一套通用 BI 模板。

默认运行：

```bash
python3 scripts/generate_dashboard.py \
  --data "<output_dir>/<博主>-分析数据.json" \
  --output "<output_dir>/<博主>-方法论看板.html"
```

HTML 与 Markdown 必须共享 `<博主>-分析数据.json` 中的确定性统计。模型生成的方法论摘要可以作为附加数据写回 `annotations`，不得覆盖脚本计算字段。

看板必须保持以下固定结构：

1. 一页看懂
2. 定位与价值
3. 内容地图
4. 选题方法
5. 文章写法
6. 观点与证据
7. 语言风格
8. 值得学习
9. 运营增长
10. 学习与迁移

所有章节站在学习者视角，重点回答“我应该学习什么、我要怎么学”，不得改回作者自检、文章评分或平台表现分析。页面底部只保留简短的来源说明与免责声明，不设置独立的“数据与边界”章节。

生成后用浏览器检查控制台、主要交互和视觉可读性。

仅当用户明确要求不生成 HTML，即 `generate_html=false` 时跳过。

### 7. 自动同步飞书

先检查来源边界：

- 样本全部来自公开 URL 或公开文章归档：默认同步。
- 样本来自本地访谈、内部文档、私密飞书文档，或敏感扫描命中：暂停自动上传并请求用户确认。

确认可同步后加载 `lark-doc`：

1. 先完成本地 Markdown。
2. 若 `<博主>-飞书同步.json` 中已有可访问 `doc_token`，更新该文档；否则创建新文档。
3. 按当前 `lark-doc` skill 的接口规范写入并读取校验。
4. 将 `doc_token`、URL、标题、内容指纹和更新时间写入 `<博主>-飞书同步.json`。
5. 校验关键章节存在后返回 URL。

飞书失败不得影响本地文件完成状态。

仅当用户明确要求不同步飞书，即 `sync_lark=false` 时跳过。

## 质量门槛

- `<博主>-分析数据.json` 与 `<博主>-文章特征.csv` 必须由脚本生成。
- 结论基于正文并披露样本边界。
- 可观察统计与主观归纳明确区分。
- 数据分析尽量覆盖所有可计算维度，并明确不可得字段。
- 每项重要统计都说明口径、分母、分类规则或计算方式。
- 每个数据模块都连接到代表文章和方法论启发。
- 每个核心模块都有证据和可复用动作。
- 案例不足时明确写“未形成稳定案例库”。
- 不推断无法从样本支持的作者意图。
- 本地输出路径全部位于 `output_dir`。
- HTML 和飞书默认完成；用户明确关闭时记录跳过原因。
- HTML 导航必须为十个固定章节，底部必须包含来源说明和免责声明。
- HTML 不得出现独立的“数据与边界”章节，不得出现“自检、评分、通过/不通过”等面向作者的评价模块。
- 最终运行：

  ```bash
  python3 scripts/validate_outputs.py "<output_dir>"
  ```

## 参考资料

- `references/report-template.md`：生成主报告时读取。
- `references/data-analysis-framework.md`：执行详细数据分析时读取。
- `references/copywriting-framework-template.md`：生成独立文案框架时读取。
- `references/interactive-dashboard-template.md`：默认生成 HTML 时读取。
- `references/analysis-data.schema.json`：共享分析数据结构。
- `scripts/analyze_corpus.py`：解析语料并生成确定性特征数据。
- `scripts/generate_dashboard.py`：从共享数据源生成离线 HTML。
- `scripts/validate_outputs.py`：校验数据、报告、HTML 和同步元数据的一致性。

