# Author Methodology Analysis

> 作者内容方法论深度分析器——基于多篇作者/博主/公众号/品牌内容的正交，进行21维度全面数据分析（样本质量、发布节奏、篇幅密度、主题分类、关键词体系、标题策略、开头模式、篇章结构、论证方式、证据体系、实体网络、判断立场、语言风格、读者收益、CTA、图片使用、时间演化、交叉关联、异常检测），提炼作者定位、选题系统、分析框架、判断标准、表达模板、案例库、金句风格、内容机会和写作SOP。默认生成本地Markdown报告、独立文案框架、HTML看板并同步飞书。适用于"分析这个博主的写作方法论""拆解XX公众号的内容策略""提炼竞品的内容套路""生成可复用写作框架"等请求。

- Skill: `jorinyang/author-methodology-analysis` (Agent Skill)
- Install (CLI): `npx skillmds@latest add jorinyang/author-methodology-analysis`
- Raw SKILL.md: https://api.skillmd.com/api/skills/jorinyang/author-methodology-analysis/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Web & Frontend
- License: MIT
- Author: jorinyang (https://skillmd.com/u/jorinyang)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/jorinyang/author-methodology-analysis

---


# 作者内容方法论深度分析器

> 来源：freestylefly/author-methodology-analysis-skill（作者苍何），适配为 Hermes Skill 格式。
> 原始许可：MIT

## 概述

基于多篇作者/博主/公众号/品牌内容的正文，进行全面、可解释、可复核的数据分析。覆盖 21 个维度，提炼作者定位、内容资产、选题系统、分析框架、判断标准、表达模板、案例库、金句风格、内容机会和写作 SOP。**学习者视角**——每个模块回答：这个博主怎么做 → 为什么有效 → 我能学什么 → 做什么练习 → 哪些不能照搬。

## 触发条件

### 通用领域触发矩阵

覆盖 5 大领域、30 个子场景。自动识别触发。

#### AI 领域
| 场景 | 触发信号 |
|------|---------|
| AI写作风格逆向 | "分析AI生成内容的特征模式""AI写作有什么规律" |
| AI产品内容营销分析 | "拆解Cursor/Windsurf的公众号文案方法论" |
| AI研究员IP分析 | "分析这个AI研究员的写作风格""提炼Karpathy的博客方法论" |
| Prompt工程反哺 | "分析优质AI博主的结构→反哺prompt设计" |
| AI竞品内容策略 | "拆解AI竞品的公众号内容策略" |

#### 咨询领域
| 场景 | 触发信号 |
|------|---------|
| 客户内容审计 | "审计XX公司的对外内容质量""分析客户公众号的品牌一致性" |
| 顾问写作标准化 | "提炼顶级顾问的写作框架""标准化咨询报告的写作方法" |
| 行业思想领导力分析 | "分析行业头部公司的白皮书方法论" |
| 交付物质量门禁 | "审查这些咨询报告是否符合专业标准" |
| 竞品方案拆解 | "拆解竞品咨询公司的方案写作套路" |

#### 企业管理领域
| 场景 | 触发信号 |
|------|---------|
| 品牌声音一致性审计 | "审计不同部门写的对外内容是否一致""检查品牌声音统一性" |
| 领导力IP孵化 | "分析CEO的公开写作风格""提炼高管的个人品牌定位" |
| 企业内容能力诊断 | "评估团队写作水平""分析企业内容团队的强项和盲区" |
| 新员工写作培训 | "提炼企业写作风格做培训材料""生成新员工写作手册" |
| 雇主品牌内容优化 | "分析招聘公众号的内容质量""优化雇主品牌话术" |

#### 数字化领域
| 场景 | 触发信号 |
|------|---------|
| 数据驱动内容策略 | "用数据决定选题方向""分析内容策略的数据依据" |
| AI辅助写作基础设施 | "提炼写作框架作为AI prompt模板""方法论→提示词转化" |
| 内容资产化 | "将隐性写作经验转化为显性知识""提炼可复用的内容组件" |
| 内容质量量化 | "量化评估内容质量""用数据说话评判文章好坏" |

#### 通用内容分析
| 场景 | 触发信号 |
|------|---------|
| 博主方法论拆解 | "分析这个博主的写作方法论""拆解XX的公众号套路""这个博主为什么写得好" |
| 竞品内容策略 | "竞品的内容策略是什么""拆解竞品公众号""分析同行的写作套路" |
| 自我内容诊断 | "分析我们自己的公众号""我们的内容有什么问题""诊断品牌内容质量" |
| 写作框架提炼 | "提炼可复用的写作框架""生成标题公式和开头模板""拆成能用的写作组件" |
| 批量内容审计 | "批量分析这些文章""审计这个文件夹里的所有文章" |

### 手动触发关键词
分析博主方法论、拆解公众号套路、内容方法论分析、作者写作风格分析、提炼写作框架、分析内容策略、文案框架生成、竞品内容拆解、品牌声音分析、写作SOP提炼、标题策略分析、金句风格提取、author-methodology、内容审计、批量文章分析、拆解写作套路

### 不触发
- 单篇文章的句子级修改（用 editorial-review-prose）
- 通用深度追问（用 advanced-elicitation）
- 去AI味（用 humanizer）
- 少于3篇文章的样本

---

## 输入契约

调用方（如 `wechat-article-archive`）应提供：

- `input_dir` 或明确的文件列表/文档内容
- `output_dir`
- 作者或账号名
- 可选的文章清单，包含标题、链接和发布时间
- `generate_html`：默认 `true`
- `sync_lark`：默认 `true`

支持格式：Markdown/TXT（内置解析器）、DOCX（`python-docx`）、可提取文本的 PDF（`pypdf`）、飞书文档（通过 `lark-doc` 读取）。

---

## 输出契约

```
<output_dir>/
  <博主>-方法论报告.md
  <博主>-文案框架.md
  <博主>-分析数据.json
  <博主>-文章特征.csv
  <博主>-方法论看板.html          # 默认生成
  <博主>-飞书同步.json            # 成功同步后生成
```

所有输出使用"`<博主>-<功能>.<扩展名>`"命名。

---

## 工作流

### 1. 建立样本清单

🔴 CHECKPOINT — 样本建立前确认：样本数量是否 ≥3 篇（<3 不输出报告）？是否 ≥5 篇（<5 只做描述性分析）？输入目录格式是否支持（Markdown/TXT/DOCX/PDF/飞书文档）？

```bash
python3 scripts/analyze_corpus.py \
  --input "<input_dir>" \
  --output "<output_dir>"
```

- 少于 5 篇时只做描述性分析并明确低稳定性
- 少于 3 篇时不得输出趋势、演化或稳定风格结论
- 超过 50 篇时优先全量做基础统计

### 2. 预处理正文

- 删除导航、广告和版权尾注等噪声
- 保留标题层级、列表、引用、案例、数据和结论段
- 区分原文片段与模型归纳

### 3. 21维度数据分析

默认覆盖维度：

| # | 维度 | 条件 |
|---|------|------|
| 1 | 样本质量与数据完整性 | 核心必做 |
| 2 | 发布节奏（频率/周期/星期分布） | 有发布时间 |
| 3 | 篇幅与内容密度（字数/段落/句子/图片） | 核心必做 |
| 4 | 主题与内容类型（母题/对象/场景/问题类型） | 核心必做 |
| 5 | 关键词与概念体系（高频词/TF-IDF/概念共现） | ≥5篇 |
| 6 | 标题策略（长度/类型/钩子/承诺/一致性） | 核心必做 |
| 7 | 开头与叙事入口（类型/转场/主题-开头组合） | ≥5篇 |
| 8 | 篇章结构（小标题/列表/叙事路径/段落功能分布） | 核心必做 |
| 9 | 论证方式（因果/对比/归纳/反证/边界说明） | ≥5篇 |
| 10 | 证据体系（类型/数量/可追溯性/一手vs二手） | 核心必做 |
| 11 | 案例与实体网络（人物/公司/产品/事件共现） | ≥5篇 |
| 12 | 判断与立场（强弱/时间尺度/价值取向） | ≥5篇 |
| 13 | 语言与可读性（词汇/句长/节奏/修辞/口语化） | 核心必做 |
| 14 | 读者收益与行动引导 | ≥5篇 |
| 15 | 内容机会与缺口 | 核心必做 |
| 16 | 竞品选题雷达（公开搜索同行标题） | ≥5篇 |
| 17 | 图片使用（密度/图位/视觉内容作用） | 有图片数据 |
| 18 | 时间演化（主题/表达/判断随时间变化） | 有发布时间 |
| 19 | 维度交叉关联 | ≥10篇且分类稳定 |
| 21 | 异常样本与过度集中 | 核心必做 |

**数据口径要求**：
- 每个指标说明分母、分类规则或计算方式
- 主观标签写入 `annotations`，包含 `dimension, label, article_ids, evidence, rule, confidence`
- 词频不能等同于作者态度；主题/金句/情绪标签必须说明分类规则

### 4. 提炼方法论

🔴 CHECKPOINT — 方法论提炼前确认：21 维度数据是否已全部完成？`<博主>-分析数据.json` 和 `<博主>-文章特征.csv` 是否已由脚本生成？主观标签是否都包含 `annotations` 含证据？样本是否 ≥5 篇（<5 禁出趋势/演化/稳定风格结论）？

主报告至少包含 13 个模块：

1. 作者定位与内容人设
2. 读者画像与内容收益
3. 内容资产地图
4. 选题系统
5. 分析框架
6. 判断标准
7. 表达模板
8. 案例库
9. 金句风格
10. 内容缺口与选题机会
11. 可复用写作 SOP
12. 风险与边界
13. 样本清单

每个关键结论引用 2-5 篇文章标题或短片段。原文摘录保持必要且简短；抽象模板标注"抽象模板"，结构化示例标注"非作者原文"。

### 5. 生成独立文案框架

包含：选题脚手架、8-15条标题公式、多类开头模板、至少3套正文结构、段落句式+转场句、金句句式生成器、结尾CTA、1-2个结构化示例、发布前检查清单与禁用边界。

**只学结构，不复刻作者独特表达，不冒充作者。**

### 6. 自动生成 HTML 看板

🔴 CHECKPOINT — HTML 生成前确认：`<博主>-分析数据.json` 是否完整（21 维度数据齐全）？用户是否明确要求关闭 HTML 生成？输出目录是否可写？

```bash
python3 scripts/generate_dashboard.py \
  --data "<output_dir>/<博主>-分析数据.json" \
  --output "<output_dir>/<博主>-方法论看板.html"
```

看板固定十章节结构（学习者视角）：
1. 一页看懂 2. 定位与价值 3. 内容地图 4. 选题方法
5. 文章写法 6. 观点与证据 7. 语言风格 8. 值得学习
9. 运营增长 10. 学习与迁移

### 7. 自动同步飞书

通过 `lark-doc` 技能同步。先完成本地 Markdown，再创建/更新飞书文档。飞书失败不得影响本地文件完成状态。

---

## 失败模式与恢复

| 触发条件 | 症状 | 一线修复 | 仍失败兜底 |
|---|---|---|---|
| 样本数量 <3 篇 | `analyze_corpus.py` 报告样本不足 | 向用户说明最少需要 3 篇，请求补充更多文章 | 只做描述性统计（字数/篇幅），不出方法论报告 |
| 输入格式不支持 | `analyze_corpus.py` 报 "unsupported format" | 确认文件格式（MD/TXT/DOCX/PDF），对 PDF 先用 `ocr-and-documents` 提取文本 | 请求用户提供 Markdown 或纯文本版本 |
| 21 维度数据不完整 | `validate_outputs.py` 报缺少字段 | 确认维度条件是否满足（如 ≥5 篇才做关键词/论证分析），检查脚本输出日志 | 补充缺失维度的脚本执行，或标记为 "N/A（样本不足）" |
| HTML 生成失败 | `generate_dashboard.py` 报错 | 检查 `<博主>-分析数据.json` 是否完整且格式正确，确认输出目录可写 | 先生成 Markdown 报告，HTML 稍后手动补生成 |
| 飞书同步失败 | `lark-doc` 接口返回错误 | 检查飞书 token 是否有效，文档权限是否正确 | 本地 Markdown 已完成，飞书记录失败原因，不阻塞交付 |
| 文章编码/乱码 | 中文变为乱码 | 确认文件编码为 UTF-8，用 `chardet` 检测后转码 | 请求用户提供 UTF-8 编码版本 |
| 分析结论与常识矛盾 | 某维度结论明显不合理 | 检查该维度的 `annotations` 证据，确认分类规则是否正确应用 | 标记该维度为 "需要人工审核"，不输出该结论 |

## 质量门槛

- `<博主>-分析数据.json` 与 `<博主>-文章特征.csv` 必须由脚本生成
- 结论基于正文并披露样本边界
- 可观察统计与主观归纳明确区分
- 不推断无法从样本支持的作者意图
- HTML 导航必须为十个固定章节，底部包含来源说明和免责声明
- 最终运行 `python3 scripts/validate_outputs.py "<output_dir>"`

---

## 与其他技能的协作

| 技能 | 关系 | 场景 |
|------|------|------|
| `wechat-article-archive` | 上游调用者 | 采集完公众号文章后自动触发分析 |
| `zhike-content-output` | 互补 | 分析结果验证自身是否遵循对客铁律 |
| `advanced-elicitation` | 审视工具 | 对分析结果做多视角深度审视 |
| `humanizer` | 后处理 | 确保提炼的写作框架没有AI味 |
| `editorial-review-prose` | 下游审查 | 对生成的文案框架做句子级编辑 |
| `domain-decompose` | 方法论互补 | 对21维度做降秩——哪几维是真正的独立生成器 |

## 资源

> ⚠️ Python 脚本需从上游仓库安装。详见 [`references/script-setup.md`](references/script-setup.md)。测试结果见 [`references/test-results.md`](references/test-results.md)。

本技能 Python 脚本源自 `freestylefly/author-methodology-analysis-skill`：

| 脚本 | 路径 | 用途 | 验证 |
|---|---|---|---|
| `analyze_corpus.py` | `scripts/analyze_corpus.py` | 解析语料生成特征数据（JSON + CSV） | `python3 scripts/analyze_corpus.py --help` |
| `generate_dashboard.py` | `scripts/generate_dashboard.py` | 从 JSON 数据生成 HTML 看板 | `python3 scripts/generate_dashboard.py --help` |
| `validate_outputs.py` | `scripts/validate_outputs.py` | 校验数据/报告/HTML/同步元数据完整性 | `python3 scripts/validate_outputs.py "<output_dir>"` |

### 安装步骤

```bash
git clone https://github.com/freestylefly/author-methodology-analysis-skill.git /tmp/ama
cp /tmp/ama/scripts/analyze_corpus.py scripts/
cp /tmp/ama/scripts/generate_dashboard.py scripts/
cp /tmp/ama/scripts/validate_outputs.py scripts/
chmod +x scripts/*.py
```

Python 依赖：`pandas`, `jieba`（中文分词）, `python-docx`, `pypdf`。参考文件：`references/script-setup.md` 含完整环境配置，`references/test-results.md` 含测试用例与预期输出。

## 常见陷阱

1. **样本量不足强行分析** — 少于5篇只做描述，少于3篇禁出趋势结论
2. **混淆"学习"与"抄袭"** — 框架只学结构，标注"抽象模板""非作者原文"
3. **主观标签无证据** — 每条标注必须写入 `annotations` 含文章ID和证据
4. **跳过HTML生成** — HTML 是标准交付物，只有用户明确关闭才跳过
5. **数据口径不清** — 每项统计说明分母、分类规则、计算方式

## 验证清单

- [ ] 样本数 ≥ 3 篇（否则不出报告）
- [ ] `<博主>-分析数据.json` 和 `<博主>-文章特征.csv` 由脚本生成
- [ ] 所有主观标签写入 `annotations` 含证据
- [ ] 13个方法论模块全部完成
- [ ] 文案框架含8-15条标题公式
- [ ] HTML 看板十章节结构正确
- [ ] 飞书同步完成（或记录跳过原因）
- [ ] `validate_outputs.py` 通过

## ⛔ 反例与禁止

以下行为明确禁止，违反将导致分析质量严重下降或误导性结论：

- ❌ **样本 <3 篇时输出完整报告** — 少于 3 篇不得输出趋势、演化或稳定风格结论，只做描述性分析
- ❌ **混淆"学习"与"抄袭"** — 框架只学结构，标注"抽象模板""非作者原文"，不得复刻作者独特表达
- ❌ **主观标签无证据** — 每条标注必须写入 `annotations` 含文章 ID 和证据片段，不能凭空断言
- ❌ **跳过 HTML 看板生成** — HTML 是标准交付物，只有用户明确说"不生成 HTML"才可跳过
- ❌ **数据口径不透明** — 每项统计必须说明分母、分类规则或计算方式，禁止只给数字不给口径
- ❌ **词频等同于作者态度** — 高频词不代表作者立场，主题/金句/情绪标签必须说明分类规则
- ❌ **跨样本推断超出边界** — 不得从 5 篇文章推断"该博主一贯风格"，必须披露样本覆盖的时间范围和边界

