作者内容方法论深度分析器
来源:freestylefly/author-methodology-analysis-skill(作者苍何),适配为 Hermes Skill 格式。 原始许可:MIT
概述
基于多篇作者/博主/公众号/品牌内容的正文,进行全面、可解释、可复核的数据分析。覆盖 21 个维度,提炼作者定位、内容资产、选题系统、分析框架、判断标准、表达模板、案例库、金句风格、内容机会和写作 SOP。学习者视角——每个模块回答:这个博主怎么做 → 为什么有效 → 我能学什么 → 做什么练习 → 哪些不能照搬。
触发条件
通用领域触发矩阵
覆盖 5 大领域、30 个子场景。自动识别触发。
AI 领域
| 场景 | 触发信号 |
|---|---|
| AI写作风格逆向 | "分析AI生成内容的特征模式""AI写作有什么规律" |
| AI产品内容营销分析 | "拆解Cursor/Windsurf的公众号文案方法论" |
| AI研究员IP分析 | "分析这个AI研究员的写作风格""提炼Karpathy的博客方法论" |
| Prompt工程反哺 | "分析优质AI博主的结构→反哺prompt设计" |
| AI竞品内容策略 | "拆解AI竞品的公众号内容策略" |
咨询领域
| 场景 | 触发信号 |
|---|---|
| 客户内容审计 | "审计XX公司的对外内容质量""分析客户公众号的品牌一致性" |
| 顾问写作标准化 | "提炼顶级顾问的写作框架""标准化咨询报告的写作方法" |
| 行业思想领导力分析 | "分析行业头部公司的白皮书方法论" |
| 交付物质量门禁 | "审查这些咨询报告是否符合专业标准" |
| 竞品方案拆解 | "拆解竞品咨询公司的方案写作套路" |
企业管理领域
| 场景 | 触发信号 |
|---|---|
| 品牌声音一致性审计 | "审计不同部门写的对外内容是否一致""检查品牌声音统一性" |
| 领导力IP孵化 | "分析CEO的公开写作风格""提炼高管的个人品牌定位" |
| 企业内容能力诊断 | "评估团队写作水平""分析企业内容团队的强项和盲区" |
| 新员工写作培训 | "提炼企业写作风格做培训材料""生成新员工写作手册" |
| 雇主品牌内容优化 | "分析招聘公众号的内容质量""优化雇主品牌话术" |
数字化领域
| 场景 | 触发信号 |
|---|---|
| 数据驱动内容策略 | "用数据决定选题方向""分析内容策略的数据依据" |
| AI辅助写作基础设施 | "提炼写作框架作为AI prompt模板""方法论→提示词转化" |
| 内容资产化 | "将隐性写作经验转化为显性知识""提炼可复用的内容组件" |
| 内容质量量化 | "量化评估内容质量""用数据说话评判文章好坏" |
通用内容分析
| 场景 | 触发信号 |
|---|---|
| 博主方法论拆解 | "分析这个博主的写作方法论""拆解XX的公众号套路""这个博主为什么写得好" |
| 竞品内容策略 | "竞品的内容策略是什么""拆解竞品公众号""分析同行的写作套路" |
| 自我内容诊断 | "分析我们自己的公众号""我们的内容有什么问题""诊断品牌内容质量" |
| 写作框架提炼 | "提炼可复用的写作框架""生成标题公式和开头模板""拆成能用的写作组件" |
| 批量内容审计 | "批量分析这些文章""审计这个文件夹里的所有文章" |
手动触发关键词
分析博主方法论、拆解公众号套路、内容方法论分析、作者写作风格分析、提炼写作框架、分析内容策略、文案框架生成、竞品内容拆解、品牌声音分析、写作SOP提炼、标题策略分析、金句风格提取、author-methodology、内容审计、批量文章分析、拆解写作套路
不触发
- 单篇文章的句子级修改(用 editorial-review-prose)
- 通用深度追问(用 advanced-elicitation)
- 去AI味(用 humanizer)
- 少于3篇文章的样本
输入契约
调用方(如 wechat-article-archive)应提供:
input_dir或明确的文件列表/文档内容output_dir- 作者或账号名
- 可选的文章清单,包含标题、链接和发布时间
generate_html:默认truesync_lark:默认true
支持格式:Markdown/TXT(内置解析器)、DOCX(python-docx)、可提取文本的 PDF(pypdf)、飞书文档(通过 lark-doc 读取)。
输出契约
<output_dir>/
<博主>-方法论报告.md
<博主>-文案框架.md
<博主>-分析数据.json
<博主>-文章特征.csv
<博主>-方法论看板.html # 默认生成
<博主>-飞书同步.json # 成功同步后生成
所有输出使用"<博主>-<功能>.<扩展名>"命名。
工作流
1. 建立样本清单
🔴 CHECKPOINT — 样本建立前确认:样本数量是否 ≥3 篇(<3 不输出报告)?是否 ≥5 篇(<5 只做描述性分析)?输入目录格式是否支持(Markdown/TXT/DOCX/PDF/飞书文档)?
python3 scripts/analyze_corpus.py \
--input "<input_dir>" \
--output "<output_dir>"
- 少于 5 篇时只做描述性分析并明确低稳定性
- 少于 3 篇时不得输出趋势、演化或稳定风格结论
- 超过 50 篇时优先全量做基础统计
2. 预处理正文
- 删除导航、广告和版权尾注等噪声
- 保留标题层级、列表、引用、案例、数据和结论段
- 区分原文片段与模型归纳
3. 21维度数据分析
默认覆盖维度:
| # | 维度 | 条件 |
|---|---|---|
| 1 | 样本质量与数据完整性 | 核心必做 |
| 2 | 发布节奏(频率/周期/星期分布) | 有发布时间 |
| 3 | 篇幅与内容密度(字数/段落/句子/图片) | 核心必做 |
| 4 | 主题与内容类型(母题/对象/场景/问题类型) | 核心必做 |
| 5 | 关键词与概念体系(高频词/TF-IDF/概念共现) | ≥5篇 |
| 6 | 标题策略(长度/类型/钩子/承诺/一致性) | 核心必做 |
| 7 | 开头与叙事入口(类型/转场/主题-开头组合) | ≥5篇 |
| 8 | 篇章结构(小标题/列表/叙事路径/段落功能分布) | 核心必做 |
| 9 | 论证方式(因果/对比/归纳/反证/边界说明) | ≥5篇 |
| 10 | 证据体系(类型/数量/可追溯性/一手vs二手) | 核心必做 |
| 11 | 案例与实体网络(人物/公司/产品/事件共现) | ≥5篇 |
| 12 | 判断与立场(强弱/时间尺度/价值取向) | ≥5篇 |
| 13 | 语言与可读性(词汇/句长/节奏/修辞/口语化) | 核心必做 |
| 14 | 读者收益与行动引导 | ≥5篇 |
| 15 | 内容机会与缺口 | 核心必做 |
| 16 | 竞品选题雷达(公开搜索同行标题) | ≥5篇 |
| 17 | 图片使用(密度/图位/视觉内容作用) | 有图片数据 |
| 18 | 时间演化(主题/表达/判断随时间变化) | 有发布时间 |
| 19 | 维度交叉关联 | ≥10篇且分类稳定 |
| 21 | 异常样本与过度集中 | 核心必做 |
数据口径要求:
- 每个指标说明分母、分类规则或计算方式
- 主观标签写入
annotations,包含dimension, label, article_ids, evidence, rule, confidence - 词频不能等同于作者态度;主题/金句/情绪标签必须说明分类规则
4. 提炼方法论
🔴 CHECKPOINT — 方法论提炼前确认:21 维度数据是否已全部完成?<博主>-分析数据.json 和 <博主>-文章特征.csv 是否已由脚本生成?主观标签是否都包含 annotations 含证据?样本是否 ≥5 篇(<5 禁出趋势/演化/稳定风格结论)?
主报告至少包含 13 个模块:
- 作者定位与内容人设
- 读者画像与内容收益
- 内容资产地图
- 选题系统
- 分析框架
- 判断标准
- 表达模板
- 案例库
- 金句风格
- 内容缺口与选题机会
- 可复用写作 SOP
- 风险与边界
- 样本清单
每个关键结论引用 2-5 篇文章标题或短片段。原文摘录保持必要且简短;抽象模板标注"抽象模板",结构化示例标注"非作者原文"。
5. 生成独立文案框架
包含:选题脚手架、8-15条标题公式、多类开头模板、至少3套正文结构、段落句式+转场句、金句句式生成器、结尾CTA、1-2个结构化示例、发布前检查清单与禁用边界。
只学结构,不复刻作者独特表达,不冒充作者。
6. 自动生成 HTML 看板
🔴 CHECKPOINT — HTML 生成前确认:<博主>-分析数据.json 是否完整(21 维度数据齐全)?用户是否明确要求关闭 HTML 生成?输出目录是否可写?
python3 scripts/generate_dashboard.py \
--data "<output_dir>/<博主>-分析数据.json" \
--output "<output_dir>/<博主>-方法论看板.html"
看板固定十章节结构(学习者视角):
- 一页看懂 2. 定位与价值 3. 内容地图 4. 选题方法
- 文章写法 6. 观点与证据 7. 语言风格 8. 值得学习
- 运营增长 10. 学习与迁移
7. 自动同步飞书
通过 lark-doc 技能同步。先完成本地 Markdown,再创建/更新飞书文档。飞书失败不得影响本地文件完成状态。
失败模式与恢复
| 触发条件 | 症状 | 一线修复 | 仍失败兜底 |
|---|---|---|---|
| 样本数量 <3 篇 | analyze_corpus.py 报告样本不足 |
向用户说明最少需要 3 篇,请求补充更多文章 | 只做描述性统计(字数/篇幅),不出方法论报告 |
| 输入格式不支持 | analyze_corpus.py 报 "unsupported format" |
确认文件格式(MD/TXT/DOCX/PDF),对 PDF 先用 ocr-and-documents 提取文本 |
请求用户提供 Markdown 或纯文本版本 |
| 21 维度数据不完整 | validate_outputs.py 报缺少字段 |
确认维度条件是否满足(如 ≥5 篇才做关键词/论证分析),检查脚本输出日志 | 补充缺失维度的脚本执行,或标记为 "N/A(样本不足)" |
| HTML 生成失败 | generate_dashboard.py 报错 |
检查 <博主>-分析数据.json 是否完整且格式正确,确认输出目录可写 |
先生成 Markdown 报告,HTML 稍后手动补生成 |
| 飞书同步失败 | lark-doc 接口返回错误 |
检查飞书 token 是否有效,文档权限是否正确 | 本地 Markdown 已完成,飞书记录失败原因,不阻塞交付 |
| 文章编码/乱码 | 中文变为乱码 | 确认文件编码为 UTF-8,用 chardet 检测后转码 |
请求用户提供 UTF-8 编码版本 |
| 分析结论与常识矛盾 | 某维度结论明显不合理 | 检查该维度的 annotations 证据,确认分类规则是否正确应用 |
标记该维度为 "需要人工审核",不输出该结论 |
质量门槛
<博主>-分析数据.json与<博主>-文章特征.csv必须由脚本生成- 结论基于正文并披露样本边界
- 可观察统计与主观归纳明确区分
- 不推断无法从样本支持的作者意图
- HTML 导航必须为十个固定章节,底部包含来源说明和免责声明
- 最终运行
python3 scripts/validate_outputs.py "<output_dir>"
与其他技能的协作
| 技能 | 关系 | 场景 |
|---|---|---|
wechat-article-archive |
上游调用者 | 采集完公众号文章后自动触发分析 |
zhike-content-output |
互补 | 分析结果验证自身是否遵循对客铁律 |
advanced-elicitation |
审视工具 | 对分析结果做多视角深度审视 |
humanizer |
后处理 | 确保提炼的写作框架没有AI味 |
editorial-review-prose |
下游审查 | 对生成的文案框架做句子级编辑 |
domain-decompose |
方法论互补 | 对21维度做降秩——哪几维是真正的独立生成器 |
资源
⚠️ Python 脚本需从上游仓库安装。详见
references/script-setup.md。测试结果见references/test-results.md。
本技能 Python 脚本源自 freestylefly/author-methodology-analysis-skill:
| 脚本 | 路径 | 用途 | 验证 |
|---|---|---|---|
analyze_corpus.py |
scripts/analyze_corpus.py |
解析语料生成特征数据(JSON + CSV) | python3 scripts/analyze_corpus.py --help |
generate_dashboard.py |
scripts/generate_dashboard.py |
从 JSON 数据生成 HTML 看板 | python3 scripts/generate_dashboard.py --help |
validate_outputs.py |
scripts/validate_outputs.py |
校验数据/报告/HTML/同步元数据完整性 | python3 scripts/validate_outputs.py "<output_dir>" |
安装步骤
git clone https://github.com/freestylefly/author-methodology-analysis-skill.git /tmp/ama
cp /tmp/ama/scripts/analyze_corpus.py scripts/
cp /tmp/ama/scripts/generate_dashboard.py scripts/
cp /tmp/ama/scripts/validate_outputs.py scripts/
chmod +x scripts/*.py
Python 依赖:pandas, jieba(中文分词), python-docx, pypdf。参考文件:references/script-setup.md 含完整环境配置,references/test-results.md 含测试用例与预期输出。
常见陷阱
- 样本量不足强行分析 — 少于5篇只做描述,少于3篇禁出趋势结论
- 混淆"学习"与"抄袭" — 框架只学结构,标注"抽象模板""非作者原文"
- 主观标签无证据 — 每条标注必须写入
annotations含文章ID和证据 - 跳过HTML生成 — HTML 是标准交付物,只有用户明确关闭才跳过
- 数据口径不清 — 每项统计说明分母、分类规则、计算方式
验证清单
- 样本数 ≥ 3 篇(否则不出报告)
-
<博主>-分析数据.json和<博主>-文章特征.csv由脚本生成 - 所有主观标签写入
annotations含证据 - 13个方法论模块全部完成
- 文案框架含8-15条标题公式
- HTML 看板十章节结构正确
- 飞书同步完成(或记录跳过原因)
-
validate_outputs.py通过
⛔ 反例与禁止
以下行为明确禁止,违反将导致分析质量严重下降或误导性结论:
- ❌ 样本 <3 篇时输出完整报告 — 少于 3 篇不得输出趋势、演化或稳定风格结论,只做描述性分析
- ❌ 混淆"学习"与"抄袭" — 框架只学结构,标注"抽象模板""非作者原文",不得复刻作者独特表达
- ❌ 主观标签无证据 — 每条标注必须写入
annotations含文章 ID 和证据片段,不能凭空断言 - ❌ 跳过 HTML 看板生成 — HTML 是标准交付物,只有用户明确说"不生成 HTML"才可跳过
- ❌ 数据口径不透明 — 每项统计必须说明分母、分类规则或计算方式,禁止只给数字不给口径
- ❌ 词频等同于作者态度 — 高频词不代表作者立场,主题/金句/情绪标签必须说明分类规则
- ❌ 跨样本推断超出边界 — 不得从 5 篇文章推断"该博主一贯风格",必须披露样本覆盖的时间范围和边界