程序化SEO分析与规划
构建和审计从结构化数据源大规模生成的SEO页面。 强制执行质量门控,防止薄内容惩罚和索引膨胀。
何时使用
- 当用户需要程序化SEO规划或审查时使用。
- 当设计模板、数据驱动页面或可扩展的URL系统时使用。
- 当需要防止大规模页面集中的薄内容和索引膨胀时使用。
数据源评估
评估驱动程序化页面的数据:
- CSV/JSON文件:行数、列唯一性、缺失值
- API端点:响应结构、数据新鲜度、速率限制
- 数据库查询:记录数、字段完整度、更新频率
- 数据质量检查:
- 每条记录必须有足够的独特属性以生成差异化内容
- 标记重复或近似重复的记录(>80%字段重叠)
- 验证数据新鲜度;过时数据会产生过时页面
模板引擎规划
设计能产生独特、有价值页面的模板:
- 变量注入点:标题、H1、正文段落、元描述、Schema
- 内容块:静态内容(页面间共享)vs 动态内容(每页独特)
- 条件逻辑:根据数据可用性显示/隐藏段落
- 补充内容:相关项目、上下文提示、用户生成内容
- 模板审查清单:
- 每个页面必须读起来像一个独立的、有价值的资源
- 禁止"填空式"模式(仅在相同文本中替换城市/产品名称)
- 动态段落必须添加真实信息,而非仅仅是关键词变体
URL模式策略
常见模式
/tools/[tool-name]:工具/产品目录页/[city]/[service]:位置+服务页/integrations/[platform]:集成落地页/glossary/[term]:定义/参考页/templates/[template-name]:可下载模板页
URL规则
- 从数据派生的小写、连字符分隔的slug
- 反映站点架构的逻辑层级
- 禁止重复slug;在生成时强制唯一性
- URL长度保持在100个字符以内
- 主要内容URL不使用查询参数
- 尾部斜杠使用保持一致(匹配现有站点模式)
内链自动化
- 中心/辐射模型:分类中心页链接到各个程序化页面
- 相关项目:基于数据属性自动链接到3-5个相关页面
- 面包屑:从URL层级生成BreadcrumbList Schema
- 交叉链接:在共享属性(同类别、同城市、同功能)的程序化页面之间建立链接
- 锚文本:使用描述性、多样化的锚文本。避免精确匹配关键词的重复
- 链接密度:每1000字3-5个内链(匹配seo-content指南)
薄内容防护
质量门控
| 指标 | 阈值 | 操作 |
|---|---|---|
| 未经内容审查的页面 | 100+ | ⚠️ 警告:发布前需要内容审计 |
| 无正当理由的页面 | 500+ | 🛑 硬停止:需要用户明确批准和薄内容审计 |
| 每页独特内容占比 | <40% | ❌ 标记为薄内容(可能有惩罚风险) |
| 每页字数 | <300 | ⚠️ 标记待审查(可能缺乏足够价值) |
规模化内容滥用:执法背景(2025-2026)
Google的规模化内容滥用政策(2024年3月推出)在2025年经历了重大执法升级:
- 2025年6月:一波针对大规模AI生成内容网站的人工处罚
- 2025年8月:SpamBrain垃圾更新增强了对AI生成链接方案和内容农场的模式检测
- 结果:Google报告称2024年3月执法后搜索结果中低质量、非原创内容减少了45%
程序化页面的增强质量门控:
- 内容差异化:任意两个程序化页面之间必须有≥30-40%的内容是真正独特的(不仅仅是城市/关键词字符串替换)
- 人工审查:发布前至少对5-10%的生成页面进行抽样审查
- 渐进式发布:以50-100页为批次发布。在扩展前监控索引和排名2-4周。未经明确质量审查,绝不同时发布500+程序化页面。
- 独立价值测试:每个页面应通过此测试:"即使没有其他类似页面存在,这个页面是否也值得发布?"
- 站点声誉滥用:如果在高权威域名(非自有)下发布程序化内容,可能触发站点声誉滥用惩罚。Google于2024年11月开始积极执法。
建议:
<40%独特内容的警告门控仍然合适。考虑在<30%独特内容时设置硬停止,以防止规模化内容滥用风险。
安全的程序化页面(可大规模发布)
✅ 集成页面(附带真实设置文档、API详情、截图) ✅ 模板/工具页面(附带可下载内容、使用说明) ✅ 术语页面(200+字定义,含示例、相关术语) ✅ 产品页面(独特规格、评论、对比数据) ✅ 数据驱动页面(每条记录有独特统计、图表、分析)
惩罚风险(避免大规模发布)
❌ 仅替换城市名称的相同文本位置页面 ❌ 没有行业特定价值的"最佳[工具]for[行业]"页面 ❌ 没有真实对比数据的"[竞品]替代方案"页面 ❌ 未经人工审查和独特价值添加的AI生成页面 ❌ >60%内容为共享模板样板文本的页面
唯一性计算
独特内容占比 = (本页面独有的词数) / (页面总词数) × 100
与程序化集合中的所有其他页面进行对比。共享的页眉、页脚和导航不纳入计算。模板样板文本纳入计算。
Canonical策略
- 每个程序化页面必须有自引用canonical标签
- 参数变体(排序、筛选、分页)canonical指向基础URL
- 分页系列:canonical指向第1页或使用rel=next/prev
- 如果程序化页面与手动页面重叠,手动页面为canonical
- 除非有意进行跨域设置,否则不canonical到不同域名
Sitemap集成
- 为所有程序化页面自动生成sitemap条目
- 每个sitemap文件最多50,000个URL(协议限制)
- 如需多个sitemap文件,使用sitemap索引
<lastmod>反映实际数据更新时间戳(非生成时间)- 从sitemap中排除已noindex的程序化页面
- 在robots.txt中注册sitemap
- 随着数据源新增记录动态更新sitemap
索引膨胀防护
- Noindex低价值页面:未达到质量门控的页面
- 分页:第1页之后的分页结果noindex(或使用rel=next/prev)
- 分面导航:筛选视图noindex,canonical指向基础分类
- 抓取预算:对于>10k程序化页面的站点,在Search Console中监控抓取统计
- 薄页面合并:将数据不足的记录合并到聚合页面
- 定期审计:每月审查已索引页面数与预期页面数
输出
程序化SEO评分:XX/100
评估摘要
| 类别 | 状态 | 得分 |
|---|---|---|
| 数据质量 | ✅/⚠️/❌ | XX/100 |
| 模板唯一性 | ✅/⚠️/❌ | XX/100 |
| URL结构 | ✅/⚠️/❌ | XX/100 |
| 内链建设 | ✅/⚠️/❌ | XX/100 |
| 薄内容风险 | ✅/⚠️/❌ | XX/100 |
| 索引管理 | ✅/⚠️/❌ | XX/100 |
严重问题(立即修复)
高优先级(1周内修复)
中优先级(1月内修复)
低优先级(待办)
建议
- 数据源改进
- 模板修改
- URL模式调整
- 质量门控合规措施
错误处理
| 场景 | 操作 |
|---|---|
| URL不可达 | 报告连接错误及状态码。建议验证URL可访问性并检查是否需要身份验证。 |
| 未检测到程序化页面 | 通知用户未发现模板生成或数据驱动的页面模式。建议检查页面是否使用客户端渲染,或URL是否指向正确的部分。 |
| 超过薄内容阈值 | 触发质量门控警告。报告独特内容百分比并标记低于40%唯一性的页面。要求用户确认后方可继续。 |
| 质量门控违规 | 在硬停止阈值(500+页面无正当理由或<30%独特内容)处暂停分析。呈现发现结果并要求用户明确批准后方可继续。 |
限制
- 仅当任务明确匹配上述范围时使用本技能。
- 不要将输出视为环境特定验证、测试或专家审查的替代品。
- 如果缺少必要输入、权限、安全边界或成功标准,请停下来请求澄清。