AI应用架构设计Skill

模型接入、RAG服务、推理成本策略的AI应用架构设计方法。当需要设计AI应用整体架构(模型层、检索层、服务编排、成本控制)时使用。

Sky-Cube 7b9fb2d 2.6 KB Updated

File contents

AI应用架构设计Skill

适用场景

从零设计或重构 AI 应用(对话问答、Agent、内容生成、知识助手),需要输出分层架构、模型接入方式、RAG 服务边界与推理成本控制方案。

执行步骤

  1. 梳理约束:AI 能力清单(生成/检索/分类/工具调用)、QPS、延迟预算、可用性目标、数据合规与私有化要求。
  2. 分层设计:接入层(API/网关)→ 应用服务层(业务编排、会话管理)→ AI 能力层(模型服务、RAG、Agent)→ 数据层(业务库、向量库、缓存、对象存储)。
  3. 模型接入设计:统一模型网关收敛多模型调用,集中管理密钥(禁止硬编码),约定同步/流式(SSE)接口形态,明确超时与重试策略。
  4. RAG 服务设计:RAG 独立为检索服务,明确索引构建/更新链路、权限过滤与降级策略(检索不可用时禁用 RAG,禁止带病生成)。
  5. 成本策略:按场景分级路由(轻量模型处理简单任务)、答案缓存、Prompt 精简、批处理;给出成本估算模型、配额与熔断控制。
  6. 可观测与安全:全链路 traceId、Token 用量与成本监控、Prompt 注入防护、敏感数据脱敏后进入模型上下文。

规范要点

  • 模型调用必须走统一网关,业务代码禁止直连各厂商 SDK,便于路由、限流、密钥轮换。
  • 同步请求必须有超时;长生成任务必须走流式或异步任务,禁止占用同步接口超时预算。
  • 密钥、模型地址等配置统一走配置中心/环境变量,禁止硬编码在代码或前端构建产物中。
  • RAG、缓存、降级均需设计「AI 不可用」分支:返回明确错误或降级结果,禁止静默编造。
  • 成本与质量需量化:上线前给出每请求 Token 估算与月度成本预测,成本超标有熔断。

输出模板

## AI 应用架构方案
架构分层图(文字版):接入层 → 应用服务层 → AI 能力层 → 数据层
模型清单:场景/模型/调用方式(同步或流式)/降级备选
RAG 链路:数据源/索引策略/更新频率/权限过滤
成本策略:分级路由规则 + 单位请求成本估算 + 配额熔断
可观测:日志/监控指标/告警阈值

自检清单

  • 分层清晰,AI 能力层与业务层解耦
  • 模型网关统一收敛,密钥无硬编码
  • 同步/流式接口形态与超时策略已明确
  • AI 不可用时有降级或明确失败分支
  • 成本估算与配额熔断已设计

Sky-Cube/fullflow-dev-agent/tree/main/.claude/skills/ai-architecture-design commit 7b9fb2d984

Frequently asked questions

npx skillmds@latest add sky-cube/ai-skill-2