AI应用架构设计Skill
适用场景
从零设计或重构 AI 应用(对话问答、Agent、内容生成、知识助手),需要输出分层架构、模型接入方式、RAG 服务边界与推理成本控制方案。
执行步骤
- 梳理约束:AI 能力清单(生成/检索/分类/工具调用)、QPS、延迟预算、可用性目标、数据合规与私有化要求。
- 分层设计:接入层(API/网关)→ 应用服务层(业务编排、会话管理)→ AI 能力层(模型服务、RAG、Agent)→ 数据层(业务库、向量库、缓存、对象存储)。
- 模型接入设计:统一模型网关收敛多模型调用,集中管理密钥(禁止硬编码),约定同步/流式(SSE)接口形态,明确超时与重试策略。
- RAG 服务设计:RAG 独立为检索服务,明确索引构建/更新链路、权限过滤与降级策略(检索不可用时禁用 RAG,禁止带病生成)。
- 成本策略:按场景分级路由(轻量模型处理简单任务)、答案缓存、Prompt 精简、批处理;给出成本估算模型、配额与熔断控制。
- 可观测与安全:全链路 traceId、Token 用量与成本监控、Prompt 注入防护、敏感数据脱敏后进入模型上下文。
规范要点
- 模型调用必须走统一网关,业务代码禁止直连各厂商 SDK,便于路由、限流、密钥轮换。
- 同步请求必须有超时;长生成任务必须走流式或异步任务,禁止占用同步接口超时预算。
- 密钥、模型地址等配置统一走配置中心/环境变量,禁止硬编码在代码或前端构建产物中。
- RAG、缓存、降级均需设计「AI 不可用」分支:返回明确错误或降级结果,禁止静默编造。
- 成本与质量需量化:上线前给出每请求 Token 估算与月度成本预测,成本超标有熔断。
输出模板
## AI 应用架构方案
架构分层图(文字版):接入层 → 应用服务层 → AI 能力层 → 数据层
模型清单:场景/模型/调用方式(同步或流式)/降级备选
RAG 链路:数据源/索引策略/更新频率/权限过滤
成本策略:分级路由规则 + 单位请求成本估算 + 配额熔断
可观测:日志/监控指标/告警阈值
自检清单
- 分层清晰,AI 能力层与业务层解耦
- 模型网关统一收敛,密钥无硬编码
- 同步/流式接口形态与超时策略已明确
- AI 不可用时有降级或明确失败分支
- 成本估算与配额熔断已设计