# Mlops

> Use when working with AI — development rules

- Skill: `liaosw97/mlops` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add liaosw97/mlops`
- Raw SKILL.md: https://api.skillmd.com/api/skills/liaosw97/mlops/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: liaosw97 (https://skillmd.com/u/liaosw97)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/liaosw97/mlops

---


## 核心原则
- 可复现性：确保实验可追溯、模型可重建、结果可复现
- 自动化优先：实现训练、评估、部署的全流程自动化
- 持续集成部署：将CI/CD理念应用于机器学习工作流
- 监控与治理：建立模型性能监控和合规审计机制
- 团队协作：支持多角色协作和知识共享

## 技术栈
- MLflow：开源机器学习生命周期管理平台，支持实验跟踪、模型注册和部署
- Kubeflow：Kubernetes原生机器学习工具包，支持分布式训练和Pipeline编排
- TensorFlow Extended（TFX）：端到端ML生产流水线框架
- Seldon Core：Kubernetes上的模型部署和推理服务平台
- DVC：数据版本控制系统，实现数据和模型的版本化管理
- Weights & Biases：实验跟踪和可视化平台，支持团队协作
- Great Expectations：数据质量测试和文档化工具
- Prometheus/Grafana：模型监控和可视化技术栈

## 最佳实践
1. **实验管理**：规范记录超参数、指标、代码版本和环境配置；使用实验跟踪工具建立实验知识库；实施实验对比分析识别最优配置；建立实验模板加速新实验创建

2. **特征工程管理**：构建特征存储（Feature Store）实现特征共享和复用；版本化特征定义和计算逻辑；监控特征质量及时发现数据问题；建立特征血缘追踪影响分析

3. **模型版本管理**：实施模型注册中心统一管理模型版本；关联模型与训练数据、代码版本；使用模型签名定义输入输出规范；建立模型审批和发布流程

4. **模型部署策略**：支持批量推理、在线推理和边缘推理多种部署模式；实施金丝雀发布和A/B测试降低风险；实现模型自动伸缩应对流量变化；建立模型回滚机制快速处理问题

5. **监控与告警**：监控模型性能指标（延迟、吞吐量、错误率）；检测数据漂移和概念漂移；建立模型质量告警阈值；实施定期模型再训练策略

## 关键约定
1. 所有实验需记录唯一标识符，关联代码commit hash和环境配置
2. 模型部署前必须通过验证测试，包括单元测试、集成测试和性能测试
3. 特征存储中的特征需包含完整文档，说明计算逻辑和使用场景
4. 模型监控指标保留周期不少于90天，支持历史问题追溯
5. 建立模型卡片（Model Card）记录模型用途、限制和性能特征

