Mlops

Use when working with AI — development rules

liaosw97 Updated

File contents

核心原则

  • 可复现性:确保实验可追溯、模型可重建、结果可复现
  • 自动化优先:实现训练、评估、部署的全流程自动化
  • 持续集成部署:将CI/CD理念应用于机器学习工作流
  • 监控与治理:建立模型性能监控和合规审计机制
  • 团队协作:支持多角色协作和知识共享

技术栈

  • MLflow:开源机器学习生命周期管理平台,支持实验跟踪、模型注册和部署
  • Kubeflow:Kubernetes原生机器学习工具包,支持分布式训练和Pipeline编排
  • TensorFlow Extended(TFX):端到端ML生产流水线框架
  • Seldon Core:Kubernetes上的模型部署和推理服务平台
  • DVC:数据版本控制系统,实现数据和模型的版本化管理
  • Weights & Biases:实验跟踪和可视化平台,支持团队协作
  • Great Expectations:数据质量测试和文档化工具
  • Prometheus/Grafana:模型监控和可视化技术栈

最佳实践

  1. 实验管理:规范记录超参数、指标、代码版本和环境配置;使用实验跟踪工具建立实验知识库;实施实验对比分析识别最优配置;建立实验模板加速新实验创建

  2. 特征工程管理:构建特征存储(Feature Store)实现特征共享和复用;版本化特征定义和计算逻辑;监控特征质量及时发现数据问题;建立特征血缘追踪影响分析

  3. 模型版本管理:实施模型注册中心统一管理模型版本;关联模型与训练数据、代码版本;使用模型签名定义输入输出规范;建立模型审批和发布流程

  4. 模型部署策略:支持批量推理、在线推理和边缘推理多种部署模式;实施金丝雀发布和A/B测试降低风险;实现模型自动伸缩应对流量变化;建立模型回滚机制快速处理问题

  5. 监控与告警:监控模型性能指标(延迟、吞吐量、错误率);检测数据漂移和概念漂移;建立模型质量告警阈值;实施定期模型再训练策略

关键约定

  1. 所有实验需记录唯一标识符,关联代码commit hash和环境配置
  2. 模型部署前必须通过验证测试,包括单元测试、集成测试和性能测试
  3. 特征存储中的特征需包含完整文档,说明计算逻辑和使用场景
  4. 模型监控指标保留周期不少于90天,支持历史问题追溯
  5. 建立模型卡片(Model Card)记录模型用途、限制和性能特征

liaosw97/awesome-rules-skills/tree/main/plugins/mlops/skills/mlops commit aa9cc7763c

Frequently asked questions

npx skillmds@latest add liaosw97/mlops