Computer Vision

Use when working with computer vision — image processing, object detection, OpenCV, YOLO

liaosw97 Updated

File contents

核心原则

  • 数据质量优先:高质量的标注数据和合理的数据增强是模型性能的基石
  • 精度与效率平衡:在模型精度和推理速度之间找到最佳平衡点
  • 端到端优化:从数据预处理到模型部署进行全链路优化
  • 可解释性设计:模型决策过程应具备可解释性和可追溯性
  • 伦理与隐私:遵守数据隐私法规,防止算法偏见和滥用

技术栈

  • OpenCV:开源计算机视觉库,提供图像处理、视频分析和传统视觉算法
  • PyTorch:动态计算图深度学习框架,适合研究原型开发和快速迭代
  • TensorFlow:生产级深度学习框架,支持大规模分布式训练和部署
  • YOLO:实时目标检测算法系列,平衡速度与精度的工业级选择
  • DETR:基于Transformer的端到端目标检测架构
  • SAM:Segment Anything Model,通用图像分割基础模型
  • MediaPipe:Google开源的跨平台机器学习解决方案,适合实时应用

最佳实践

  1. 数据准备与标注:建立规范的标注流程,使用CVAT、LabelImg等专业标注工具;实施数据质量控制,定期审核标注一致性;采用多样化的数据增强策略,包括几何变换、颜色抖动、Mixup、CutMix等

  2. 模型选择与优化:根据应用场景选择合适的模型架构,实时应用优先考虑轻量级模型如MobileNet、EfficientNet-Lite;利用预训练权重进行迁移学习,显著减少训练时间和数据需求

  3. 训练策略:采用渐进式学习率调整策略,如Cosine Annealing、Warmup;使用混合精度训练(FP16/BF16)加速训练过程;实施早停策略防止过拟合

  4. 部署优化:应用模型量化(INT8/FP16)减少模型体积和推理延迟;使用TensorRT、ONNX Runtime等推理引擎加速部署;针对边缘设备进行模型剪枝和知识蒸馏

  5. 评估与监控:使用多维度评估指标(mAP、IoU、F1-score等)全面评估模型性能;建立模型性能监控机制,及时发现数据漂移和模型退化

关键约定

  1. 图像数据统一使用 RGB 格式处理,注意 OpenCV 默认 BGR 格式的转换
  2. 模型输入尺寸保持 32 像素对齐,适配卷积网络下采样要求
  3. 归一化参数与预训练模型保持一致,ImageNet 标准为 mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]
  4. 目标检测边界框格式统一使用 [x_center, y_center, width, height] 归一化坐标
  5. 输出结果需包含置信度阈值过滤,建议默认阈值为 0.5

liaosw97/awesome-rules-skills/tree/main/plugins/ai-research/skills/computer-vision commit 993583b98d

Frequently asked questions

npx skillmds@latest add liaosw97/computer-vision