Edge AI

Use when working with AI — development rules

liaosw97 Updated

File contents

核心原则

  • 资源感知设计:模型设计需充分考虑目标设备的计算、存储和能耗限制
  • 精度效率平衡:在有限资源下实现最优的精度-延迟-能耗权衡
  • 隐私优先:数据本地处理,减少云端传输,保护用户隐私
  • 实时性保障:满足边缘场景对低延迟、实时响应的严格要求
  • 可维护性:支持远程更新、版本管理和模型迭代

技术栈

  • TensorFlow Lite:轻量级推理框架,支持Android、iOS和嵌入式设备
  • ONNX Runtime Mobile:跨平台高性能推理引擎
  • PyTorch Mobile:PyTorch官方移动端部署方案
  • TensorRT:NVIDIA推理优化引擎,支持GPU加速和INT8量化
  • Core ML:Apple生态机器学习框架,深度集成iOS/macOS
  • NNAPI:Android神经网络API,支持硬件加速
  • TVM:深度学习编译器栈,支持多硬件后端优化

最佳实践

  1. 模型压缩技术:应用训练后量化(PTQ)将FP32模型转换为INT8/FP16;使用量化感知训练(QAT)保持压缩后精度;实施结构化剪枝移除冗余通道;采用知识蒸馏将大模型知识迁移到小模型

  2. 神经网络架构搜索:使用MobileNet、EfficientNet-Lite等专为移动端设计的架构;采用NAS自动搜索适合目标硬件的最优网络结构;利用神经架构重参数化在训练和推理阶段获得不同收益

  3. 推理优化:算子融合减少内存访问和计算开销;使用Half-Precision浮点数加速计算;实施动态Batch大小调整;优化内存布局为NCHW或NHWC以匹配硬件特性

  4. 增量学习与联邦更新:支持边缘设备上的在线学习和模型微调;实施联邦学习进行分布式模型更新;设计差分更新机制减少传输带宽

  5. 跨平台部署:使用统一的中间表示(ONNX)实现跨框架互操作;针对不同硬件后端(CPU/GPU/NPU/DSP)选择最优算子实现;建立设备能力检测和自适应降级机制

关键约定

  1. 模型文件大小控制在目标设备可用内存的 50% 以内
  2. 推理延迟应满足应用场景实时性要求,建议关键任务低于 100ms
  3. 量化后模型精度损失应控制在 1% 以内
  4. 提供模型预热机制,首次推理前完成初始化
  5. 实现模型签名验证,确保更新来源可信

liaosw97/awesome-rules-skills/tree/main/plugins/ai-research/skills/edge-ai commit daea0659db

Frequently asked questions

npx skillmds@latest add liaosw97/edge-ai