# Edge AI

> Use when working with AI — development rules

- Skill: `liaosw97/edge-ai` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add liaosw97/edge-ai`
- Raw SKILL.md: https://api.skillmd.com/api/skills/liaosw97/edge-ai/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Research & Search
- Author: liaosw97 (https://skillmd.com/u/liaosw97)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/liaosw97/edge-ai

---


## 核心原则
- 资源感知设计：模型设计需充分考虑目标设备的计算、存储和能耗限制
- 精度效率平衡：在有限资源下实现最优的精度-延迟-能耗权衡
- 隐私优先：数据本地处理，减少云端传输，保护用户隐私
- 实时性保障：满足边缘场景对低延迟、实时响应的严格要求
- 可维护性：支持远程更新、版本管理和模型迭代

## 技术栈
- TensorFlow Lite：轻量级推理框架，支持Android、iOS和嵌入式设备
- ONNX Runtime Mobile：跨平台高性能推理引擎
- PyTorch Mobile：PyTorch官方移动端部署方案
- TensorRT：NVIDIA推理优化引擎，支持GPU加速和INT8量化
- Core ML：Apple生态机器学习框架，深度集成iOS/macOS
- NNAPI：Android神经网络API，支持硬件加速
- TVM：深度学习编译器栈，支持多硬件后端优化

## 最佳实践
1. **模型压缩技术**：应用训练后量化（PTQ）将FP32模型转换为INT8/FP16；使用量化感知训练（QAT）保持压缩后精度；实施结构化剪枝移除冗余通道；采用知识蒸馏将大模型知识迁移到小模型

2. **神经网络架构搜索**：使用MobileNet、EfficientNet-Lite等专为移动端设计的架构；采用NAS自动搜索适合目标硬件的最优网络结构；利用神经架构重参数化在训练和推理阶段获得不同收益

3. **推理优化**：算子融合减少内存访问和计算开销；使用Half-Precision浮点数加速计算；实施动态Batch大小调整；优化内存布局为NCHW或NHWC以匹配硬件特性

4. **增量学习与联邦更新**：支持边缘设备上的在线学习和模型微调；实施联邦学习进行分布式模型更新；设计差分更新机制减少传输带宽

5. **跨平台部署**：使用统一的中间表示（ONNX）实现跨框架互操作；针对不同硬件后端（CPU/GPU/NPU/DSP）选择最优算子实现；建立设备能力检测和自适应降级机制

## 关键约定
1. 模型文件大小控制在目标设备可用内存的 50% 以内
2. 推理延迟应满足应用场景实时性要求，建议关键任务低于 100ms
3. 量化后模型精度损失应控制在 1% 以内
4. 提供模型预热机制，首次推理前完成初始化
5. 实现模型签名验证，确保更新来源可信

