# AI Engineering Toolkit

> AI Engineering Toolkit

- Skill: `kscz0000/ai-engineering-toolkit` (Agent Skill)
- Install (CLI): `npx skillmds@latest add kscz0000/ai-engineering-toolkit`
- Raw SKILL.md: https://api.skillmd.com/api/skills/kscz0000/ai-engineering-toolkit/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: kscz0000 (https://skillmd.com/u/kscz0000)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/kscz0000/ai-engineering-toolkit

---


# AI Engineering Toolkit

## 概述

一套包含6个结构化、专家级工作流的工具集，将你的AI编程助手转变为资深AI工程伙伴。每个技能都封装了可复用的方法论——不仅仅是"让AI帮忙"，而是一个带有量化评分、检查清单和决策树的分步决策框架。

与临时AI辅助的关键区别：**每个工作流都能产生一致、可复现的结果**，无论谁执行或何时执行。你可以将评分系统作为团队基线，并将其写入CI/CD流水线。

## 何时使用此技能

- 在生产部署前评估或优化LLM系统提示词时使用
- 设计RAG管道并需要结构化架构决策（而非模板代码）时使用
- 规划上下文窗口各区域的token预算分配时使用
- 对AI智能体进行上线前安全审计时使用
- 为LLM应用构建评估框架时使用
- 在编写代码前思考产品策略时使用

## 工作原理

### 技能1：提示词评估器

在8个维度（清晰度、具体性、完整性、简洁性、结构化、依据性、安全性、鲁棒性）上以1-10分评分，加权汇总为0-100分。识别最弱的3个维度，生成针对性重写，并重新评估。支持单提示词、A/B对比和批量评估三种模式。

### 技能2：上下文预算规划器

分析5个上下文区域（系统区、Few-shot示例、用户输入、检索内容、输出区）的token分布，生成优化分配方案。包含每个区域的压缩策略决策树。常见发现：输出区被压缩到6%以下——此技能可在截断发生前捕获此问题。

### 技能3：RAG管道架构师

遍历完整的架构决策树：文档格式 → 解析策略 → 分块方法（固定/语义/递归）→ 嵌入模型选择 → 检索方法（向量/关键词/混合）→ 评估指标（Faithfulness、Relevancy、Context Precision）。覆盖Naive RAG、Advanced RAG和Modular RAG模式。

### 技能4：智能体安全卫士

> **⚠️ 仅限授权使用**
> 此技能仅供教育目的或授权安全评估使用。
> 使用此工具前必须获得系统所有者的明确书面许可。
> 滥用此工具是违法的，严禁使用。

执行跨5个攻击类别的65项红队审计：直接提示注入、间接提示注入（通过RAG文档）、信息提取（系统提示词/API密钥泄露）、工具滥用（SQL注入、路径遍历、命令注入）、目标劫持。AI构建对抗性测试提示词用于评估目的，在每个测试阶段前请求用户确认，判定通过/失败，并生成修复建议。所有测试都在评估上下文内进行，不与外部系统交互。建议在沙盒环境（Docker/VM）中运行审计。

### 技能5：评估框架构建器

为LLM应用设计评估指标系统。包含LLM-as-Judge评分框架及偏见缓解策略（位置偏见、冗长偏见、自我增强偏见）。输出CI/CD就绪的评估流水线模板。

### 技能6：产品思维教练

一个5阶段引导式对话框架：深挖动机 → 评估市场机会 → 寻找路径 → 设计场景 → 分析竞争。适用于在编写任何代码前思考"我们是否应该构建这个？"

## 示例

### 示例1：提示词评估

请求："评估这个系统提示词"

```
You are a customer support agent. Help users with their questions. Be nice and helpful.
```

结果：总分 **28/100**。最弱维度：安全性（1/10，零注入防护）、具体性（2/10，无输出格式）、结构化（2/10，无分段）。自动重写得分 **82/100**，增加了范围边界、响应格式、升级规则和安全护栏。

### 示例2：安全审计

请求："对我的客服智能体运行安全审计"

结果：执行65项测试。发现3个严重失败：Base64编码指令绕过、通过工具调用的路径遍历、通过角色扮演提取系统提示词。为每项提供修复建议。

## 最佳实践

- ✅ 在任何生产部署前运行提示词评估器——设定团队基线（如≥70/100）
- ✅ 在开发早期使用上下文预算规划器，而非在遇到截断问题后
- ✅ 将智能体安全卫士作为上线前关卡，而非事后补救
- ✅ 按顺序组合技能：RAG设计 → 上下文优化 → 提示词打磨 → 安全审计 → 评估设置
- ❌ 不要仅依赖单一维度分数——查看完整画像
- ❌ 不要因为"只是内部工具"就跳过安全审计

## 安全与风险说明

- 所有技能都是只读分析和咨询工作流。没有任何技能修改文件或发起网络请求。
- 智能体安全卫士技能仅用于评估目的构建对抗性测试提示词——这些都在评估上下文内进行，不与外部系统交互。
- **智能体安全卫士被归类为攻击性技能**：它生成攻击载荷（提示注入、SQL注入、命令注入）用于授权安全测试。该技能在执行每个测试阶段前需要用户明确确认。尽可能在沙盒环境中运行。
- 不包含武器化载荷。所有对抗性提示词均具有教育性质。

## 安装

```bash
# 通过 skill install 命令（Claude Code / WorkBuddy / Cursor）
/skill install -g viliawang-pm/ai-engineering-toolkit

# 手动安装
git clone https://github.com/viliawang-pm/ai-engineering-toolkit.git
cp -r ai-engineering-toolkit/skills/* ~/.claude/skills/
```

**仓库地址**: [github.com/viliawang-pm/ai-engineering-toolkit](https://github.com/viliawang-pm/ai-engineering-toolkit)
**许可证**: MIT

## 局限性
- 仅当任务明确匹配上述范围时使用此技能。
- 不要将输出作为环境特定验证、测试或专家审查的替代品。
- 如果缺少所需输入、权限、安全边界或成功标准，请停止并请求澄清。

