LLM Engineering – Operational Skill Hub
A single resource for executing, validating, and scaling LLM systems with modern production standards, while delegating domain depth to specialized skills.
This skill provides quick reference, decision frameworks, and navigation to detailed operational patterns for:
- Data, training, fine-tuning (PEFT/LoRA standard)
- Evaluation (automated testing, metrics, rollout gates)
- Deployment (vLLM 24x throughput, FP8/FP4 quantization)
- LLMOps (automated drift detection, retraining)
- Safety (multi-layered defenses, AI-powered guardrails)
For detailed patterns: See Resources and Templates sections below.
Quick Reference
| Task |
Tool/Framework |
Command/Pattern |
When to Use |
| RAG Pipeline |
LlamaIndex, LangChain |
Page-level chunking + hybrid retrieval |
Dynamic knowledge, 0.648 accuracy |
| Agentic Workflow |
LangGraph, AutoGen, CrewAI |
ReAct, multi-agent orchestration |
Complex tasks, tool use required |
| Prompt Design |
Anthropic, OpenAI guides |
CoT, few-shot, structured |
Task-specific behavior control |
| Evaluation |
LangSmith, W&B, RAGAS |
Multi-metric (hallucination, bias, cost) |
Quality validation, A/B testing |
| Production Deploy |
vLLM, TensorRT-LLM |
FP8/FP4 quantization, 24x throughput |
High-throughput serving, cost optimization |
| Monitoring |
Arize Phoenix, LangFuse |
Drift detection, 18-second response |
Production LLM systems |
Decision Tree: LLM System Architecture
Building LLM application: [Architecture Selection]
├─ Need current knowledge?
│ ├─ Simple Q&A? → Basic RAG (page-level chunking + hybrid retrieval)
│ └─ Complex retrieval? → Advanced RAG (reranking + contextual retrieval)
│
├─ Need tool use / actions?
│ ├─ Single task? → Simple agent (ReAct pattern)
│ └─ Multi-step workflow? → Multi-agent (LangGraph, CrewAI)
│
├─ Static behavior sufficient?
│ ├─ Quick MVP? → Prompt engineering (CI/CD integrated)
│ └─ Production quality? → Fine-tuning (PEFT/LoRA)
│
└─ Best results?
└─ Hybrid (RAG + Fine-tuning + Agents) → Comprehensive solution
See Decision Matrices for detailed selection criteria.
When to Use This Skill
Claude should invoke this skill when the user asks about:
- LLM preflight/project checklists, production best practices, or data pipelines
- Building or deploying RAG, agentic, or prompt-based LLM apps
- Prompt design, chain-of-thought (CoT), ReAct, or template patterns
- Troubleshooting LLM hallucination, bias, retrieval issues, or production failures
- Evaluating LLMs: benchmarks, multi-metric eval, or rollout/monitoring
- LLMOps: deployment, rollback, scaling, resource optimization
- Technology stack selection (models, vector DBs, frameworks)
- Production deployment strategies and operational patterns
Scope Boundaries (Use These Skills for Depth)
Resources (Best Practices & Operational Patterns)
Comprehensive operational guides with checklists, patterns, and decision frameworks:
Core Operational Patterns
Project Planning Patterns - Stack selection, FTI pipeline, performance budgeting
- AI engineering stack selection matrix
- Feature/Training/Inference (FTI) pipeline blueprint
- Performance budgeting and goodput gates
- Progressive complexity (prompt → RAG → fine-tune → hybrid)
Production Checklists - Pre-deployment validation and operational checklists
- LLM lifecycle checklist (modern production standards)
- Data & training, RAG pipeline, deployment & serving
- Safety/guardrails, evaluation, agentic systems
- Reliability & data infrastructure (DDIA-grade)
- Weekly production tasks
Common Design Patterns - Copy-paste ready implementation examples
- Chain-of-Thought (CoT) prompting
- ReAct (Reason + Act) pattern
- RAG pipeline (minimal to advanced)
- Agentic planning loop
- Self-reflection and multi-agent collaboration
Decision Matrices - Quick reference tables for selection
- RAG type decision matrix (naive → advanced → modular)
- Production evaluation table with targets and actions
- Model selection matrix (GPT-4, Claude, Gemini, self-hosted)
- Vector database, embedding model, framework selection
- Deployment strategy matrix
Anti-Patterns - Common mistakes and prevention strategies
- Data leakage, prompt dilution, RAG context overload
- Agentic runaway, over-engineering, ignoring evaluation
- Hard-coded prompts, missing observability
- Detection methods and prevention code examples
Domain-Specific Patterns
- LLMOps Best Practices - Operational lifecycle and deployment patterns
- Evaluation Patterns - Testing, metrics, and quality validation
- Prompt Engineering Patterns - Quick reference (canonical skill: ai-prompt-engineering)
- Agentic Patterns - Quick reference (canonical skill: ai-agents-development)
- RAG Best Practices - Quick reference (canonical skill: ai-llm-rag-engineering)
Note: Each resource file includes preflight/validation checklists, copy-paste reference tables, inline templates, anti-patterns, and decision matrices.
Templates (Copy-Paste Ready)
Production templates by use case and technology:
RAG Pipelines
- Basic RAG - Simple retrieval-augmented generation
- Advanced RAG - Hybrid retrieval, reranking, contextual embeddings
Prompt Engineering
- Chain-of-Thought - Step-by-step reasoning pattern
- ReAct - Reason + Act for tool use
Agentic Workflows
- Reflection Agent - Self-critique and improvement
- Multi-Agent - Manager-worker orchestration
Data Pipelines
- Data Quality - Validation, deduplication, PII detection
Deployment
- LLM Deployment - Production deployment with monitoring
Evaluation
- Multi-Metric Evaluation - Comprehensive testing suite
Related Skills
This skill integrates with complementary Claude Code skills:
Core Dependencies
- ai-llm-rag-engineering - Advanced RAG patterns, chunking strategies, hybrid retrieval, reranking
- ai-llm-search-retrieval - Search optimization, BM25 tuning, vector search, ranking pipelines
- ai-prompt-engineering - Systematic prompt design, evaluation, testing, and optimization
- ai-agents-development - Agent architectures, tool use, multi-agent systems, autonomous workflows
Production & Operations
- ai-llm-development - Model training, fine-tuning, dataset creation, instruction tuning
- ai-llm-ops-inference - Production serving, quantization, batching, GPU optimization
- ai-ml-ops-production - Deployment patterns, monitoring, drift detection, API design
- ai-ml-ops-security - Security guardrails, prompt injection defense, privacy protection
External Resources
See data/sources.json for 50+ curated authoritative sources:
- Official LLM platform docs - OpenAI, Anthropic, Gemini, Mistral, Azure OpenAI, AWS Bedrock
- Open-source models and frameworks - HuggingFace Transformers, LLaMA, vLLM, PEFT/LoRA, DeepSpeed
- RAG frameworks and vector DBs - LlamaIndex, LangChain, LangGraph, Haystack, Pinecone, Qdrant, Chroma
- 2025 Agentic frameworks - Anthropic Agent SDK, AutoGen, CrewAI, LangGraph Multi-Agent, Semantic Kernel
- 2025 RAG innovations - Microsoft GraphRAG (knowledge graphs), Pathway (real-time), hybrid retrieval
- Prompt engineering - Anthropic Prompt Library, Prompt Engineering Guide, CoT/ReAct patterns
- Evaluation and monitoring - OpenAI Evals, HELM, Anthropic Evals, LangSmith, W&B, Arize Phoenix
- Production deployment - LiteLLM, Ollama, RunPod, Together AI, vLLM serving
Usage
For New Projects
- Start with Production Checklists - Validate all pre-deployment requirements
- Use Decision Matrices - Select technology stack
- Reference Project Planning Patterns - Design FTI pipeline
- Implement with Common Design Patterns - Copy-paste code examples
- Avoid Anti-Patterns - Learn from common mistakes
For Troubleshooting
- Check Anti-Patterns - Identify failure modes and mitigations
- Use Decision Matrices - Evaluate if architecture fits use case
- Reference Common Design Patterns - Verify implementation correctness
For Ongoing Operations
- Follow Production Checklists - Weekly operational tasks
- Integrate Evaluation Patterns - Continuous quality monitoring
- Apply LLMOps Best Practices - Deployment and rollback procedures
Navigation Summary
Quick Decisions: Decision Matrices
Pre-Deployment: Production Checklists
Planning: Project Planning Patterns
Implementation: Common Design Patterns
Troubleshooting: Anti-Patterns
Domain Depth: LLMOps | Evaluation | Prompts | Agents | RAG
Templates: templates/ - Copy-paste ready production code
Sources: data/sources.json - Authoritative documentation links
1---2name: ai-llm-engineering3description: Operational skill hub for LLM system architecture, evaluation, deployment, and optimization (modern production standards). Links to specialized skills for prompts, RAG, agents, and safety. Integrates recent advances: PEFT/LoRA fine-tuning, hybrid RAG handoff (see dedicated skill), vLLM 24x throughput, multi-layered security (90%+ bypass for single-layer), automated drift detection (18-second response), and CI/CD-aligned evaluation.4---5
6# LLM Engineering – Operational Skill Hub
7
8A single resource for executing, validating, and scaling LLM systems with **modern production standards**, while delegating domain depth to specialized skills.
9
10This skill provides quick reference, decision frameworks, and navigation to detailed operational patterns for:
11
12- Data, training, fine-tuning (PEFT/LoRA standard)
13- Evaluation (automated testing, metrics, rollout gates)
14- Deployment (vLLM 24x throughput, FP8/FP4 quantization)
15- LLMOps (automated drift detection, retraining)
16- Safety (multi-layered defenses, AI-powered guardrails)
17
18**For detailed patterns:** See [Resources](#resources-best-practices--operational-patterns) and [Templates](#templates-copy-paste-ready) sections below.
19
20---
21
22## Quick Reference
23
24| Task | Tool/Framework | Command/Pattern | When to Use |
25|------|----------------|-----------------|-------------|
26| RAG Pipeline | LlamaIndex, LangChain | Page-level chunking + hybrid retrieval | Dynamic knowledge, 0.648 accuracy |
27| Agentic Workflow | LangGraph, AutoGen, CrewAI | ReAct, multi-agent orchestration | Complex tasks, tool use required |
28| Prompt Design | Anthropic, OpenAI guides | CoT, few-shot, structured | Task-specific behavior control |
29| Evaluation | LangSmith, W&B, RAGAS | Multi-metric (hallucination, bias, cost) | Quality validation, A/B testing |
30| Production Deploy | vLLM, TensorRT-LLM | FP8/FP4 quantization, 24x throughput | High-throughput serving, cost optimization |
31| Monitoring | Arize Phoenix, LangFuse | Drift detection, 18-second response | Production LLM systems |
32
33---
34
35## Decision Tree: LLM System Architecture
36
37```text
38Building LLM application: [Architecture Selection]
39 ├─ Need current knowledge?
40 │ ├─ Simple Q&A? → Basic RAG (page-level chunking + hybrid retrieval)
41 │ └─ Complex retrieval? → Advanced RAG (reranking + contextual retrieval)
42 │
43 ├─ Need tool use / actions?
44 │ ├─ Single task? → Simple agent (ReAct pattern)
45 │ └─ Multi-step workflow? → Multi-agent (LangGraph, CrewAI)
46 │
47 ├─ Static behavior sufficient?
48 │ ├─ Quick MVP? → Prompt engineering (CI/CD integrated)
49 │ └─ Production quality? → Fine-tuning (PEFT/LoRA)
50 │
51 └─ Best results?
52 └─ Hybrid (RAG + Fine-tuning + Agents) → Comprehensive solution
53```
54
55**See [Decision Matrices](resources/decision-matrices.md) for detailed selection criteria.**
56
57---
58
59## When to Use This Skill
60
61Claude should invoke this skill when the user asks about:
62
63- LLM preflight/project checklists, production best practices, or data pipelines
64- Building or deploying RAG, agentic, or prompt-based LLM apps
65- Prompt design, chain-of-thought (CoT), ReAct, or template patterns
66- Troubleshooting LLM hallucination, bias, retrieval issues, or production failures
67- Evaluating LLMs: benchmarks, multi-metric eval, or rollout/monitoring
68- LLMOps: deployment, rollback, scaling, resource optimization
69- Technology stack selection (models, vector DBs, frameworks)
70- Production deployment strategies and operational patterns
71
72---
73
74## Scope Boundaries (Use These Skills for Depth)
75
76- **Prompt design & CI/CD** → [ai-prompt-engineering](../ai-prompt-engineering/SKILL.md)
77- **RAG pipelines & chunking** → [ai-llm-rag-engineering](../ai-llm-rag-engineering/SKILL.md)
78- **Search tuning (BM25, HNSW, hybrid)** → [ai-llm-search-retrieval](../ai-llm-search-retrieval/SKILL.md)
79- **Agent architectures & tools** → [ai-agents-development](../ai-agents-development/SKILL.md)
80- **Serving optimization/quantization** → [ai-llm-ops-inference](../ai-llm-ops-inference/SKILL.md)
81- **Production deployment/monitoring** → [ai-ml-ops-production](../ai-ml-ops-production/SKILL.md)
82- **Security/guardrails** → [ai-ml-ops-security](../ai-ml-ops-security/SKILL.md)
83
84---
85
86## Resources (Best Practices & Operational Patterns)
87
88Comprehensive operational guides with checklists, patterns, and decision frameworks:
89
90### Core Operational Patterns
91
92- **[Project Planning Patterns](resources/project-planning-patterns.md)** - Stack selection, FTI pipeline, performance budgeting
93 - AI engineering stack selection matrix
94 - Feature/Training/Inference (FTI) pipeline blueprint
95 - Performance budgeting and goodput gates
96 - Progressive complexity (prompt → RAG → fine-tune → hybrid)
97
98- **[Production Checklists](resources/production-checklists.md)** - Pre-deployment validation and operational checklists
99 - LLM lifecycle checklist (modern production standards)
100 - Data & training, RAG pipeline, deployment & serving
101 - Safety/guardrails, evaluation, agentic systems
102 - Reliability & data infrastructure (DDIA-grade)
103 - Weekly production tasks
104
105- **[Common Design Patterns](resources/common-design-patterns.md)** - Copy-paste ready implementation examples
106 - Chain-of-Thought (CoT) prompting
107 - ReAct (Reason + Act) pattern
108 - RAG pipeline (minimal to advanced)
109 - Agentic planning loop
110 - Self-reflection and multi-agent collaboration
111
112- **[Decision Matrices](resources/decision-matrices.md)** - Quick reference tables for selection
113 - RAG type decision matrix (naive → advanced → modular)
114 - Production evaluation table with targets and actions
115 - Model selection matrix (GPT-4, Claude, Gemini, self-hosted)
116 - Vector database, embedding model, framework selection
117 - Deployment strategy matrix
118
119- **[Anti-Patterns](resources/anti-patterns.md)** - Common mistakes and prevention strategies
120 - Data leakage, prompt dilution, RAG context overload
121 - Agentic runaway, over-engineering, ignoring evaluation
122 - Hard-coded prompts, missing observability
123 - Detection methods and prevention code examples
124
125### Domain-Specific Patterns
126
127- **[LLMOps Best Practices](resources/llmops-best-practices.md)** - Operational lifecycle and deployment patterns
128- **[Evaluation Patterns](resources/eval-patterns.md)** - Testing, metrics, and quality validation
129- **[Prompt Engineering Patterns](resources/prompt-engineering-patterns.md)** - Quick reference (canonical skill: [ai-prompt-engineering](../ai-prompt-engineering/SKILL.md))
130- **[Agentic Patterns](resources/agentic-patterns.md)** - Quick reference (canonical skill: [ai-agents-development](../ai-agents-development/SKILL.md))
131- **[RAG Best Practices](resources/rag-best-practices.md)** - Quick reference (canonical skill: [ai-llm-rag-engineering](../ai-llm-rag-engineering/SKILL.md))
132
133**Note:** Each resource file includes preflight/validation checklists, copy-paste reference tables, inline templates, anti-patterns, and decision matrices.
134
135---
136
137## Templates (Copy-Paste Ready)
138
139Production templates by use case and technology:
140
141### RAG Pipelines
142
143- **[Basic RAG](templates/rag-pipelines/template-basic-rag.md)** - Simple retrieval-augmented generation
144- **[Advanced RAG](templates/rag-pipelines/template-advanced-rag.md)** - Hybrid retrieval, reranking, contextual embeddings
145
146### Prompt Engineering
147
148- **[Chain-of-Thought](templates/prompt-engineering/template-cot.md)** - Step-by-step reasoning pattern
149- **[ReAct](templates/prompt-engineering/template-react.md)** - Reason + Act for tool use
150
151### Agentic Workflows
152
153- **[Reflection Agent](templates/agentic-workflows/template-reflection.md)** - Self-critique and improvement
154- **[Multi-Agent](templates/agentic-workflows/template-multi-agent.md)** - Manager-worker orchestration
155
156### Data Pipelines
157
158- **[Data Quality](templates/data-pipelines/template-data-quality.md)** - Validation, deduplication, PII detection
159
160### Deployment
161
162- **[LLM Deployment](templates/deployment/template-llm-deployment.md)** - Production deployment with monitoring
163
164### Evaluation
165
166- **[Multi-Metric Evaluation](templates/evaluation/template-multi-metric.md)** - Comprehensive testing suite
167
168---
169
170## Related Skills
171
172This skill integrates with complementary Claude Code skills:
173
174### Core Dependencies
175
176- **[ai-llm-rag-engineering](../ai-llm-rag-engineering/SKILL.md)** - Advanced RAG patterns, chunking strategies, hybrid retrieval, reranking
177- **[ai-llm-search-retrieval](../ai-llm-search-retrieval/SKILL.md)** - Search optimization, BM25 tuning, vector search, ranking pipelines
178- **[ai-prompt-engineering](../ai-prompt-engineering/SKILL.md)** - Systematic prompt design, evaluation, testing, and optimization
179- **[ai-agents-development](../ai-agents-development/SKILL.md)** - Agent architectures, tool use, multi-agent systems, autonomous workflows
180
181### Production & Operations
182
183- **[ai-llm-development](../ai-llm-development/SKILL.md)** - Model training, fine-tuning, dataset creation, instruction tuning
184- **[ai-llm-ops-inference](../ai-llm-ops-inference/SKILL.md)** - Production serving, quantization, batching, GPU optimization
185- **[ai-ml-ops-production](../ai-ml-ops-production/SKILL.md)** - Deployment patterns, monitoring, drift detection, API design
186- **[ai-ml-ops-security](../ai-ml-ops-security/SKILL.md)** - Security guardrails, prompt injection defense, privacy protection
187
188---
189
190## External Resources
191
192See **[data/sources.json](data/sources.json)** for 50+ curated authoritative sources:
193
194- **Official LLM platform docs** - OpenAI, Anthropic, Gemini, Mistral, Azure OpenAI, AWS Bedrock
195- **Open-source models and frameworks** - HuggingFace Transformers, LLaMA, vLLM, PEFT/LoRA, DeepSpeed
196- **RAG frameworks and vector DBs** - LlamaIndex, LangChain, LangGraph, Haystack, Pinecone, Qdrant, Chroma
197- **2025 Agentic frameworks** - Anthropic Agent SDK, AutoGen, CrewAI, LangGraph Multi-Agent, Semantic Kernel
198- **2025 RAG innovations** - Microsoft GraphRAG (knowledge graphs), Pathway (real-time), hybrid retrieval
199- **Prompt engineering** - Anthropic Prompt Library, Prompt Engineering Guide, CoT/ReAct patterns
200- **Evaluation and monitoring** - OpenAI Evals, HELM, Anthropic Evals, LangSmith, W&B, Arize Phoenix
201- **Production deployment** - LiteLLM, Ollama, RunPod, Together AI, vLLM serving
202
203---
204
205## Usage
206
207### For New Projects
208
2091. Start with **[Production Checklists](resources/production-checklists.md)** - Validate all pre-deployment requirements
2102. Use **[Decision Matrices](resources/decision-matrices.md)** - Select technology stack
2113. Reference **[Project Planning Patterns](resources/project-planning-patterns.md)** - Design FTI pipeline
2124. Implement with **[Common Design Patterns](resources/common-design-patterns.md)** - Copy-paste code examples
2135. Avoid **[Anti-Patterns](resources/anti-patterns.md)** - Learn from common mistakes
214
215### For Troubleshooting
216
2171. Check **[Anti-Patterns](resources/anti-patterns.md)** - Identify failure modes and mitigations
2182. Use **[Decision Matrices](resources/decision-matrices.md)** - Evaluate if architecture fits use case
2193. Reference **[Common Design Patterns](resources/common-design-patterns.md)** - Verify implementation correctness
220
221### For Ongoing Operations
222
2231. Follow **[Production Checklists](resources/production-checklists.md)** - Weekly operational tasks
2242. Integrate **[Evaluation Patterns](resources/eval-patterns.md)** - Continuous quality monitoring
2253. Apply **[LLMOps Best Practices](resources/llmops-best-practices.md)** - Deployment and rollback procedures
226
227---
228
229## Navigation Summary
230
231**Quick Decisions:** [Decision Matrices](resources/decision-matrices.md)
232**Pre-Deployment:** [Production Checklists](resources/production-checklists.md)
233**Planning:** [Project Planning Patterns](resources/project-planning-patterns.md)
234**Implementation:** [Common Design Patterns](resources/common-design-patterns.md)
235**Troubleshooting:** [Anti-Patterns](resources/anti-patterns.md)
236
237**Domain Depth:** [LLMOps](resources/llmops-best-practices.md) | [Evaluation](resources/eval-patterns.md) | [Prompts](resources/prompt-engineering-patterns.md) | [Agents](resources/agentic-patterns.md) | [RAG](resources/rag-best-practices.md)
238
239**Templates:** [templates/](templates/) - Copy-paste ready production code
240
241**Sources:** [data/sources.json](data/sources.json) - Authoritative documentation links
242
243---