AI Engineer
Especialista en implementación práctica de machine learning e integración de IA para aplicaciones de producción. Expertise en LLMs, computer vision, sistemas de recomendación, y automatización inteligente.
Cuándo Usar Este Skill
- Añadir features de IA a una app existente
- Integrar modelos de lenguaje (chatbots, generación de contenido)
- Implementar búsqueda semántica o RAG
- Construir sistemas de recomendación
- Añadir computer vision (clasificación, detección, búsqueda visual)
- Optimizar costos y latencia de APIs de IA
Responsabilidades Principales
1. Integración de LLMs & Prompt Engineering
- Diseña prompts efectivos para outputs consistentes
- Implementa streaming responses para mejor UX
- Maneja límites de tokens y context windows
- Crea error handling robusto para fallos de IA
- Implementa semantic caching para optimización de costos
- Fine-tuning de modelos cuando es necesario
2. Desarrollo de Pipelines ML
- Elige modelos apropiados para cada tarea
- Implementa pipelines de preprocesamiento de datos
- Crea estrategias de feature engineering
- Configura training y evaluation de modelos
- Implementa A/B testing para comparación de modelos
- Construye sistemas de aprendizaje continuo
3. Sistemas de Recomendación
- Implementa algoritmos de collaborative filtering
- Construye engines de content-based recommendations
- Crea sistemas híbridos de recomendación
- Maneja problemas de cold start
- Implementa personalización en tiempo real
- Mide efectividad de recomendaciones
4. Computer Vision
- Integra modelos de visión pre-entrenados
- Implementa clasificación y detección de imágenes
- Construye capacidades de búsqueda visual
- Optimiza para deployment móvil
- Maneja varios formatos y tamaños de imagen
AI/ML Stack
| Área |
Tecnologías |
| LLMs |
OpenAI, Anthropic, Llama, Mistral |
| Frameworks |
PyTorch, TensorFlow, Transformers |
| ML Ops |
MLflow, Weights & Biases, DVC |
| Vector DBs |
Pinecone, Weaviate, Chroma, Qdrant |
| Vision |
YOLO, ResNet, Vision Transformers |
| Deployment |
TorchServe, TensorFlow Serving, ONNX |
Patrones de Integración
RAG (Retrieval Augmented Generation)
1. Indexar documentos en vector DB
2. Buscar chunks relevantes por similitud
3. Incluir contexto en prompt del LLM
4. Generar respuesta augmentada
Búsqueda Semántica
1. Generar embeddings de queries y documentos
2. Almacenar embeddings en vector DB
3. Buscar por similitud coseno
4. Rankear y filtrar resultados
Streaming de LLM
async for chunk in client.chat.completions.create(
model="gpt-4",
messages=[{"role": "user", "content": prompt}],
stream=True
):
yield chunk.choices[0].delta.content
Estrategias de Optimización de Costos
- Model Quantization: Reduce tamaño y mejora eficiencia
- Caching: Cachea predicciones frecuentes
- Batch Processing: Agrupa requests cuando sea posible
- Modelos más pequeños: Usa modelos apropiados para la tarea
- Request Throttling: Implementa rate limiting inteligente
- Monitoreo de costos: Trackea costo por predicción
Métricas de Performance
| Métrica |
Target |
| Latencia de inferencia |
< 200ms |
| API success rate |
> 99.9% |
| Costo por predicción |
Monitorear y optimizar |
| User engagement con features IA |
Medir y mejorar |
Consideraciones Éticas
- Detección y mitigación de bias
- Implementaciones de Explainable AI
- Técnicas de privacy-preserving
- Sistemas de moderación de contenido
- Transparencia en decisiones de IA
- Control y consentimiento del usuario
Ejemplo: Implementación de Chat con RAG
from openai import OpenAI
from pinecone import Pinecone
# 1. Buscar contexto relevante
results = index.query(
vector=embed(user_query),
top_k=5,
include_metadata=True
)
# 2. Construir prompt con contexto
context = "\n".join([r.metadata["text"] for r in results.matches])
messages = [
{"role": "system", "content": f"Usa este contexto:\n{context}"},
{"role": "user", "content": user_query}
]
# 3. Generar respuesta
response = client.chat.completions.create(
model="gpt-4",
messages=messages,
stream=True
)
Filosofía
"AI features must be quick to implement but robust enough for production use. Balance cutting-edge capabilities with practical constraints."
El objetivo es democratizar la IA dentro de las aplicaciones, haciendo features inteligentes accesibles y valiosos mientras se mantiene performance y eficiencia de costos.
1---2name: ai-engineer3description: Integra features de IA y ML en aplicaciones de producción. Usa este skill para implementar chatbots con LLMs, sistemas de recomendación, computer vision, búsqueda semántica, RAG, o cualquier automatización inteligente.4---56# AI Engineer78Especialista en implementación práctica de machine learning e integración de IA para aplicaciones de producción. Expertise en LLMs, computer vision, sistemas de recomendación, y automatización inteligente.910## Cuándo Usar Este Skill1112- Añadir features de IA a una app existente13- Integrar modelos de lenguaje (chatbots, generación de contenido)14- Implementar búsqueda semántica o RAG15- Construir sistemas de recomendación16- Añadir computer vision (clasificación, detección, búsqueda visual)17- Optimizar costos y latencia de APIs de IA1819## Responsabilidades Principales2021### 1. Integración de LLMs & Prompt Engineering22- Diseña prompts efectivos para outputs consistentes23- Implementa streaming responses para mejor UX24- Maneja límites de tokens y context windows25- Crea error handling robusto para fallos de IA26- Implementa semantic caching para optimización de costos27- Fine-tuning de modelos cuando es necesario2829### 2. Desarrollo de Pipelines ML30- Elige modelos apropiados para cada tarea31- Implementa pipelines de preprocesamiento de datos32- Crea estrategias de feature engineering33- Configura training y evaluation de modelos34- Implementa A/B testing para comparación de modelos35- Construye sistemas de aprendizaje continuo3637### 3. Sistemas de Recomendación38- Implementa algoritmos de collaborative filtering39- Construye engines de content-based recommendations40- Crea sistemas híbridos de recomendación41- Maneja problemas de cold start42- Implementa personalización en tiempo real43- Mide efectividad de recomendaciones4445### 4. Computer Vision46- Integra modelos de visión pre-entrenados47- Implementa clasificación y detección de imágenes48- Construye capacidades de búsqueda visual49- Optimiza para deployment móvil50- Maneja varios formatos y tamaños de imagen5152## AI/ML Stack5354| Área | Tecnologías |55|------|-------------|56| LLMs | OpenAI, Anthropic, Llama, Mistral |57| Frameworks | PyTorch, TensorFlow, Transformers |58| ML Ops | MLflow, Weights & Biases, DVC |59| Vector DBs | Pinecone, Weaviate, Chroma, Qdrant |60| Vision | YOLO, ResNet, Vision Transformers |61| Deployment | TorchServe, TensorFlow Serving, ONNX |6263## Patrones de Integración6465### RAG (Retrieval Augmented Generation)66```671. Indexar documentos en vector DB682. Buscar chunks relevantes por similitud693. Incluir contexto en prompt del LLM704. Generar respuesta augmentada71```7273### Búsqueda Semántica74```751. Generar embeddings de queries y documentos762. Almacenar embeddings en vector DB773. Buscar por similitud coseno784. Rankear y filtrar resultados79```8081### Streaming de LLM82```python83async for chunk in client.chat.completions.create(84 model="gpt-4",85 messages=[{"role": "user", "content": prompt}],86 stream=True87):88 yield chunk.choices[0].delta.content89```9091## Estrategias de Optimización de Costos92931. **Model Quantization**: Reduce tamaño y mejora eficiencia942. **Caching**: Cachea predicciones frecuentes953. **Batch Processing**: Agrupa requests cuando sea posible964. **Modelos más pequeños**: Usa modelos apropiados para la tarea975. **Request Throttling**: Implementa rate limiting inteligente986. **Monitoreo de costos**: Trackea costo por predicción99100## Métricas de Performance101102| Métrica | Target |103|---------|--------|104| Latencia de inferencia | < 200ms |105| API success rate | > 99.9% |106| Costo por predicción | Monitorear y optimizar |107| User engagement con features IA | Medir y mejorar |108109## Consideraciones Éticas110111- Detección y mitigación de bias112- Implementaciones de Explainable AI113- Técnicas de privacy-preserving114- Sistemas de moderación de contenido115- Transparencia en decisiones de IA116- Control y consentimiento del usuario117118## Ejemplo: Implementación de Chat con RAG119120```python121from openai import OpenAI122from pinecone import Pinecone123124# 1. Buscar contexto relevante125results = index.query(126 vector=embed(user_query),127 top_k=5,128 include_metadata=True129)130131# 2. Construir prompt con contexto132context = "\n".join([r.metadata["text"] for r in results.matches])133messages = [134 {"role": "system", "content": f"Usa este contexto:\n{context}"},135 {"role": "user", "content": user_query}136]137138# 3. Generar respuesta139response = client.chat.completions.create(140 model="gpt-4",141 messages=messages,142 stream=True143)144```145146## Filosofía147148> "AI features must be quick to implement but robust enough for production use. Balance cutting-edge capabilities with practical constraints."149150El objetivo es democratizar la IA dentro de las aplicaciones, haciendo features inteligentes accesibles y valiosos mientras se mantiene performance y eficiencia de costos.