Data Science & AI Guide
Master data science, machine learning, generative AI, and modern AI engineering practices.
Quick Start
Python Data Science Stack
import pandas as pd
import numpy as np
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
# Load and prepare data
df = pd.read_csv('data.csv')
X = df.drop('target', axis=1)
y = df['target']
# Split data
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
# Train model
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)
# Evaluate
accuracy = model.score(X_test, y_test)
Deep Learning with PyTorch
import torch
import torch.nn as nn
class SimpleNN(nn.Module):
def __init__(self):
super().__init__()
self.linear1 = nn.Linear(784, 128)
self.linear2 = nn.Linear(128, 10)
def forward(self, x):
x = torch.relu(self.linear1(x))
return self.linear2(x)
# Training loop
model = SimpleNN()
optimizer = torch.optim.Adam(model.parameters())
criterion = nn.CrossEntropyLoss()
LLM Prompt Engineering
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-4",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "What is machine learning?"}
],
temperature=0.7
)
Data Science Path
Fundamentals
- Mathematics: Statistics, linear algebra, calculus
- Python: Libraries (Pandas, NumPy, Scikit-learn)
- Data Analysis: Exploratory analysis, visualization
- SQL: Querying and data manipulation
Machine Learning
- Supervised Learning: Regression, classification
- Unsupervised Learning: Clustering, dimensionality reduction
- Model Evaluation: Cross-validation, metrics
- Hyperparameter Tuning: Grid search, Bayesian optimization
Deep Learning
- Neural Networks: Architecture, training
- CNNs: Computer vision tasks
- RNNs: Sequence modeling
- Transformers: Modern architecture for NLP/Vision
Natural Language Processing
- Text Processing: Tokenization, embeddings
- Word Embeddings: Word2Vec, GloVe, FastText
- BERT: Contextual embeddings
- Transformers: GPT, BERT for various NLP tasks
Generative AI & LLMs
Large Language Models
- GPT Family: GPT-3.5, GPT-4 for text generation
- Claude: Constitutional AI models
- Open Source: Llama, Mistral, Zephyr
- Fine-tuning: Adapting models for specific tasks
Prompt Engineering
- Role-based Prompting: Setting context and expertise
- Few-shot Learning: Examples in prompt
- Chain-of-Thought: Step-by-step reasoning
- Retrieval Augmented Generation (RAG): Knowledge augmentation
# RAG Example
from langchain.vectorstores import Chroma
from langchain.embeddings import OpenAIEmbeddings
from langchain.chains import RetrievalQA
embeddings = OpenAIEmbeddings()
vectorstore = Chroma(embedding_function=embeddings)
qa = RetrievalQA.from_chain_type(
llm=llm,
chain_type="stuff",
retriever=vectorstore.as_retriever()
)
AI Agents
- Tool Use: Agents calling external tools
- Planning: Multi-step task execution
- Memory: Conversation history, context
- Evaluation: Assessing agent performance
Data Engineering
ETL Pipelines
- Apache Airflow: Workflow orchestration
- dbt: Data transformation
- Kafka: Stream processing
- Spark: Distributed processing
Big Data
- Hadoop: Distributed storage and processing
- Spark: In-memory processing framework
- Scala: Spark's native language
- Distributed Systems: Understanding CAP theorem
Data Warehousing
- Snowflake: Cloud data warehouse
- BigQuery: Google's data warehouse
- Redshift: AWS data warehouse
- Star Schema: Dimensional modeling
MLOps
Model Management
- Model Versioning: Tracking model versions
- Model Registry: MLflow, Weights & Biases
- Experiment Tracking: Monitoring training runs
- Model Cards: Documenting model capabilities
Deployment
- Model Serving: FastAPI, TFServing
- Containerization: Docker for models
- Kubernetes: Production ML deployment
- API Monitoring: Performance and data drift
Monitoring
- Data Drift: Detecting distribution changes
- Model Drift: Performance degradation
- Feature Store: Consistent feature serving
- Observability: Logging and metrics
Technology Stack
Core Libraries
- Pandas: Data manipulation
- NumPy: Numerical computing
- Scikit-learn: Machine learning
- Matplotlib/Seaborn: Visualization
- Plotly: Interactive plots
Deep Learning
- TensorFlow: Keras API, distributed training
- PyTorch: Dynamic graphs, research-friendly
- JAX: Functional programming for ML
LLM Frameworks
- LangChain: Building LLM applications
- LlamaIndex: RAG and indexing
- OpenAI API: GPT models access
- Hugging Face: Model hub and transformers
Learning Path
Fundamentals (3 months)
- Python programming
- Statistics and mathematics
- Data manipulation with Pandas
Machine Learning (3 months)
- Supervised learning
- Model evaluation
- Feature engineering
Deep Learning (2 months)
- Neural networks
- CNNs and RNNs
- Transformers
Specialization (ongoing)
- NLP / Computer Vision / Tabular Data
- LLMs and generative AI
- MLOps and production
Projects
- Iris Classification - Classic ML project
- Housing Price Prediction - Regression
- Sentiment Analysis - NLP with transformers
- Image Classification - CNN with deep learning
- LLM Chatbot - Using prompt engineering
- RAG System - Knowledge-augmented AI
- Time Series Forecasting - Stock predictions
Resources
Learning Platforms
- Coursera: Andrew Ng's ML course
- Fast.ai: Practical deep learning
- DataCamp: Interactive data science
- Kaggle: Competitions and datasets
Documentation
Roadmap.sh Reference: https://roadmap.sh/ai-engineer
Status: ✅ Production Ready | SASMP: v1.3.0 | Bonded Agent: 04-data-ai-specialist
1---2name: data-ai-guide3description: Comprehensive data science, machine learning, and AI guide covering Python, deep learning, NLP, LLMs, prompt engineering, and MLOps. Use when building AI models, data pipelines, or machine learning systems.4---5
6# Data Science & AI Guide
7
8Master data science, machine learning, generative AI, and modern AI engineering practices.
9
10## Quick Start
11
12### Python Data Science Stack
13```python
14import pandas as pd
15import numpy as np
16from sklearn.model_selection import train_test_split
17from sklearn.ensemble import RandomForestClassifier
18
19# Load and prepare data
20df = pd.read_csv('data.csv')
21X = df.drop('target', axis=1)
22y = df['target']
23
24# Split data
25X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
26
27# Train model
28model = RandomForestClassifier(n_estimators=100)
29model.fit(X_train, y_train)
30
31# Evaluate
32accuracy = model.score(X_test, y_test)
33```
34
35### Deep Learning with PyTorch
36```python
37import torch
38import torch.nn as nn
39
40class SimpleNN(nn.Module):
41 def __init__(self):
42 super().__init__()
43 self.linear1 = nn.Linear(784, 128)
44 self.linear2 = nn.Linear(128, 10)
45
46 def forward(self, x):
47 x = torch.relu(self.linear1(x))
48 return self.linear2(x)
49
50# Training loop
51model = SimpleNN()
52optimizer = torch.optim.Adam(model.parameters())
53criterion = nn.CrossEntropyLoss()
54```
55
56### LLM Prompt Engineering
57```python
58from openai import OpenAI
59
60client = OpenAI()
61
62response = client.chat.completions.create(
63 model="gpt-4",
64 messages=[
65 {"role": "system", "content": "You are a helpful assistant."},
66 {"role": "user", "content": "What is machine learning?"}
67 ],
68 temperature=0.7
69)
70```
71
72## Data Science Path
73
74### Fundamentals
75- **Mathematics**: Statistics, linear algebra, calculus
76- **Python**: Libraries (Pandas, NumPy, Scikit-learn)
77- **Data Analysis**: Exploratory analysis, visualization
78- **SQL**: Querying and data manipulation
79
80### Machine Learning
81- **Supervised Learning**: Regression, classification
82- **Unsupervised Learning**: Clustering, dimensionality reduction
83- **Model Evaluation**: Cross-validation, metrics
84- **Hyperparameter Tuning**: Grid search, Bayesian optimization
85
86### Deep Learning
87- **Neural Networks**: Architecture, training
88- **CNNs**: Computer vision tasks
89- **RNNs**: Sequence modeling
90- **Transformers**: Modern architecture for NLP/Vision
91
92### Natural Language Processing
93- **Text Processing**: Tokenization, embeddings
94- **Word Embeddings**: Word2Vec, GloVe, FastText
95- **BERT**: Contextual embeddings
96- **Transformers**: GPT, BERT for various NLP tasks
97
98## Generative AI & LLMs
99
100### Large Language Models
101- **GPT Family**: GPT-3.5, GPT-4 for text generation
102- **Claude**: Constitutional AI models
103- **Open Source**: Llama, Mistral, Zephyr
104- **Fine-tuning**: Adapting models for specific tasks
105
106### Prompt Engineering
107- **Role-based Prompting**: Setting context and expertise
108- **Few-shot Learning**: Examples in prompt
109- **Chain-of-Thought**: Step-by-step reasoning
110- **Retrieval Augmented Generation (RAG)**: Knowledge augmentation
111
112```python
113# RAG Example
114from langchain.vectorstores import Chroma
115from langchain.embeddings import OpenAIEmbeddings
116from langchain.chains import RetrievalQA
117
118embeddings = OpenAIEmbeddings()
119vectorstore = Chroma(embedding_function=embeddings)
120
121qa = RetrievalQA.from_chain_type(
122 llm=llm,
123 chain_type="stuff",
124 retriever=vectorstore.as_retriever()
125)
126```
127
128### AI Agents
129- **Tool Use**: Agents calling external tools
130- **Planning**: Multi-step task execution
131- **Memory**: Conversation history, context
132- **Evaluation**: Assessing agent performance
133
134## Data Engineering
135
136### ETL Pipelines
137- **Apache Airflow**: Workflow orchestration
138- **dbt**: Data transformation
139- **Kafka**: Stream processing
140- **Spark**: Distributed processing
141
142### Big Data
143- **Hadoop**: Distributed storage and processing
144- **Spark**: In-memory processing framework
145- **Scala**: Spark's native language
146- **Distributed Systems**: Understanding CAP theorem
147
148### Data Warehousing
149- **Snowflake**: Cloud data warehouse
150- **BigQuery**: Google's data warehouse
151- **Redshift**: AWS data warehouse
152- **Star Schema**: Dimensional modeling
153
154## MLOps
155
156### Model Management
157- **Model Versioning**: Tracking model versions
158- **Model Registry**: MLflow, Weights & Biases
159- **Experiment Tracking**: Monitoring training runs
160- **Model Cards**: Documenting model capabilities
161
162### Deployment
163- **Model Serving**: FastAPI, TFServing
164- **Containerization**: Docker for models
165- **Kubernetes**: Production ML deployment
166- **API Monitoring**: Performance and data drift
167
168### Monitoring
169- **Data Drift**: Detecting distribution changes
170- **Model Drift**: Performance degradation
171- **Feature Store**: Consistent feature serving
172- **Observability**: Logging and metrics
173
174## Technology Stack
175
176### Core Libraries
177- **Pandas**: Data manipulation
178- **NumPy**: Numerical computing
179- **Scikit-learn**: Machine learning
180- **Matplotlib/Seaborn**: Visualization
181- **Plotly**: Interactive plots
182
183### Deep Learning
184- **TensorFlow**: Keras API, distributed training
185- **PyTorch**: Dynamic graphs, research-friendly
186- **JAX**: Functional programming for ML
187
188### LLM Frameworks
189- **LangChain**: Building LLM applications
190- **LlamaIndex**: RAG and indexing
191- **OpenAI API**: GPT models access
192- **Hugging Face**: Model hub and transformers
193
194## Learning Path
195
1961. **Fundamentals** (3 months)
197 - Python programming
198 - Statistics and mathematics
199 - Data manipulation with Pandas
200
2012. **Machine Learning** (3 months)
202 - Supervised learning
203 - Model evaluation
204 - Feature engineering
205
2063. **Deep Learning** (2 months)
207 - Neural networks
208 - CNNs and RNNs
209 - Transformers
210
2114. **Specialization** (ongoing)
212 - NLP / Computer Vision / Tabular Data
213 - LLMs and generative AI
214 - MLOps and production
215
216## Projects
217
2181. **Iris Classification** - Classic ML project
2192. **Housing Price Prediction** - Regression
2203. **Sentiment Analysis** - NLP with transformers
2214. **Image Classification** - CNN with deep learning
2225. **LLM Chatbot** - Using prompt engineering
2236. **RAG System** - Knowledge-augmented AI
2247. **Time Series Forecasting** - Stock predictions
225
226## Resources
227
228### Learning Platforms
229- **Coursera**: Andrew Ng's ML course
230- **Fast.ai**: Practical deep learning
231- **DataCamp**: Interactive data science
232- **Kaggle**: Competitions and datasets
233
234### Documentation
235- [Scikit-learn](https://scikit-learn.org/)
236- [PyTorch](https://pytorch.org/)
237- [Hugging Face](https://huggingface.co/)
238- [OpenAI API](https://platform.openai.com/)
239
240**Roadmap.sh Reference**: https://roadmap.sh/ai-engineer
241
242---
243
244**Status**: ✅ Production Ready | **SASMP**: v1.3.0 | **Bonded Agent**: 04-data-ai-specialist