XAI Grok API Mastery
Complete expertise in XAI's Grok API for building production-ready AI applications with language models, agentic tools, RAG, and multimodal capabilities.
🎯 Auto-Activation Triggers
This skill automatically activates when the user mentions:
- "Grok" or "grok"
- "XAI" or "x.ai"
- "Ask Grok" or "Use Grok"
- Model names: "grok-4", "grok-4-fast", "grok-3", etc.
- Tools: "web_search", "x_search" (in XAI context)
- Multi-perspective analysis requests
- Comparison requests: "Claude vs Grok", "compare perspectives"
🚀 Quick Hook Access
Call Grok directly via hooks (use Bash tool):
# Non-streaming (default, most queries)
export XAI_API_KEY=$(grep XAI_API_KEY /Users/manu/Documents/LUXOR/xai/.env | cut -d '=' -f2) && \
echo '{"prompt": "Your question here", "model": "grok-4-fast"}' | ~/.claude/hooks/grok-api.sh
# Streaming (for long responses)
cd /Users/manu/Documents/LUXOR/xai && source venv/bin/activate && \
export XAI_API_KEY=$(grep XAI_API_KEY .env | cut -d '=' -f2) && \
echo '{"prompt": "Your question here", "stream": true}' | python ~/.claude/hooks/grok-streaming.py
# With tools (web search)
export XAI_API_KEY=$(grep XAI_API_KEY /Users/manu/Documents/LUXOR/xai/.env | cut -d '=' -f2) && \
echo '{"prompt": "Research latest AI", "tools": ["web_search"]}' | ~/.claude/hooks/grok-api.sh
Skill Overview
This skill provides comprehensive knowledge of XAI's Grok API platform, covering all 7 models (5 language, 2 multimodal), 3 server-side agentic tools (web search, X search, code execution), RAG infrastructure via Collections API, and advanced features including reasoning with encrypted thinking traces, massive 2M token context windows, and cost optimization strategies.
Core Expertise
1. Model Selection & Optimization
- 7 Production Models: grok-4, grok-4-fast (reasoning/non-reasoning variants), grok-3, grok-3-mini, grok-2-vision, grok-2-image
- Context Windows: Up to 2M tokens (largest available)
- Reasoning Models: Native reasoning with encrypted thinking traces
- Cost Optimization: 98% savings strategies (grok-4-fast vs grok-4)
- Model Selection Matrix: Decision trees for optimal model selection by use case
2. Authentication & Security
- API Key Management: Creation, rotation, deletion via Console and Management API
- ACL System: Fine-grained permissions (endpoints, models, wildcards)
- Rate Limiting: QPM, QPS, TPM configuration and monitoring
- Team Management: Admin vs member permissions, key ownership
- Security Best Practices: Secret management, rotation schedules, least privilege
3. Chat & Completions API
- Message Structure: System, user, assistant roles with flexible ordering
- Streaming: SSE streaming for real-time responses
- Deferred Completions: Long-running tasks with polling
- Stateful Conversations: Responses API with previous_response_id
- Token Management: Prompt, reasoning, completion token tracking
- Parameter Tuning: Temperature, top_p, max_tokens, seed for reproducibility
- System Fingerprint: Configuration tracking for debugging
4. Agentic Tools (Server-Side)
- web_search(): Real-time internet search with domain filtering
- x_search(): X/Twitter search with handle/engagement filtering
- code_execution(): Python sandbox for data analysis, calculations, visualization
- Multi-Tool Orchestration: Combining tools for complex research workflows
- Tool Usage Tracking: Billing and cost monitoring
- Stateful Agentic Conversations: Multi-turn tool-augmented dialogs
5. RAG Implementation (Collections API)
- Collection Management: Create, list, update, delete collections
- Document Upload: HTML, PDF, TXT, Markdown support
- Chunking Strategies: Token-based splitting (512-2048 tokens, configurable overlap)
- Embedding & Indexing: Automatic with grok-embedding-small
- Semantic Search: Multi-collection search with relevance scoring
- RAG Patterns: 6 production patterns (basic, iterative, citations, hybrid, conversational, confidence)
6. Image Capabilities
- Image Understanding: grok-2-vision-1212 (text + image → text)
- Input formats: URL, base64 (JPG, PNG up to 20 MiB)
- Detail parameter: high, low, auto
- Use cases: OCR, document analysis, visual Q&A
- Image Generation: grok-2-image-1212 (text → image)
- Batch generation: 1-10 images
- Prompt refinement system
- Cost: $0.07/image
7. Live Search & Citations
- Search Modes: auto, on, off
- Data Sources: Web, X, News, RSS feeds
- Citation Tracking: Source URLs, snippets, timestamps
- Source Filtering: Domain allow/exclude lists, geographic targeting
- Cost Optimization: Limiting search results, caching strategies
8. Cost Management
- Pricing Structure: Tiered pricing by context window (<128K, >128K)
- Token Categories: Prompt (fresh/cached), reasoning, completion
- Tool Costs: $2.50 per 100 sources (web/X search)
- Cost Estimators: Token-based cost calculation
- Optimization Strategies: Model selection, caching, batching, right-sizing
9. SDK Integration
- Native SDKs: xai-sdk (Python, TypeScript)
- Compatible SDKs: OpenAI SDK, Anthropic SDK (base_url override)
- Framework Integration: Vercel AI SDK, LangChain, LlamaIndex
- gRPC API: High-performance protocol alternative
10. Production Patterns
- Error Handling: HTTP codes, retry logic with exponential backoff
- Streaming Patterns: SSE chunking, progressive display
- Async Workflows: Deferred completions, background processing
- Monitoring: Token usage tracking, cost analysis, performance metrics
- Debugging: System fingerprint, encrypted thinking traces, verbose logging
Use Case Mastery
By Application Type
- Chatbots: Model selection, conversation management, memory strategies
- Research Agents: Multi-tool orchestration, citation tracking, iterative refinement
- Document Q&A: RAG implementation, chunking optimization, context management
- Image Processing: OCR, visual analysis, document extraction
- Content Generation: Image generation, batch processing, prompt engineering
- Data Analysis: Code execution, statistical analysis, visualization
By Industry
- Finance: Market research, analysis workflows, compliance
- Healthcare: Document processing, research assistance, privacy considerations
- E-commerce: Product descriptions, visual search, content generation
- Customer Support: Knowledge base Q&A, RAG implementation, escalation
- Media: Content generation, image creation, social listening
- Legal: Document analysis, OCR, citation tracking
- Education: Tutoring systems, Q&A, research assistance
Technical Capabilities
Code Generation
- Complete Python implementations using xai-sdk
- OpenAI SDK compatibility examples
- curl commands for API testing
- JavaScript/TypeScript examples
- Production-ready error handling
- Async/await patterns
- Streaming implementations
- Batch processing pipelines
Architecture Design
- System architecture diagrams
- Data flow visualization
- Tool orchestration patterns
- State management strategies
- Scaling considerations
- Multi-tenant design
- Caching architectures
Debugging & Troubleshooting
- Common error diagnosis (401, 403, 429, 500)
- Token consumption issues
- Tool calling problems
- Streaming interruptions
- Rate limit debugging
- Performance optimization
- Cost anomaly investigation
Integration Patterns
Pattern Library
- Basic Chat: Simple conversational interface
- Streaming Chat: Real-time response display
- Agentic Research: Multi-tool autonomous workflows
- RAG Knowledge Base: Document Q&A with semantic search
- Image Understanding: OCR and visual analysis
- Image Generation: Batch content creation
- Hybrid RAG: Collections + Live Search
- Conversational RAG: Stateful document Q&A
- Multi-Tool Analysis: Web + Code execution
- Social Listening: X search with sentiment analysis
SDK Usage Patterns
# xAI SDK (Native)
from xai_sdk import Client
from xai_sdk.chat import user, system
from xai_sdk.tools import web_search, code_execution
client = Client(api_key="xai-...")
chat = client.chat.create(model="grok-4-fast", tools=[web_search()])
chat.append(user("Query"))
response = chat.sample()
# OpenAI SDK (Compatible)
from openai import OpenAI
client = OpenAI(api_key="xai-...", base_url="https://api.x.ai/v1")
response = client.chat.completions.create(model="grok-4-fast", messages=[...])
# Streaming
for response, chunk in chat.stream():
print(chunk.content, end="", flush=True)
# RAG
collection = client.collections.create(name="Docs")
client.collections.upload_document(collection_id=..., data=..., content_type=...)
results = client.collections.search(query="...", collection_ids=[...])
# Image Understanding
from xai_sdk.chat import image
chat.append(user("Analyze", image(image_url="...", detail="high")))
# Image Generation
images = client.images.generate(model="grok-2-image-1212", prompt="...", n=4)
Best Practices
Performance
- Use grok-4-fast for 98% cost savings
- Disable reasoning when not needed (non-reasoning variant)
- Enable prompt caching for repeated prompts (62.5% savings)
- Stay under 128K context to avoid 2× pricing
- Batch multiple queries when possible
- Optimize tool usage (limit search results)
- Pre-process images (compress before upload)
Reliability
- Implement exponential backoff for retries
- Handle rate limiting (429 errors)
- Monitor token consumption
- Use deferred completions for long tasks
- Implement circuit breakers for tools
- Log all tool calls for debugging
- Track system fingerprints for reproducibility
Security
- Rotate API keys every 30-90 days
- Use ACLs for least privilege access
- Never commit keys to version control
- Use secret management systems (AWS Secrets Manager, etc.)
- Separate dev/staging/prod keys
- Monitor usage for anomalies
- Enable audit logging
Cost Optimization
- Right-size model selection (don't always use grok-4)
- Monitor and alert on token spikes
- Implement caching layers
- Use token estimators before requests
- Batch operations where possible
- Optimize chunking for RAG (larger chunks = fewer tokens)
- Set max_tokens limits to prevent runaway costs
Documentation Reference
Complete Documentation Suite
Located in /Users/manu/Documents/LUXOR/xai/docs/:
- 00-OVERVIEW-AND-CAPABILITIES.md - Platform overview, architecture, quick reference
- 01-MODELS-AND-CAPABILITIES.md - Model catalog, pricing, selection guide (67,000 tokens)
- 02-AUTHENTICATION-AND-KEYS.md - API keys, ACLs, rate limits (34 KB)
- 03-CHAT-AND-COMPLETIONS.md - Chat API, streaming, deferred (1,500+ lines)
- 04-AGENTIC-TOOLS.md - Web search, X search, code execution (8,000 words)
- 05-COLLECTIONS-AND-RAG.md - RAG implementation, chunking (64 KB)
- 06-LIVE-SEARCH-AND-CITATIONS.md - Search modes, citations (60 KB)
- 07-IMAGE-CAPABILITIES.md - Image understanding, generation (95 KB)
Workflow Diagrams
Located in /Users/manu/Documents/LUXOR/xai/diagrams/workflows.md:
- Authentication flow
- Chat completion workflows
- Agentic tool orchestration
- RAG implementation flow
- Image processing workflows
- Multi-tool research pipeline
- State management patterns
- Error handling flow
- Cost optimization decision tree
When to Use This Skill
Automatic Activation
This skill should be automatically activated when:
- User mentions "XAI", "Grok", "grok-4", "grok-2-image", "grok-2-vision"
- User asks about XAI API integration
- User needs help with Grok model selection
- User wants to implement agentic tools (web search, X search, code execution)
- User is building RAG systems with XAI
- User needs image understanding or generation with Grok
- User asks about XAI pricing or cost optimization
- User needs authentication/API key management for XAI
Explicit Invocation
User can invoke with:
- "Use the XAI Grok API skill"
- "Help me with Grok API"
- "I need XAI expertise"
Quick Start Templates
Template 1: Simple Chatbot
from xai_sdk import Client
from xai_sdk.chat import user, system
client = Client(api_key="xai-...")
chat = client.chat.create(model="grok-4-fast-non-reasoning")
chat.append(system("You are a helpful assistant."))
chat.append(user("Hello!"))
response = chat.sample()
print(response.content)
Template 2: Research Agent
from xai_sdk import Client
from xai_sdk.chat import user
from xai_sdk.tools import web_search, code_execution
client = Client(api_key="xai-...")
chat = client.chat.create(
model="grok-4-fast",
tools=[web_search(), code_execution()]
)
chat.append(user("Research query"))
for response, chunk in chat.stream():
print(chunk.content, end="", flush=True)
Template 3: RAG System
from xai_sdk import Client
from xai_sdk.chat import user
client = Client(api_key="xai-...", management_api_key="xai-...")
# Create collection and upload docs
collection = client.collections.create(name="KB")
# ... upload documents ...
# Query
results = client.collections.search(query="question", collection_ids=[collection.collection_id])
context = "\n".join([r.text for r in results.results])
# Generate answer
chat = client.chat.create(model="grok-4-fast")
chat.append(user(f"Context: {context}\n\nQuestion: ..."))
response = chat.sample()
Template 4: Image Analysis
from xai_sdk import Client
from xai_sdk.chat import user, image
client = Client(api_key="xai-...")
chat = client.chat.create(model="grok-2-vision-1212")
chat.append(user("Analyze", image(image_url="...", detail="high")))
response = chat.sample()
Common Tasks
Task: Choose the Right Model
Decision tree:
- Need images? → grok-2-vision (understanding) or grok-2-image (generation)
- Need reasoning? → YES: grok-4-fast-reasoning, NO: grok-4-fast-non-reasoning
- Budget tight? → grok-4-fast variants (98% savings)
- Speed critical? → grok-4-fast-non-reasoning (no thinking tokens)
- High volume? → grok-3-mini (lowest cost language model)
Task: Implement Streaming
for response, chunk in chat.stream():
if response.usage.reasoning_tokens:
print(f"\rThinking... ({response.usage.reasoning_tokens} tokens)", end="")
if chunk.content:
print(chunk.content, end="", flush=True)
Task: Handle Errors
from xai_sdk.exceptions import RateLimitError, APIError
import time
max_retries = 3
for attempt in range(max_retries):
try:
response = chat.sample()
break
except RateLimitError:
wait_time = 2 ** attempt
time.sleep(wait_time)
except APIError as e:
if e.status_code >= 500:
time.sleep(2 ** attempt)
else:
raise
Task: Estimate Cost
def estimate_cost(model, prompt_tokens, completion_tokens):
prices = {
"grok-4-fast": (2, 10),
"grok-4-fast-non-reasoning": (0.20, 1),
"grok-3-mini": (2, 5),
}
if prompt_tokens > 128_000:
prices = {k: (v[0]*2, v[1]*2) for k, v in prices.items()}
prompt_price, completion_price = prices[model]
return (prompt_tokens * prompt_price + completion_tokens * completion_price) / 1_000_000
cost = estimate_cost("grok-4-fast", 10_000, 2_000)
print(f"${cost:.4f}")
Skill Maintenance
Last Updated: November 2025
Source: Context7 xAI documentation (/websites/x_ai, 245 code snippets)
Coverage: Complete (100% of public XAI API as of Nov 2025)
Status: Production-ready
Update Triggers:
- New model releases
- API endpoint changes
- Pricing updates
- New tool additions
- Breaking changes
Related Skills
This skill complements:
- API Architecture: For designing XAI-powered applications
- Python Development: For SDK usage
- Cloud Architecture: For deploying XAI applications
- Database Management: For RAG implementations
- Image Processing: For multimodal applications
Success Metrics
Users should be able to:
- ✅ Select the optimal XAI model for any use case
- ✅ Implement chat completions with streaming in <10 minutes
- ✅ Build agentic research tools with web/X search
- ✅ Deploy production RAG systems with Collections API
- ✅ Process images with understanding and generation
- ✅ Optimize costs by 90%+ through strategic model selection
- ✅ Debug and troubleshoot XAI API issues independently
- ✅ Architect scalable XAI-powered applications
Skill Ready: This comprehensive XAI Grok API mastery skill provides production-ready expertise for building any XAI-powered application.
1---2name: xai-grok-api-mastery3description: XAI Grok API Mastery4---5# XAI Grok API Mastery67Complete expertise in XAI's Grok API for building production-ready AI applications with language models, agentic tools, RAG, and multimodal capabilities.89## 🎯 Auto-Activation Triggers1011This skill **automatically activates** when the user mentions:12- "Grok" or "grok"13- "XAI" or "x.ai"14- "Ask Grok" or "Use Grok"15- Model names: "grok-4", "grok-4-fast", "grok-3", etc.16- Tools: "web_search", "x_search" (in XAI context)17- Multi-perspective analysis requests18- Comparison requests: "Claude vs Grok", "compare perspectives"1920## 🚀 Quick Hook Access2122**Call Grok directly via hooks (use Bash tool):**2324```bash25# Non-streaming (default, most queries)26export XAI_API_KEY=$(grep XAI_API_KEY /Users/manu/Documents/LUXOR/xai/.env | cut -d '=' -f2) && \27echo '{"prompt": "Your question here", "model": "grok-4-fast"}' | ~/.claude/hooks/grok-api.sh2829# Streaming (for long responses)30cd /Users/manu/Documents/LUXOR/xai && source venv/bin/activate && \31export XAI_API_KEY=$(grep XAI_API_KEY .env | cut -d '=' -f2) && \32echo '{"prompt": "Your question here", "stream": true}' | python ~/.claude/hooks/grok-streaming.py3334# With tools (web search)35export XAI_API_KEY=$(grep XAI_API_KEY /Users/manu/Documents/LUXOR/xai/.env | cut -d '=' -f2) && \36echo '{"prompt": "Research latest AI", "tools": ["web_search"]}' | ~/.claude/hooks/grok-api.sh37```3839## Skill Overview4041This skill provides comprehensive knowledge of XAI's Grok API platform, covering all 7 models (5 language, 2 multimodal), 3 server-side agentic tools (web search, X search, code execution), RAG infrastructure via Collections API, and advanced features including reasoning with encrypted thinking traces, massive 2M token context windows, and cost optimization strategies.4243## Core Expertise4445### 1. Model Selection & Optimization46- **7 Production Models**: grok-4, grok-4-fast (reasoning/non-reasoning variants), grok-3, grok-3-mini, grok-2-vision, grok-2-image47- **Context Windows**: Up to 2M tokens (largest available)48- **Reasoning Models**: Native reasoning with encrypted thinking traces49- **Cost Optimization**: 98% savings strategies (grok-4-fast vs grok-4)50- **Model Selection Matrix**: Decision trees for optimal model selection by use case5152### 2. Authentication & Security53- **API Key Management**: Creation, rotation, deletion via Console and Management API54- **ACL System**: Fine-grained permissions (endpoints, models, wildcards)55- **Rate Limiting**: QPM, QPS, TPM configuration and monitoring56- **Team Management**: Admin vs member permissions, key ownership57- **Security Best Practices**: Secret management, rotation schedules, least privilege5859### 3. Chat & Completions API60- **Message Structure**: System, user, assistant roles with flexible ordering61- **Streaming**: SSE streaming for real-time responses62- **Deferred Completions**: Long-running tasks with polling63- **Stateful Conversations**: Responses API with previous_response_id64- **Token Management**: Prompt, reasoning, completion token tracking65- **Parameter Tuning**: Temperature, top_p, max_tokens, seed for reproducibility66- **System Fingerprint**: Configuration tracking for debugging6768### 4. Agentic Tools (Server-Side)69- **web_search()**: Real-time internet search with domain filtering70- **x_search()**: X/Twitter search with handle/engagement filtering71- **code_execution()**: Python sandbox for data analysis, calculations, visualization72- **Multi-Tool Orchestration**: Combining tools for complex research workflows73- **Tool Usage Tracking**: Billing and cost monitoring74- **Stateful Agentic Conversations**: Multi-turn tool-augmented dialogs7576### 5. RAG Implementation (Collections API)77- **Collection Management**: Create, list, update, delete collections78- **Document Upload**: HTML, PDF, TXT, Markdown support79- **Chunking Strategies**: Token-based splitting (512-2048 tokens, configurable overlap)80- **Embedding & Indexing**: Automatic with grok-embedding-small81- **Semantic Search**: Multi-collection search with relevance scoring82- **RAG Patterns**: 6 production patterns (basic, iterative, citations, hybrid, conversational, confidence)8384### 6. Image Capabilities85- **Image Understanding**: grok-2-vision-1212 (text + image → text)86 - Input formats: URL, base64 (JPG, PNG up to 20 MiB)87 - Detail parameter: high, low, auto88 - Use cases: OCR, document analysis, visual Q&A89- **Image Generation**: grok-2-image-1212 (text → image)90 - Batch generation: 1-10 images91 - Prompt refinement system92 - Cost: $0.07/image9394### 7. Live Search & Citations95- **Search Modes**: auto, on, off96- **Data Sources**: Web, X, News, RSS feeds97- **Citation Tracking**: Source URLs, snippets, timestamps98- **Source Filtering**: Domain allow/exclude lists, geographic targeting99- **Cost Optimization**: Limiting search results, caching strategies100101### 8. Cost Management102- **Pricing Structure**: Tiered pricing by context window (<128K, >128K)103- **Token Categories**: Prompt (fresh/cached), reasoning, completion104- **Tool Costs**: $2.50 per 100 sources (web/X search)105- **Cost Estimators**: Token-based cost calculation106- **Optimization Strategies**: Model selection, caching, batching, right-sizing107108### 9. SDK Integration109- **Native SDKs**: xai-sdk (Python, TypeScript)110- **Compatible SDKs**: OpenAI SDK, Anthropic SDK (base_url override)111- **Framework Integration**: Vercel AI SDK, LangChain, LlamaIndex112- **gRPC API**: High-performance protocol alternative113114### 10. Production Patterns115- **Error Handling**: HTTP codes, retry logic with exponential backoff116- **Streaming Patterns**: SSE chunking, progressive display117- **Async Workflows**: Deferred completions, background processing118- **Monitoring**: Token usage tracking, cost analysis, performance metrics119- **Debugging**: System fingerprint, encrypted thinking traces, verbose logging120121## Use Case Mastery122123### By Application Type124- **Chatbots**: Model selection, conversation management, memory strategies125- **Research Agents**: Multi-tool orchestration, citation tracking, iterative refinement126- **Document Q&A**: RAG implementation, chunking optimization, context management127- **Image Processing**: OCR, visual analysis, document extraction128- **Content Generation**: Image generation, batch processing, prompt engineering129- **Data Analysis**: Code execution, statistical analysis, visualization130131### By Industry132- **Finance**: Market research, analysis workflows, compliance133- **Healthcare**: Document processing, research assistance, privacy considerations134- **E-commerce**: Product descriptions, visual search, content generation135- **Customer Support**: Knowledge base Q&A, RAG implementation, escalation136- **Media**: Content generation, image creation, social listening137- **Legal**: Document analysis, OCR, citation tracking138- **Education**: Tutoring systems, Q&A, research assistance139140## Technical Capabilities141142### Code Generation143- Complete Python implementations using xai-sdk144- OpenAI SDK compatibility examples145- curl commands for API testing146- JavaScript/TypeScript examples147- Production-ready error handling148- Async/await patterns149- Streaming implementations150- Batch processing pipelines151152### Architecture Design153- System architecture diagrams154- Data flow visualization155- Tool orchestration patterns156- State management strategies157- Scaling considerations158- Multi-tenant design159- Caching architectures160161### Debugging & Troubleshooting162- Common error diagnosis (401, 403, 429, 500)163- Token consumption issues164- Tool calling problems165- Streaming interruptions166- Rate limit debugging167- Performance optimization168- Cost anomaly investigation169170## Integration Patterns171172### Pattern Library1731. **Basic Chat**: Simple conversational interface1742. **Streaming Chat**: Real-time response display1753. **Agentic Research**: Multi-tool autonomous workflows1764. **RAG Knowledge Base**: Document Q&A with semantic search1775. **Image Understanding**: OCR and visual analysis1786. **Image Generation**: Batch content creation1797. **Hybrid RAG**: Collections + Live Search1808. **Conversational RAG**: Stateful document Q&A1819. **Multi-Tool Analysis**: Web + Code execution18210. **Social Listening**: X search with sentiment analysis183184### SDK Usage Patterns185```python186# xAI SDK (Native)187from xai_sdk import Client188from xai_sdk.chat import user, system189from xai_sdk.tools import web_search, code_execution190191client = Client(api_key="xai-...")192chat = client.chat.create(model="grok-4-fast", tools=[web_search()])193chat.append(user("Query"))194response = chat.sample()195196# OpenAI SDK (Compatible)197from openai import OpenAI198client = OpenAI(api_key="xai-...", base_url="https://api.x.ai/v1")199response = client.chat.completions.create(model="grok-4-fast", messages=[...])200201# Streaming202for response, chunk in chat.stream():203 print(chunk.content, end="", flush=True)204205# RAG206collection = client.collections.create(name="Docs")207client.collections.upload_document(collection_id=..., data=..., content_type=...)208results = client.collections.search(query="...", collection_ids=[...])209210# Image Understanding211from xai_sdk.chat import image212chat.append(user("Analyze", image(image_url="...", detail="high")))213214# Image Generation215images = client.images.generate(model="grok-2-image-1212", prompt="...", n=4)216```217218## Best Practices219220### Performance221- Use grok-4-fast for 98% cost savings222- Disable reasoning when not needed (non-reasoning variant)223- Enable prompt caching for repeated prompts (62.5% savings)224- Stay under 128K context to avoid 2× pricing225- Batch multiple queries when possible226- Optimize tool usage (limit search results)227- Pre-process images (compress before upload)228229### Reliability230- Implement exponential backoff for retries231- Handle rate limiting (429 errors)232- Monitor token consumption233- Use deferred completions for long tasks234- Implement circuit breakers for tools235- Log all tool calls for debugging236- Track system fingerprints for reproducibility237238### Security239- Rotate API keys every 30-90 days240- Use ACLs for least privilege access241- Never commit keys to version control242- Use secret management systems (AWS Secrets Manager, etc.)243- Separate dev/staging/prod keys244- Monitor usage for anomalies245- Enable audit logging246247### Cost Optimization248- Right-size model selection (don't always use grok-4)249- Monitor and alert on token spikes250- Implement caching layers251- Use token estimators before requests252- Batch operations where possible253- Optimize chunking for RAG (larger chunks = fewer tokens)254- Set max_tokens limits to prevent runaway costs255256## Documentation Reference257258### Complete Documentation Suite259Located in `/Users/manu/Documents/LUXOR/xai/docs/`:2602611. **00-OVERVIEW-AND-CAPABILITIES.md** - Platform overview, architecture, quick reference2622. **01-MODELS-AND-CAPABILITIES.md** - Model catalog, pricing, selection guide (67,000 tokens)2633. **02-AUTHENTICATION-AND-KEYS.md** - API keys, ACLs, rate limits (34 KB)2644. **03-CHAT-AND-COMPLETIONS.md** - Chat API, streaming, deferred (1,500+ lines)2655. **04-AGENTIC-TOOLS.md** - Web search, X search, code execution (8,000 words)2666. **05-COLLECTIONS-AND-RAG.md** - RAG implementation, chunking (64 KB)2677. **06-LIVE-SEARCH-AND-CITATIONS.md** - Search modes, citations (60 KB)2688. **07-IMAGE-CAPABILITIES.md** - Image understanding, generation (95 KB)269270### Workflow Diagrams271Located in `/Users/manu/Documents/LUXOR/xai/diagrams/workflows.md`:272- Authentication flow273- Chat completion workflows274- Agentic tool orchestration275- RAG implementation flow276- Image processing workflows277- Multi-tool research pipeline278- State management patterns279- Error handling flow280- Cost optimization decision tree281282## When to Use This Skill283284### Automatic Activation285This skill should be automatically activated when:286- User mentions "XAI", "Grok", "grok-4", "grok-2-image", "grok-2-vision"287- User asks about XAI API integration288- User needs help with Grok model selection289- User wants to implement agentic tools (web search, X search, code execution)290- User is building RAG systems with XAI291- User needs image understanding or generation with Grok292- User asks about XAI pricing or cost optimization293- User needs authentication/API key management for XAI294295### Explicit Invocation296User can invoke with:297- "Use the XAI Grok API skill"298- "Help me with Grok API"299- "I need XAI expertise"300301## Quick Start Templates302303### Template 1: Simple Chatbot304```python305from xai_sdk import Client306from xai_sdk.chat import user, system307308client = Client(api_key="xai-...")309chat = client.chat.create(model="grok-4-fast-non-reasoning")310chat.append(system("You are a helpful assistant."))311chat.append(user("Hello!"))312response = chat.sample()313print(response.content)314```315316### Template 2: Research Agent317```python318from xai_sdk import Client319from xai_sdk.chat import user320from xai_sdk.tools import web_search, code_execution321322client = Client(api_key="xai-...")323chat = client.chat.create(324 model="grok-4-fast",325 tools=[web_search(), code_execution()]326)327chat.append(user("Research query"))328for response, chunk in chat.stream():329 print(chunk.content, end="", flush=True)330```331332### Template 3: RAG System333```python334from xai_sdk import Client335from xai_sdk.chat import user336337client = Client(api_key="xai-...", management_api_key="xai-...")338339# Create collection and upload docs340collection = client.collections.create(name="KB")341# ... upload documents ...342343# Query344results = client.collections.search(query="question", collection_ids=[collection.collection_id])345context = "\n".join([r.text for r in results.results])346347# Generate answer348chat = client.chat.create(model="grok-4-fast")349chat.append(user(f"Context: {context}\n\nQuestion: ..."))350response = chat.sample()351```352353### Template 4: Image Analysis354```python355from xai_sdk import Client356from xai_sdk.chat import user, image357358client = Client(api_key="xai-...")359chat = client.chat.create(model="grok-2-vision-1212")360chat.append(user("Analyze", image(image_url="...", detail="high")))361response = chat.sample()362```363364## Common Tasks365366### Task: Choose the Right Model367**Decision tree**:3681. Need images? → grok-2-vision (understanding) or grok-2-image (generation)3692. Need reasoning? → YES: grok-4-fast-reasoning, NO: grok-4-fast-non-reasoning3703. Budget tight? → grok-4-fast variants (98% savings)3714. Speed critical? → grok-4-fast-non-reasoning (no thinking tokens)3725. High volume? → grok-3-mini (lowest cost language model)373374### Task: Implement Streaming375```python376for response, chunk in chat.stream():377 if response.usage.reasoning_tokens:378 print(f"\rThinking... ({response.usage.reasoning_tokens} tokens)", end="")379 if chunk.content:380 print(chunk.content, end="", flush=True)381```382383### Task: Handle Errors384```python385from xai_sdk.exceptions import RateLimitError, APIError386import time387388max_retries = 3389for attempt in range(max_retries):390 try:391 response = chat.sample()392 break393 except RateLimitError:394 wait_time = 2 ** attempt395 time.sleep(wait_time)396 except APIError as e:397 if e.status_code >= 500:398 time.sleep(2 ** attempt)399 else:400 raise401```402403### Task: Estimate Cost404```python405def estimate_cost(model, prompt_tokens, completion_tokens):406 prices = {407 "grok-4-fast": (2, 10),408 "grok-4-fast-non-reasoning": (0.20, 1),409 "grok-3-mini": (2, 5),410 }411 if prompt_tokens > 128_000:412 prices = {k: (v[0]*2, v[1]*2) for k, v in prices.items()}413414 prompt_price, completion_price = prices[model]415 return (prompt_tokens * prompt_price + completion_tokens * completion_price) / 1_000_000416417cost = estimate_cost("grok-4-fast", 10_000, 2_000)418print(f"${cost:.4f}")419```420421## Skill Maintenance422423**Last Updated**: November 2025424**Source**: Context7 xAI documentation (/websites/x_ai, 245 code snippets)425**Coverage**: Complete (100% of public XAI API as of Nov 2025)426**Status**: Production-ready427428**Update Triggers**:429- New model releases430- API endpoint changes431- Pricing updates432- New tool additions433- Breaking changes434435## Related Skills436437This skill complements:438- **API Architecture**: For designing XAI-powered applications439- **Python Development**: For SDK usage440- **Cloud Architecture**: For deploying XAI applications441- **Database Management**: For RAG implementations442- **Image Processing**: For multimodal applications443444## Success Metrics445446Users should be able to:447- ✅ Select the optimal XAI model for any use case448- ✅ Implement chat completions with streaming in <10 minutes449- ✅ Build agentic research tools with web/X search450- ✅ Deploy production RAG systems with Collections API451- ✅ Process images with understanding and generation452- ✅ Optimize costs by 90%+ through strategic model selection453- ✅ Debug and troubleshoot XAI API issues independently454- ✅ Architect scalable XAI-powered applications455456---457458**Skill Ready**: This comprehensive XAI Grok API mastery skill provides production-ready expertise for building any XAI-powered application.