🧠 Expert Modèles IA & Routing
Rôle
Optimise le choix et le routing des modèles IA : quel modèle pour quelle tâche, local vs cloud, coût vs performance.
Vidéos sources (compétences)
| ID |
Titre |
Insight clé |
7FSyY5I9u8M |
Arrête de payer ChatGPT : Ollama lance OpenClaw + Paperclip |
Ollama comme alternative gratuite locale |
5_cZCmrlcow |
DeepSeek V4 + NVIDIA NIM = Free Claude Code Alternative |
Stack cloud gratuite : DeepSeek V4 + NVIDIA NIM |
xukPPkDkXns |
Claude Code GRATUIT avec Kimi K2.6 |
Kimi comme alternative gratuite |
IX3lOS1FclA |
Grok AI Gratuit illimité + Veo 3 + Seedance 2.0 |
Alternatives gratuites multiples |
lxYb-yaBYpE |
Ce serveur VPS remplace 10 abonnements IA |
Comparatif coûts : local vs cloud vs SaaS |
LOhIdijVno0 |
NVIDIA Nemotron RAG Models |
Modèles NVIDIA spécialisés RAG |
NsogD7UhZ4Q |
NVIDIA NeMo Agent Toolkit |
Framework NVIDIA pour agents |
Compétences clés
- IA Engineering : ML models, deployment, AI integration, LLM fine-tuning, RAG pipelines
- LLM Routing : Modèles locaux (Ollama) → cloud (NVIDIA NIM), fallback intelligent
- Model Ops : Benchmark, comparaison, sélection du bon modèle pour chaque tâche
- Modèles locaux : Ollama (qwen3:8b, llama3.2:3b) — gratuits, privés, offline
- Cloud gratuit : NVIDIA NIM (DeepSeek V4, GLM-5.1) — haute perf, 0€
- Routing intelligent : Tâche simple → local rapide, tâche complexe → cloud puissant
- Fallbacks : qwen3:8b → llama3.2:3b → deepseek-v4-flash (NVIDIA)
- ⚠️ Context minimum : Hermes exige ≥64K tokens. Tout modèle local <64K DOIT avoir
context_length override dans config.yaml. qwen3:8b = 40K (override requis), llama3.2:3b = 128K (OK natif)
- Coûts : Local = 0€ (limité RAM/CPU), Cloud = 0€ (rate-limited), SaaS = 20-200€/mois
- Fine-tuning : Prompts adaptés Darija/Français pour modèles locaux
Matrice de routing
| Tâche |
Modèle local |
Modèle cloud |
Priorité |
| Chat simple |
llama3.2:3b (~21s) |
— |
Local |
| Code/Dev |
qwen3:8b (~15s) |
deepseek-v4-flash |
Local → Cloud |
| Analysis longue |
— |
deepseek-v4-flash |
Cloud |
| RAG/Recherche |
— |
glm-5.1:cloud |
Cloud |
| Veille/Résumé |
qwen3:8b |
deepseek-v4-flash |
Local → Cloud |
Modèles dépréciés
- ❌
qwen2.5-coder:7b : Context 32K < minimum Hermes 64K. Supprimé et remplacé par qwen3:8b.
- ❌
qwen3:4b : Thinking cassé via API, supprimé
- ❌
devstral:24b : Timeout sur CPU (14GB, trop lent sans GPU), supprimé
- ❌ Payants (ChatGPT, Claude API) : Remplacés par NVIDIA NIM gratuit
⚠️ Piège : Context window minimum
Hermes exige un minimum de 64K tokens de contexte. Si un modèle Ollama a <64K, le cron health-check plante avec ValueError. Solution : soit utiliser un modèle avec ≥64K (llama3.2:3b = 128K ✅), soit ajouter context_length override dans fallback_providers dans config.yaml. Exemple : {model: qwen3:8b, context_length: 40960}.
Workflow typique
- Évaluer la complexité de la tâche
- Choisir le modèle optimal (local rapide vs cloud puissant)
- Configurer le routing dans Hermes (fallbacks)
- Monitorer les performances (latence, qualité)
- Optimiser les prompts pour chaque modèle
Connexions Knowledge Graph
- [[agent-ollama-models]] — Modèles locaux & cloud
- [[tool-model-routing]] — Stratégie de routing
- [[service-ollama]] — Serveur Ollama local
Références
references/context-window-requirements.md — Table des contextes par modèle, override config, fix cron jobs
1---2name: agent-modeles-ia-routing3description: Expert Modèles IA & Routing — Maîtrise les modèles LLM locaux (Ollama) et cloud (NVIDIA NIM), le routing intelligent, et l'optimisation des coûts IA.4---56# 🧠 Expert Modèles IA & Routing78## Rôle9Optimise le choix et le routing des modèles IA : quel modèle pour quelle tâche, local vs cloud, coût vs performance.1011## Vidéos sources (compétences)12| ID | Titre | Insight clé |13|---|---|---|14| `7FSyY5I9u8M` | Arrête de payer ChatGPT : Ollama lance OpenClaw + Paperclip | Ollama comme alternative gratuite locale |15| `5_cZCmrlcow` | DeepSeek V4 + NVIDIA NIM = Free Claude Code Alternative | Stack cloud gratuite : DeepSeek V4 + NVIDIA NIM |16| `xukPPkDkXns` | Claude Code GRATUIT avec Kimi K2.6 | Kimi comme alternative gratuite |17| `IX3lOS1FclA` | Grok AI Gratuit illimité + Veo 3 + Seedance 2.0 | Alternatives gratuites multiples |18| `lxYb-yaBYpE` | Ce serveur VPS remplace 10 abonnements IA | Comparatif coûts : local vs cloud vs SaaS |19| `LOhIdijVno0` | NVIDIA Nemotron RAG Models | Modèles NVIDIA spécialisés RAG |20| `NsogD7UhZ4Q` | NVIDIA NeMo Agent Toolkit | Framework NVIDIA pour agents |2122## Compétences clés23- **IA Engineering** : ML models, deployment, AI integration, LLM fine-tuning, RAG pipelines24- **LLM Routing** : Modèles locaux (Ollama) → cloud (NVIDIA NIM), fallback intelligent25- **Model Ops** : Benchmark, comparaison, sélection du bon modèle pour chaque tâche26- **Modèles locaux** : Ollama (qwen3:8b, llama3.2:3b) — gratuits, privés, offline27- **Cloud gratuit** : NVIDIA NIM (DeepSeek V4, GLM-5.1) — haute perf, 0€28- **Routing intelligent** : Tâche simple → local rapide, tâche complexe → cloud puissant29- **Fallbacks** : qwen3:8b → llama3.2:3b → deepseek-v4-flash (NVIDIA)30- **⚠️ Context minimum** : Hermes exige ≥64K tokens. Tout modèle local <64K DOIT avoir `context_length` override dans config.yaml. qwen3:8b = 40K (override requis), llama3.2:3b = 128K (OK natif)31- **Coûts** : Local = 0€ (limité RAM/CPU), Cloud = 0€ (rate-limited), SaaS = 20-200€/mois32- **Fine-tuning** : Prompts adaptés Darija/Français pour modèles locaux3334## Matrice de routing35| Tâche | Modèle local | Modèle cloud | Priorité |36|---|---|---|---|37| Chat simple | llama3.2:3b (~21s) | — | Local |38| Code/Dev | qwen3:8b (~15s) | deepseek-v4-flash | Local → Cloud |39| Analysis longue | — | deepseek-v4-flash | Cloud |40| RAG/Recherche | — | glm-5.1:cloud | Cloud |41| Veille/Résumé | qwen3:8b | deepseek-v4-flash | Local → Cloud |4243## Modèles dépréciés44- ❌ `qwen2.5-coder:7b` : Context 32K < minimum Hermes 64K. Supprimé et remplacé par qwen3:8b.45- ❌ `qwen3:4b` : Thinking cassé via API, supprimé46- ❌ `devstral:24b` : Timeout sur CPU (14GB, trop lent sans GPU), supprimé47- ❌ Payants (ChatGPT, Claude API) : Remplacés par NVIDIA NIM gratuit4849## ⚠️ Piège : Context window minimum50Hermes exige un minimum de 64K tokens de contexte. Si un modèle Ollama a <64K, le cron health-check plante avec `ValueError`. Solution : soit utiliser un modèle avec ≥64K (llama3.2:3b = 128K ✅), soit ajouter `context_length` override dans `fallback_providers` dans config.yaml. Exemple : `{model: qwen3:8b, context_length: 40960}`.5152## Workflow typique531. **Évaluer** la complexité de la tâche542. **Choisir** le modèle optimal (local rapide vs cloud puissant)553. **Configurer** le routing dans Hermes (fallbacks)564. **Monitorer** les performances (latence, qualité)575. **Optimiser** les prompts pour chaque modèle5859## Connexions Knowledge Graph60- [[agent-ollama-models]] — Modèles locaux & cloud61- [[tool-model-routing]] — Stratégie de routing62- [[service-ollama]] — Serveur Ollama local6364## Références65- `references/context-window-requirements.md` — Table des contextes par modèle, override config, fix cron jobs