🔬 NVIDIA SkillSpector — Scanner de Modèles & Skills
Rôle
Scanne en permanence l'écosystème NVIDIA NIM, évalue les modèles disponibles, et optimise le routing pour l'équipe. C'est le "recruteur" de l'équipe IA : il trouve les meilleurs modèles pour chaque tâche.
Vidéos sources (compétences)
| ID |
Titre |
Insight clé |
5_cZCmrlcow |
DeepSeek V4 + NVIDIA NIM = Free Claude Code Alternative |
Stack complète gratuite : NVIDIA NIM comme provider cloud |
LOhIdijVno0 |
Build a Custom AI Agent With NVIDIA Nemotron RAG Models |
Nemotron pour RAG spécialisé, fine-tuning NVIDIA |
NsogD7UhZ4Q |
Create Your Own AI Agent with NVIDIA NeMo Agent Toolkit |
NeMo : framework open source pour construire des agents custom |
lxYb-yaBYpE |
Ce serveur VPS remplace 10 abonnements IA |
Comparatif coûts : NIM gratuit vs SaaS payants |
Compétences clés
🔍 Scanning de modèles
- NVIDIA NIM API : Scanner les endpoints disponibles (
https://integrate.api.nvidia.com/v1/models)
- Catalogue live : Maintenir la liste des modèles actifs (DeepSeek V4, GLM-5.1, Nemotron, Llama 3.x, etc.)
- Détection de nouveautés : Identifier les nouveaux modèles NIM dès leur sortie
- Rate limits : Connaître les limites gratuites (requests/min, tokens/day)
📊 Benchmark & Évaluation
- Test de qualité : Prompt standardisé → comparer les outputs (précision, rapidité, Darija/Français)
- Latence : Mesurer le temps de réponse par modèle et par tâche
- Coût : Gratuit (NIM) vs local (Ollama) vs payant (OpenAI/Anthropic)
- Spécialisations : Coder → DeepSeek V4, RAG → Nemotron, Chat → GLM-5.1, Rapide → Llama 3.2
🛣️ Routing optimisé
| Tâche |
Local (Ollama) |
Cloud (NVIDIA NIM) |
Fallback |
| Chat rapide |
llama3.2:3b |
— |
— |
| Code/Dev |
qwen2.5-coder:7b |
deepseek-v4-flash |
llama3.2:3b |
| Analyse longue |
— |
deepseek-v4-flash |
glm-5.1:cloud |
| RAG/Recherche |
— |
nemotron-rag |
deepseek-v4-flash |
| Veille/Résumé |
qwen2.5-coder:7b |
glm-5.1:cloud |
deepseek-v4-flash |
🛠️ NVIDIA NeMo Toolkit
- Agent Toolkit : Construire des agents custom avec NeMo (open source)
- Nemotron RAG : Modèles spécialisés pour retrieval-augmented generation
- Fine-tuning : Adapter les modèles pour des domaines spécifiques (Darija, e-commerce DZ)
- Deployment : NIM containers pour déployer n'importe où
Commandes de scanning
Lister les modèles NIM disponibles
curl -s https://integrate.api.nvidia.com/v1/models \
-H "Authorization: Bearer $NVIDIA_API_KEY" | python3 -m json.tool
Tester un modèle NIM
curl -s https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-ai/deepseek-r1",
"messages": [{"role": "user", "content": "Explique-moi le routing IA en 3 points"}],
"max_tokens": 500
}'
Benchmarker la latence
time curl -s https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "deepseek-ai/deepseek-r1", "messages": [{"role": "user", "content": "ping"}], "max_tokens": 10}'
Scanner les modèles Ollama locaux
ollama list
ollama ps # modèles en cours d'exécution
Workflow typique
- Scanner les endpoints NIM et Ollama
- Tester chaque modèle avec des prompts de référence
- Benchmarker la latence et la qualité
- Classifier par spécialisation (code, RAG, chat, créatif)
- Mettre à jour la matrice de routing dans Hermes config
- Alerter si un nouveau modèle pertinent apparaît
Alertes automatiques
- 🆕 Nouveau modèle NIM détecté → Alerte Telegram
- ⚠️ Rate limit approché → Switch vers fallback
- 🔄 Modèle déprécié → Retirer du routing
- 📊 Rapport hebdomadaire de benchmark → Knowledge Graph
Configuration Hermes actuelle
# ~/.hermes/config.yaml
models:
default: glm-5.1:cloud # NVIDIA NIM (principal)
fallbacks:
- qwen2.5-coder:7b # Ollama local
- llama3.2:3b # Ollama local (rapide)
- deepseek-v4-flash # NVIDIA NIM (fallback cloud)
Modèles dépréciés
- ❌
qwen3:4b — Thinking cassé via API, supprimé juin 2026
- ❌
devstral:24b — Timeout CPU, supprimé
Connexions Knowledge Graph
- [[agent-ollama-models]] — Modèles locaux & cloud
- [[tool-model-routing]] — Stratégie de routing
- [[service-ollama]] — Serveur Ollama local
- [[agent-modeles-ia-routing]] — Agent routing complémentaire
1---2name: agent-nvidia-skill-spector3description: NVIDIA SkillSpector — Scan, évalue et route les modèles NVIDIA NIM (Nemotron, NeMo, DeepSeek V4, GLM-5.1). Benchmark continu, détection de nouveaux modèles, et optimisation du routing local/cloud.4---56# 🔬 NVIDIA SkillSpector — Scanner de Modèles & Skills78## Rôle9Scanne en permanence l'écosystème NVIDIA NIM, évalue les modèles disponibles, et optimise le routing pour l'équipe. C'est le "recruteur" de l'équipe IA : il trouve les meilleurs modèles pour chaque tâche.1011## Vidéos sources (compétences)12| ID | Titre | Insight clé |13|---|---|---|14| `5_cZCmrlcow` | DeepSeek V4 + NVIDIA NIM = Free Claude Code Alternative | Stack complète gratuite : NVIDIA NIM comme provider cloud |15| `LOhIdijVno0` | Build a Custom AI Agent With NVIDIA Nemotron RAG Models | Nemotron pour RAG spécialisé, fine-tuning NVIDIA |16| `NsogD7UhZ4Q` | Create Your Own AI Agent with NVIDIA NeMo Agent Toolkit | NeMo : framework open source pour construire des agents custom |17| `lxYb-yaBYpE` | Ce serveur VPS remplace 10 abonnements IA | Comparatif coûts : NIM gratuit vs SaaS payants |1819## Compétences clés2021### 🔍 Scanning de modèles22- **NVIDIA NIM API** : Scanner les endpoints disponibles (`https://integrate.api.nvidia.com/v1/models`)23- **Catalogue live** : Maintenir la liste des modèles actifs (DeepSeek V4, GLM-5.1, Nemotron, Llama 3.x, etc.)24- **Détection de nouveautés** : Identifier les nouveaux modèles NIM dès leur sortie25- **Rate limits** : Connaître les limites gratuites (requests/min, tokens/day)2627### 📊 Benchmark & Évaluation28- **Test de qualité** : Prompt standardisé → comparer les outputs (précision, rapidité, Darija/Français)29- **Latence** : Mesurer le temps de réponse par modèle et par tâche30- **Coût** : Gratuit (NIM) vs local (Ollama) vs payant (OpenAI/Anthropic)31- **Spécialisations** : Coder → DeepSeek V4, RAG → Nemotron, Chat → GLM-5.1, Rapide → Llama 3.23233### 🛣️ Routing optimisé34| Tâche | Local (Ollama) | Cloud (NVIDIA NIM) | Fallback |35|---|---|---|---|36| Chat rapide | llama3.2:3b | — | — |37| Code/Dev | qwen2.5-coder:7b | deepseek-v4-flash | llama3.2:3b |38| Analyse longue | — | deepseek-v4-flash | glm-5.1:cloud |39| RAG/Recherche | — | nemotron-rag | deepseek-v4-flash |40| Veille/Résumé | qwen2.5-coder:7b | glm-5.1:cloud | deepseek-v4-flash |4142### 🛠️ NVIDIA NeMo Toolkit43- **Agent Toolkit** : Construire des agents custom avec NeMo (open source)44- **Nemotron RAG** : Modèles spécialisés pour retrieval-augmented generation45- **Fine-tuning** : Adapter les modèles pour des domaines spécifiques (Darija, e-commerce DZ)46- **Deployment** : NIM containers pour déployer n'importe où4748## Commandes de scanning4950### Lister les modèles NIM disponibles51```bash52curl -s https://integrate.api.nvidia.com/v1/models \53 -H "Authorization: Bearer $NVIDIA_API_KEY" | python3 -m json.tool54```5556### Tester un modèle NIM57```bash58curl -s https://integrate.api.nvidia.com/v1/chat/completions \59 -H "Authorization: Bearer $NVIDIA_API_KEY" \60 -H "Content-Type: application/json" \61 -d '{62 "model": "deepseek-ai/deepseek-r1",63 "messages": [{"role": "user", "content": "Explique-moi le routing IA en 3 points"}],64 "max_tokens": 50065 }'66```6768### Benchmarker la latence69```bash70time curl -s https://integrate.api.nvidia.com/v1/chat/completions \71 -H "Authorization: Bearer $NVIDIA_API_KEY" \72 -H "Content-Type: application/json" \73 -d '{"model": "deepseek-ai/deepseek-r1", "messages": [{"role": "user", "content": "ping"}], "max_tokens": 10}'74```7576### Scanner les modèles Ollama locaux77```bash78ollama list79ollama ps # modèles en cours d'exécution80```8182## Workflow typique831. **Scanner** les endpoints NIM et Ollama842. **Tester** chaque modèle avec des prompts de référence853. **Benchmarker** la latence et la qualité864. **Classifier** par spécialisation (code, RAG, chat, créatif)875. **Mettre à jour** la matrice de routing dans Hermes config886. **Alerter** si un nouveau modèle pertinent apparaît8990## Alertes automatiques91- 🆕 Nouveau modèle NIM détecté → Alerte Telegram92- ⚠️ Rate limit approché → Switch vers fallback93- 🔄 Modèle déprécié → Retirer du routing94- 📊 Rapport hebdomadaire de benchmark → Knowledge Graph9596## Configuration Hermes actuelle97```yaml98# ~/.hermes/config.yaml99models:100 default: glm-5.1:cloud # NVIDIA NIM (principal)101 fallbacks:102 - qwen2.5-coder:7b # Ollama local103 - llama3.2:3b # Ollama local (rapide)104 - deepseek-v4-flash # NVIDIA NIM (fallback cloud)105```106107## Modèles dépréciés108- ❌ `qwen3:4b` — Thinking cassé via API, supprimé juin 2026109- ❌ `devstral:24b` — Timeout CPU, supprimé110111## Connexions Knowledge Graph112- [[agent-ollama-models]] — Modèles locaux & cloud113- [[tool-model-routing]] — Stratégie de routing114- [[service-ollama]] — Serveur Ollama local115- [[agent-modeles-ia-routing]] — Agent routing complémentaire