Réactivation dual-GPU + routing intelligent
Date : 13/02/2026 23:00
Status : TERMINE
Duree : ~30 min
Objectif
Réactiver la RTX 2070 Super (GPU1) pour les tâches Ollama légères pendant que la RTX 3090 gère les tâches lourdes. Adapter le routing pour que ça ne casse pas ulias-org.
Travail réalisé
1. Constat initial
- ollama-gpu1 était déjà running (port 11435) malgré la "désactivation" précédente
- ai-orchestrator le détectait comme running
- Le problème : ulias-org hardcodait
gpu: 0 partout
2. ulias-org — Retirer hardcode GPU (commit 4ec90ca)
interpreter.ts : retiré gpu: 0 du call llmChat
client.ts : ajouté commentaire explicatif, routing délégué à l'orchestrator
- Push → Pipeline #1031 success
3. ai-orchestrator — Routing intelligent (commit d512647)
- Seuil GPU1 : 2000 → 6000 MB (la 2070S peut gérer des 7B)
- Affinité modèle : préfère le GPU où le modèle est déjà chargé
- Route vers GPU1 quand GPU0 est occupé par tâche exclusive
- Track le nom du modèle dans gpu_slots
- Push → Pipeline #1032 success
4. Tests validés
| Modèle |
VRAM |
GPU choisi |
Attendu |
| llama3.2 (3B) |
2000 MB |
GPU1 |
GPU1 |
| nomic-embed-text |
400 MB |
GPU1 |
GPU1 |
| qwen3:8b (8B) |
5000 MB |
GPU0 |
GPU0 |
| ulias-org health |
- |
OK |
OK |
| ulias-org capabilities |
- |
31 agents, 8 teams |
OK |
Résultat
Dual-GPU opérationnel :
- RTX 3090 : qwen3:8b, devstral, Wan2.1, ComfyUI...
- RTX 2070S : llama3.2, gemma3:4b, embeddings, petits modèles
- Fallback automatique si un GPU est occupé
- Affinité modèle pour éviter les reloads inutiles