AI Orchestrator - Support Multi-GPU / Multi-Machine
Priorite : HAUTE
Date : 02/02/2026
Contexte
Aujourd'hui l'orchestrateur AI tourne sur une seule machine (win11, 192.168.1.30).
A terme, plusieurs machines GPU seront disponibles :
| Machine |
GPU |
Reseau |
Usage prevu |
| win11 (33800) |
RTX existante |
Local |
Modeles legers (7-22B) |
| Nouvelle machine (33800) |
RTX 3070 |
Local |
Modeles moyens |
| Machine Raph (86000) |
RTX 2070 |
WireGuard |
Overflow / backup |
| Future machine |
RTX 5080 |
A definir |
Modeles lourds (70B+) |
Fonctionnalites a implementer
1. Registry de GPU workers
- Chaque machine GPU s'enregistre aupres de l'orchestrateur
- Heartbeat / health check periodique
- Infos : GPU model, VRAM dispo, modeles charges, latence reseau
2. Routage intelligent des jobs
- Choisir le worker en fonction de :
- Modele demande (certains modeles ne tiennent que sur certaines GPU)
- VRAM disponible
- Queue de jobs en attente par worker
- Latence reseau (preferer local vs WireGuard)
- Priorite du job
3. Failover / load balancing
- Si un worker est down, router vers un autre
- Si un job timeout sur un worker, retry sur un autre
- Round-robin ou least-loaded pour les modeles disponibles sur plusieurs workers
4. Interface admin
- Dashboard des workers : status, GPU usage, queue
- Gestion des modeles par worker (pull/delete)
- Metriques : temps de reponse moyen par worker/modele
Architecture proposee
orchestrateur (central)
├── worker win11 (local, RTX existante)
├── worker machine2 (local, RTX 3070)
├── worker raph (WireGuard, RTX 2070)
└── worker machine3 (a definir, RTX 5080)
Chaque worker = instance Ollama avec un agent leger qui reporte son status.
L'orchestrateur maintient un registre et dispatch les jobs.