Date : 15/02/2026
Status : IMPLEMENTEE
Projet : ai-orchestrator
Fichier : /stock_8to/33800-stack/projects/ai-orchestrator/app/main.py
MAX_SERVER_CONCURRENT = 10 s'applique a TOUS les GPUs de maniere identique.
Resultat : l'orchestrator envoie 10 jobs d'embeddings en rafale sur GPU1, Ollama repond 503 "maximum pending requests exceeded", tous les jobs echouent.
Ligne 793 :
MAX_SERVER_CONCURRENT = 10 # Meme limite pour les 2 GPUs
Ligne 4167 dans can_dispatch() :
if server_count >= MAX_SERVER_CONCURRENT: # Pas de distinction par GPU
return False
1 seule modification : rendre la limite par GPU dans GPU_CONFIG.
GPU_CONFIG = {
0: {"name": "RTX 3090", "vram_total": 24576},
1: {"name": "RTX 2070 Super", "vram_total": 8192},
}
# ...
MAX_SERVER_CONCURRENT = 10
GPU_CONFIG = {
0: {"name": "RTX 3090", "vram_total": 24576, "max_server_concurrent": 8},
1: {"name": "RTX 2070 Super", "vram_total": 8192, "max_server_concurrent": 2},
}
Et dans can_dispatch() (ligne 4167) :
# Avant :
if server_count >= MAX_SERVER_CONCURRENT:
# Apres :
max_concurrent = GPU_CONFIG[gpu_id].get("max_server_concurrent", 4)
if server_count >= max_concurrent:
MAX_SERVER_CONCURRENT devient inutilisee → la supprimermain.py