33800 Docs

← Retour

Ollama GPU1 - Smart Routing

Date: 07/02/2026 21:30 Status : IMPLEMENTEE

Objectif

Quand la RTX 3090 est occupée (comfyui, fooocus, wan21...), les petites demandes Ollama (codegen, mistral:7b, llama3.1:8b...) sont redirigées automatiquement vers une 2e instance Ollama sur la RTX 2070 Super.

Modifications

ai-orchestrator/app/main.py

  1. Nouvel outil ollama-gpu1 : 2e instance Ollama, port 11435, GPU 1
  2. stop_cmd ollama : changé de taskkill /IM (tuerait les 2) → kill par port
  3. Smart routing dans process_single_job : si tool_id="ollama" ET GPU 0 occupé ET modèle petit → reroute vers ollama-gpu1
  4. execute_ollama_job : port dynamique selon l'instance
  5. Modèles exclus GPU1 : 70b, 32b, 14b, 13b, 8x7b, mixtral (> 8 Go VRAM)

Pas de modification win11

Le start_cmd génère les bonnes variables d'environnement : CUDA_VISIBLE_DEVICES=1 + OLLAMA_HOST=0.0.0.0:11435 → pas de .bat à créer sur win11