33800 Docs

← Retour

Task : Sprint 0 — Validation Modeles Locaux pour Ulias-Org

Date : 12/02/2026 14:30 Status : TERMINE Proposition : 12-02-2026-15-00-ulias-org-v5-connectors-multiuser.md


Resultats

Modeles testes

Modele Params Taille GPU Tool Calling Score Vitesse
devstral-small-2 24B 15 GB 3090 Natif, direct 5/5 15-47 tok, 1-5s
qwen3:4b 4B 2.5 GB 3090 Natif, avec thinking 5/5 253-824 tok, 2-9s
qwen3:8b 8B 5.2 GB 3090 Natif, avec thinking 3/5 Oublie suffixe instance
qwen2.5-coder:7b 7.6B 4.7 GB 3090 Texte brut (pas natif) ~OK Pas de tool_calls struct
mistral:7b 7.2B 4.4 GB 3090 Natif ~OK Doublons tool calls

Findings critiques

  1. qwen3-coder-next = MORT — 52 GB (MoE 80B total), ne rentre sur aucun GPU
  2. qwen3-coder = trop gros — Plus petit variant = 30B (19 GB)
  3. glm-4.7-flash = trop gros — 19 GB minimum
  4. 2070S est 10x plus lente que la 3090 — ~10 tok/s vs ~100 tok/s pour qwen3:4b
  5. qwen3:4b > qwen3:8b en tool calling — le 4B suit mieux les instructions exactes

Test ReAct (multi-turn avec tool results)

Etape devstral-small-2 qwen3:4b
Turn 1 (readFile) 26 tok, 2.1s 478 tok, 4.8s
Turn 2 (editFile) 211 tok, 21.1s 1540 tok, 15.9s
Qualite fix Bloc entier (robuste) Ligne seule (fragile)
Tokens totaux 237 2018 (8.5x plus)

Conclusions

devstral-small-2 est excellent pour les agents :

qwen3:4b est solide en backup :

Decision GPU

Option A recommandee (revisee) :

Avec context switching Ollama : devstral reste charge sur la 3090, les agents se partagent le modele. Pas besoin de 2 modeles differents — devstral fait tout mieux.

La 2070S sert pour :