Task : Sprint 0 — Validation Modeles Locaux pour Ulias-Org
Date : 12/02/2026 14:30
Status : TERMINE
Proposition : 12-02-2026-15-00-ulias-org-v5-connectors-multiuser.md
Resultats
Modeles testes
| Modele |
Params |
Taille |
GPU |
Tool Calling |
Score |
Vitesse |
| devstral-small-2 |
24B |
15 GB |
3090 |
Natif, direct |
5/5 |
15-47 tok, 1-5s |
| qwen3:4b |
4B |
2.5 GB |
3090 |
Natif, avec thinking |
5/5 |
253-824 tok, 2-9s |
| qwen3:8b |
8B |
5.2 GB |
3090 |
Natif, avec thinking |
3/5 |
Oublie suffixe instance |
| qwen2.5-coder:7b |
7.6B |
4.7 GB |
3090 |
Texte brut (pas natif) |
~OK |
Pas de tool_calls struct |
| mistral:7b |
7.2B |
4.4 GB |
3090 |
Natif |
~OK |
Doublons tool calls |
Findings critiques
- qwen3-coder-next = MORT — 52 GB (MoE 80B total), ne rentre sur aucun GPU
- qwen3-coder = trop gros — Plus petit variant = 30B (19 GB)
- glm-4.7-flash = trop gros — 19 GB minimum
- 2070S est 10x plus lente que la 3090 — ~10 tok/s vs ~100 tok/s pour qwen3:4b
- qwen3:4b > qwen3:8b en tool calling — le 4B suit mieux les instructions exactes
Test ReAct (multi-turn avec tool results)
| Etape |
devstral-small-2 |
qwen3:4b |
| Turn 1 (readFile) |
26 tok, 2.1s |
478 tok, 4.8s |
| Turn 2 (editFile) |
211 tok, 21.1s |
1540 tok, 15.9s |
| Qualite fix |
Bloc entier (robuste) |
Ligne seule (fragile) |
| Tokens totaux |
237 |
2018 (8.5x plus) |
Conclusions
devstral-small-2 est excellent pour les agents :
- 5/5 tool calling fiable
- Pas de "thinking" inutile = tokens minimaux
- Remplace des blocs entiers = edits robustes
- ~40 tok/s sur la 3090
qwen3:4b est solide en backup :
- 5/5 aussi mais 8x plus de tokens (thinking)
- Raisonnement visible (debuggable)
- Tient sur la 2070S (2.5 GB) mais 10x plus lent
Decision GPU
Option A recommandee (revisee) :
- GPU0 (3090) : devstral-small-2 = modele principal pour TOUS les agents
- GPU1 (2070S) : nomic-embed-text (embeddings) + qwen3:4b en overflow
- Raison : la 2070S est trop lente (10 tok/s) pour etre utile en agent primaire
Avec context switching Ollama : devstral reste charge sur la 3090, les agents se partagent le modele. Pas besoin de 2 modeles differents — devstral fait tout mieux.
La 2070S sert pour :
- Embeddings (nomic-embed-text) — deja operationnel
- Overflow quand la 3090 est occupee par un outil exclusif (ComfyUI, Wan2.1)
- Taches non-urgentes en background (qwen3:4b, lent mais correct)