33800 Docs

← Retour

STATUS - Infrastructure 33800

Derniere mise a jour: 23/02/2026 02:00

Archives : Les sessions avant le 09/02/2026 sont dans STATUS-archives/STATUS-archive-avant-09-02-2026.md

Session actuelle (23/02/2026 — nuit)

Audit + Nettoyage organisation Claude (TERMINE)

Audit complet de la stack et de l'organisation Claude (propositions, tasks, backlog, STATUS.md, memory/). Puis nettoyage en 7 etapes.

Proposition : propositions/23-02-2026-01-15-nettoyage-organisation-claude.md (VALIDEE) Snapshot : /stock_8to/33800-stack/backups/claude-snapshot-23-02-2026.tar.gz (1.2 Mo)

Actions realisees :

  1. Rotation STATUS.md : 2991 → 416 lignes. Historique avant 09/02 archive dans STATUS-archives/
  2. Propositions marquees : 150 orphelines marquees (122 IMPLEMENTEE, 20 EN ATTENTE, 5 REPORTEE, 3 ORPHELINE). 0 proposition sans statut.
  3. Tasks zombies corrigees : 5 faux "EN COURS" corriges (3 TERMINE, 1 EN ATTENTE LinkedIn, 1 EN ATTENTE QwikPress)
  4. Backlog requalifie : LinkedIn → URGENT, QwikPress 8 items → CETTE SEMAINE, Projets IA 6 items → FIL ROUGE. 7 fichiers renommes avec date.
  5. INDEX-BACKLOG regenere : 56 items classes par priorite, a jour
  6. Memory/ nettoye : 3 fichiers redondants fusionnes et archives (ssh-connector, raph-86000, rhinov-vpn). 23 → 20 fichiers.
  7. Regle CLAUDE.md : Section "Rotation et maintenance" ajoutee + checklist propositions en fin de tache

Decisions utilisateur :

Lecon ajoutee dans MEMORY.md : Defaut #13 — C'est Claude qui oublie de mettre a jour les propositions, pas l'utilisateur.


Session precedente (16/02/2026 — apres-midi)

Lot 4 — Combler les 10 gaps du Dashboard (TERMINE)

Implementation complete des 10 gaps entre l'ancien dashboard bash et le nouveau dashboard Qwik SSR + 4 fixes post-deploiement.

Backend (monitoring repo #95) — 5 commits :

Frontend (frontend repo #120) — 1 commit :

8 nouveaux endpoints : docker dev containers/images, services registry/syncthing, infra ssl/nginx-detail/zfs-extra, ai models

10 gaps combles :

  1. Docker PROD + DEV sections
  2. Grille serveurs (RAM/disk/load/uptime) sur index
  3. Smart-Deploy Registry table
  4. Certs SSL + alertes
  5. Mounts NFS + symlinks + docker volumes
  6. Page Nginx dediee (filtres, recherche, table)
  7. RAIDZ ARC cache, serials disques, dossiers
  8. Ollama live (19 modeles)
  9. Syncthing status live
  10. Cron monitoring-collect

4 fixes post-deploiement :

Verification : 8 endpoints OK, 4 crons OK, page GitLab OK


Filtrage URL-driven pour le dashboard connectors-front (TERMINE)

Suite du travail de la session precedente. Le frontend connectors-front utilise maintenant les URL search params pour stocker l'etat des filtres (categorie, tags, recherche texte). Les filtres sont bookmarkables et partageables.

Commit : 745c3e4 (connectors-front, CI/CD success, deploye)

Fichiers modifies :

Rappel session precedente (15/02/2026) :

Tests valides :


Session precedente (15/02/2026 — soir)

Fix SSH setup-key : generation de cles (TERMINE)

Diagnostic et fix du bug qui empechait l'instance nginx-SSH de fonctionner via connectors.

Cause racine : setupAutoKey() generait des cles RSA en format PKCS#8/SPKI incompatible avec ssh2. La methode convertToOpenSSH() etait un placeholder casse (SPKI DER brut en format ssh-rsa). De plus, le mot de passe etait supprime apres installation de cle, rendant l'instance inaccessible si la cle echouait.

Fix (commit 3ea4de9, CI/CD success, deploye) :

Tests valides :


Session precedente (14/02/2026 — soir)

UX actionnable + Briefing generique (TERMINE)

Frontend ulias-org-web : boutons Relancer/Modifier sur les objectifs (chat + historique), tool results collapsibles, barre de confidence coloree, barre de progression structuree avec badges agent/model, filtre status dans l'historique.

Backend ulias-org : disambiguation generique des instances. Quand le message touche un type de connecteur (SSH, GitLab, email, Proxmox, etc.) qui a >1 instance et que l'utilisateur ne precise pas laquelle → briefing automatique. Fonctionne pour tous les types, pas de hardcode par connecteur. Les questions sont generees dynamiquement depuis les instances reelles de l'utilisateur.

Commits deployes (tous CI/CD success):

Erreurs de Claude cette session :


Integration Anthropic API + Cost Tracking (TERMINE)

Ajout d'Anthropic Claude comme provider LLM cloud dans ai-orchestrator + tracking des couts en temps reel. Les agents ulias-org avec tools complexes sont routes vers Anthropic (quand la cle API sera configuree), les taches legeres restent en local sur Ollama.

Commits deployes (tous CI/CD success):

Features:

Migration SQL executee: +6 colonnes sur ai_jobs (cost_usd, provider, tokens_input/output, cache_read/creation_tokens)

Tests valides: /api/costs/live OK, /api/costs/summary OK, tool "anthropic" enregistre, schemas OK, ulias-org 31 agents healthy

Activation future: ajouter ANTHROPIC_API_KEY: "sk-ant-..." dans conf.prod.gouroubleu.yml + redeploy


Session precedente (13/02/2026)

Conversations persistantes Phase 1 (TERMINE)

Ajout de la persistance des conversations pour ulias-org. Les messages (user, assistant, events) sont sauvegardes en DB et restaures au rechargement.

Commits deployes (tous CI/CD success):

Features:

Tests valides: GET/POST/PATCH/DELETE conversations, GET messages, WS auto-create, messages persistes en DB


Reactivation Dual-GPU + Routing intelligent (TERMINE)

RTX 2070 Super reactivee pour les taches Ollama legeres.

Commits deployes (tous CI/CD success):

Routing actuel:

Tests valides: llama3.2→GPU1, qwen3:8b→GPU0, embeddings→GPU1, ulias-org healthy


Ulias Org v0.8.0 — Fix Auth, GPU, Scheduler, Pages vides (TERMINE)

Correction de 6+ bugs bloquants decouverts lors des tests de v0.8.0.

Commits deployes (tous CI/CD success):

Fixes appliques:

  1. Auth email/password — Login via POST connectors-api /api/auth/login, creation auto de cle API
    • Parsing session.access_token + user.id (format connectors-api)
    • Noms de cle uniques (timestamp) pour eviter conflit avec cles revoquees
    • Scopes ["*"] sur les cles creees
  2. userId = UUID — Avant: ck_live_ (prefix API key). Maintenant: 821349f2-... (vrai UUID)
  3. GPU routinggpu: 1 (RTX 2070S 8GB) → gpu: 0 (RTX 3090 24GB), timeout 30s→90s
  4. Embeddingsollama-gpu1ollama (RTX 3090)
  5. Scheduler guardjobsRunning Map previent l'empilement de jobs concurrents
  6. Scheduler reactivedENABLE_SCHEDULER: "true"
  7. Profile PUT — Colonne preferences JSONB ajoutee a agents.ceo_profile + defaults NOT NULL
  8. Pages videsresolveSession() sur TOUS les endpoints REST (auto-creation session)

ollama-gpu1 stoppe, scheduled tasks nettoyees sur win11:

Tests valides (tous OK):

Infrastructure actuelle:


Session precedente (12/02/2026 soir)

Ulias Org - Vision Complete v0.8.0 (TERMINE)

Implementation complete des sprints 2-8. Systeme passe de MVP a production.

Services:

25 agents, 7 teams: engineering (5), ops (4), research (3), media (3), security (3), transversal (4), ceo (3)

Pages web UI: Chat, Monitor, History, Decisions, Teams, Settings, Login

Infrastructure:

CI/CD: Les deux repos pushes et deployes


Ulias Org - Deploiement E2E (TERMINE)

Deploiement complet et test end-to-end reussi de ulias-org (organisation IA autonome).

Service: https://ulias-org.33800.nowhere84.com (port 5515, SSL, WebSocket)

Flow valide:

Fixes appliques:


Session precedente (12/02/2026 matin)

Verification logrotate + sync-logs (TERMINE)

Verification post-fix du pipeline de logs installe le 11/02. Deux problemes supplementaires decouverts et corriges :

1. Logrotate nginx — paquet manquant

2. Sync-logs O2switch — 2 curls zombies

3. Bug doublon logs dans le script

Resultat sync 11/02 : | Source | Lignes | |--------|--------| | pve/journal | 38 764 | | nginx/access | 3 854 | | nginx/vhost-access | 152 321 | | nginx/vhost-error | 5 765 | | gitlab/rails | 162 322 | | gitlab/nginx | 72 368 | | prod-portainer/docker | 2 103 595 | | dev-portainer/docker | ~2M |


Session precedente (11/02/2026)

Etat des lieux stack + Fix pipeline logs (TERMINE)

Etat des lieux complet de l'infra, puis correction du pipeline de logs :

Diagnostics :

3 problemes decouverts et corriges :

  1. Logrotate inactif sur nginx VM — package cron absent, logs grossissaient sans fin (1.1 Go). Fix: apt install cron, logrotate s'executera quotidiennement (daily, 14 rotations, compress).

  2. sync-logs-o2switch.sh non fonctionnel — 3 bugs : FQDN DNS casse (ssh-nowhere84.o2switch.net → alias o2switch), limit=100000 depassait le max Loki 5000 (pagination batch 1000 + curl timeout 30s), rsync --mkpath non supporte par O2switch (mkdir -p prealable). Le script n'avait JAMAIS fonctionne — aucun log archive sur O2switch.

  3. nginx-logs-archive.sh supprime — Redondant avec Loki + O2switch, archive quasi vide.

Test final reussi : 8 fichiers, 2.4M lignes, 29 Mo archives sur O2switch ~/backup/logs/.

Architecture logs resultante :

Task: ~/tasks/11-02-2026-02-30-fix-pipeline-logs-nginx-o2switch.md


Session precedente (10/02/2026)

Verification complete Win11 + AI Orchestrator (TERMINE)

Tests end-to-end de toute la chaine orchestrator → win11 :

Win11 (192.168.1.30) :

Jobs testes via orchestrator :

Limite identifiee : mistral:latest (4.3 Go) ne tient pas sur GPU1 (8 Go VRAM, 3.8 Go deja utilisees). Petits modeles (llama3.2, nomic-embed-text, gemma3:4b) OK. Comportement attendu du VRAM-aware scheduling.

Containers Docker : 29 containers healthy sur prod-portainer (seul notif-logger unhealthy, preexistant)

Parallelisation /api/tools/refresh (TERMINE)

Split Health Check en 4 etapes (TERMINE)

Remplacement du bloc monolithique step 9 dans smart-deploy par 4 etapes granulaires :

Etape Verifie Rollback si echec
9a Container Check docker inspect status=running Non (probleme image/config)
9b Port Readiness TCP connect avec retries Oui
9c Health interne HTTP /health sur IP:port Oui
9d Health HTTPS Domaine externe nginx/SSL Non (probleme nginx, pas app)

Proposition Blue-Green Deployment (REDIGE)


Session precedente (09/02/2026)

Fix Multi-GPU AI Orchestrator - Fiabilisation + VRAM-aware scheduling (TERMINE)