33800 Docs

← Retour

AI Orchestrator - Tests Complets

Date: 17/01/2026 16:45 Status: ✅ TERMINÉ

Objectif

Tester tous les outils IA via l'AI Orchestrator API et leurs APIs Gradio respectives.

Tests Effectués

1. Switch Automatique via Orchestrator

De Vers Méthode Résultat
- ComfyUI POST /api/tools/comfyui/start
ComfyUI Fooocus POST /api/tools/fooocus/start?force=true
Fooocus ComfyUI POST /api/tools/comfyui/start?force=true
ComfyUI Wan2.1 POST /api/tools/wan21/start?force=true ✅ (~4 min)
Wan2.1 Bark POST /api/tools/bark/start?force=true
Bark MusicGen POST /api/tools/musicgen/start?force=true
MusicGen SadTalker Manuel

2. Bark TTS - Génération Audio

API: POST /gradio_api/call/lambda

Test Texte Voix Taille Status
Simple "Hello world" None 94 Ko
Français "Bonjour! Je suis Bark..." v2/fr_speaker_1 1.3 Mo
Émotions "[laughs] [sighs] [music]" v2/en_speaker_3 1.3 Mo

Fichiers générés:

3. MusicGen - Génération Musique

API: POST /gradio_api/call/generate_music

Style Description Durée Taille Status
EDM Electronic dance, synthesizers 10s 637 Ko
Jazz Smooth jazz, saxophone, piano 15s 957 Ko
Rock 90s grunge, distorted guitars 10s 637 Ko

Fichiers générés:

4. SadTalker - Talking Head

Status: ⚠️ Interface Web OK, API complexe

5. FaceFusion - Face Swap

Status: ✅ Fonctionnel (Web UI) Port: 7869 API: Gradio 6.x - API complexe (workflow par jobs)

Corrections appliquées:

Note API: L'API FaceFusion utilise un workflow par jobs complexe :

Fichier modifié: I:\facefusion\start_facefusion.bat

@echo off
cd /d I:\facefusion
set PATH=C:\Users\gouro\AppData\Local\Microsoft\WinGet\Links;%PATH%
set GRADIO_SERVER_NAME=0.0.0.0
set GRADIO_SERVER_PORT=7869
venv\Scripts\python.exe facefusion.py run --ui-layouts default

6. TripoSR - Image to 3D

Status: ❌ Non fonctionnel Problème: Module torchmcubes manquant (pas sur PyPI) Solution: Compiler depuis source GitHub

Corrections Appliquées

MusicGen

pip install scipy

SadTalker

pip install numpy==1.26.4
pip install scipy==1.10.1 --force-reinstall --no-deps
pip install gradio==3.50.2

Utilisation VRAM

Outil VRAM Utilisée VRAM Libre
Bark TTS ~6.4 Go ~18 Go
MusicGen ~0.9 Go ~23 Go
Wan2.1 ~7.4 Go ~17 Go

APIs Gradio Documentées

Bark TTS (port 7866)

# Générer audio
curl -X POST http://192.168.1.30:7866/gradio_api/call/lambda \
  -H "Content-Type: application/json" \
  -d '{"data":["Texte à dire","v2/fr_speaker_1"]}'

# Récupérer résultat
curl http://192.168.1.30:7866/gradio_api/call/lambda/{event_id}

MusicGen (port 7867)

# Générer musique
curl -X POST http://192.168.1.30:7867/gradio_api/call/generate_music \
  -H "Content-Type: application/json" \
  -d '{"data":["Description style musical", durée_secondes]}'

# Récupérer résultat
curl http://192.168.1.30:7867/gradio_api/call/generate_music/{event_id}

Prochaines Étapes

  1. Installer ffmpeg sur win11 pour FaceFusion ✅ Fait
  2. Compiler torchmcubes pour TripoSR
  3. Investiguer API SadTalker avec Python Gradio Client
  4. Phase 3 AI Orchestrator: Système de queue Redis

Fichiers Modifiés