Main Page: Difference between revisions

From Essential
Jump to navigation Jump to search
(155 intermediate revisions by the same user not shown)
Line 1: Line 1:
[[File:Infocepo-picture.png|thumb|right|Discover cloud computing on infocepo.com]]
[[File:Infocepo-picture.png|thumb|right|Discover cloud and AI on infocepo.com]]


= Discover Cloud Computing on infocepo.com =
= infocepo.com – Cloud, AI & Labs =


Welcome! This portal is designed for IT professionals, engineers, students, and enthusiasts who want to master cloud infrastructure, explore AI tools, and accelerate their IT skills through hands-on labs and open-source solutions.
Bienvenue sur le portail '''infocepo.com'''.
 
Ce wiki documente l’écosystème '''Cloud, IA, automatisation et lab''' d’Infocepo. 
Il s’adresse aux :
 
* administrateurs systèmes,
* ingénieurs cloud,
* développeurs,
* étudiants,
* curieux qui veulent apprendre en pratiquant.
 
L’objectif est simple : transformer la théorie en '''scripts réutilisables, schémas, architectures, APIs et laboratoires concrets'''.


__TOC__
__TOC__


== Quick Start ==
----
* '''Master cloud infrastructure:''' Practical guides and labs
 
* '''Explore artificial intelligence:''' Trends and hands-on tools
= Accès rapide =
* '''Compare cloud providers:''' Kubernetes, AWS, OpenStack, and more
 
* '''Develop expertise:''' Training, open-source, and real-world projects
== Portail principal ==
* [https://infocepo.com infocepo.com]
 
== Assistant IA ==
* [https://chat.infocepo.com Chat assistant]
 
== Liste des pages du wiki ==
* [[Special:AllPages|Toutes les pages]]
 
== Vue d’ensemble ==
[[File:Ailab-architecture.png|thumb|'''Infra architecture overview''']]
 
= Démarrer rapidement =
 
== Parcours recommandés ==
 
; 1. Construire un assistant IA privé
* Déployer une stack type '''Hermes WebUI + Ollama + GPU'''
* Ajouter un modèle de chat et un modèle de résumé
* Brancher des données internes via '''RAG + embeddings'''
 
; 2. Lancer un lab cloud
* Créer un petit cluster Kubernetes, OpenStack ou bare-metal
* Mettre en place un pipeline de déploiement (Helm, Ansible, Terraform…)
* Ajouter un service IA : transcription, résumé, chatbot, OCR…
 
; 3. Préparer un audit ou une migration
* Inventorier les serveurs avec '''ServerDiff.sh'''
* Concevoir l’architecture cible
* Automatiser la migration avec des scripts reproductibles
 
== Vue d’ensemble du contenu ==
* '''Guides IA & outils''' : assistants, modèles, évaluation, GPU, RAG
* '''Cloud & infrastructure''' : Kubernetes, OpenStack, HA, HPC, DevSecOps
* '''Labs & scripts''' : audit, migration, automatisation
* '''Comparatifs''' : Kubernetes vs OpenStack vs AWS vs bare-metal, etc.


----
----


= AI & Cloud Tools =
= Vision =


; '''AI Assistants'''
[[File:Automation-full-vs-humans.png|thumb|right|The world after automation]]
* [https://chat.openai.com ChatGPT4] – Public conversational AI with strong learning capabilities
* [https://github.com/open-webui/open-webui Open WebUI] + [https://www.scaleway.com/en/h100-pcie-try-it-now/ GPU H100] + [https://ollama.com Ollama] – Private assistants and self-hosted LLM APIs
* [https://github.com/ynotopec/summarize Private summary] – Fast, offline summarizer for your data


; '''Development & Model Tracking'''
Le but à long terme est de construire un environnement où :
* [https://ollama.com/library LLM Trending] – Latest open-source LLMs
 
* [https://github.com/search?q=stars%3A%3E15000+forks%3A%3E1500+created%3A%3E2022-06-01&type=repositories&s=updated&o=desc Project Trending] – Top trending codebases since 2022
* les assistants IA privés accélèrent la production,
* [https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard LLM Leaderboard] – Community benchmarks
* les tâches répétitives sont automatisées,
* [https://chat.lmsys.org ChatBot Evaluation] – Compare chatbot performance
* les déploiements sont industrialisés,
* [https://www.perplexity.ai Perplexity AI] – Cutting-edge research and question answering
* l’infrastructure reste '''compréhensible, portable et réutilisable'''.
* [https://huggingface.co/models Models Trending] – Model marketplace
 
* [https://github.com/hiyouga/LLaMA-Factory LLM Fine Tuning] – Advanced training framework
Chaque sortie IA est mesurée en temps réel, les modèles faibles sont remplacés automatiquement, et les tâches sans valeur sont coupées. L'autonomie vient de mécanismes techniques qui fonctionnent quand personne ne regarde — pas de règles écrites dans un doc.
* [https://huggingface.co/spaces/mteb/leaderboard Embedding Leaderboard] – Ranking for vector search models
 
* [https://ann-benchmarks.com Vectors DB Ranking] – Database speed and feature comparison
[[File:SUMMARY-DIAGRAM-7311e6b1-aede-4989-ade2-a42d1a6e0ff2.png|thumb|right|Main page summary]]
* [https://www.nvidia.com/en-us/data-center/h100/ NVIDIA H100] – HPC/AI GPUs for Kubernetes clusters
* [https://www.nvidia.com/fr-fr/geforce/graphics-cards/40-series/rtx-4080-family NVIDIA 4080] – Prosumer GPU for private deployments
* [https://huggingface.co/models?pipeline_tag=image-text-to-text&sort=trending Img2txt Trending] – Vision-language models
* [https://huggingface.co/spaces/TIGER-Lab/GenAI-Arena Txt2img Evaluation] – Compare generative image models
* [https://github.com/chatchat-space/Langchain-Chatchat Chatchat] – Private RAG assistant (multi-lingual)
* [https://top500.org/lists/green500/ HPC Efficiency] – Top green supercomputers


----
----


== Notable Open LLMs ==
= Catalogue rapide des services =
''(Last updated: 26/07/2025)''


{| class="wikitable"
{| class="wikitable"
! Model !! Description / Notable Features
|+ Services principaux
! Catégorie !! Service !! Rôle
|-
| API || [https://api-nothink.ailab.infocepo.com/docs LLM] || Modèles de chat, code, RAG, OCR
|-
| API || [https://api-audio2txt.ailab.infocepo.com/docs STT] || Transcription audio
|-
| API || [https://api-tts-omnivoice.ailab.infocepo.com/docs TTS] || Synthèse vocale
|-
| API || [https://github.com/ynotopec/api-realtime-ai realtime-ai] || Temps réel WebSocket / WebRTC
|-
| API || [https://api-nothink.ailab.infocepo.com/docs IMAGE2TXT] || OCR / VLM via endpoint dédié
|-
| API || [https://api-summary.ailab.infocepo.com:wait-2026-12/docs summary] || Résumé de textes longs
|-
| API || [https://api-embedding.ailab.infocepo.com/docs EMBEDDINGS] || Embeddings pour RAG
|-
|-
| '''ai-chat''' || gemma3n, cost efficient
| API || [https://chromadb.ailab.infocepo.com:wait-2026-12 ChromaDB] || Base vecteur
|-
|-
| '''ai-translate''' || gemma3n, temperature=0 (deterministic translation)
| API || [https://api-txt2image.ailab.infocepo.com/docs TXT2IMAGE] || Génération d’images
|-
|-
| '''ai-summary''' || qwen2.5, optimized for summarization
| API || [https://api-diarization.ailab.infocepo.com/docs diarization] || Segmentation locuteurs
|-
|-
| '''ai-code''' || mistral-small, advanced code reasoning
| Observabilité || [https://grafana.ailab.infocepo.com:wait-2026-12 monitoring] || Dashboards techniques
|-
|-
| '''ai-code-completion''' || granite-2b, fast code suggestions
| Observabilité || [https://uptime-kuma.ailab.infocepo.com:wait-2026-12/status/ai status] || Disponibilité des services
|-
|-
| '''ai-parse''' || gemma2-simpo, parsing & extraction
| Observabilité || [https://web-stat.c1.ailab.infocepo.com:wait-2026-12 web-stat] || Statistiques web
|-
|-
| '''ai-RAG-FR''' || qwen2.5, French RAG applications
| Observabilité || [https://api.ailab.infocepo.com:wait-2026-09/ui LLM-stat] || Vue API / usage
|-
|-
| '''mannix/gemma2-9b-simpo''' || OllamaFunctions integration
| Outils || [https://datalab.ailab.infocepo.com:wait-2026-12 dataLab] || Environnement de travail hors-production
|-
| Outils || [https://translate-rt.ailab.infocepo.com realtime translation] || Traduction
|-
| Outils || [https://demos.ailab.infocepo.com Demos] || Démonstrateurs
|}
|}


----
----


= Industry News & Trends =
= Nouveautés =


* [https://www.youtube.com/@lev-selector/videos Top AI News] – Video digest
== Nouveautés 01/08/2026 ==
* [https://betterprogramming.pub/color-your-captions-streamlining-live-transcriptions-with-diart-and-openais-whisper-6203350234ef Real-time transcription with Diart + Whisper] – Speaker tracking
* [https://translate-rt.ailab.infocepo.com '''Traduction temps réel'''] : réduction significative des hallucinations lors des silences, diminution de la latence et ajout de la plupart des langues en TTS.
* [https://github.com/openai-translator/openai-translator OpenAI Translator] – Modern open-source translation
* [https://api-tts-omnivoice.ailab.infocepo.com '''TTS Omnivoice'''] : Qualité TTS augmenté et ajout plus global des langues (600).
* [https://www.mouser.fr/ProductDetail/BittWare/RS-GQ-GC1-0109?qs=ST9lo4GX8V2eGrFMeVQmFw%3D%3D GROQ LLM accelerator] – Fast, low-cost inference hardware
* [https://api-lightrag.ailab.infocepo.com '''LightRAG'''] : LightRAG est un framework RAG avancé et léger qui combine graphes de connaissances et recherche vectorielle pour une analyse contextuelle profonde et efficace.
* [https://opensearch.org/docs/latest/search-plugins/conversational-search Opensearch with LLM] – Enhanced search experiences
* [https://api-reranker.ailab.infocepo.com/docs '''API reranker'''] : [https://github.com/ynotopec/api-reranker git].
* [https://api-embedding.ailab.infocepo.com '''API embedding'''] : Mise à jour des paramètres RAG optimisation : bge-m3 (chunk 1000, 100 overlap). [https://github.com/ynotopec/api-embedding git]
* [https://github.com/ynotopec/api-llm-privacy-proxy '''privacy-filter'''] : filtrage données personnelles.
* [https://github.com/multica-ai/andrej-karpathy-skills '''Un seul fichier CLAUDE.md'''] inspiré d'Andrej Karpathy pour transformer Claude en un vrai ingénieur logiciel.
* [https://github.com/ynotopec/qwen36-sglang '''Qwen3.6'''] : Qwen3.6 delivers substantial upgrades in agentic coding and thinking preservation than previous Qwen models. Déployé avec [https://huggingface.co/nvidia/Qwen3.6-35B-A3B-NVFP4 '''NVIDIA/Qwen3.6-35B-A3B-NVFP4'''] — quantisation NVFP4 optimisée pour l'inférence GPU NVIDIA.
* [https://github.com/NousResearch/hermes-agent '''Hermes Agent'''] : l'agent qui s'améliore et grandit avec toi.
* [https://github.com/anomalyco/opencode '''opencode'''] : CLI coder à comparer avec Aider / OpenHands. (⚠️ migration : ancienne URL `github.com/sst/opencode` → redirige vers `anomalyco/opencode`)
* [https://github.com/ynotopec/api-convert2md '''api-convert2md'''] : extraction de tableaux pour RAG compatible Open WebUI.
* Ajout de [https://github.com/ynotopec/coder-brain/blob/main/first-architecture.md '''brains expérimentaux'''].
* Ajout de [https://github.com/ynotopec/legal-agent '''legal-agent'''].
* Ajout de [https://github.com/ynotopec/ai-security '''ai-security'''].
* [https://sam-audio.ailab.infocepo.com '''sam-audio'''] : séparation audio sémantique.
* Ajout de l'[https://github.com/ynotopec/api-realtime-ai '''API Realtime'''] : WebRTC / WebSocket bidirectionnel basse latence.


----
----


= Training & Learning =
== Nouveautés 02/06 - 03/08/2026 ==
* [https://github.com/ynotopec/translate-rt '''translate-rt'''] : API de traduction multilingue temps réel — PR #3 fix timeout (gestion réponses lentes), PR #2 URLs configurables via .env.
* [https://github.com/ynotopec/GLM-4.7-Flash-vLLM '''GLM-4.7-Flash-vLLM'''] : Déploiement vLLM GLM-4.7 Flash.
* [https://github.com/ynotopec/qwen3.5-fp8-vllm '''qwen3.5-fp8-vllm'''] : Déploiement Qwen 3.5 FP8 via vLLM.
* [https://github.com/ynotopec/api-rag '''api-rag'''] : API RAG (recherche sémantique) — fix support FAISS SVE, suppression logs verbeux, wait-for-APIS avant build index vectoriel.
* [https://github.com/ynotopec/api-diarization '''api-diarization'''] : API diarisation audio — install améliorée, ergonomics auth, documentation setup projet.
* [https://github.com/ynotopec/api-audio2txt '''api-audio2txt'''] : API FastAPI ASR ( Whisper ) — refonte complète, installer uv, docs runtime.
* [https://github.com/ynotopec/api-llm-privacy-proxy-openmed '''privacy-proxy-openmed'''] : Privacy proxy OpenMed-based — LLM upstream optionnel (mode privacy-only).
* [https://github.com/ynotopec/api-llm-privacy-proxy-gliner2 '''privacy-proxy-gliner2'''] : Privacy proxy GLiNER2-based — détection entités nommées, upstream LLM optionnel, PR #1 en cours.
* [https://github.com/ynotopec/api-llm-custom '''api-llm-custom'''] : Proxy LLM custom — paramètres modèle configurables, alias ai-default, gestion erreurs upstream.


* [https://www.youtube.com/watch?v=4Bdc55j80l8 Transformers Explained] – Intro to Transformers algorithm
 
* Hands-on labs and scripts in the [[LAB project|CLOUD LAB]] below
== Nouveautés 03/08/2026 ==
* [https://github.com/ynotopec/infocepo-infra-mcp '''infocepo-infra-mcp'''] : MCP server universel — zéro clé en dur, lecture API key depuis ~/.infocepo-credentials, déploiement K8s, refacto stdio (plus de shell wrapper).
* [https://github.com/ynotopec/nemotron-embed '''nemotron-embed'''] : Service Nemotron-3 Embedding vLLM — systemd service, script de lancement, documentation d'installation.
* [https://github.com/ynotopec/agent-saas '''agent-saas'''] : Plateforme SaaS d'agents IA autonomes — manifests K8s complets, dashboard FastAPI, hardening déploiement.


----
----


= Cloud Lab & Audit Projects =
= Priorités =


[[File:Infocepo.drawio.png|400px|Cloud Lab Reference Diagram]]


; '''Lab Project'''
== Top tasks ==
Experiment with high-availability, cloud migration, and audit automation.
* Ajouter [https://github.com/microsoft/presidio '''Presidio'''] : anonymisation / masquage PII, socle RGPD.
* Ajouter [https://github.com/llm-d/llm-d '''llm-d'''] : blueprints + charts Kubernetes pour industrialiser les déploiements.
* Ajouter [https://github.com/ai-dynamo/dynamo '''Dynamo'''] : orchestration inférence multi-nœuds.
* Ajouter [https://github.com/vllm-project/guidellm '''GuideLLM'''] : capacity planning / benchmark réaliste.
* Ajouter [https://github.com/NVIDIA-NeMo/Guardrails '''NeMo Guardrails'''] : garde-fous et politiques.
* '''Coût unitaire par tâche''' : chaque API doit exposer son prix/ml/token en temps réel — pas une facture mensuelle.
* '''Qualité auto''' : précision/hallucination rate branchés sur les sorties IA, avec rollback automatique si qualité < seuil.


=== Cloud Audit ===
== Backlog / Veille Technologique ==
* '''[[ServerDiff.sh]]''' – Bash script for auditing servers, tracking config drift, and checking environment consistency


=== Cloud Migration Example ===
=== Agents IA & Orchestration ===
[[File:Diagram-migration-ORACLE-KVM-v2.drawio.png|400px|Cloud Migration Diagram]]


* [https://github.com/block/buzz '''buzz (Block)'''] - Plateforme de communication "hive mind" : humains et agents IA cohabitent dans les memes canaux, auto-hebergeable.
* [https://github.com/pingdotgg/t3code '''t3code'''] - Interface web GUI pour orchestrer les agents de codage (Codex, Claude Code, Cursor...) depuis un navigateur.
* [https://github.com/moeru-ai/airi '''airi (Moeru AI)'''] - Companion IA auto-heberge : voice chat temps reel, controle de jeux (Minecraft, Factorio), compatible Grok.
* [https://github.com/bojieli/ai-agent-book '''ai-agent-book'''] - Livre open-source (10 chapitres, 94 experiences) couvrant les AI Agents : LLM + contexte + outils, de la theorie a la production.
* [https://github.com/Zackriya-Solutions/meetily '''meetily''' ] — Assistant IA de reunion local avec transcription Parakeet/Whisper en direct, diarisation et resume Ollama. 100% local, aucun cloud.
* [https://github.com/wonderwhy-er/DesktopCommanderMCP '''DesktopCommanderMCP''' ] — Serveur MCP pour Claude : controle terminal, recherche fichiers et edition de diffs.
* [https://github.com/openai/codex-plugin-cc '''codex-plugin-cc''' ] — Utiliser Codex depuis Claude Code pour reviewer du code ou deleguer des taches.
* [https://github.com/TencentCloud/CubeSandbox '''CubeSandbox''' ] — Sandbox instantanee, concurrente, securisee et leger pour agents IA.
* [https://github.com/ogulcancelik/herdr '''herdr''' ] — Multiplexeur d'agents qui vit dans votre terminal.
* [https://github.com/bradautomates/claude-video '''claude-video''' ] — Donner a Claude la capacite de regarder des vidéos : download, extraction frames, transcription.
* [https://github.com/iOfficeAI/OfficeCLI '''OfficeCLI''' ] — Suite Office construite pour agents IA : lire, modifier, automatiser Word, Excel, PowerPoint en binaire unique.
* [https://github.com/tt-a1i/archify '''archify''' ] — Skill agent : generer de beaux diagrammes d'architecture avec export PNG/JPEG/WebP/SVG.
* [https://github.com/alirezarezvani/claude-skills '''claude-skills''' ] — 345 skills et plugins pour agents de codage (30+ agents, 70+ commandes, 330+ skills) pour Claude Code, Codex, Gemini CLI, Cursor, et 8+.
* [https://github.com/ChromeDevTools/chrome-devtools-mcp '''chrome-devtools-mcp''' ] — Chrome DevTools pour agents de codage via MCP.
* [https://github.com/paperclipai/paperclip Paperclip] — Orchestrateur open-source pour coordonner et superviser une équipe d'agents IA autonomes
* [https://github.com/openclaw/openclaw OpenClaw]
* [https://github.com/colbymchenry/codegraph '''codegraph''' ] — Indexation locale des graphes de code pour agents (Hermes, Claude, Codex sync auto).
* [https://github.com/Egonex-AI/Understand-Anything '''Understand-Anything''' ] — Transforme tout code en graphe de connaissances interactif explorable et questionnable.
* [https://github.com/All-Hands-AI/OpenHands OpenHands] — Agent IA autonome pour le développement logiciel
* [https://github.com/langgenius/dify Dify] — Plateforme de développement d'applications IA (LLM Ops)
* [https://github.com/browser-use/browser-use browser-use] — Framework pour contrôler les navigateurs via des agents IA
* [https://github.com/langchain-ai/langchain LangChain] — Framework pour applications basées sur les LLM
* [https://github.com/FlowiseAI/Flowise FlowiseAI] — Build LLM apps visually
* [https://github.com/RasaHQ/rasa '''Rasa'''] — Framework open-source pour chatbots et assistants vocaux
* [https://github.com/DeusData/codebase-memory-mcp '''codebase-memory-mcp''' ] - Serveur MCP haute performance pour l'indexation de codebases en graphe de connaissances persistant.
* [https://github.com/Panniantong/Agent-Reach '''Agent-Reach''' ] - Donnez des yeux a vos agents IA pour naviguer le web entier (Twitter, Reddit, YouTube, GitHub) en CLI, sans frais API.
* [https://github.com/NVIDIA/SkillSpector '''SkillSpector''' ] - Scanner de securite pour les competences d'agents IA : detecte vulnerabilites, patterns malveillants et risques.
* [https://github.com/withastro/flue '''flue''' ] - Framework sandbox pour agents IA -- isolation et execution securisee de plugins/agents.
* [https://github.com/addyosmani/agent-skills '''agent-skills''' ] - Skills d'ingenierie de qualite production pour les agents de codage IA (Claude, Cursor, etc.).
* [https://github.com/bytedance/deer-flow '''deer-flow''' ] - SuperAgent open-source a horizon long : recherche, codage et creation avec sandboxes, memoires, outils, sous-agents et passerelle de messages.
* [https://github.com/stablyai/orca '''Orca''' ] - ADE pour travailler avec une flotte d'agents paralleles. Lancez n'importe quel agent de codage avec votre propre abonnement, disponible sur desktop et mobile.
* [https://github.com/aws/agent-toolkit-for-aws '''agent-toolkit-for-aws''' ] - Serveurs MCP, competences et plugins officiels supports par AWS pour aider les agents IA a construire sur AWS.
* [https://github.com/topoteretes/cognee '''cognee''' ] - Plateforme de memoire IA open-source pour agents. Offrez a vos agents une memoire a long terme persistante via un moteur de graphe de connaissances auto-hebergt.
* [https://github.com/alibaba/page-agent '''page-agent''' ] - Agent GUI en-page JavaScript. Controlez les interfaces web en langage naturel.
* [https://github.com/BuilderIO/agent-native '''agent-native''' ] - Framework pour construire des applications natives pour agents IA.
* [https://github.com/Nutlope/hallmark '''hallmark''' ] - Competence design anti-AI-slop pour Claude Code, Cursor et Codex.
* [https://github.com/tirth8205/code-review-graph '''code-review-graph''' ] - Graphe d'intelligence locale du code pour MCP et CLI ; construit une carte persistante du codebase pour les outils IA.
* [https://github.com/MoonshotAI/kimi-code '''kimi-code''' ] - Le CLI agent Kimi Code : point de depart pour les agents de nouvelle generation.
* [https://github.com/1jehuang/jcode '''jcode''' ] - Le harnais d'agent le plus intelligent pour le code.
* [https://github.com/Shubhamsaboo/awesome-llm-apps '''awesome-llm-apps''' ] - Plus de 100 applications IA, competences d'agents et apps RAG - libre et open source.
* [https://github.com/earendil-works/pi '''pi''' ] - Boite a outils agent IA : API LLM unifiee, boucle agent, TUI, CLI agent de codage.
* [https://github.com/openinterpreter/openinterpreter '''openinterpreter''' ] - Agent de codage pour les modeles ouverts comme Kimi K3.
* [https://github.com/ayghri/i-have-adhd '''i-have-adhd''' ] - Skill pour agent de codage qui arrete le discour de cacher la reponse. Sortie ADHD-friendly.
* [https://github.com/agegr/pi-web '''pi-web''' ] - Interface web pour agent de codage PI avec commandes et interfaces.
* [https://github.com/mattpocock/skills '''skills''' ] - Skills provenant directement du repertoire .agents d'un ingenieur reelement experimente.
* [https://github.com/earthtojake/text-to-cad '''text-to-cad''' ] - Collection de skills agent pour CAO, robotique et conception hardware.
* [https://github.com/virgiliojr94/book-to-skill '''book-to-skill'''] - Transforme tout PDF technique en competence Claude Code : pret a etudier, referencer et utiliser pendant le travail.. (13726 stars)
* [https://github.com/UditAkhourii/adhd '''adhd'''] - Skill agent de codage : tree-of-thought avec pruning, base sur Claude & Codex Agent SDK. Ideation divergente.. (2879 stars)
* [https://github.com/different-ai/openwork openwork] - Alternative open-source a Claude Cowork (base sur opencode) : harness d agents de codage auto-heberge, multi-agents et multi-modeles.* [https://github.com/citrolabs/ego-lite '''ego-lite'''] - Navigateur optimise pour les agents IA : automation avec etat de session, compatible Codex et Claude Code.. (6536 stars)
=== Audio & TTS ===
* [https://huggingface.co/Supertone/supertonic-3 '''Superto''']
* [https://github.com/microsoft/VibeVoice '''VibeVoice (Microsoft)'''] - Framework vocal open-source (TTS + ASR) de Microsoft : synthese, clonage et reconnaissance vocale de '''pointe.nic-3''' — TTS léger pour inférence locale, ONNX Runtime, zéro cloud
* [https://github.com/SYSTRAN/faster-whisper '''faster-whisper (mutualisé)'''] — Transcription speech-to-text optimisée
* [https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct '''Qwen3-Omni-30B-A3B-Instruct'''] — Modèle multimodal Qwen (audio + texte + image)
* '''nemotron-3.5-asr-streaming-0.6b''' — Modèle ASR streaming NVIDIA, faible latence pour transcription temps réel
=== Génération & Édition d'Images ===
* [https://huggingface.co/HiDream-ai/HiDream-O1-Image '''HiDream-O1-Image'''] — Modèle unifié pixel-level (UiT), sans VAE externe — t2i, édition, personnalisation jusqu'à 2048×2048
=== RAG & Traitement de Documents ===
* '''RAG sur PDF avec images'''
* [https://huggingface.co/ibm-granite/granite-docling-258M '''granite-docling-258M'''] — Parsing structuré de documents IBM Granite
* [https://github.com/deepset-ai/haystack '''Haystack'''] — Framework RAG end-to-end (deepset)
* [https://github.com/mem0ai/mem0 '''Mem0'''] — Mémorie à long terme pour agents IA
* [https://github.com/meilisearch/meilisearch '''meilisearch'''] — Moteur de recherche full-text
* [https://github.com/Stirling-Tools/Stirling-PDF '''Stirling-PDF''' ] - Application PDF #1 sur GitHub : traitement complet des PDF sur tous les appareils.
* [https://github.com/apache/ossie '''Ossie''' ] - Standard open-source Apache pour les metadonnees semantiques entre analytics, IA et BI.
=== APIs à Développer ===
* '''Classificateur IA''' — Classification de contenu
* '''Résumé mutualisé''' — API de résumé de texte partagée
* '''NER''' — Reconnaissance d'entités nommées
* '''Compressor''' — Compression de contenu
=== Infrastructure & Backend ===
* [https://github.com/andrewyng/aisuite '''aisuite'''] - Interface unifiee pour les LLM : un seul appel OpenAI-compatible pour OpenAI, Anthropic, Google, AWS, Cohere, Ollama, OpenRouter...
* [https://github.com/diegosouzapw/OmniRoute '''OmniRoute''' ] — Passerelle IA gratuite : un endpoint, 231+ providers (50+ free), compression 15-95% tokens.
* [https://github.com/temporalio/temporal '''Temporal'''] — Orchestration de workflows critiques
* [https://github.com/vllm-project/semantic-router '''Semantic Router'''] — Routage sémantique de requêtes vLLM
* [https://github.com/supabase/supabase '''Supabase'''] — Alternative open-source Firebase (PostgreSQL, Auth, etc.)
* [https://github.com/metabase/metabase '''Metabase'''] — Analytics et dashboards open-source
* [https://github.com/n8n-io/n8n '''N8N'''] — Workflow automation open-source
* [https://github.com/n0-computer/iroh '''iroh''' ] - Stack reseau modulaire en Rust -- decentralise, base sur des cles plutot que des IP.
* [https://github.com/LMCache/LMCache '''LMCache''' ] - Couche KV cache ultra-rapide pour les L
* [https://github.com/opengeos/GeoLibre GeoLibre] - Plateforme SIG open-source cloud-native pour visualisation et analyse de donnees geospatiales (web, bureau, mobile, Jupyter).
* [https://github.com/CoreBunch/Instatic Instatic] - CMS visuel auto-heberge et agentic alternative a Webflow/Framer : utilisateurs, roles, plugins, base de donnees integree.LM -- reduit drastiquement la latence d'inference.
* [https://github.com/meshery/meshery '''Meshery''' ] - Gestionnaire cloud native open-source -- observabilite et orchestration multi-cluster.
* [https://github.com/koala73/worldmonitor '''worldmonitor''' ] - Tableau de bord de renseignement global en temps reel : aggregation IA de news et suivi d'infrastructure.
* [https://github.com/oblien/openship '''openship''' ] - Plateforme de deploiement auto-hebergeee et auto-deployee avec travaux automatiques.
=== Outils Dev ===
* [https://github.com/Aider-AI/aider '''Aider'''] — Assistant de codage IA en ligne de commande
* [https://github.com/continuedev/continue '''Continue'''] — Extension IDE IA (VS Code, JetBrains)
* [https://github.com/KnockOutEZ/wigolo '''wigolo''' ] - Web local-first pour agent de codage — recherche, fetch, crawl et recherche via MCP, sans clee API.
* [https://modelcontextprotocol.io '''MCP LLM'''] — Modèle de langage via Model Context Protocol
= Assistants IA & outils cloud =
== Assistants IA ==
; '''Assistants IA auto-hébergés'''
* [https://github.com/nesquena/hermes-webui '''Hermes WebUI'''] + [https://ollama.com '''Ollama'''] + GPU 
: Stack typique pour assistant privé, API OpenAI-compatible et expérimentation locale.
== Développement, modèles & veille ==
; '''Découverte de modèles'''
* [https://huggingface.co/models '''Models Trending''']
; '''Évaluation & benchmarks'''
* [https://arena.ai/leaderboard/code '''Agentic Evaluation''']
; '''Outils de développement & fine-tuning'''
* [https://github.com/trending?since=weekly '''Project Trending''']
* [https://grok.com '''News search''']
== Matériel IA & GPU ==
* NVIDIA GH200
* DGX Spark
* [https://www.mouser.fr/ProductDetail/BittWare/RS-GQ-GC1-0109?qs=ST9lo4GX8V2eGrFMeVQmFw%3D%3D GROQ LLM accelerator]
----
= API Realtime AI (DEV) =
'''Statut :''' environnement DEV, remplaçante prévue de l’API OpenAI pour les cas temps réel.
== Configuration ==
{| class="wikitable"
{| class="wikitable"
! Task !! Description !! Duration (days)
! Variable !! Valeur
|-
|-
| Audit infrastructure || 82 services, automated via ServerDiff.sh || 1.5
| OPENAI_API_BASE || <code>wss://api-realtime-ai.ailab.infocepo.com:wait-2026-12/v1</code>
|-
|-
| Diagram cloud architecture || Visual design || 1.5
| OPENAI_API_KEY || <code>sk-XXXXX</code>
|}
 
== Dépôt GitHub ==
* [https://github.com/ynotopec/api-realtime-ai ynotopec/api-realtime-ai]
 
== Page de test ==
* <code>external-test/half-duplex.html</code> — annulation d’écho + mode half-duplex.
 
== Compatibilité ==
Remplacer l’URL OpenAI par <code>$OPENAI_API_BASE</code> pour tester compatibilité et performances.
 
----
 
= API LLM (OpenAI compatible) =
 
* URL de base : <code>https://api-nothink.ailab.infocepo.com/v1</code>
* Création du token : [https://llm-token.ailab.infocepo.com:wait-2026-12 OPENAI_API_KEY]
* Documentation : [https://api-nothink.ailab.infocepo.com/docs Documentation API]
 
== Liste des modèles ==
<pre>
curl -X GET \
  'https://api-nothink.ailab.infocepo.com/v1/models' \
  -H 'Authorization: Bearer sk-XXXXX' \
  -H 'accept: application/json' \
  | jq | sed -rn 's#^.*id.*: "(.*)".*$#* \1#p' | sort -u
</pre>
 
== Modèles ouverts & endpoints internes ==
 
''Dernière mise à jour : 2026-06-30''
 
Les modèles ci-dessous correspondent à des '''endpoints logiques''' exposés derrière une passerelle.
 
{| class="wikitable"
! Endpoint !! Description / usage principal
|-
|-
| Compliance check || 2 clouds, 6 hypervisors, 6TB RAM || 1.5
| '''ai-thinking''' || '''qwen3.6 fp8''' – thinking
|-
|-
| Install cloud platforms || Deploy core cloud environments || 1.0
| '''ai-fast''' || '''qwen3.6 fp8''' en mode '''fast''' – vision/OCR/ai-default
|-
|-
| Stability check || Early operations || 0.5
| '''ai-embedding''' || '''bge-m3''' – recherche sémantique
|-
|-
| Automation study || Automate deployment/tasks || 1.5
| '''ai-stt''' || '''whisper3-turbo''' – transcription vocale multilingual
|-
|-
| Develop templates || 6 templates, 8 envs, 2 clouds/OS || 1.5
| '''ai-tts''' || '''OmniVoice''' – TTS multilingual
|-
|-
| Migration diagram || Process illustration || 1.0
| '''ai-image''' || '''OpenDalle''' – image génération
|}
 
== Exemple bash ==
<pre>
export OPENAI_API_MODEL="ai-default"
export OPENAI_API_BASE="https://api-nothink.ailab.infocepo.com/v1"
export OPENAI_API_KEY="sk-XXXXX"
 
promptValue="Quel est ton nom ?"
jsonValue='{
  "model": "'${OPENAI_API_MODEL}'",
  "messages": [{"role": "user", "content": "'${promptValue}'"}],
  "temperature": 0
}'
 
curl ${OPENAI_API_BASE}/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d "${jsonValue}" 2>/dev/null | jq '.choices[0].message.content'
</pre>
 
== Vue infra LLM ==
[[File:Litellm-proxy-mermaid-diagram-2024-03-24-205202.png|thumb|right]]
 
'''DEV (au choix)'''
* '''A.''' <code>LiteLLM → vLLM/SgLang</code> : tests perf / compatibilité
* '''B.''' <code>LiteLLM → Ollama</code> : simple, rapide à itérer
* '''C.''' <code>Ollama</code> direct : POC ultra-léger
 
'''DEV – modèle FR / résumé'''
* <code>LiteLLM → Ollama /v1</code>
 
'''PROD'''
* '''Standard :''' <code>LiteLLM → vLLM/SgLang</code>
* '''Pont DEV→PROD :''' <code>LiteLLM (DEV) → LiteLLM (PROD) → vLLM/SgLang</code>
 
'''Notes :'''
* '''LiteLLM''' = passerelle unique (clés, quotas, logs)
* '''vLLM/SgLang''' = performance / stabilité en charge
* '''Ollama''' = simplicité de prototypage
 
----
 
= API Image to Text =
 
* Utilise l’API LLM avec un endpoint adapté à l’OCR / VLM.
* Modèle recommandé : <code>ai-vision</code>
 
== Exemple bash ==
<pre>
OPENAI_API_KEY=sk-XXXXX
 
base64 -w0 "/path/to/image.png" > img.b64
 
jq -n --rawfile img img.b64 \
'{
  model: "ai-vision",
  messages: [
    {
      role: "user",
      content: [
        { "type": "text", "text": "Décris cette image." },
        {
          "type": "image_url",
          "image_url": { "url": ("data:image/png;base64," + ($img | rtrimstr("\n"))) }
        }
      ]
    }
  ]
}' > payload.json
 
curl https://api-nothink.ailab.infocepo.com/v1/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  --data-binary @payload.json
</pre>
 
== Exemple Python ==
<pre>
import base64
import json
import requests
import os
 
API_KEY = os.getenv("OPENAI_API_KEY")
MODEL = "ai-vision"
IMG_PATH = "/path/to/image.png"
API_URL = "https://api-nothink.ailab.infocepo.com/v1/chat/completions"
 
with open(IMG_PATH, "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode("utf-8")
 
payload = {
    "model": MODEL,
    "messages": [
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Décris cette image."},
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/png;base64,{img_b64}"}
                }
            ]
        }
    ]
}
 
headers = {
    "Authorization": f"Bearer {API_KEY}",
    "Content-Type": "application/json"
}
 
response = requests.post(API_URL, headers=headers, data=json.dumps(payload))
 
if response.ok:
    print(json.dumps(response.json(), indent=2, ensure_ascii=False))
else:
    print(f"Erreur {response.status_code}: {response.text}")
</pre>
 
----
 
= API STT =
 
* URL : <code>https://api-audio2txt.ailab.infocepo.com/v1</code>
* Clé : <code>OPENAI_API_KEY=sk-XXXXX</code>
* Modèle : <code>whisper-1</code>
* Documentation : [https://api-audio2txt.ailab.infocepo.com/docs API STT docs]
 
== Exemple Python ==
<pre>
import requests
 
OPENAI_API_KEY = 'sk-XXXXX'
 
url = 'https://api-audio2txt.ailab.infocepo.com/v1/audio/transcriptions'
headers = {
    'Authorization': f'Bearer {OPENAI_API_KEY}',
}
files = {
    'file': ('file.opus', open('/path/to/file.opus', 'rb')),
    'model': (None, 'whisper-1')
}
 
response = requests.post(url, headers=headers, files=files)
print(response.json())
</pre>
 
== Exemple curl ==
<pre>
[ ! -f /tmp/test.ogg ] && wget "https://upload.wikimedia.org/wikipedia/commons/1/17/Fables_de_La_Fontaine_Livre_1_01.ogg" -O /tmp/test.ogg
 
export OPENAI_API_KEY=sk-XXXXX
 
curl https://api-audio2txt.ailab.infocepo.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -F model="whisper-1" \
  -F file="@/tmp/test.ogg"
</pre>
 
== Notes ==
* Plusieurs formats audio sont acceptés.
* Le flux final est normalisé en '''16 kHz mono'''.
* Pour une qualité optimale : privilégier '''OPUS 16 kHz mono'''.
 
== UI ==
* [https://translate-rt.ailab.infocepo.com translate-rt]
 
----
 
= API TTS =
 
* URL : <code>https://api-tts-omnivoice.ailab.infocepo.com/v1</code>
* Clé : <code>OPENAI_API_KEY=sk-XXXXX</code>
* Documentation : [https://api-tts-omnivoice.ailab.infocepo.com/docs API TTS docs]
 
== Exemple ==
<pre>
export OPENAI_API_KEY=sk-XXXXX
 
curl https://api-tts-omnivoice.ailab.infocepo.com/v1/audio/speech \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-4o-mini-tts",
    "input": "Bonjour, ceci est un test de synthèse vocale.",
    "voice": "coral",
    "instructions": "Speak in a cheerful and positive tone.",
    "response_format": "opus"
  }' | ffplay -i -
</pre>
 
----
 
= API Text to Image =
 
* URL : <code>https://api-txt2image.ailab.infocepo.com/v1</code>
* Clé API : <code>OPENAI_API_KEY=sk-...</code>
* Documentation : [https://api-txt2image.ailab.infocepo.com/docs API TXT2IMAGE docs]
 
== Exemple ==
<pre>
export OPENAI_API_KEY=EMPTY
 
curl https://api-txt2image.ailab.infocepo.com/v1/images/generations \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "prompt": "a photo of a happy corgi puppy sitting and facing forward, studio light, longshot",
    "n": 1,
    "size": "1024x1024"
  }'
</pre>
 
----
 
= API Diarization =
 
* Documentation : [https://api-diarization.ailab.infocepo.com/docs API Diarization docs]
 
== Exemple ==
<pre>
wget "https://upload.wikimedia.org/wikipedia/commons/6/60/Mike_Peters_on_Politics_and_Emotion_%28Interview_1984%29.mp3" -O /tmp/test.mp3
 
curl -X POST "https://api-diarization.ailab.infocepo.com/upload-audio/" \
  -H "Authorization: Bearer token1" \
  -F "file=@/tmp/test.mp3"
</pre>
 
----
 
= API Summary =
 
* Documentation : [https://api-summary.ailab.infocepo.com:wait-2026-12/docs API Summary docs]
 
== Exemple ==
<pre>
text="The tower is 324 metres tall and is one of the most recognizable monuments in the world."
 
json_payload=$(jq -nc --arg text "$text" '{"text": $text}')
 
curl -X POST https://api-summary.ailab.infocepo.com:wait-2026-12/summary/ \
  -H "Content-Type: application/json" \
  -d "$json_payload"
</pre>
 
----
 
= API Text Embeddings =
 
* URL : <code>https://api-embedding.ailab.infocepo.com/v1</code>
* Documentation : [https://api-embedding.ailab.infocepo.com/docs Documentation]
 
== Exemple ==
<pre>
curl https://api-embedding.ailab.infocepo.com/v1/embeddings \
  -X POST \
  -d '{"model":"bge-m3","input":"What is Deep Learning?"}' \
  -H 'Content-Type: application/json'
</pre>
 
----
 
= API DB Vectors (ChromaDB) =
 
== Production ==
* URL : <code>https://chromadb.ailab.infocepo.com:wait-2026-12</code>
* Token : <code>XXXXX</code>
 
== Lab ==
<pre>
export CHROMA_HOST=https://chromadb.c1.ailab.infocepo.com:wait-2026-12
export CHROMA_PORT=443
export CHROMA_TOKEN=XXXX
</pre>
 
== Exemple curl ==
<pre>
curl -v "${CHROMA_HOST}"/api/v1/collections \
  -H "Authorization: Bearer ${CHROMA_TOKEN}"
</pre>
 
== Exemple Python ==
<pre>
import chromadb
from chromadb.config import Settings
 
def chroma_http(host, port=80, token=None):
    return chromadb.HttpClient(
        host=host,
        port=port,
        ssl=host.startswith('https') or port == 443,
        settings=(
            Settings(
                chroma_client_auth_provider='chromadb.auth.token.TokenAuthClientProvider',
                chroma_client_auth_credentials=token,
            ) if token else Settings()
        )
    )
 
client = chroma_http(CHROMA_HOST, CHROMA_PORT, CHROMA_TOKEN)
collections = client.list_collections()
print(collections)
</pre>
 
== Déployer sa propre instance ==
<pre>
export nameSpace=your_namespace
domainRoot=ailab.infocepo.com
 
helm repo add chroma https://amikos-tech.github.io/chromadb-chart/
helm repo update
 
helm upgrade --install chromadb chroma/chromadb -n ${nameSpace} \
  --set chromadb.apiVersion="0.4.24" \
  --set ingress.enabled=true \
  --set ingress.hosts[0].host="${nameSpace}-chromadb.${domainRoot}" \
  --set ingress.hosts[0].paths[0].path=/ \
  --set ingress.hosts[0].paths[0].pathType=ImplementationSpecific \
  --set ingress.annotations."cert-manager\.io/cluster-issuer"=letsencrypt-prod \
  --set ingress.tls[0].secretName=${nameSpace}-chromadb.${domainRoot}-tls \
  --set ingress.tls[0].hosts[0]="${nameSpace}-chromadb.${domainRoot}"
 
kubectl -n ${nameSpace} patch ingress/chromadb --type=json \
  -p '[{"op":"add","path":"/metadata/annotations/nginx.ingress.kubernetes.io~1proxy-body-size","value":"0"}]'
</pre>
 
== Récupérer le token ==
<pre>
kubectl --namespace ${nameSpace} get secret chromadb-auth \
  -o jsonpath="{.data.token}" | base64 --decode && echo
</pre>
 
----
 
= Registry =
 
* URL : [https://registry.ailab.infocepo.com:wait-2026-09 registry.ailab.infocepo.com:wait-2026-09]
* Login : <code>user</code>
* Password : <code>XXXXX</code>
 
== Exemple ==
<pre>
curl -u "user:XXXXX" https://registry.ailab.infocepo.com:wait-2026-09/v2/_catalog
</pre>
 
== Exemple K8S ==
<pre>
deploymentName=
nameSpace=
 
kubectl -n ${nameSpace} create secret docker-registry pull-secret \
  --docker-server=registry.ailab.infocepo.com:wait-2026-09 \
  --docker-username=user \
  --docker-password=XXXXX \
  --docker-email=contact@example.com
 
kubectl -n ${nameSpace} patch deployment ${deploymentName} \
  -p '{"spec":{"template":{"spec":{"imagePullSecrets":[{"name":"pull-secret"}]}}}}'
</pre>
 
----
 
= Stockage objet externe (S3) =
 
* Endpoint : <code>https://s3.ailab.infocepo.com:wait-2026-09</code>
* Access key : <code>XXXX</code>
* Secret key : <code>XXXX</code>
 
Un bucket nommé <code>ORG</code> a été créé pour stocker des documents de démonstration.
 
----
 
= RAG optimisation =
 
* Embeddings : <code>BAAI/bge-m3</code>
* <code>chunk_size=1000</code>
* <code>chunk_overlap=100</code>
* LLM : <code>qwen3.6</code>
* Pour les PDF mixtes : '''PDF → image → OCR / VLM''' peut améliorer les résultats.
 
----
 
= Workflow =
 
Autoroute directe : code → CI/CD → deploy → monitoring. Pas de comité, pas de responsable désigné — chaque étape se déclenche automatiquement si la précédente passe. Si ça rate, alerte directe sans passer par un humain sauf décision explicite de fallback.
 
----
 
= Environnements =
 
== Hors production ==
* Utiliser [https://datalab.ailab.infocepo.com:wait-2026-12 datalab]
* Support : canal Mattermost Offre IA
* Le pseudo utilisateur doit respecter la convention interne
* Demander si besoin un accès Linux + Kubernetes
 
== Production (best-effort) ==
* Publier le code applicatif, les secrets (format SOPS), le Dockerfile et le code infra (Helm ou manifests K8S) sur Git
* Demander un namespace
* Lire la documentation de surveillance associée
 
== Limites de l’infrastructure ==
* Les charges GPU sont intentionnellement limitées en journée.
* Coût unitaire mesuré automatiquement (dashboards temps réel, pas Excel).
----
 
= Cloud Lab & projets d’audit =
 
[[File:Infocepo.drawio.png|400px|Cloud Lab reference diagram]]
 
Le '''Cloud Lab''' fournit des scénarios reproductibles : audit d’infrastructure, migration cloud, automatisation, haute disponibilité.
 
== Projet d’audit ==
; '''[[ServerDiff.sh]]'''
Script Bash d’audit permettant de :
* détecter les dérives de configuration,
* comparer plusieurs environnements,
* préparer un plan de migration ou de remédiation.
* [https://github.com/alibaba/open-code-review '''open-code-review'''] - Outil de review de code open-source teste a l echelle Alibaba : pipeline deterministe + agent LLM, precise par ligne.. (16590 stars)
 
== Exemple de migration cloud ==
[[File:Diagram-migration-ORACLE-KVM-v2.drawio.png|400px|Cloud migration diagram]]
 
{| class="wikitable"
! Tâche !! Description !! Durée (jours)
|-
| Audit infrastructure || 82 services, audit automatisé via '''ServerDiff.sh''' || 1.5
|-
| Diagramme d’architecture || Conception visuelle et documentation || 1.5
|-
| Contrôles de conformité || 2 clouds, 6 hyperviseurs, 6 To RAM || 1.5
|-
| Installation plateforme cloud || Déploiement des environnements cibles || 1.0
|-
| Vérification de stabilité || Premiers tests fonctionnels || 0.5
|-
| Étude d’automatisation || Identification des tâches répétitives || 1.5
|-
|-
| Write migration code || 138 lines (see MigrationApp.sh) || 1.5
| Développement des templates || 6 templates, 8 environnements, 2 clouds / OS || 1.5
|-
|-
| Process stabilization || Ensure repeatable migration || 1.5
| Diagramme de migration || Illustration du processus || 1.0
|-
|-
| Cloud benchmarking || Performance test vs legacy || 1.5
| Écriture du code de migration || 138 lignes (voir '''MigrationApp.sh''') || 1.5
|-
|-
| Downtime calibration || Per-migration time calculation || 0.5
| Stabilisation || Validation de la reproductibilité || 1.5
|-
|-
| VM loading || 82 VMs: OS, code, 2 IPs each || 0.1
| Benchmark cloud || Comparaison vs legacy || 1.5
|-
|-
! colspan=2 align="right"| '''Total''' !! 15 man-days
| Réglage des temps d’arrêt || Calcul du downtime || 0.5
|-
| Chargement VM || 82 VMs : OS, code, 2 IP par VM || 0.1
|-
! colspan=2 align="right"| '''Total''' !! 15 jours.homme
|}
|}


==== Stability check ====
=== Vérifications de stabilité (HA minimale) ===
 
{| class="wikitable"
{| class="wikitable"
! Action !! Expected Result
! Action !! Résultat attendu
|-
|-
| Power off one node || All resources started
| Extinction d’un nœud || Tous les services redémarrent automatiquement sur les autres nœuds
|-
|-
| Power off/on all nodes simultaneously || All resources started
| Extinction / redémarrage simultané de tous les nœuds || Les services repartent correctement après reboot
|}
|}
'''Autonomie testée''' : vérifier que la migration fonctionne seule en tirant le repo et lançant le script, sans personne qui connaît le système de tête.


----
----


= Web Infrastructure & Best Practices =
= Architecture web & bonnes pratiques =
 
[[File:WebModelDiagram.drawio.png|400px|Reference web architecture]]
 
Principes de conception :


[[File:WebModelDiagram.drawio.png|400px|Web Architecture Reference]]
* privilégier une infrastructure '''simple, modulaire et flexible''',
* rapprocher le contenu du client (GDNS ou équivalent),
* utiliser des load balancers réseau (LVS, IPVS),
* comparer les coûts et éviter le '''vendor lock-in''',
* pour TLS :
** '''HAProxy''' pour les frontends rapides,
** '''Envoy''' pour les cas avancés (mTLS, HTTP/2/3),
* pour le cache :
** '''Varnish''', '''Apache Traffic Server''',
* favoriser les stacks open-source,
* utiliser files, buffers, queues et quotas pour lisser les pics.


* Favor minimal, flexible infrastructure
== Références ==
* Track customer location via GDNS or similar
* [https://wikitech.wikimedia.org/wiki/Wikimedia_infrastructure Wikimedia infrastructure]
* Use network load balancers (LVS, IPVS) for scaling
* [https://github.com/systemdesign42/system-design System Design GitHub]
* Compare prices and beware of vendor lock-in
* For TLS: use HAProxy for fast frontend, Envoy for compatibility
* Caching: Varnish, Apache Traffic Server for large content
* Prefer open-source stacks and database caches (e.g. Memcached)
* Use message queues and buffers for workload smoothing
* For more examples: [https://wikitech.wikimedia.org/wiki/Wikimedia_infrastructure Wikimedia Cloud Architecture], [https://github.com/systemdesign42/system-design System Design GitHub]


----
----


= Major Cloud Platforms: Feature Comparison =
= Comparatif des grandes plateformes cloud =


{| class="wikitable"
{| class="wikitable"
! Function !! Kubernetes !! OpenStack !! AWS !! Bare-metal !! HPC !! CRM !! oVirt
! Fonctionnalité !! Kubernetes !! OpenStack !! AWS !! Bare-metal !! HPC !! CRM !! oVirt
|-
|-
| '''Deployment Tools''' || Helm, YAML, ArgoCD, Juju || Ansible, Terraform, Juju || CloudFormation, Terraform, Juju || Ansible, Shell || xCAT, Clush || Ansible, Shell || Ansible, Python
| '''Outils de déploiement''' || Helm, YAML, ArgoCD, Juju || Ansible, Terraform, Juju || CloudFormation, Terraform, Juju || Ansible, Shell || xCAT, Clush || Ansible, Shell || Ansible, Python
|-
|-
| '''Bootstrap Method''' || API || API, PXE || API || PXE, IPMI || PXE, IPMI || PXE, IPMI || PXE, API
| '''Méthode de bootstrap''' || API || API, PXE || API || PXE, IPMI || PXE, IPMI || PXE, IPMI || PXE, API
|-
|-
| '''Router Control''' || Kube-router || Router/Subnet API || Route Table/Subnet API || Linux, OVS || xCAT || Linux || API
| '''Contrôle routeur''' || Kube-router || Router/Subnet API || Route Table / Subnet API || Linux, OVS || xCAT || Linux || API
|-
|-
| '''Firewall Control''' || Istio, NetworkPolicy || Security Groups API || Security Group API || Linux Firewall || Linux Firewall || Linux Firewall || API
| '''Contrôle firewall''' || Istio, NetworkPolicy || Security Groups API || Security Group API || Linux firewall || Linux firewall || Linux firewall || API
|-
|-
| '''Network Virtualization''' || VLAN, VxLAN, others || VPC || VPC || OVS, Linux || xCAT || Linux || API
| '''Virtualisation réseau''' || VLAN, VxLAN || VPC || VPC || OVS, Linux || xCAT || Linux || API
|-
|-
| '''DNS''' || CoreDNS || DNS-Nameserver || Route 53 || GDNS || xCAT || Linux || API
| '''DNS''' || CoreDNS || DNS-Nameserver || Route 53 || GDNS || xCAT || Linux || API
|-
|-
| '''Load Balancer''' || Kube-proxy, LVS || LVS || Network Load Balancer || LVS || SLURM || Ldirectord || N/A
| '''Load balancer''' || Kube-proxy, LVS || LVS || Network Load Balancer || LVS || SLURM || Ldirectord || N/A
|-
|-
| '''Storage Options''' || Local, Cloud, PVC || Swift, Cinder, Nova || S3, EFS, EBS, FSx || Swift, XFS, EXT4, RAID10 || GPFS || SAN || NFS, SAN
| '''Stockage''' || Local, cloud, PVC || Swift, Cinder, Nova || S3, EFS, EBS, FSx || Swift, XFS, EXT4, RAID10 || GPFS || SAN || NFS, SAN
|}
|}
Cette table sert de point de départ pour choisir la bonne stack selon :
* le niveau de contrôle souhaité,
* le contexte (on-prem, cloud public, HPC…),
* les outils d’automatisation existants.
----
= Haute disponibilité, HPC & DevSecOps =
== Haute disponibilité avec Corosync & Pacemaker ==
[[File:HA-REF.drawio.png|400px|HA cluster architecture]]
Principes :
* clusters multi-nœuds ou multi-sites,
* fencing via IPMI,
* provisioning PXE / NTP / DNS / TFTP,
* pour 2 nœuds : attention au split-brain,
* 3 nœuds ou plus recommandés en production.
=== Ressources fréquentes ===
* multipath, LUNs, LVM, NFS,
* processus applicatifs,
* IP virtuelles, DNS, listeners réseau.
== HPC ==
[[File:HPC.drawio.png|400px|Overview of an HPC cluster]]
* orchestration de jobs (SLURM ou équivalent),
* stockage partagé haute performance,
* intégration possible avec des workloads IA.
== DevSecOps ==
[[File:DSO-POC-V3.drawio.png|400px|DevSecOps reference design]]
* CI/CD avec contrôles de sécurité intégrés,
* observabilité dès la conception,
* scans de vulnérabilité,
* gestion des secrets,
* policy-as-code.
----
= News & trends =
* [https://www.youtube.com/@lev-selector/videos Top AI News]
* [https://betterprogramming.pub/color-your-captions-streamlining-live-transcriptions-with-diart-and-openais-whisper-6203350234ef Real-time transcription with Diart + Whisper]
* [https://github.com/openai-translator/openai-translator OpenAI Translator]
* [https://opensearch.org/docs/latest/search-plugins/conversational-search Opensearch with LLM]
----
= Formation & apprentissage =
* [https://www.youtube.com/watch?v=4Bdc55j80l8 Transformers Explained]
* Labs, scripts et retours d’expérience concrets dans le projet Cloud Lab


----
----


= Useful Cloud & IT Links =
= Liens cloud & IT utiles =


* [https://cloud.google.com/free/docs/aws-azure-gcp-service-comparison Cloud Providers Compared]
* [https://cloud.google.com/free/docs/aws-azure-gcp-service-comparison Cloud Providers Compared]
Line 186: Line 953:
* [https://landscape.cncf.io/?fullscreen=yes CNCF Official Landscape]
* [https://landscape.cncf.io/?fullscreen=yes CNCF Official Landscape]
* [https://wikitech.wikimedia.org/wiki/Wikimedia_infrastructure Wikimedia Cloud Wiki]
* [https://wikitech.wikimedia.org/wiki/Wikimedia_infrastructure Wikimedia Cloud Wiki]
* [https://openapm.io OpenAPM – SRE Tools]
* [https://openapm.io OpenAPM]
* [https://access.redhat.com/downloads/content/package-browser RedHat Package Browser]
* [https://access.redhat.com/downloads/content/package-browser Red Hat Package Browser]
* [https://www.silkhom.com/barometre-2021-des-tjm-dans-informatique-digital Freelance IT Rates]
* [https://www.silkhom.com/barometre-2021-des-tjm-dans-informatique-digital Baromètre TJM IT]
* [https://www.glassdoor.fr/salaire/Hays-Salaires-E10166.htm IT Salaries (Glassdoor)]
* [https://www.glassdoor.fr/salaire/Hays-Salaires-E10166.htm Indicateurs salariaux IT]


----
----


= Advanced: High-Availability, HPC & DevSecOps =
= Outils collaboratifs =


== High Availability with Corosync & Pacemaker ==
== Dépôts de code ==
[[File:HA-REF.drawio.png|400px|HA Cluster Architecture]]
* [https://github.com/ynotopec GitHub ynotopec]


* Multi-node or dual-room clusters for redundancy
== Base de connaissance ==
* Use IPMI for fencing, provision via PXE/NTP/DNS/TFTP
* ce wiki
* For 2-node clusters: stagger fencing for stability; 3+ nodes recommended


=== Common Resources Pattern ===
== Messagerie ==
* Multipath storage, LUN, LVM, NFS
* contact interne / support selon les projets
* User and process resources
* IP, DNS, Listener management


== HPC ==
== SSO ==
[[File:HPC.drawio.png|400px|HPC Cluster Overview]]
* [https://auth-lab.ailab.infocepo.com:wait-2026-12/auth Keycloak]


== DevSecOps ==
== MLflow ==
[[File:DSO-POC-V3.drawio.png|400px|DevSecOps Reference Design]]
* [[MLFlow|MLFlow]]


----
----


'''For more examples, guides, and scripts, visit [https://infocepo.com infocepo.com]. Contributions and suggestions welcome!'''
= À propos & contributions =
 
Suggestions de corrections, améliorations de schémas, retours d’expérience ou nouveaux labs bienvenus.
 
Ce wiki a vocation à rester un '''laboratoire vivant''' pour l’IA, le cloud et l’automatisation.

Revision as of 14:18, 3 August 2026

Discover cloud and AI on infocepo.com

infocepo.com – Cloud, AI & Labs

Bienvenue sur le portail infocepo.com.

Ce wiki documente l’écosystème Cloud, IA, automatisation et lab d’Infocepo. Il s’adresse aux :

  • administrateurs systèmes,
  • ingénieurs cloud,
  • développeurs,
  • étudiants,
  • curieux qui veulent apprendre en pratiquant.

L’objectif est simple : transformer la théorie en scripts réutilisables, schémas, architectures, APIs et laboratoires concrets.


Accès rapide

Portail principal

Assistant IA

Liste des pages du wiki

Vue d’ensemble

Infra architecture overview

Démarrer rapidement

Parcours recommandés

1. Construire un assistant IA privé
  • Déployer une stack type Hermes WebUI + Ollama + GPU
  • Ajouter un modèle de chat et un modèle de résumé
  • Brancher des données internes via RAG + embeddings
2. Lancer un lab cloud
  • Créer un petit cluster Kubernetes, OpenStack ou bare-metal
  • Mettre en place un pipeline de déploiement (Helm, Ansible, Terraform…)
  • Ajouter un service IA : transcription, résumé, chatbot, OCR…
3. Préparer un audit ou une migration
  • Inventorier les serveurs avec ServerDiff.sh
  • Concevoir l’architecture cible
  • Automatiser la migration avec des scripts reproductibles

Vue d’ensemble du contenu

  • Guides IA & outils : assistants, modèles, évaluation, GPU, RAG
  • Cloud & infrastructure : Kubernetes, OpenStack, HA, HPC, DevSecOps
  • Labs & scripts : audit, migration, automatisation
  • Comparatifs : Kubernetes vs OpenStack vs AWS vs bare-metal, etc.

Vision

The world after automation

Le but à long terme est de construire un environnement où :

  • les assistants IA privés accélèrent la production,
  • les tâches répétitives sont automatisées,
  • les déploiements sont industrialisés,
  • l’infrastructure reste compréhensible, portable et réutilisable.

Chaque sortie IA est mesurée en temps réel, les modèles faibles sont remplacés automatiquement, et les tâches sans valeur sont coupées. L'autonomie vient de mécanismes techniques qui fonctionnent quand personne ne regarde — pas de règles écrites dans un doc.

Main page summary

Catalogue rapide des services

Services principaux
Catégorie Service Rôle
API LLM Modèles de chat, code, RAG, OCR
API STT Transcription audio
API TTS Synthèse vocale
API realtime-ai Temps réel WebSocket / WebRTC
API IMAGE2TXT OCR / VLM via endpoint dédié
API summary Résumé de textes longs
API EMBEDDINGS Embeddings pour RAG
API ChromaDB Base vecteur
API TXT2IMAGE Génération d’images
API diarization Segmentation locuteurs
Observabilité monitoring Dashboards techniques
Observabilité status Disponibilité des services
Observabilité web-stat Statistiques web
Observabilité LLM-stat Vue API / usage
Outils dataLab Environnement de travail hors-production
Outils realtime translation Traduction
Outils Demos Démonstrateurs

Nouveautés

Nouveautés 01/08/2026

  • Traduction temps réel : réduction significative des hallucinations lors des silences, diminution de la latence et ajout de la plupart des langues en TTS.
  • TTS Omnivoice : Qualité TTS augmenté et ajout plus global des langues (600).
  • LightRAG : LightRAG est un framework RAG avancé et léger qui combine graphes de connaissances et recherche vectorielle pour une analyse contextuelle profonde et efficace.
  • API reranker : git.
  • API embedding : Mise à jour des paramètres RAG optimisation : bge-m3 (chunk 1000, 100 overlap). git
  • privacy-filter : filtrage données personnelles.
  • Un seul fichier CLAUDE.md inspiré d'Andrej Karpathy pour transformer Claude en un vrai ingénieur logiciel.
  • Qwen3.6 : Qwen3.6 delivers substantial upgrades in agentic coding and thinking preservation than previous Qwen models. Déployé avec NVIDIA/Qwen3.6-35B-A3B-NVFP4 — quantisation NVFP4 optimisée pour l'inférence GPU NVIDIA.
  • Hermes Agent : l'agent qui s'améliore et grandit avec toi.
  • opencode : CLI coder à comparer avec Aider / OpenHands. (⚠️ migration : ancienne URL `github.com/sst/opencode` → redirige vers `anomalyco/opencode`)
  • api-convert2md : extraction de tableaux pour RAG compatible Open WebUI.
  • Ajout de brains expérimentaux.
  • Ajout de legal-agent.
  • Ajout de ai-security.
  • sam-audio : séparation audio sémantique.
  • Ajout de l'API Realtime : WebRTC / WebSocket bidirectionnel basse latence.

Nouveautés 02/06 - 03/08/2026

  • translate-rt : API de traduction multilingue temps réel — PR #3 fix timeout (gestion réponses lentes), PR #2 URLs configurables via .env.
  • GLM-4.7-Flash-vLLM : Déploiement vLLM GLM-4.7 Flash.
  • qwen3.5-fp8-vllm : Déploiement Qwen 3.5 FP8 via vLLM.
  • api-rag : API RAG (recherche sémantique) — fix support FAISS SVE, suppression logs verbeux, wait-for-APIS avant build index vectoriel.
  • api-diarization : API diarisation audio — install améliorée, ergonomics auth, documentation setup projet.
  • api-audio2txt : API FastAPI ASR ( Whisper ) — refonte complète, installer uv, docs runtime.
  • privacy-proxy-openmed : Privacy proxy OpenMed-based — LLM upstream optionnel (mode privacy-only).
  • privacy-proxy-gliner2 : Privacy proxy GLiNER2-based — détection entités nommées, upstream LLM optionnel, PR #1 en cours.
  • api-llm-custom : Proxy LLM custom — paramètres modèle configurables, alias ai-default, gestion erreurs upstream.


Nouveautés 03/08/2026

  • infocepo-infra-mcp : MCP server universel — zéro clé en dur, lecture API key depuis ~/.infocepo-credentials, déploiement K8s, refacto stdio (plus de shell wrapper).
  • nemotron-embed : Service Nemotron-3 Embedding vLLM — systemd service, script de lancement, documentation d'installation.
  • agent-saas : Plateforme SaaS d'agents IA autonomes — manifests K8s complets, dashboard FastAPI, hardening déploiement.

Priorités

Top tasks

  • Ajouter Presidio : anonymisation / masquage PII, socle RGPD.
  • Ajouter llm-d : blueprints + charts Kubernetes pour industrialiser les déploiements.
  • Ajouter Dynamo : orchestration inférence multi-nœuds.
  • Ajouter GuideLLM : capacity planning / benchmark réaliste.
  • Ajouter NeMo Guardrails : garde-fous et politiques.
  • Coût unitaire par tâche : chaque API doit exposer son prix/ml/token en temps réel — pas une facture mensuelle.
  • Qualité auto : précision/hallucination rate branchés sur les sorties IA, avec rollback automatique si qualité < seuil.

Backlog / Veille Technologique

Agents IA & Orchestration

  • buzz (Block) - Plateforme de communication "hive mind" : humains et agents IA cohabitent dans les memes canaux, auto-hebergeable.
  • t3code - Interface web GUI pour orchestrer les agents de codage (Codex, Claude Code, Cursor...) depuis un navigateur.
  • airi (Moeru AI) - Companion IA auto-heberge : voice chat temps reel, controle de jeux (Minecraft, Factorio), compatible Grok.
  • ai-agent-book - Livre open-source (10 chapitres, 94 experiences) couvrant les AI Agents : LLM + contexte + outils, de la theorie a la production.
  • meetily — Assistant IA de reunion local avec transcription Parakeet/Whisper en direct, diarisation et resume Ollama. 100% local, aucun cloud.
  • DesktopCommanderMCP — Serveur MCP pour Claude : controle terminal, recherche fichiers et edition de diffs.
  • codex-plugin-cc — Utiliser Codex depuis Claude Code pour reviewer du code ou deleguer des taches.
  • CubeSandbox — Sandbox instantanee, concurrente, securisee et leger pour agents IA.
  • herdr — Multiplexeur d'agents qui vit dans votre terminal.
  • claude-video — Donner a Claude la capacite de regarder des vidéos : download, extraction frames, transcription.
  • OfficeCLI — Suite Office construite pour agents IA : lire, modifier, automatiser Word, Excel, PowerPoint en binaire unique.
  • archify — Skill agent : generer de beaux diagrammes d'architecture avec export PNG/JPEG/WebP/SVG.
  • claude-skills — 345 skills et plugins pour agents de codage (30+ agents, 70+ commandes, 330+ skills) pour Claude Code, Codex, Gemini CLI, Cursor, et 8+.
  • chrome-devtools-mcp — Chrome DevTools pour agents de codage via MCP.
  • Paperclip — Orchestrateur open-source pour coordonner et superviser une équipe d'agents IA autonomes
  • OpenClaw
  • codegraph — Indexation locale des graphes de code pour agents (Hermes, Claude, Codex sync auto).
  • Understand-Anything — Transforme tout code en graphe de connaissances interactif explorable et questionnable.
  • OpenHands — Agent IA autonome pour le développement logiciel
  • Dify — Plateforme de développement d'applications IA (LLM Ops)
  • browser-use — Framework pour contrôler les navigateurs via des agents IA
  • LangChain — Framework pour applications basées sur les LLM
  • FlowiseAI — Build LLM apps visually
  • Rasa — Framework open-source pour chatbots et assistants vocaux
  • codebase-memory-mcp - Serveur MCP haute performance pour l'indexation de codebases en graphe de connaissances persistant.
  • Agent-Reach - Donnez des yeux a vos agents IA pour naviguer le web entier (Twitter, Reddit, YouTube, GitHub) en CLI, sans frais API.
  • SkillSpector - Scanner de securite pour les competences d'agents IA : detecte vulnerabilites, patterns malveillants et risques.
  • flue - Framework sandbox pour agents IA -- isolation et execution securisee de plugins/agents.
  • agent-skills - Skills d'ingenierie de qualite production pour les agents de codage IA (Claude, Cursor, etc.).


  • deer-flow - SuperAgent open-source a horizon long : recherche, codage et creation avec sandboxes, memoires, outils, sous-agents et passerelle de messages.
  • Orca - ADE pour travailler avec une flotte d'agents paralleles. Lancez n'importe quel agent de codage avec votre propre abonnement, disponible sur desktop et mobile.
  • agent-toolkit-for-aws - Serveurs MCP, competences et plugins officiels supports par AWS pour aider les agents IA a construire sur AWS.
  • cognee - Plateforme de memoire IA open-source pour agents. Offrez a vos agents une memoire a long terme persistante via un moteur de graphe de connaissances auto-hebergt.
  • page-agent - Agent GUI en-page JavaScript. Controlez les interfaces web en langage naturel.
  • agent-native - Framework pour construire des applications natives pour agents IA.
  • hallmark - Competence design anti-AI-slop pour Claude Code, Cursor et Codex.
  • code-review-graph - Graphe d'intelligence locale du code pour MCP et CLI ; construit une carte persistante du codebase pour les outils IA.
  • kimi-code - Le CLI agent Kimi Code : point de depart pour les agents de nouvelle generation.
  • jcode - Le harnais d'agent le plus intelligent pour le code.
  • awesome-llm-apps - Plus de 100 applications IA, competences d'agents et apps RAG - libre et open source.
  • pi - Boite a outils agent IA : API LLM unifiee, boucle agent, TUI, CLI agent de codage.
  • openinterpreter - Agent de codage pour les modeles ouverts comme Kimi K3.
  • i-have-adhd - Skill pour agent de codage qui arrete le discour de cacher la reponse. Sortie ADHD-friendly.
  • pi-web - Interface web pour agent de codage PI avec commandes et interfaces.
  • skills - Skills provenant directement du repertoire .agents d'un ingenieur reelement experimente.
  • text-to-cad - Collection de skills agent pour CAO, robotique et conception hardware.
  • book-to-skill - Transforme tout PDF technique en competence Claude Code : pret a etudier, referencer et utiliser pendant le travail.. (13726 stars)
  • adhd - Skill agent de codage : tree-of-thought avec pruning, base sur Claude & Codex Agent SDK. Ideation divergente.. (2879 stars)
  • openwork - Alternative open-source a Claude Cowork (base sur opencode) : harness d agents de codage auto-heberge, multi-agents et multi-modeles.* ego-lite - Navigateur optimise pour les agents IA : automation avec etat de session, compatible Codex et Claude Code.. (6536 stars)

Audio & TTS

  • Superto
  • VibeVoice (Microsoft) - Framework vocal open-source (TTS + ASR) de Microsoft : synthese, clonage et reconnaissance vocale de pointe.nic-3 — TTS léger pour inférence locale, ONNX Runtime, zéro cloud
  • faster-whisper (mutualisé) — Transcription speech-to-text optimisée
  • Qwen3-Omni-30B-A3B-Instruct — Modèle multimodal Qwen (audio + texte + image)
  • nemotron-3.5-asr-streaming-0.6b — Modèle ASR streaming NVIDIA, faible latence pour transcription temps réel

Génération & Édition d'Images

  • HiDream-O1-Image — Modèle unifié pixel-level (UiT), sans VAE externe — t2i, édition, personnalisation jusqu'à 2048×2048

RAG & Traitement de Documents

  • RAG sur PDF avec images
  • granite-docling-258M — Parsing structuré de documents IBM Granite
  • Haystack — Framework RAG end-to-end (deepset)
  • Mem0 — Mémorie à long terme pour agents IA
  • meilisearch — Moteur de recherche full-text


  • Stirling-PDF - Application PDF #1 sur GitHub : traitement complet des PDF sur tous les appareils.
  • Ossie - Standard open-source Apache pour les metadonnees semantiques entre analytics, IA et BI.

APIs à Développer

  • Classificateur IA — Classification de contenu
  • Résumé mutualisé — API de résumé de texte partagée
  • NER — Reconnaissance d'entités nommées
  • Compressor — Compression de contenu

Infrastructure & Backend

  • aisuite - Interface unifiee pour les LLM : un seul appel OpenAI-compatible pour OpenAI, Anthropic, Google, AWS, Cohere, Ollama, OpenRouter...
  • OmniRoute — Passerelle IA gratuite : un endpoint, 231+ providers (50+ free), compression 15-95% tokens.
  • Temporal — Orchestration de workflows critiques
  • Semantic Router — Routage sémantique de requêtes vLLM
  • Supabase — Alternative open-source Firebase (PostgreSQL, Auth, etc.)
  • Metabase — Analytics et dashboards open-source
  • N8N — Workflow automation open-source
  • iroh - Stack reseau modulaire en Rust -- decentralise, base sur des cles plutot que des IP.
  • LMCache - Couche KV cache ultra-rapide pour les L
  • GeoLibre - Plateforme SIG open-source cloud-native pour visualisation et analyse de donnees geospatiales (web, bureau, mobile, Jupyter).
  • Instatic - CMS visuel auto-heberge et agentic alternative a Webflow/Framer : utilisateurs, roles, plugins, base de donnees integree.LM -- reduit drastiquement la latence d'inference.
  • Meshery - Gestionnaire cloud native open-source -- observabilite et orchestration multi-cluster.
  • worldmonitor - Tableau de bord de renseignement global en temps reel : aggregation IA de news et suivi d'infrastructure.
  • openship - Plateforme de deploiement auto-hebergeee et auto-deployee avec travaux automatiques.

Outils Dev

  • Aider — Assistant de codage IA en ligne de commande
  • Continue — Extension IDE IA (VS Code, JetBrains)
  • wigolo - Web local-first pour agent de codage — recherche, fetch, crawl et recherche via MCP, sans clee API.
  • MCP LLM — Modèle de langage via Model Context Protocol

Assistants IA & outils cloud

Assistants IA

Assistants IA auto-hébergés
Stack typique pour assistant privé, API OpenAI-compatible et expérimentation locale.

Développement, modèles & veille

Découverte de modèles
Évaluation & benchmarks
Outils de développement & fine-tuning

Matériel IA & GPU


API Realtime AI (DEV)

Statut : environnement DEV, remplaçante prévue de l’API OpenAI pour les cas temps réel.

Configuration

Variable Valeur
OPENAI_API_BASE wss://api-realtime-ai.ailab.infocepo.com:wait-2026-12/v1
OPENAI_API_KEY sk-XXXXX

Dépôt GitHub

Page de test

  • external-test/half-duplex.html — annulation d’écho + mode half-duplex.

Compatibilité

Remplacer l’URL OpenAI par $OPENAI_API_BASE pour tester compatibilité et performances.


API LLM (OpenAI compatible)

Liste des modèles

curl -X GET \
  'https://api-nothink.ailab.infocepo.com/v1/models' \
  -H 'Authorization: Bearer sk-XXXXX' \
  -H 'accept: application/json' \
  | jq | sed -rn 's#^.*id.*: "(.*)".*$#* \1#p' | sort -u

Modèles ouverts & endpoints internes

Dernière mise à jour : 2026-06-30

Les modèles ci-dessous correspondent à des endpoints logiques exposés derrière une passerelle.

Endpoint Description / usage principal
ai-thinking qwen3.6 fp8 – thinking
ai-fast qwen3.6 fp8 en mode fast – vision/OCR/ai-default
ai-embedding bge-m3 – recherche sémantique
ai-stt whisper3-turbo – transcription vocale multilingual
ai-tts OmniVoice – TTS multilingual
ai-image OpenDalle – image génération

Exemple bash

export OPENAI_API_MODEL="ai-default"
export OPENAI_API_BASE="https://api-nothink.ailab.infocepo.com/v1"
export OPENAI_API_KEY="sk-XXXXX"

promptValue="Quel est ton nom ?"
jsonValue='{
  "model": "'${OPENAI_API_MODEL}'",
  "messages": [{"role": "user", "content": "'${promptValue}'"}],
  "temperature": 0
}'

curl ${OPENAI_API_BASE}/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d "${jsonValue}" 2>/dev/null | jq '.choices[0].message.content'

Vue infra LLM

DEV (au choix)

  • A. LiteLLM → vLLM/SgLang : tests perf / compatibilité
  • B. LiteLLM → Ollama : simple, rapide à itérer
  • C. Ollama direct : POC ultra-léger

DEV – modèle FR / résumé

  • LiteLLM → Ollama /v1

PROD

  • Standard : LiteLLM → vLLM/SgLang
  • Pont DEV→PROD : LiteLLM (DEV) → LiteLLM (PROD) → vLLM/SgLang

Notes :

  • LiteLLM = passerelle unique (clés, quotas, logs)
  • vLLM/SgLang = performance / stabilité en charge
  • Ollama = simplicité de prototypage

API Image to Text

  • Utilise l’API LLM avec un endpoint adapté à l’OCR / VLM.
  • Modèle recommandé : ai-vision

Exemple bash

OPENAI_API_KEY=sk-XXXXX

base64 -w0 "/path/to/image.png" > img.b64

jq -n --rawfile img img.b64 \
'{
  model: "ai-vision",
  messages: [
    {
      role: "user",
      content: [
        { "type": "text", "text": "Décris cette image." },
        {
          "type": "image_url",
          "image_url": { "url": ("data:image/png;base64," + ($img | rtrimstr("\n"))) }
        }
      ]
    }
  ]
}' > payload.json

curl https://api-nothink.ailab.infocepo.com/v1/chat/completions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  --data-binary @payload.json

Exemple Python

import base64
import json
import requests
import os

API_KEY = os.getenv("OPENAI_API_KEY")
MODEL = "ai-vision"
IMG_PATH = "/path/to/image.png"
API_URL = "https://api-nothink.ailab.infocepo.com/v1/chat/completions"

with open(IMG_PATH, "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode("utf-8")

payload = {
    "model": MODEL,
    "messages": [
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Décris cette image."},
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/png;base64,{img_b64}"}
                }
            ]
        }
    ]
}

headers = {
    "Authorization": f"Bearer {API_KEY}",
    "Content-Type": "application/json"
}

response = requests.post(API_URL, headers=headers, data=json.dumps(payload))

if response.ok:
    print(json.dumps(response.json(), indent=2, ensure_ascii=False))
else:
    print(f"Erreur {response.status_code}: {response.text}")

API STT

Exemple Python

import requests

OPENAI_API_KEY = 'sk-XXXXX'

url = 'https://api-audio2txt.ailab.infocepo.com/v1/audio/transcriptions'
headers = {
    'Authorization': f'Bearer {OPENAI_API_KEY}',
}
files = {
    'file': ('file.opus', open('/path/to/file.opus', 'rb')),
    'model': (None, 'whisper-1')
}

response = requests.post(url, headers=headers, files=files)
print(response.json())

Exemple curl

[ ! -f /tmp/test.ogg ] && wget "https://upload.wikimedia.org/wikipedia/commons/1/17/Fables_de_La_Fontaine_Livre_1_01.ogg" -O /tmp/test.ogg

export OPENAI_API_KEY=sk-XXXXX

curl https://api-audio2txt.ailab.infocepo.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -F model="whisper-1" \
  -F file="@/tmp/test.ogg"

Notes

  • Plusieurs formats audio sont acceptés.
  • Le flux final est normalisé en 16 kHz mono.
  • Pour une qualité optimale : privilégier OPUS 16 kHz mono.

UI


API TTS

Exemple

export OPENAI_API_KEY=sk-XXXXX

curl https://api-tts-omnivoice.ailab.infocepo.com/v1/audio/speech \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-4o-mini-tts",
    "input": "Bonjour, ceci est un test de synthèse vocale.",
    "voice": "coral",
    "instructions": "Speak in a cheerful and positive tone.",
    "response_format": "opus"
  }' | ffplay -i -

API Text to Image

Exemple

export OPENAI_API_KEY=EMPTY

curl https://api-txt2image.ailab.infocepo.com/v1/images/generations \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "prompt": "a photo of a happy corgi puppy sitting and facing forward, studio light, longshot",
    "n": 1,
    "size": "1024x1024"
  }'

API Diarization

Exemple

wget "https://upload.wikimedia.org/wikipedia/commons/6/60/Mike_Peters_on_Politics_and_Emotion_%28Interview_1984%29.mp3" -O /tmp/test.mp3

curl -X POST "https://api-diarization.ailab.infocepo.com/upload-audio/" \
  -H "Authorization: Bearer token1" \
  -F "file=@/tmp/test.mp3"

API Summary

Exemple

text="The tower is 324 metres tall and is one of the most recognizable monuments in the world."

json_payload=$(jq -nc --arg text "$text" '{"text": $text}')

curl -X POST https://api-summary.ailab.infocepo.com:wait-2026-12/summary/ \
  -H "Content-Type: application/json" \
  -d "$json_payload"

API Text Embeddings

Exemple

curl https://api-embedding.ailab.infocepo.com/v1/embeddings \
  -X POST \
  -d '{"model":"bge-m3","input":"What is Deep Learning?"}' \
  -H 'Content-Type: application/json'

API DB Vectors (ChromaDB)

Production

Lab

export CHROMA_HOST=https://chromadb.c1.ailab.infocepo.com:wait-2026-12
export CHROMA_PORT=443
export CHROMA_TOKEN=XXXX

Exemple curl

curl -v "${CHROMA_HOST}"/api/v1/collections \
  -H "Authorization: Bearer ${CHROMA_TOKEN}"

Exemple Python

import chromadb
from chromadb.config import Settings

def chroma_http(host, port=80, token=None):
    return chromadb.HttpClient(
        host=host,
        port=port,
        ssl=host.startswith('https') or port == 443,
        settings=(
            Settings(
                chroma_client_auth_provider='chromadb.auth.token.TokenAuthClientProvider',
                chroma_client_auth_credentials=token,
            ) if token else Settings()
        )
    )

client = chroma_http(CHROMA_HOST, CHROMA_PORT, CHROMA_TOKEN)
collections = client.list_collections()
print(collections)

Déployer sa propre instance

export nameSpace=your_namespace
domainRoot=ailab.infocepo.com

helm repo add chroma https://amikos-tech.github.io/chromadb-chart/
helm repo update

helm upgrade --install chromadb chroma/chromadb -n ${nameSpace} \
  --set chromadb.apiVersion="0.4.24" \
  --set ingress.enabled=true \
  --set ingress.hosts[0].host="${nameSpace}-chromadb.${domainRoot}" \
  --set ingress.hosts[0].paths[0].path=/ \
  --set ingress.hosts[0].paths[0].pathType=ImplementationSpecific \
  --set ingress.annotations."cert-manager\.io/cluster-issuer"=letsencrypt-prod \
  --set ingress.tls[0].secretName=${nameSpace}-chromadb.${domainRoot}-tls \
  --set ingress.tls[0].hosts[0]="${nameSpace}-chromadb.${domainRoot}"

kubectl -n ${nameSpace} patch ingress/chromadb --type=json \
  -p '[{"op":"add","path":"/metadata/annotations/nginx.ingress.kubernetes.io~1proxy-body-size","value":"0"}]'

Récupérer le token

kubectl --namespace ${nameSpace} get secret chromadb-auth \
  -o jsonpath="{.data.token}" | base64 --decode && echo

Registry

Exemple

curl -u "user:XXXXX" https://registry.ailab.infocepo.com:wait-2026-09/v2/_catalog

Exemple K8S

deploymentName=
nameSpace=

kubectl -n ${nameSpace} create secret docker-registry pull-secret \
  --docker-server=registry.ailab.infocepo.com:wait-2026-09 \
  --docker-username=user \
  --docker-password=XXXXX \
  --docker-email=contact@example.com

kubectl -n ${nameSpace} patch deployment ${deploymentName} \
  -p '{"spec":{"template":{"spec":{"imagePullSecrets":[{"name":"pull-secret"}]}}}}'

Stockage objet externe (S3)

Un bucket nommé ORG a été créé pour stocker des documents de démonstration.


RAG optimisation

  • Embeddings : BAAI/bge-m3
  • chunk_size=1000
  • chunk_overlap=100
  • LLM : qwen3.6
  • Pour les PDF mixtes : PDF → image → OCR / VLM peut améliorer les résultats.

Workflow

Autoroute directe : code → CI/CD → deploy → monitoring. Pas de comité, pas de responsable désigné — chaque étape se déclenche automatiquement si la précédente passe. Si ça rate, alerte directe sans passer par un humain sauf décision explicite de fallback.


Environnements

Hors production

  • Utiliser datalab
  • Support : canal Mattermost Offre IA
  • Le pseudo utilisateur doit respecter la convention interne
  • Demander si besoin un accès Linux + Kubernetes

Production (best-effort)

  • Publier le code applicatif, les secrets (format SOPS), le Dockerfile et le code infra (Helm ou manifests K8S) sur Git
  • Demander un namespace
  • Lire la documentation de surveillance associée

Limites de l’infrastructure

  • Les charges GPU sont intentionnellement limitées en journée.
  • Coût unitaire mesuré automatiquement (dashboards temps réel, pas Excel).

Cloud Lab & projets d’audit

Cloud Lab reference diagram

Le Cloud Lab fournit des scénarios reproductibles : audit d’infrastructure, migration cloud, automatisation, haute disponibilité.

Projet d’audit

ServerDiff.sh

Script Bash d’audit permettant de :

  • détecter les dérives de configuration,
  • comparer plusieurs environnements,
  • préparer un plan de migration ou de remédiation.
  • open-code-review - Outil de review de code open-source teste a l echelle Alibaba : pipeline deterministe + agent LLM, precise par ligne.. (16590 stars)

Exemple de migration cloud

Cloud migration diagram

Tâche Description Durée (jours)
Audit infrastructure 82 services, audit automatisé via ServerDiff.sh 1.5
Diagramme d’architecture Conception visuelle et documentation 1.5
Contrôles de conformité 2 clouds, 6 hyperviseurs, 6 To RAM 1.5
Installation plateforme cloud Déploiement des environnements cibles 1.0
Vérification de stabilité Premiers tests fonctionnels 0.5
Étude d’automatisation Identification des tâches répétitives 1.5
Développement des templates 6 templates, 8 environnements, 2 clouds / OS 1.5
Diagramme de migration Illustration du processus 1.0
Écriture du code de migration 138 lignes (voir MigrationApp.sh) 1.5
Stabilisation Validation de la reproductibilité 1.5
Benchmark cloud Comparaison vs legacy 1.5
Réglage des temps d’arrêt Calcul du downtime 0.5
Chargement VM 82 VMs : OS, code, 2 IP par VM 0.1
Total 15 jours.homme

Vérifications de stabilité (HA minimale)

Action Résultat attendu
Extinction d’un nœud Tous les services redémarrent automatiquement sur les autres nœuds
Extinction / redémarrage simultané de tous les nœuds Les services repartent correctement après reboot


Autonomie testée : vérifier que la migration fonctionne seule en tirant le repo et lançant le script, sans personne qui connaît le système de tête.


Architecture web & bonnes pratiques

Reference web architecture

Principes de conception :

  • privilégier une infrastructure simple, modulaire et flexible,
  • rapprocher le contenu du client (GDNS ou équivalent),
  • utiliser des load balancers réseau (LVS, IPVS),
  • comparer les coûts et éviter le vendor lock-in,
  • pour TLS :
    • HAProxy pour les frontends rapides,
    • Envoy pour les cas avancés (mTLS, HTTP/2/3),
  • pour le cache :
    • Varnish, Apache Traffic Server,
  • favoriser les stacks open-source,
  • utiliser files, buffers, queues et quotas pour lisser les pics.

Références


Comparatif des grandes plateformes cloud

Fonctionnalité Kubernetes OpenStack AWS Bare-metal HPC CRM oVirt
Outils de déploiement Helm, YAML, ArgoCD, Juju Ansible, Terraform, Juju CloudFormation, Terraform, Juju Ansible, Shell xCAT, Clush Ansible, Shell Ansible, Python
Méthode de bootstrap API API, PXE API PXE, IPMI PXE, IPMI PXE, IPMI PXE, API
Contrôle routeur Kube-router Router/Subnet API Route Table / Subnet API Linux, OVS xCAT Linux API
Contrôle firewall Istio, NetworkPolicy Security Groups API Security Group API Linux firewall Linux firewall Linux firewall API
Virtualisation réseau VLAN, VxLAN VPC VPC OVS, Linux xCAT Linux API
DNS CoreDNS DNS-Nameserver Route 53 GDNS xCAT Linux API
Load balancer Kube-proxy, LVS LVS Network Load Balancer LVS SLURM Ldirectord N/A
Stockage Local, cloud, PVC Swift, Cinder, Nova S3, EFS, EBS, FSx Swift, XFS, EXT4, RAID10 GPFS SAN NFS, SAN

Cette table sert de point de départ pour choisir la bonne stack selon :

  • le niveau de contrôle souhaité,
  • le contexte (on-prem, cloud public, HPC…),
  • les outils d’automatisation existants.

Haute disponibilité, HPC & DevSecOps

Haute disponibilité avec Corosync & Pacemaker

HA cluster architecture

Principes :

  • clusters multi-nœuds ou multi-sites,
  • fencing via IPMI,
  • provisioning PXE / NTP / DNS / TFTP,
  • pour 2 nœuds : attention au split-brain,
  • 3 nœuds ou plus recommandés en production.

Ressources fréquentes

  • multipath, LUNs, LVM, NFS,
  • processus applicatifs,
  • IP virtuelles, DNS, listeners réseau.

HPC

Overview of an HPC cluster

  • orchestration de jobs (SLURM ou équivalent),
  • stockage partagé haute performance,
  • intégration possible avec des workloads IA.

DevSecOps

DevSecOps reference design

  • CI/CD avec contrôles de sécurité intégrés,
  • observabilité dès la conception,
  • scans de vulnérabilité,
  • gestion des secrets,
  • policy-as-code.

News & trends


Formation & apprentissage


Liens cloud & IT utiles


Outils collaboratifs

Dépôts de code

Base de connaissance

  • ce wiki

Messagerie

  • contact interne / support selon les projets

SSO

MLflow


À propos & contributions

Suggestions de corrections, améliorations de schémas, retours d’expérience ou nouveaux labs bienvenus.

Ce wiki a vocation à rester un laboratoire vivant pour l’IA, le cloud et l’automatisation.