# AI^VILLAGE — Analyse finale de la Table ronde S3 / Orion3

**Date :** 23 septembre 2026  
**Session :** `S3-20-20260923T195817+0200-717cc5`  
**Statut :** analyse post-séance — aucun vote, aucun gagnant, aucune installation automatique.

## Résumé

La question utile n’est pas « quel est le meilleur modèle ? », mais **quelles capacités locales ajouter à AI^VILLAGE, sur quel nœud, avec quel coût et pour quel rôle ?**

La séance a produit **79 réponses directes**. **15 réponses originales tardives** ont été récupérées dans les journaux serveur, soit **94 complétions textuelles authentiques**. Cinq vrais timeouts ont ensuite été rejoués séparément ; ces replays sont des réponses nouvelles et ne sont pas confondus avec la séance originale.

## Conclusions structurantes

- S3 doit être traité comme un nœud CPU sobre et spécialisé, pas comme un petit Orion3.
- Le couple RAG + architectures efficaces/atypiques est la piste la plus structurante pour S3.
- Orion3 est le terrain naturel des expériences multimodales, raisonnement et modèles plus lourds.
- La diversité linguistique/culturelle doit être une capacité recherchée explicitement, pas un simple sous-produit des benchmarks.
- La séance a montré une contagion factuelle autour d’un faux S3/A100; les prochaines séances doivent verrouiller un bloc de faits matériels non négociable.
- Les mentions explicites de candidats sont des indices d’attention seulement. Plusieurs portances ont dérivé hors format; aucune absence de mention ne vaut rejet.
- Les 5 replays postérieurs sont conservés séparément et ne sont pas traités comme des réponses originales de la séance.

## Paniers d’action proposés

- **S3 · infrastructure RAG :** C09 BGE-M3, C10 Arctic-Embed-M-v2.0.
- **S3 · génération/efficacité :** C01 LFM2.5, C02 BitNet, C03 RecurrentGemma, C04 Granite H-Micro, C05 SmolLM3, C06 EXAONE.
- **S3 · R&D / diversité :** C07 InkubaLM, C08 RWKV7.
- **Pont S3 ↔ Orion3 :** C11 Ministral 3 3B, d’abord sur Orion3 puis S3 quantifié si pertinent.
- **Orion3 · multimodal / raisonnement :** C12 Gemma 3n, C13 Phi Flash, C14 Phi multimodal, C15 OLMo 3 Think.
- **Orion3 · R&D / diversité / limite haute :** C16 Nemotron, C17 MiniCPM4, C18 Ling, C19 Aya, C20 gpt-oss-20b.

Ces paniers ne sont **pas un classement**. Ils définissent des expériences comparables.

## 20 candidats

### C01 · LiquidAI LFM2.5-1.2B-Instruct

- **Orientation :** `BENCHMARK_S3`
- **Rôle :** Edge/génératif
- **Pourquoi :** Très compact, architecture LFM distincte et positionnement edge. Bon test de portance légère sur CPU.
- **Inconnue principale :** Mesurer latence CPU, RAM réelle, français et qualité conversationnelle; licence LFM 1.0 à conserver visible.
- **Attention observée :** 8 réponses authentiques / 6 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct

### C02 · Microsoft BitNet b1.58-2B-4T

- **Orientation :** `BENCHMARK_S3_RD`
- **Rôle :** Efficacité / architecture
- **Pourquoi :** Cas scientifique majeur pour S3 : 1.58-bit natif et runtime BitNet spécifique.
- **Inconnue principale :** Intégration bitnet.cpp distincte du chemin Ollama; mesurer débit, mémoire et stabilité sur i7-8565U.
- **Attention observée :** 3 réponses authentiques / 2 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/microsoft/bitnet-b1.58-2B-4T

### C03 · Google RecurrentGemma-2B-IT

- **Orientation :** `BENCHMARK_S3_SECONDARY`
- **Rôle :** Récurrence
- **Pourquoi :** Contrepoint récurrent compact utile face à LFM/BitNet/RWKV.
- **Inconnue principale :** Modèle plus ancien et conditions Gemma; intérêt surtout comparatif.
- **Attention observée :** 0 réponses authentiques / 0 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/google/recurrentgemma-2b-it

### C04 · IBM Granite 4.0 H-Micro

- **Orientation :** `BENCHMARK_S3_RD`
- **Rôle :** Hybride Mamba-2
- **Pourquoi :** 3B hybride conçu pour usages locaux / basse latence; bonne expérience d’architecture.
- **Inconnue principale :** Support Mamba-2 et quantification à vérifier sur S3; ne pas inférer la vitesse avant benchmark.
- **Attention observée :** 0 réponses authentiques / 0 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://www.ibm.com/granite/docs/models/granite4-0

### C05 · Hugging Face SmolLM3-3B

- **Orientation :** `BENCHMARK_S3_SECONDARY`
- **Rôle :** Compact polyvalent
- **Pourquoi :** Petit modèle ouvert et multilingue, utile comme baseline moderne simple.
- **Inconnue principale :** Moins différenciant architecturalement que LFM, BitNet ou RWKV.
- **Attention observée :** 0 réponses authentiques / 0 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/HuggingFaceTB/SmolLM3-3B

### C06 · LG AI EXAONE 4.0-1.2B

- **Orientation :** `BENCHMARK_S3_WITH_LICENSE_GUARD`
- **Rôle :** Diversité coréenne / on-device
- **Pourquoi :** 1.2B, nouvelle famille culturelle et technique, pertinente pour la diversité du Village.
- **Inconnue principale :** Licence EXAONE spécifique/NC observée pour cette release; périmètre d’usage à respecter.
- **Attention observée :** 0 réponses authentiques / 0 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-1.2B

### C07 · Lelapa AI InkubaLM-0.4B

- **Orientation :** `RD_S3_DIVERSITY`
- **Rôle :** Diversité africaine
- **Pourquoi :** Très petit modèle apportant une diversité linguistique/culturelle absente du parc.
- **Inconnue principale :** Capacité limitée et licence CC-BY-NC; intérêt d’abord expérimental, pas remplacement d’un assistant généraliste.
- **Attention observée :** 1 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/lelapa/InkubaLM-0.4B

### C08 · RWKV7 Goose 2.9B — 20260831

- **Orientation :** `RD_PRIORITY_S3_ORION`
- **Rôle :** Architecture récurrente RWKV
- **Pourquoi :** Candidat le plus explicitement discuté; architecture attention-free et état récurrent constant très différente.
- **Inconnue principale :** Checkpoint de base : post-training/alignment nécessaire avant d’en faire une portance conversationnelle.
- **Attention observée :** 12 réponses authentiques / 4 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/RWKV/RWKV7-G1j-2.9B-20260831

### C09 · BAAI BGE-M3

- **Orientation :** `INFRASTRUCTURE_S3_RAG`
- **Rôle :** RAG riche
- **Pourquoi :** Peut faire de S3 un nœud RAG autonome : dense + sparse + multi-vector.
- **Inconnue principale :** Plus lourd qu’un embedding simple; mesurer coût CPU/indexation et bénéfice réel des modes multiples.
- **Attention observée :** 0 réponses authentiques / 0 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/BAAI/bge-m3

### C10 · Snowflake Arctic-Embed-M-v2.0

- **Orientation :** `INFRASTRUCTURE_S3_RAG`
- **Rôle :** RAG léger multilingue
- **Pourquoi :** Alternative plus légère à BGE-M3, 74 langues, Apache-2.0.
- **Inconnue principale :** Comparer qualité/latence/mémoire à BGE-M3 sur le corpus réel d’AI^VILLAGE.
- **Attention observée :** 3 réponses authentiques / 2 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/Snowflake/snowflake-arctic-embed-m-v2.0

### C11 · Mistral Ministral 3 3B Instruct 2512

- **Orientation :** `BENCHMARK_ORION_THEN_S3`
- **Rôle :** Multimodal edge
- **Pourquoi :** Vision + texte, français, famille edge; pont naturel entre S3 et Orion3.
- **Inconnue principale :** Commencer sur Orion3; tenter S3 uniquement après quantification et mesure réelle de RAM.
- **Attention observée :** 0 réponses authentiques / 0 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/mistralai/Ministral-3-3B-Instruct-2512-BF16

### C12 · Google Gemma 3n E4B-it

- **Orientation :** `BENCHMARK_ORION`
- **Rôle :** Multimodal large diversité
- **Pourquoi :** Texte, image, vidéo et audio avec forte couverture linguistique; apporte perception au Village.
- **Inconnue principale :** Intégration plus complexe et conditions Gemma; éviter de dupliquer des services multimédias sans cas d’usage.
- **Attention observée :** 2 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/google/gemma-3n-E4B-it

### C13 · Microsoft Phi-4-mini-flash-reasoning

- **Orientation :** `BENCHMARK_ORION_REASONING`
- **Rôle :** Raisonnement spécialisé
- **Pourquoi :** Architecture Phi Flash atypique et focalisation maths/code; utile comme spécialiste.
- **Inconnue principale :** Ne pas extrapoler ses résultats maths à un assistant généraliste; runtime custom à valider.
- **Attention observée :** 6 réponses authentiques / 3 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/microsoft/Phi-4-mini-flash-reasoning

### C14 · Microsoft Phi-4-multimodal-instruct

- **Orientation :** `BENCHMARK_ORION_MULTIMODAL`
- **Rôle :** Perception texte/vision/audio
- **Pourquoi :** Portance perceptive potentielle, complémentaire des modèles texte actuels.
- **Inconnue principale :** Compréhension multimodale ≠ génération image/audio; vérifier VRAM et pipeline.
- **Attention observée :** 3 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/microsoft/Phi-4-multimodal-instruct

### C15 · Ai2 OLMo 3 7B Think

- **Orientation :** `RD_ORION`
- **Rôle :** Recherche ouverte / raisonnement
- **Pourquoi :** OLMo apporte une famille de recherche très ouverte et un spécialiste de raisonnement.
- **Inconnue principale :** 7B recoupe plusieurs modèles Orion existants; intérêt à démontrer par benchmark différentiel.
- **Attention observée :** 3 réponses authentiques / 3 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/allenai/Olmo-3-7B-Think

### C16 · NVIDIA Nemotron Nano 9B v2

- **Orientation :** `RD_ORION`
- **Rôle :** Hybride NVIDIA
- **Pourquoi :** Nouvelle famille et architecture Nemotron-H, potentiellement intéressante pour outils/conversation.
- **Inconnue principale :** 9B + custom_code : quantification/offload à mesurer sur RTX 3070 8GB.
- **Attention observée :** 5 réponses authentiques / 4 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2

### C17 · OpenBMB MiniCPM4-8B

- **Orientation :** `RD_ORION`
- **Rôle :** Diversité OpenBMB
- **Pourquoi :** Nouvelle famille chinoise/anglaise qui diversifie au-delà de Qwen.
- **Inconnue principale :** Runtime custom_code et bénéfice par rapport aux modèles déjà présents à démontrer.
- **Attention observée :** 1 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/openbmb/MiniCPM4-8B

### C18 · inclusionAI Ling-3.0-tiny

- **Orientation :** `RD_PRIORITY_ORION`
- **Rôle :** MoE hybride très atypique
- **Pourquoi :** 7.9B total / 1.3B actifs, architecture KDA–MLA + MoE; forte valeur de diversité architecturale.
- **Inconnue principale :** Runtime récent/custom; tester INT4 et stabilité avant toute intégration permanente.
- **Attention observée :** 1 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/inclusionAI/Ling-3.0-tiny

### C19 · Cohere Labs Aya Expanse 8B

- **Orientation :** `RD_ORION_DIVERSITY`
- **Rôle :** Multilingue / culturel
- **Pourquoi :** Aya apporte une diversité linguistique forte et une philosophie de recherche multilingue distincte.
- **Inconnue principale :** Licence CC-BY-NC + AUP; poids 8B. L’API Cohere a été retirée en 2026 mais les poids de recherche restent publiés séparément.
- **Attention observée :** 1 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://huggingface.co/CohereLabs/aya-expanse-8b

### C20 · OpenAI gpt-oss-20b

- **Orientation :** `RD_HEAVY_ORION`
- **Rôle :** Raisonnement MoE / agentique
- **Pourquoi :** 21B total / 3.6B actifs : bon test de limite supérieure locale, outils et raisonnement.
- **Inconnue principale :** RTX 3070 8GB insuffisante pour un chargement GPU complet; offload/CPU et latence doivent être mesurés.
- **Attention observée :** 4 réponses authentiques / 1 portances (indice d’attention, pas de soutien).
- **Source officielle :** https://developers.openai.com/api/docs/models/gpt-oss-20b

## Incident méthodologique majeur

Une affirmation inventée présentant S3 comme un cluster NVIDIA A100 a circulé entre plusieurs réponses. Le matériel réel était pourtant connu : S3 = i7-8565U, 7.6 GiB RAM, sans GPU dédié. Certaines portances ont corrigé cette dérive, mais elle a contaminé une partie de la discussion.

**Conséquence :** les futures Tables rondes doivent injecter un bloc de faits matériels verrouillé et distinguer explicitement `FACT`, `HYPOTHESIS` et `OTHER_PORTANCE_CLAIM`.

## Limites de la séance

- Le protocole de sortie `Cxx` a été mal suivi par plusieurs petites portances.
- Les fichiers automatiques de positions/minorités ne suffisent donc pas à reconstruire un vote — et aucun vote n’était demandé.
- Les mentions lexicales ne mesurent ni qualité ni accord.
- Les 5 replays postérieurs restent hors du corpus authentique de la séance.

## Suite expérimentale

Installer uniquement en **sandbox / benchmark**, par petits paniers. Mesurer au minimum : RAM, VRAM, temps de chargement, tokens/s, latence au premier token, énergie/température, stabilité runtime, français/multilingue, qualité RAG ou multimodale, et complexité d’intégration T^AI. La décision de permanence reste humaine.
