The Easy CompanyIA utile · décisions claires
Menu

LLM exécutables en local — guide par matériel

Contrôle: 23 août 2026. Point de vue: particulier ou développeur résidant en Belgique qui veut faire tourner un modèle sur sa propre machine, sans envoyer de données à un fournisseur cloud. Ce fichier complète l'observatoire des 20 écosystèmes; il ne le remplace pas.

⚠️ État de vérification au 23 août 2026. La revue Approfondie hebdomadaire de la semaine ISO 2026-W34 a été exécutée le 17 août ; la prochaine est due le 24 août, premier jour de la semaine 2026-W35, et aucun rattrapage n’est dû au 23 août. Aucune carte modèle, licence ni mesure de vitesse citée dans ce guide n’a pu être revérifiée ce jour : huggingface.co, modelscope.cn et les domaines d’éditeurs de moteurs restent refusés par la politique de sortie réseau. Les seuls éléments revérifiés ce jour sont des versions de paquets, relevées aux registres ouverts : vllm 0.27.1 (11 août), transformers 5.15.1 (19 août). Une version publiée n’établit ni fonctionnalité, ni performance, ni licence : aucune recommandation de ce guide n’en est modifiée. Les tableaux ci-dessous reflètent donc l’état vérifié au 17 août, statuts et réserves renouvelés sans réévaluation du fond [S226].

⚠️ État de vérification antérieur, conservé pour le détail des réserves. La revue Approfondie hebdomadaire de la semaine ISO 2026-W34 a été exécutée le 17 août ; la prochaine est due le 24 août, aucun rattrapage n’est dû. Aucune carte modèle, licence ou mesure de vitesse citée dans ce guide n’a pu être revérifiée : huggingface.co, modelscope.cn, ollama.com, lmstudio.ai et les domaines fournisseurs restent bloqués. Les versions des moteurs ont en revanche été relevées aux registres officiels, ouverts directement : llama-cpp-python 0.3.35 (17 août 2026), vLLM 0.27.1 (11 août 2026), MLX-LM 0.31.3 et transformers 5.15.1 — cette dernière étant la seule publication nouvelle depuis le contrôle précédent, le 19 août à 11:28 UTC. Le registre date cette publication mais n’en documente pas le contenu, github.com étant refusé : aucune recommandation n’est modifiée sur cette base. Aucune publication de poids ouverts nouvelle n’est intervenue entre le 15 et le 20 août. Les tableaux conservent le niveau de preuve de leur dernier contrôle effectif et ne sont pas modifiés sur la foi de sources secondaires.
⚠️ État de vérification antérieur, conservé pour le détail des réserves. Aucune carte modèle, licence ou mesure de vitesse citée dans ce guide n’a pu être revérifiée ce jour : huggingface.co, modelscope.cn, ollama.com, lmstudio.ai et les domaines fournisseurs restent bloqués par la politique de sortie réseau. Les tableaux conservent le niveau de preuve de leur dernier contrôle effectif et ne sont pas modifiés sur la foi de sources secondaires. Une nouveauté de premier plan est enregistrée sans être intégrée aux recommandations: Qwen3.8-27B, publié le 14 août sous Apache 2.0 — voir l’encadré ci-dessous.
🆕 Qwen3.8-27B, publié le 14 août 2026 sous Apache 2.0 — candidat sérieux, pas encore une recommandation. Modèle dense de 27 milliards de paramètres — et non MoE —, nativement multimodal en entrée texte, image et vidéo pour une sortie texte, 262 144 jetons de contexte natif avec extension vers environ 1 M par YaRN annoncée. La licence Apache 2.0 autorise usage commercial, modification et redistribution sans seuil de revenu, ce qui le distingue nettement de Qwen3.8-Max paru le 12 août sous une licence propriétaire à partage de revenus — et qui, à 2 400 milliards de paramètres, n’est de toute façon exécutable sur aucun matériel grand public. Ordre de grandeur attendu pour un dense de 27 B en Q4_K_M, par simple application des repères mémoire de ce guide : environ 15–16 Go de poids, donc une cible naturelle pour une carte 24 Go en tout-GPU, et un déchargement partiel envisageable sur 12 Go. Ces chiffres sont une projection arithmétique, pas une mesure. Rien n’est vérifié à ce stade : aucune variante quantifiée GGUF n’a été constatée, aucune vitesse sourcée n’existe, l’empreinte réelle de l’encodeur de vision n’est pas connue, le coût du cache clé-valeur à 262 k de contexte n’est pas établi, et la qualité en français et en néerlandais n’est pas évaluée. Les dépôts de poids étant refusés depuis l’environnement d’exécution, la licence elle-même n’a pas été lue à la source. Aucun tableau de ce guide n’est modifié sur cette base : le modèle est porté à la revue Approfondie du 17 août [S197, S199].
Agent de code local. Cohere North Mini Code 1.0 (9 juin 2026, Apache 2.0, MoE 30 B / 3 B actifs, 256 k de contexte annoncés) est le candidat le plus sérieux pour un agent de code entièrement local sur une seule carte 24 Go. Voir les sections 3.4 Code et 3.8 Agents locaux. Les empreintes de Muse Glimmer 30B sont documentées avec les paliers de quantification publiés et leur dégradation annoncée.
⚠️ Deux modèles très commentés cette semaine qui ne sont pas des options locales. GLM-5.3 (Z.ai, 14 août) est annoncé comme le meilleur modèle de code à poids ouverts de son éditeur, mais ses poids ne sont pas publiés — annoncés sous environ deux semaines, après évaluation de sûreté. Tant qu’aucun fichier n’est téléchargeable sous une licence nommée, il n’entre dans aucun palier de ce guide ; le repli auto-hébergeable reste GLM-5.2 sous licence MIT [S179–S181]. DeepSeek V4 Pro 0813 (13 août) publie bien ses poids sous MIT, mais il s’agit d’un mixture-of-experts de 1 600 milliards de paramètres pour environ 893 Go de fichiers : hors de portée de tout matériel de particulier, et de la plupart des PME. Une licence permissive ne rend pas un modèle exécutable chez soi [S182–S183].
⚠️ Vérifiez la génération, pas le nom de la famille. Les familles de référence pour une nouvelle installation sont Gemma 4 (E2B/E4B/12B/26B-A4B/31B, Apache 2.0, multimodale, contexte 128 k–256 k) [S126] et Qwen3.6 (dont 35B-A3B) [S127], toutes deux sorties en avril 2026. Gemma 3 et Qwen3 restent parfaitement fonctionnels — inutile de les désinstaller — mais ne constituent plus le premier choix. Un tag de registre populaire continue souvent de pointer vers une génération précédente: vérifiez la date de la carte de modèle, pas le nom de la famille. Sorties d'août directement pertinentes en local: Muse Glimmer 30B (Meta), Nemotron 3.5 Lightning 30B-A3B (NVIDIA), Shieldstral 1.0 3B (Mistral) et Granite 4.1 (IBM).
Avertissement de méthode. Les empreintes mémoire sont calculées à partir de la taille des poids et de la quantification, puis recoupées avec les cartes de modèles officielles. Les vitesses en tokens/s proviennent de bancs d'essai indépendants et dépendent fortement du matériel exact, du moteur, du contexte et du réglage: elles sont indicatives et marquées « à tester ». Ne considérez jamais un modèle comme « compatible » s'il ne tient pas réellement en mémoire avec la quantification et le contexte visés. En cas de doute: à tester.
Niveau de preuve de cette édition: les domaines officiels (ai.google.dev, huggingface.co, mistral.ai…) étaient bloqués par la politique de sortie réseau. Les caractéristiques ci-dessous proviennent de l'index de recherche restituant ces pages officielles et de sources indépendantes convergentes. Les tailles de fichiers GGUF exactes doivent être revérifiées sur la carte du quantifieur choisi avant téléchargement.

1. Comment lire les besoins mémoire

Un modèle en RAM/VRAM = poids quantifiés + cache KV (croît avec le contexte) + overhead (moteur, buffers, activations). Règle de travail:

QuantificationOctets/paramRepère qualité
FP16 / BF162,0référence, non quantifié
Q8_01,0quasi sans perte
Q6_K~0,82perte négligeable
Q5_K_M~0,68très bon compromis
Q4_K_M~0,57défaut recommandé grand public
Q3_K_M~0,43dégradation visible, dépannage
MXFP4 (gpt-oss)~0,53 (4,25 bit)quantification native d'origine [S100]

GPU/mémoire unifiée entièrement (tous les poids tiennent) est beaucoup plus rapide que l'offload CPU/GPU (une partie des couches sur le CPU). Un modèle qui « tient » par offload peut être 3 à 10× plus lent. Les modèles MoE (Mixture-of-Experts, peu de paramètres actifs par jeton, ex. gpt-oss, Qwen3-30B-A3B) restent rapides même partiellement en RAM, car peu de calcul par jeton.

2. Tableau de décision par configuration

Estimations à Q4_K_M (sauf mention), contexte modéré (8–16 k). « GPU » = tout en VRAM; « offload » = CPU+GPU; « CPU » = mémoire système seule.

ConfigurationPalier réalisteRecommandation principale (chat)AlternativesÀ éviter
Raspberry Pi 5 · 4 Go RAM (CPU ARM)0,3–2,3 BGemma 4 E2B (~1,3 Go, audio+image)Llama 3.2 1B; Gemma 3 1B; LFM2.5-230M (veille)≥4B (swap constant), tout contexte long
CPU seul · 8 Go RAM2–4,5 BGemma 4 E4B (~2,6 Go)Qwen3 4B; Llama 3.2 3B; Phi-4-mini 3.8B7–8B (tient à peine, lent), 13B+
CPU seul · 16 Go RAM8–12 BGemma 4 12B (~6,8 Go)Qwen3.6 9B; Llama 3.1 8B; gpt-oss-20b (serré)Denses 24B+, contexte 128k
CPU seul · 32 Go RAM26–35 B (MoE)Qwen3.6-35B-A3B (MoE, 3 B actifs)Gemma 4 26B-A4B; gpt-oss-20bDenses 70B (très lent)
CPU seul · 64 Go RAM30–120 B (MoE)gpt-oss-120b (MoE, ~64 Go)Nemotron 3.5 Lightning 30B-A3B; Llama 3.3 70B dense (lent)70B dense pour l'interactif
Mini-PC / portable · 16 Go RAM (iGPU)8–12 BGemma 4 12BQwen3.6 9B; Mistral Nemo 12BDenses 24B+
Mini-PC / portable · 32 Go RAM26–35 BQwen3.6-35B-A3B (MoE)Gemma 4 26B-A4B; Gemma 4 31B (lent)70B dense
Apple Silicon · 16 Go unifiée (MLX/Metal)8–12 BGemma 4 12B (MLX 4-bit)Qwen3.6 9B; Gemma 4 E4B26B+ (mémoire unifiée partagée avec l'OS)
Apple Silicon · 32 Go unifiée26–35 BQwen3.6-35B-A3BMuse Glimmer 30B (K-Quant-Dynamic, ~0,2 % de dégradation); North Mini Code 1.0 w4a16 pour le code; Gemma 4 31B; gpt-oss-20b70B dense (serré, lent)
GPU · 8 Go VRAM4–9 B (GPU)Qwen3.6 9B (~5,1 Go)Gemma 4 E4B (contexte large); DeepSeek-R1-Distill 7BDenses 14B+ en tout-GPU
GPU · 12 Go VRAM (ex. RTX 3060)12 B dense (GPU)Gemma 4 12B (~6,8 Go)Qwen3.6-35B-A3B (offload, +RAM); gpt-oss-20b (offload)26–35B en tout-GPU; Muse Glimmer 30B en tout-GPU
GPU · 16 Go VRAM20–26 B MoEGemma 4 26B-A4B (~14,8 Go)gpt-oss-20b (~13 Go); Nemotron 3.5 Lightning (NVFP4)31B dense en tout-GPU
GPU · 24 Go VRAM (ex. RTX 4090)30–35 B (GPU)Qwen3.6-35B-A3B (Q4_K_M ≈ 21 Go)Muse Glimmer 30B (K-Quant ≈ 17 Go, ~1,0 % de dégradation); North Mini Code 1.0 w4a16 (~18–20 Go) pour le code; Gemma 4 31B; Devstral 24B70B en tout-GPU (offload/2-bit seulement); North Mini Code à 256 k de contexte (cache KV insuffisant)

Cas particulier RTX 3060 12 Go + 64 Go RAM (profil demandé). Tout-GPU confortable jusqu'à 12 B Q4: Gemma 4 12B (~6,8 Go de poids, ~8–9 Go chargé) laisse une marge de contexte confortable. Les 64 Go de RAM permettent l'offload de modèles nettement plus gros, et c'est là que les MoE changent tout: Qwen3.6-35B-A3B (3 B actifs), Gemma 4 26B-A4B (3,8 B actifs), gpt-oss-20b et Nemotron 3.5 Lightning 30B-A3B restent utilisables malgré l'offload, parce que le calcul par jeton reste petit. En revanche Muse Glimmer 30B est dense: même à ~17 Go en K-Quant il ne tient pas en 12 Go de VRAM et son offload sera lent — sur ce profil, préférez un MoE. Pour un agent de code, North Mini Code 1.0 (30 B / 3 B actifs) est le bon candidat sur cette configuration précisément parce qu'il est MoE: en offload w4a16 (~18–20 Go répartis entre VRAM et RAM), le calcul par jeton reste celui d'un 3 B. Vitesse à tester, aucun banc indépendant sur ce profil. Les denses 31–32B fonctionnent par offload mais deviennent lents (~15–20 tok/s selon banc indépendant, à tester) [S108]. Réservez la VRAM au modèle en fermant les applications GPU.

3. Recommandations par catégorie

On sépare les usages pour éviter les comparaisons trompeuses: un modèle de code ou de vision ne se juge pas comme un chat généraliste.

3.1 Chat généraliste (dense)

Famille de référence 2026: Gemma 4 (Apache 2.0) et Qwen3.6 (Apache 2.0). Les lignes Gemma 3 / Qwen3 sont conservées plus bas comme repères historiques encore valides, non comme premier choix.

Modèle (version)ParamsArchiQuant. conseilléeTaille fichier ~RAM/VRAM au chargement ~Contexte réalisteFR / NLLicenceMoteursSource
Gemma 4 E2B2,3 B effectifsdense (texte+image+audio)Q4_K_M~1,3 Go~2–2,5 Go8–32 k (max 128 k)FR bon, NL correct — à testerApache 2.0llama.cpp, Ollama, LM Studio, MLXS126
Gemma 4 E4B4,5 B effectifsdense (texte+image+audio)Q4_K_M~2,6 Go~4–5 Go8–32 k (max 128 k)FR bon, NL correct — à testerApache 2.0llama.cpp, Ollama, MLXS126
Gemma 4 12B12 Bdense (texte+image+audio)Q4_K_M~6,8 Go~8–9 Go16–32 k (max à confirmer)FR très bon, NL bon — à testerApache 2.0llama.cpp, Ollama, MLXS126
Gemma 4 26B-A4B26 B / 3,8 B actifsMoE (texte+image)Q4_K_M~14,8 Go~16–17 Go32 k+ (max 256 k)FR excellent, NL bon — à testerApache 2.0llama.cpp, Ollama, MLX, vLLMS126
Gemma 4 31B31 Bdense (texte+image)Q4_K_M~17,7 Go~19–21 Go32 k+ (max 256 k)FR excellent, NL bon — à testerApache 2.0llama.cpp, Ollama, MLX, vLLMS126
Qwen3.6 9B9 BdenseQ4_K_M~5,1 Go~6–7 Go32 k+FR bon, NL correct — à testerApache 2.0llama.cpp, Ollama, MLX, vLLMS127
Muse Glimmer 30B~29,6 B + vision ~1,8 Bdense, GQA+SWA4 bits (NF4)~19,3 Go~20–22 Go130 k mesuré sans quantifier le KV100+ langues; FR/NL à testerApache 2.0vLLM, llama.cpp, UnslothS117–S118
Gemma 3 1B (historique)1 BdenseQ4_K_M~0,8 Go~1,5–2 Go8–32 kFR bon, NL correctGemma (usage)llama.cpp, Ollama, LM Studio, MLXS97
Llama 3.2 3B3 BdenseQ4_K_M~1,9 Go~3–4 Go8–32 kFR bon, NL moyenLlama Communityllama.cpp, OllamaS98
Qwen3 4B4 BdenseQ4_K_M~2,4 Go~4–5 Go32 k+FR bon, NL correctApache 2.0llama.cpp, Ollama, MLX, vLLMS96
Gemma 3 4B4 Bdense (vision)Q4_K_M~2,5 Go~4–5 Go8–32 kFR bon, NL correctGemma (usage)llama.cpp, Ollama, MLXS97
Qwen3 8B8 BdenseQ4_K_M~4,7 Go~6–7 Go32 k+FR bon, NL correctApache 2.0llama.cpp, Ollama, MLX, vLLMS96
Llama 3.1 8B8 BdenseQ4_K_M~4,7 Go~6–7 Go8–128 kFR bon, NL moyenLlama Communityllama.cpp, Ollama, vLLMS98
Gemma 3 12B12 Bdense (vision)Q4_K_M~7,3 Go~9–10 Go8–32 kFR très bon, NL bonGemma (usage)llama.cpp, Ollama, MLXS97
Qwen3 14B14 BdenseQ4_K_M~8,5 Go~10–11 Go32 k+FR très bon, NL bonApache 2.0llama.cpp, Ollama, MLX, vLLMS96
Gemma 3 27B27 Bdense (vision)Q4_K_M~16 Go~17–19 Go8–32 kFR excellent, NL bonGemma (usage)llama.cpp, Ollama, MLX, vLLMS97
Qwen3 32B32 BdenseQ4_K_M~18 Go~19–21 Go32 k+FR excellent, NL bonApache 2.0llama.cpp, Ollama, MLX, vLLMS96
Llama 3.3 70B70 BdenseQ4_K_M~40 Go~42–46 Go8–128 kFR excellent, NL bonLlama Communityllama.cpp, Ollama, vLLMS98

3.2 Modèles MoE (efficaces mémoire/vitesse)

Peu de paramètres actifs par jeton → rapides même en offload CPU. Idéaux dès 32 Go de RAM ou 16 Go de VRAM.

ModèleParams totaux / actifsQuant.Taille ~Mémoire ~ContexteNoteSource
gpt-oss-20b20,9 B / 3,6 B (32 exp., top-4)MXFP4 natif~12 Go~13–14 Go128 kBon raisonnement; ~10 tok/s CPU 14 Go, plus vite en GPUS100, S110
Gemma 4 26B-A4B26 B / 3,8 BQ4_K_M~14,8 Go~16–17 Go256 kMultimodal, Apache 2.0; bon candidat GPU 16 GoS126
Qwen3.6-35B-A3B35 B / 3 B (256 exp., 8+1 actifs)Q4_K_M~21 Go~23–24 Go262 k natif (1 M via YaRN)Attention linéaire Gated DeltaNet; multimodal texte/image/vidéo; Q4_K_M conserve ~99 % de BF16 en code selon l'éditeurS127
Nemotron 3.5 Lightning 30B-A3B30 B / 3 BNVFP4 (ou BF16)~16 Go (NVFP4)~18–19 Go1 MMoE hybride Mamba-2 + attention; licence OpenMDW-1.1; vitesse annoncée jusqu'à ×4 à taille comparable (fournisseur, à tester)S120–S121
Qwen3-30B-A3B (historique)30 B / 3,3 BQ4_K_M~18 Go~19–20 Go256 kRemplacé par Qwen3.6-35B-A3BS96
gpt-oss-120b116,8 B / 5,1 B (128 exp.)MXFP4 natif~63 Go~64 Go128 kVise 64 Go RAM; ~40 tok/s grâce au MoE (à tester)S100, S110

3.3 Raisonnement

ModèleParamsQuant.Mémoire ~Cible matérielNoteSource
DeepSeek-R1-Distill-Qwen 1.5B1,5 BQ4_K_M~1,5–2 GoPi5 4 Go / CPU 8 GoRaisonnement compact, sorties longuesS103
DeepSeek-R1-Distill-Qwen 7B7 BQ4_K_M~6 GoGPU 8 Go / CPU 16 GoBon compromis raisonnement localS103
DeepSeek-R1-Distill-Qwen 14B14 BQ4_K_M~10–11 GoGPU 12–16 GoRaisonnement soutenuS103
Qwen3 (mode thinking)4–32 BQ4_K_Mselon tailletous paliersRaisonnement activable par balise; coûte des jetonsS96
gpt-oss-20b20,9 B / 3,6 BMXFP4~13–14 GoGPU 16 Go / CPU 16 Go+Raisonnement fort pour la tailleS100
Attention: les modèles de raisonnement génèrent de longues chaînes; le cache KV et le coût en temps montent vite. Bornez le contexte de sortie.

3.4 Code

ModèleParams (actifs)Quant.Mémoire ~ContexteRepère perf.LicenceSource
Qwen2.5-Coder 7B7 BQ4_K_M~6 Go32–128 kSolide complétion/éditionApache 2.0S96
Qwen2.5-Coder 14B14 BQ4_K_M~10–11 Go32–128 kFort sur 12–16 Go VRAMApache 2.0S96
Devstral 24B24 B denseQ4_K_M~14 Go128 k46,8 % SWE-Bench Verified (agentique) [S108]Apache 2.0S99, S108
Qwen3-Coder 30B30 B / 3,3 B (MoE)Q4_K_M~19 Go256 kMeilleur rapport qualité/Go sur 24–32 Go [S108]Apache 2.0S96, S108
North Mini Code 1.0 (Cohere)30 B / 3 B (MoE, 128 experts, 8 activés)w4a16~18–20 Go256 k natif, sortie ≤64 kConçu pour l'ingénierie logicielle agentique et le terminal; ⚠️ vitesse à testerApache 2.0S149–S150

Devstral 24B est text-only, dense, tient en 14 Go et cible un RTX 4090 (24 Go) ou un Mac 32 Go; sur 12 Go il passe par offload (~18 tok/s, à tester). Qwen3-Coder-30B (MoE) reste rapide en offload et gère un très grand contexte [S108].

North Mini Code 1.0 — la nouveauté de cette section, et ses conditions réelles [S149–S150]. Publié le 9 juin 2026 par Cohere sous Apache 2.0 (usage commercial, affinage et redistribution permis). Trois raisons d'y regarder pour un poste 24 Go:

⚠️ Deux réserves à ne pas ignorer. (1) Sur une carte 24 Go, le w4a16 laisse 4–6 Go pour le cache KV — c'est peu. (2) L'attention entrelace une fenêtre glissante de 4096 jetons avec une attention globale périodique, ce qui alourdit le cache KV en long contexte. [Déduction] Les 256 k annoncés sont une capacité du modèle, pas une promesse de tenue sur 24 Go. Traitez ce chiffre comme le contexte maximal théorique et mesurez votre contexte réellement soutenable avant de bâtir un agent dessus: c'est exactement le cas de figure où le modèle « rentre » au chargement puis sature en cours de session. En BF16 non quantifié, comptez ~54–66 Go — hors de portée d'un poste grand public.

3.5 Vision (multimodal)

ModèleParamsQuant.Mémoire ~CibleNoteSource
Moondream / MiniCPM-V (tiny)~2–3 BQ4_K_M~2–4 GoPi5 (serré) / CPU 8 GoLégende, OCR simpleS94
Qwen3-VL 2B2 BQ4_K_M~3–4 GoCPU 8 Go / GPU 8 GoVision compacte, Apache 2.0S96
Gemma 4 E2B / E4B2,3 / 4,5 B eff.Q4_K_M~2–5 GoPi 5 (E2B, serré) / CPU 8 GoTexte + image + audio; Apache 2.0S126
Gemma 4 12B12 BQ4_K_M~8–9 GoGPU 12 Go / Mac 16 GoTexte + image + audio; bon FRS126
Gemma 4 26B-A4B / 31B26 (3,8 actifs) / 31 BQ4_K_M~16 / ~20 GoGPU 16–24 GoVision + FR/NL forts, contexte 256 kS126
Muse Glimmer 30B~29,6 B + vision 1,8 B4 bits~20 GoGPU 24 Go / Mac 32 GoTexte et image entrelacés sur 131 kS117–S118
Qwen3.6-35B-A3B35 B / 3 B actifsQ4_K_M~23 GoGPU 24 Go / Mac 32 GoTexte, image et vidéoS127
Qwen2.5-VL 7B7 BQ4_K_M~6–7 GoGPU 8–12 GoVision documentaire solideS96
Gemma 3 4B / 12B / 27B (historique)4 / 12 / 27 BQ4_K_M~5 / ~9 / ~17 GoGPU 8–24 GoRemplacés par Gemma 4S97

3.6 Embeddings (RAG local)

ModèleParamsDim.Mémoire ~AtoutsSource
nomic-embed-text-v2~0,5 B768<1 GoRapide, démarrage à froid court, documents longsS106
EmbeddingGemma (300M)0,3 Bconfigurable<1 GoLéger, multilingue, on-deviceS107
bge-m3~0,6 B1024~1–2 GoMultilingue, dense + sparse + ColBERT (hybride)S105
Qwen3-Embedding 0.6B / 4B / 8B0,6–8 Bflexible (MRL)~1 à ~7 GoQualité de récupération au sommet; 32 k contexteS104

Pour un RAG FR/NL, privilégier bge-m3 (hybride multilingue) ou Qwen3-Embedding (qualité, dimensions flexibles). nomic/EmbeddingGemma pour l'empreinte minimale sur petit matériel.

3.7 Garde-fous locaux (nouveau — août 2026)

Un modèle local n'a aucun filtre côté fournisseur: si vous exposez un modèle non aligné à des utilisateurs, à des documents non fiables ou à une boucle agentique, le garde-fou est à vous. Une nouveauté d'août rend cela accessible sur du matériel grand public.

ModèleParamsRôleMémoire ~LicenceNoteSource
Shieldstral 1.0 (Mistral)3 BClassification de sûreté texte + imageUn seul GPU 16 Go en précision native; ~1,7 Go en Q4Apache 2.0Base Ministral-3B + encodeur vision Pixtral. La politique de modération s'écrit en langage naturel au moment de l'inférence, au lieu d'une taxonomie figée à l'entraînement: un seul passage avant renvoie un score calibré. Le fournisseur annonce 84,9 % de F1 moyen en sûreté texte (à parité avec un modèle 7× plus gros) et 83,8 % en multimodal — mesures fournisseur, non répliquées indépendammentS122–S123
Granite 4.1 Guardian (IBM)selon varianteModèle de sûreté de la famille Granite 4.1Selon varianteOuverte selon composantFait partie d'une famille de 10 modèles (3B/8B/30B, variantes FP8, VLM documentaire, ASR multilingue)S129

Usage recommandé: placer le classificateur devant et derrière le modèle génératif (entrée utilisateur, puis sortie), avec une politique écrite pour votre cas d'usage — et la tester sur des exemples FR et NL réels, car un score agrégé anglophone ne dit rien de la qualité en néerlandais.

3.8 Agents locaux (nouveau — août 2026)

Trois modèles visent explicitement l'agent qui tourne sur votre machine, un usage jusque-là mal servi en local. Ils ne visent pas le même agent — ne les mettez pas en concurrence directe:

Rappel de prudence: un agent local qui exécute des commandes ou modifie des fichiers présente exactement les mêmes risques qu'un agent cloud. Sandbox, liste blanche de commandes, plafond d'itérations et revue humaine restent obligatoires — l'incident Hugging Face de juillet, causé par un modèle échappé de son bac à sable pendant une évaluation, en est l'illustration la plus directe [S135–S136].

4. Modèles à éviter selon le matériel

5. Marges mémoire — récapitulatif

CiblePoids Q4_K_M ~+ KV + overhead (contexte modéré)Mémoire libre conseillée
1–3 B0,8–1,9 Go+1–2 Go4 Go
7–8 B~4,7 Go+2–3 Go8 Go
12–14 B7–9 Go+2–3 Go12–16 Go
24–32 B14–18 Go+3–5 Go24 Go
70 B dense~40 Go+6–10 Go48–64 Go
120 B MoE (MXFP4)~63 Go+2–4 Go (peu d'actifs)64–72 Go

6. Procédure courte de validation locale

À faire avant de déclarer un modèle utilisable sur votre machine. Commandes stables et sûres uniquement.

  1. Installer un moteur. Le plus simple: Ollama (multi-OS, gère le placement GPU/CPU automatiquement) ou LM Studio (interface). Pour Apple Silicon, MLX offre les meilleures vitesses. Pour le service multi-utilisateur, vLLM.
  2. Tirer un modèle à sa taille. Exemple Ollama:
   ollama run gemma4:12b

(Remplacez par le tag exact voulu; vérifiez la quantification par défaut du tag, qui varie d'un registre à l'autre, ainsi que la date de publication du tag — un nom de famille populaire continue souvent de pointer vers une génération précédente.)

  1. Mesurer la mémoire réelle. Pendant l'inférence, surveillez RAM/VRAM (Gestionnaire des tâches, nvidia-smi, htop, ou l'onglet ressources de LM Studio). Confirmez qu'il reste 10–20 % de libre.
  2. Mesurer la vitesse. Notez les tokens/s affichés (Ollama: --verbose; LM Studio: panneau stats). Comparez tout-GPU vs offload.
  3. Tester le contexte visé. Chargez un prompt long représentatif; vérifiez que le KV ne fait pas déborder la mémoire ni chuter la vitesse.
  4. Tester FR et NL sur vos tâches réelles: qualité, format, refus appropriés. Un bon score anglais ne garantit pas le néerlandais.
  5. Décider : garder la config si mémoire libre OK, vitesse acceptable (≥ ~8–10 tok/s pour l'interactif) et qualité FR/NL suffisante; sinon descendre d'un palier de taille ou monter d'un cran de quantification vers le bas.

7. Compromis quantification ↔ qualité ↔ vitesse ↔ contexte

8. Sécurité et confidentialité en local

L'exécution locale supprime l'envoi de données au cloud, mais pas tous les risques:

9. Limites de ce guide

Sources

Registre complet et dates: sources.md. Les empreintes mémoire s'appuient en priorité sur les cartes de modèles et documentations officielles (S94–S107, S126–S127); les nouveautés d'août sont documentées en S117–S123 et S129; les vitesses et classements proviennent de bancs indépendants clairement identifiés (S108–S110) et sont marqués « à tester ». Les affirmations fournisseur sont signalées comme telles et séparées des mesures indépendantes.