Synthèse décisionnelle — contrôle du 23 août 2026
Une zone européenne est désormais désignable par son nom sur l’API directe d’OpenAI ; sur celle d’Anthropic, aucune ne l’est. Le paquetopenai3.3.1, téléchargé depuis PyPI puis décompressé pour lire le code réellement distribué, définitDataResidencycomme exactement quatre littéraux —"global","us","eu","ae"— associés à quatre URL de base, donthttps://eu.api.openai.com/v1. Le paramètredata_residencys’écrit au constructeur du client et refuse toute valeur hors liste. Le SDK TypeScript porte la même table dans un artefact distinct : trois vérifications indépendantes et concordantes. La capacité vient de la 3.3.0 du 18 août, dont le journal de version annonçait « support named data-residency endpoints » sans publier la liste — la lacune est refermée. Contre-vérifié le même jour sur la documentation d’Anthropic, ouverte directement :inference_geose limite à « global » et « us » (1,1× sur « us », Claude 4.6 et ultérieurs), la page énonçant elle-même en limitation courante que seules ces deux valeurs existent et que « us » est le seul geo d’espace de travail, donc le seul lieu de stockage au repos. Pour qui cherche une inférence servie depuis l’EEE sur une API directe, OpenAI expose un chemin nommé et Anthropic aucun. Réserve décisive : l’artefact prouve que l’endpoint existe et est sélectionnable, non que votre compte y est éligible, ni ce que la résidence couvre — inférence seule, ou aussi stockage et journaux.openai.cométant refusé, ces deux points restent non publiés : capacité technique établie, garantie contractuelle non établie. Deux autres faits sortent du même canal : l’arrêt de l’API Sora au 24 septembre 2026 — dans un mois exactement — est désormais un message de dépréciation compilé dans le client distribué, et non plus une convergence de presse ; et le palierultrafastest contrôlé à l’accès et limité àgpt-5.6-sol, l’énumérationServiceTiervalantauto,default,flex,scale,priority,fast,ultrafast.
⚠️ Niveau de preuve. La politique réseau sortante bloque la majorité des sites éditeurs et la totalité des six points d’entrée de veille quotidienne : sur les 55 sources du référentiel retestées une à une ce jour, 6 répondent pleinement, 2 partiellement et 47 sont refusées. Treizième contrôle consécutif au même profil : c’est une limite structurelle de l’environnement, pas un incident, et elle appelle une décision humaine — élargir la liste d’autorisation de sortie réseau. En contrepartie, ce contrôle a ouvert un canal de preuve de premier rang : l’inspection du code réellement distribué par les registres de paquets restés ouverts, qui a permis d’établir en source primaire durable trois faits jusque-là incomplets ou seulement convergents. Rien n’a été retenu depuis une source secondaire ce jour. Revérifiez prix, régions et conditions avant tout engagement contractuel ou budgétaire.
Les 11 choses à faire ce mois-ci
- Si vous cherchez une inférence européenne sur une API directe, le choix se réduit aujourd’hui à un fournisseur. Sur OpenAI, la zone se désigne par son nom depuis le code :
OpenAI(data_residency="eu")visehttps://eu.api.openai.com/v1, sans URL codée en dur — donc relisible en revue de code et vérifiable en test, au lieu d’être enfoui dans une variable d’environnement. Les quatre valeurs admises sontglobal,us,eu,ae; toute autre lève une erreur. Sur Anthropic, aucune valeur européenne n’existe, et le stockage au repos reste tenu aux États-Unis. Avant d’en tirer une architecture, exigez du fournisseur deux réponses écrites que le code ne donne pas : votre compte est-il éligible, et la résidence couvre-t-elle l’inférence seule ou aussi le stockage et les journaux ? Sans ces deux réponses, vous avez une capacité technique, pas une garantie [S222, S225]. - Borner les domaines que vos agents ont le droit d’atteindre, avant de leur confier un document client. L’entrée du 19 août ouvre
allowed_domainsetblocked_domainssur l’entrée de l’outil dans le tableauconfigsdeagent_toolset_20260401:web_searchetweb_fetchne peuvent plus sortir de ce que vous listez. C’est le premier garde-fou publié contre le mode d’attaque le plus courant sur un agent lecteur — une instruction cachée dans un document que vous n’avez pas écrit, qui pousse l’agent à récupérer une URL contrôlée par l’attaquant en y emportant ce qu’il vient de lire. Une liste blanche limitée aux sources métier ne supprime pas ce risque, elle en réduit la surface.max_content_tokensplafonne au passage le volume rapatrié par récupération, donc le coût par appel: c’est un garde-fou budgétaire autant qu’un garde-fou de sécurité. À lire en sens inverse,user_locationsurweb_searchaméliore la pertinence des résultats en français et en néerlandais mais transmet une indication de localisation au service de recherche — à consigner si vous tenez un registre de traitement. Ce qui n’est pas établi: la priorité entre liste blanche et liste noire, le comportement d’une liste vide et le traitement d’une redirection hors périmètre. Testez plutôt que de présumer [S213, S215]. - Retirer les en-têtes bêta
files-api-2025-04-14etskills-2025-10-02, en vérifiant votre pagination. Les deux API sont en disponibilité générale depuis le 19 août. Retirer l’en-tête n’est pas cosmétique: c’est la condition d’accès au format GA. Sans en-tête, la liste de fichiers pagine parpageetnext_pageet accepte un filtreids[]qui interroge jusqu’à cent identifiants en une seule requête — au lieu de balayer toute la liste —, et un objet fichier rendexpires_atexplicitement plutôt que de l’omettre, ce qui permet enfin de piloter une politique de rétention côté client. Avec l’en-tête, la requête continue de fonctionner mais reste sur l’ancien format: elle pagine parbefore_id/after_idet rejettepageetids[]comme champs inconnus. Le SDK et la CLI ajoutent l’en-tête automatiquement sur les appelsbeta.files: c’est là qu’il faut regarder avant de conclure que la bascule est faite. Quotas publiés: 1 To de stockage par organisation, 500 requêtes par minute. Réserve: la disponibilité générale porte sur l’API Claude de premier rang; sur Claude Platform on AWS et sur Microsoft Foundry, la page de compatibilité marque encore l’API Files en bêta, et Foundry exige un déploiement « Hosted on Anthropic » [S213, S214]. - Passer Claude Code en 2.1.239, et au strict minimum en 2.1.236 pour le correctif de bac à sable. La 2.1.239 (21 août, 17:18 UTC) corrige un défaut à effet de facturation direct : derrière un mandataire qui retire l’en-tête
Content-Typede la réponse, le flux Bedrock était silencieusement rejoué hors flux à chaque tour, ce qui doublait le nombre d’appels d’API facturés — un profil courant en sortie d’entreprise filtrée. La même version fait apparaître la prime 1,1× d’inférence américaine dans/cost, la ligne d’état et--max-budget-usd, et ajoute/claude-api upgradepour migrer les projets Python deanthropic0.x vers 1.x. La version du 19 août à 18:45 UTC corrige la précédence des règles de refus de lecture à motif générique dans le bac à sable macOS: une règle du type**/.envl’emporte désormais à l’intérieur d’une région de lecture autorisée, couvre le contenu des répertoires qu’elle désigne, et ne peut plus être contournée en renommant le fichier refusé. La lecture qui s’impose est inconfortable et doit être dite: si vous vous appuyiez sur une telle règle pour tenir des identifiants de client hors de portée d’un agent, la protection n’était pas complète avant cette version. Relisez vos règles plutôt que de les présumer bonnes. Dans le même esprit, les règles d’autorisation deMonitorsont désormais mises de côté tant que le mode automatique est actif, de sorte que les commandesMonitorsont examinées comme des commandes Bash, et le contrôle d’état git ne peut plus être trompé par un réglagestatus.showUntrackedFiles=no. La 2.1.237, du même jour à 23:57 UTC, corrige l’invalidation du cache de prompt pour les sessions qui passent par une passerelle LLM ou une URL de base personnalisée — effet de coût direct si vous facturez par un point d’entrée européen, une invalidation se payant en jetons d’entrée plein tarif. L’étiquettestabledu registre npm est en 2.1.228, neuf versions en retrait delatest: qui épinglestablen’a pas le correctif de bac à sable [S210]. - Passer en revue aujourd’hui vos appels aux points de terminaison retirés. Trois API expérimentales d’Anthropic —
/v1/experimental/generate_prompt,/v1/experimental/improve_prompt,/v1/experimental/templatize_prompt— sont retirées au 17 août 2026 et renvoient une erreur après retrait; les prompts, révisions et évaluations stockés dans le Workbench hérité et non exportés ne sont plus accessibles. Le même jour, Google arrêteimagen-4.0-generate-001,imagen-4.0-fast-generate-001etimagen-4.0-ultra-generate-001sur l’API Gemini. Ces deux échéances ne laissent aucune période de grâce: un appel qui fonctionnait hier échoue aujourd’hui [S203, S152]. - Recalculer le coût DeepSeek avant de relancer un traitement. Depuis le 16 août à 16:00 UTC, une grille à deux niveaux remplace le tarif unique, fenêtres pleines de 01:00–04:00 et 06:00–10:00 UTC. Le tarif creux est lui-même au-dessus de l’ancien tarif unique dans toutes les catégories: la lecture de cache est multipliée par environ 6 en heures creuses et 12 en heures pleines, la sortie en heures pleines par environ 4,55. En heure d’été de Bruxelles, les fenêtres pleines couvrent 03:00–06:00 et 08:00–12:00: la matinée de travail belge est intégralement au tarif fort, sans échappatoire pour une charge interactive. Un traitement par lots décalé à l’après-midi ou à la nuit belge coûte moitié moins [S206].
- Corriger le tokeniseur avant de comparer deux générations de modèles Claude. La page tarifaire officielle précise que les modèles 4.7 et suivants produisent environ 30 % de jetons en plus pour le même texte, Sonnet 4.6 et antérieurs conservant le tokeniseur précédent. [Déduction] Sur ce seul effet, Sonnet 5 à 2 USD/M en entrée revient à environ 2,60 USD/M au texte comparable face à Sonnet 4.6 à 3 USD/M: l’écart réel est de l’ordre de 13 %, et non des 33 % que suggère la grille. L’éditeur publie un ordre de grandeur et non un facteur exact, et aucune mesure indépendante ne le reproduit: mesurez sur votre propre charge plutôt que d’appliquer un coefficient [S204].
- Tester la montée du SDK Python OpenAI en 3.x avant de la déployer. La 3.0.0 (12 août) fait de HTTPX2 le client HTTP par défaut et n’installe plus
httpx. Ce qui casse en premier n’est pas votre code applicatif mais votre plomberie: mandataire d’entreprise, paquet de certificats, transport personnalisé. Épinglez, testez, puis montez [S195]. - Porter l’arrêt de l’API Videos d’OpenAI au 24 septembre 2026 dans votre calendrier. La dépréciation est inscrite dans les types du SDK officiel depuis le 14 août; l’échéance elle-même est établie par convergence, la page officielle des dépréciations étant inaccessible. À un peu plus d’un mois, la migration doit être engagée maintenant [S195, S201].
- Inventorier les modèles épinglés dans les flux GitHub Copilot. Claude Sonnet 3.7, Sonnet 3.7 Thinking, Claude Opus 4 et Gemini 2.0 Flash quittent toutes les surfaces Copilot le 1er septembre 2026, MAI-Code-1-Flash le 10 septembre. Tout script ou politique d’entreprise épinglant un de ces identifiants casse à cette date [S167]. Les crédits promotionnels Business et Enterprise (+30 et +70 USD/mois) expirent fin août: à usage constant, la facture de septembre monte [S137].
- Inscrire au calendrier la fin de promotion de Gemini 3.7 Flash. Le tarif de 0,75/3,75 USD/M vaut jusqu’au 31 décembre 2026, puis passe à 1,50/7,50 — un doublement. Si vous basculez un volume significatif sur ce modèle, posez dès maintenant l’échéance de réévaluation au 1er décembre 2026 [S176–S178].
Verdict en une minute
Il n’existe pas un « meilleur LLM » unique. Pour un résident belge, le choix dépend surtout de la surface achetée: application grand public, API, plateforme cloud, assistant de code ou agent. Le trio le plus polyvalent reste OpenAI, Anthropic et Google. Mistral est le choix européen le plus crédible. AWS, Microsoft et IBM dominent les besoins de gouvernance et d’intégration d’entreprise. GitHub Copilot et Cursor sont les comparaisons prioritaires pour le code. Perplexity se distingue pour la recherche sourcée. Les modèles open weight de Meta, Mistral, NVIDIA, Qwen, DeepSeek, Kimi et GLM réduisent le verrouillage, mais transfèrent la sécurité et l’exploitation à l’utilisateur.
Recommandations par profil
| Profil belge | Premier choix | Alternative | Pourquoi | Vigilance |
|---|---|---|---|---|
| Particulier polyvalent FR/NL | ChatGPT ou Gemini | Mistral Vibe | Multimodal, recherche, mémoire, écosystème | Prix au checkout, taxes locales, entraînement des données grand public |
| Recherche web sourcée | Perplexity | Gemini / ChatGPT recherche | Citations et recherche intégrées | Vérifier les sources primaires, éviter l’automatisation aveugle |
| Développeur indépendant | OpenAI ou Anthropic API | Gemini / Mistral | SDK matures, outils, sorties structurées | Budgets, snapshots, rétention, clés côté serveur |
| Développement quotidien | GitHub Copilot | Cursor | IDE, agent, revue et choix de modèles | Crédits variables, confidentialité du dépôt |
| Agent de code autonome | Claude Code / Codex | Cursor / Kimi Code | Boucles longues, terminal, outils | Exécuter en sandbox, revue humaine, plafond de coût; clôture SpaceX↔Cursor attendue fin août |
| PME Microsoft 365 | Microsoft 365 Copilot + Azure | GitHub Copilot | Identité, Office, gouvernance et agents | Licences imbriquées, prix B2B affichés hors taxes |
| Production UE sensible | Mistral endpoint UE (×1,1) ou cloud avec région UE | IBM / AWS / Azure / Google Cloud | DPA, région, contrôles et déploiement privé; SLA 99,5 % disponible en Priority Tier (×1,75, préversion) | Transferts encadrés vers sous-traitants possibles hors région: exiger la liste |
| Open weight / sur site | Muse Glimmer, Mistral, Nemotron 3.5 Lightning | Qwen3.6, Gemma 4, Granite 4.1, North Mini Code, Kimi, GLM, DeepSeek | Contrôle et portabilité; licences majoritairement Apache 2.0 désormais | Licence exacte, sécurité, capacité GPU, évaluation locale |
| Exécution 100 % locale | Gemma 4, Qwen3.6 (selon RAM/VRAM) | gpt-oss, Gemma 4 26B-A4B, Qwen3.6-35B-A3B (MoE) | Données privées, hors ligne, coût nul par jeton | Mémoire disponible, vitesse, FR/NL à tester — voir guide local |
| Agent tournant en local | Muse Glimmer 30B (24 Go VRAM) | Nemotron 3.5 Lightning 30B-A3B | Outils, reprise sur échec, 131 k de contexte, Apache 2.0 | Sandbox et plafond d’itérations obligatoires, comme pour un agent cloud |
| Agent de code en local | North Mini Code 1.0 30B-A3B (w4a16, ~18–20 Go) | Muse Glimmer 30B, Qwen3.6-35B-A3B | Apache 2.0, 256 k de contexte, 3 B actifs seulement, image Ollama disponible | Cache KV lourd en long contexte (attention glissante 4096 + globale périodique): tester à contexte réel |
| Modération / garde-fou local | Shieldstral 1.0 3B | Granite 4.1 Guardian | Politique en langage naturel à l’inférence; un GPU 16 Go suffit | Scores annoncés par le fournisseur; tester sur FR et NL réels |
État vérifié par écosystème
État courant au 17 août 2026. Cette section décrit ce qui est vrai à la date du contrôle, sans historique : l’historique est tenu par Git.
Échéances atteintes aujourd’hui
- Anthropic retire le Workbench hérité et trois API expérimentales —
/v1/experimental/generate_prompt,/v1/experimental/improve_promptet/v1/experimental/templatize_prompt— au 17 août 2026. Les appels renvoient une erreur après retrait. Le Workbench mis à jour ne prend en charge ni prompts enregistrés, ni variables, ni évaluations, et les données non exportées ne sont plus accessibles. Établi en source primaire durable [S203]. - Google arrête trois endpoints Imagen 4 sur l’API Gemini le même jour:
imagen-4.0-generate-001,imagen-4.0-fast-generate-001etimagen-4.0-ultra-generate-001. Le remplacementgemini-3.1-flash-imageimpose une réécriture de l’appel,generate_images()cédant la place àgenerate_content(). Sur Vertex AI, ces identifiants relevaient d’une échéance antérieure au 30 juin 2026. Établi par convergence, domaines Google refusés [S152].
Prix et facturation
- Le tokeniseur d’Anthropic rompt la comparabilité des grilles entre générations. Les modèles Claude 4.7 et suivants produisent environ 30 % de jetons en plus pour le même texte; Sonnet 4.6 et antérieurs conservent le tokeniseur précédent. [Déduction] Sonnet 5 à 2 USD/M revient à ~2,60 USD/M au texte comparable face à Sonnet 4.6 à 3 USD/M — un écart réel d’environ 13 %, non 33 %. Valeur publiée comme ordre de grandeur, non reproduite indépendamment: à mesurer sur charge réelle. Source primaire durable, énoncée à deux emplacements officiels distincts [S204].
- DeepSeek facture en heures pleines et heures creuses depuis le 16 août 16:00 UTC. Fenêtres pleines 01:00–04:00 et 06:00–10:00 UTC. Le tarif creux dépasse l’ancien tarif unique dans les six postes: la lecture de cache est multipliée par ~6 en heures creuses et ~12 en heures pleines, la sortie en heures pleines par ~4,55. [Déduction] C’est une hausse générale assortie d’une modulation horaire, énoncée dans le vocabulaire de la remise. En heure d’été de Bruxelles, la matinée de travail 08:00–12:00 est intégralement en heures pleines; une charge par lots décalée à l’après-midi ou à la nuit belge coûte moitié moins. Convergence de quatre sources, domaines éditeur refusés, note plafonnée [S206].
Cycle de vie et hébergement
- Claude Mythos Preview est déprécié, migration vers
claude-mythos-5. Les planchers de retrait des modèles actifs sont publiés: aucun modèle Claude actif ne peut être retiré avant le 29 septembre 2026, avec un préavis annoncé d’au moins 60 jours. Ces dates ne valent que pour les plateformes opérées par Anthropic — Bedrock et Google Cloud fixent les leurs, ce qui compte pour un projet européen dont la résidence passe par un cloud partenaire. Source primaire durable [S203]. - Anthropic loue 191 MW à Riot Platforms sur vingt ans, à Rockdale au Texas, pour ~9,1 milliards USD et jusqu’à ~16,1 milliards avec prolongations; ~96 MW fin 2027, 191 MW fin juin 2028. Aucun effet sur les régions ou la résidence offertes depuis la Belgique, et aucune capacité européenne annoncée. Convergence de presse financière de référence [S207].
Sécurité et permissions du poste de développement
- Anthropic — Claude Code démarre en mode automatique sur Pro, Max et Team depuis le 14 août. Un classificateur arbitre les actions à votre place au lieu de vous interrompre. Planchers de version pour que ce défaut s’applique: 2.1.228 sur macOS, Linux et WSL, 2.1.233 sur Windows natif; en deçà, le mode de départ reste Manuel. Un
permissions.defaultModeque vous avez posé n’est pas écrasé: Claude Code demande une fois s’il faut basculer, un refus conserve votre réglage; les défauts gérés par une organisation ne bougent pas. Non concernés: Enterprise, l’API Claude, Claude Platform on AWS, Amazon Bedrock, Google Cloud Agent Platform et Microsoft Foundry. Le classificateur est un modèle, pas une politique: il réduit les demandes d’autorisation, seules les règles de refus explicites contraignent. Source primaire ouverte directement, corroborée par le registre npm [S191–S192]. - Anthropic — cinq correctifs de sécurité Claude Code les 13 et 14 août. 2.1.233: fuite d’identifiants NTLM sous Windows par les chemins à préfixe de périphérique. 2.1.232: contournement de permissions PowerShell par paramètres écrivant des variables, contournement par liens symboliques de style Cygwin, héritage de la confiance du dépôt parent par les dépôts git imbriqués, plus la rédaction des jetons GitLab. Réserve de méthode: aucun bulletin de sécurité formel, aucun identifiant CVE — la plage de versions vulnérables et l’exploitabilité ne sont pas publiées, et aucun scanner de vulnérabilités ne peut suivre ces correctifs automatiquement. Trois des cinq ne concernent que Windows [S193].
- OpenAI — le SDK Python passe en 3.0.0 avec une rupture explicite (12 août): HTTPX2 par défaut,
httpxplus installé automatiquement, migration obligatoire des clients, transports et objets de configuration personnalisés, ou recours à une échappatoire héritée que l’éditeur décrit comme temporaire, sans date de retrait publiée. La 3.1.0 (14 août) ajoute les identifiants de flux WebSocket, le palier Ultrafast avec erreurs MCP et WebSocket structurées, et déprécie les API vidéo Sora [S195].
Confidentialité et gouvernance
- Anthropic — la Compliance API couvre les transcriptions de sessions Cowork et Claude Code. Les points de terminaison de sessions renvoient un enregistrement consolidé — invites, réponses, activité d’outils — pour les sessions locales exécutées sur les machines des utilisateurs connectés avec un compte Claude Enterprise, et pour les sessions Cowork distantes lancées depuis le web ou le mobile. Compliance Access Key requise, limite partagée de 600 requêtes par minute par organisation parente. Ce que cela veut dire concrètement: ce qu’un développeur tape dans une session Claude Code sur son poste devient récupérable côté serveur par son organisation. Cela sert un besoin réel d’audit, et déplace la frontière de ce qui est consultable par l’employeur: information des travailleurs et analyse d’impact s’imposent. Statut de bêta et exclusions rapportées à confirmer. Sans effet sur les formules individuelles Pro et Max [S194].
- Anthropic — environnements auto-hébergés de Claude Code en bêta publique sur Team et Enterprise: une session lancée depuis le web, le mobile, le bureau, le terminal ou une routine s’exécute dans le réseau de l’organisation, dépôts, artefacts et secrets compris. Distinction déterminante: l’auto-hébergement porte sur l’exécution, pas sur l’inférence. Le modèle reste appelé chez Anthropic ou chez le cloud partenaire configuré, et c’est l’inférence qui détermine la localisation du traitement. Ne présentez pas cette option comme une souveraineté de bout en bout [S192–S193].
Modèles et tarifs de la semaine
- Google — Gemini 3.7 Flash (13 août). Modèle de travail pour le code et les agents, raffinement de 3.6 Flash sur le cœur de raisonnement et non nouveau préentraînement. 1 M de contexte, 64 k de sortie, coupure de connaissances mars 2026. Tarif 0,75/3,75 USD/M — environ 0,65/3,25 EUR — jusqu’au 31 décembre 2026, puis 1,50/7,50 USD/M. [Déduction] Un prix d’appel qui double à date connue n’est pas une baisse de prix : c’est une remise à durée déterminée. Elle mérite d’être prise, avec l’échéance inscrite au calendrier. Résidence UE non confirmée pour cette version [S176–S178].
- Z.ai — GLM-5.3 (14 août). Même base MoE 743 B que GLM-5.2, gains obtenus par post-entraînement seul. Annoncé par son éditeur comme le meilleur modèle de code à poids ouverts qu’il ait mesuré, sur un banc interne : mesure fournisseur, non reproduite indépendamment, non comparable aux scores d’autres éditeurs. Les poids ne sont pas publiés, annoncés sous environ deux semaines après évaluation de sûreté. Accès par abonnement GLM Coding Plan et ZCode. [Déduction] Retenir les poids en invoquant une évaluation de sûreté, après les avoir publiés immédiatement à la version précédente, est un changement de politique d’accès et pas un détail de calendrier : tant qu’ils ne sont pas parus, GLM-5.3 n’est pas une option d’auto-hébergement, et GLM-5.2 sous MIT reste le repli [S179–S181].
- DeepSeek — V4 Pro 0813 (13 août). Disponibilité générale, poids MIT publiés (~893 Go). MoE 1,6 T / 49 B actifs, contexte 1 M, sortie max 384 k. Tarifs relevés 0,435 USD/M en entrée hors cache, 0,003625 sur succès de cache, 0,87 USD/M en sortie. Aucune région UE annoncée pour l’API directe [S182–S183].
- Claude Sonnet 5 : 2/10 USD/M sur l’endpoint Global, mais 2,20/11,00 en région UE de Google Cloud. Sur l’API de premier rang, la hausse programmée au 1er septembre n’aura pas lieu — établi sur double source primaire ouverte directement, page tarifaire et notes de version de l’API — et l’endpoint Global vaut 2,00/10,00 USD/M. Sur la grille des modèles partenaires de Google Cloud, relue en source primaire le 21 août et récupérée deux fois, la section « Anthropic’s Claude models », intitulée « Models with regional pricing », publie deux tables des mêmes modèles : une table Global à 2,00/10,00 (batch 1,00/5,00, écriture de cache 5 min 2,50, 1 h 4,00, lecture 0,20) et une table régionale non globale à 2,20/11,00 — soit +10 % — couvrant EU Multi-Region et
europe-west1. Chaque table a deux colonnes de volume de contexte (« =< 200K input tokens » et « > 200K input tokens ») aux montants identiques ; la différence de prix est bien régionale. Le mot « September » n’apparaît pas dans la page. Servir Claude Sonnet 5 depuis une région UE de Vertex coûte donc 2,20/11,00 USD/M au lieu de 2,00/10,00 en Global. Réserve : la page ne porte pas de date de mise à jour, seul est établi l’état de la grille au 21 août [S158–S159, S208, S209]. - Anthropic — Claude Mythos 5.
claude-mythos-5existe en disponibilité limitée sur invitation, au sein de Project Glasswing, pour la cybersécurité défensive, aux caractéristiques et au tarif de Fable 5 (10/50 USD/M), sans inscription en libre-service. [Déduction] Un modèle listé dans une grille tarifaire publique n’est pas pour autant commandable : il ne compte pas parmi les options réellement disponibles depuis la Belgique [S174].
Disponibilité et incidents
- Interruption des services Claude du 14 août 20:00 au 15 août 00:11 UTC, soit 22:00 → 02:11 heure de Bruxelles, résolue. API Claude, Claude Code et Cowork touchés, erreurs élevées constatées notamment sur Fable 5. Aucune analyse post-incident publique trouvée [S184–S185]. [Déduction] Le créneau est nocturne côté belge, donc peu visible en usage interactif, mais il traverse les fenêtres de traitement par lots planifiées. C’est l’argument concret du basculement multi-fournisseurs pour tout service exposé à des utilisateurs.
Souveraineté et résidence
- Mistral vend la souveraineté comme un produit. Regional Endpoints en disponibilité générale : inférence au choix en Europe ou aux États-Unis, à 1,1× le tarif global. Priority Tier en préversion publique : limites de débit personnalisées et SLA de disponibilité 99,5 % — environ 3 h 39 d’indisponibilité tolérée par mois — à 1,75× le catalogue. Coalition européenne finançant 200 MW fin 2027 et 1 GW fin 2030 [S142–S144].
La réserve est essentielle. L’inférence a lieu dans la région choisie, sous réserve de transferts encadrés vers des sous-traitants pouvant se situer hors de cette région [S144]. « Région UE » ne signifie pas « aucune donnée ne quitte l’UE » : pour un registre de traitement, ce sont la liste des sous-traitants et le DPA qui font foi, pas le nom de l’endpoint. Le SLA est annoncé en préversion — à confirmer contractuellement. [Déduction] Mistral est à cette date le seul laboratoire européen à proposer à la fois le choix de région et un niveau de service engagé. Pour un projet belge bloqué sur la résidence, +10 % reste faible devant le coût d’un auto-hébergement.
- Agents managés Claude. Le paramètre
inference_geocommande la géographie d’inférence, à la création de l’agent ou par session ; aucune géographie UE n’est documentée pour l’API directe. S’y ajoutent un budget de session avec arrêtbudget_reached, un conseiller consultable en cours de tour, et la découverte automatique des compétences d’un dépôt GitHub monté. L’API de conformité couvre depuis le 11 août les transcriptions des sessions locales Cowork et Claude Code, en bêta Enterprise [S175]. Le budget borne la dépense aux tarifs publics : il ne garantit pas un coût. - Résidence dans les clouds partenaires. Dans Microsoft Foundry, les modèles Anthropic s’exécutent sur l’infrastructure d’Anthropic, pas dans la région Azure sélectionnée ; sur AWS Bedrock et sur Google Cloud Agent Platform (ex-Vertex AI) ils tournent en région UE du cloud. La grille tarifaire de Google Cloud, relue le 21 août, nomme une multi-région UE et europe-west1 pour les modèles Claude et les facture +10 % par rapport à l’endpoint Global (Sonnet 5 à 2,20/11,00 en région UE), mais ne documente ni l’inférence, ni le stockage, ni les journaux :
docs.cloud.google.comreste refusé. À vérifier modèle par modèle [S131, S208].
Modèles frontière et positionnement
- xAI — Grok 4.6. 500 k de contexte. Sous 200 k jetons : 2 USD/M en entrée, 0,50 en cache, 6 en sortie. À partir de 200 k : 4 / 1 / 12 — et la grille haute s’applique à tous les jetons de la requête, pas seulement au dépassement, ce qui double la facture d’une requête qui franchit le seuil. Variante rapide à 2×, aucune remise batch. Cache via
prompt_cache_key(Responses API) ou l’en-têtex-grok-conv-id(Chat Completions). Donné à parité avec GPT-5.6 Sol sur l’Artificial Analysis Intelligence Index, mesure tierce à traiter comme un indice de positionnement et non comme une preuve sur vos tâches [S139–S141].
Belgique : à confirmer. Grok 4.5 était confirmé dans la console API UE depuis le 17 juillet [S68] ; rien n’établit ce statut pour 4.6. Aucune résidence UE n’est annoncée, le DPA documentant un traitement en us-east-1 et us-west-2.
- OpenAI — GPT-5.6-Cyber. Dérivé de Sol entraîné pour la recherche de vulnérabilités, 12,50/75 USD/M (cache 1,25). Accès sur dossier uniquement, via le palier Daybreak Red : à considérer comme indisponible pour un particulier ou un développeur indépendant belge. Documenté parce qu’il fixe le prix de référence d’une classe de modèles à refus réduits, et confirme que ce segment se structure derrière des barrières d’accès plutôt que derrière des refus techniques [S145–S146].
- OpenAI — palier Ultrafast, désormais établi sur artefact distribué. L’énumération
ServiceTierdu paquetopenai3.3.1 vaut exactementauto,default,flex,scale,priority,fast,ultrafast. Le palierultrafastest contrôlé à l’accès et actuellement limité àgpt-5.6-sol; une réponse servie par lui porteservice_tier=ultrafast. Détail utile en lecture de facture :fastetpriorityrenvoient tous deuxservice_tier=priority— deux noms, une seule classe de service. Opéré sur matériel Cerebras : jusqu’à 750 jetons/s et jusqu’à 14× la vitesse du palier Standard, à intelligence déclarée identique. Aucun tarif, quota, région ni SLA publiés, et chiffres de vitesse fournisseur non reproduits : ne rien budgéter dessus [S168–S169, S224]. - Alibaba — Qwen3.8-Max. 2,4 T de paramètres MoE dont 95 B actifs, 1 M de contexte, entrée texte/image/vidéo, 2/6 USD/M. Les poids ouverts annoncés pour la semaine du 10 août ne sont toujours pas publiés et aucune licence n’est nommée : à traiter comme une promesse, pas comme un fait [S115–S116, S157].
- OpenAI — grille GPT-5.6. Sol 5/30, Terra 2/12, Luna 0,20/1,20 USD/M, tous à 1,05 M de contexte ; cache lu à −90 %, écritures explicites à 1,25×. La grille long contexte (Sol 10/45, Terra 4/18, Luna 0,40/1,80) fait presque doubler le coût réel sur les requêtes longues — ce que le prix de tête masque [S61–S62, S112, S124].
- Anthropic — Opus 5 à 5/25 USD/M, effort configurable, mode Fast à 2× ; Fable 5 reste le plafond général à 10/50 USD/M [S63–S64].
- Google — Gemini 3.6 Flash en GA à 1,50/7,50 USD/M, 1 M de contexte, 64 k de sortie et outils natifs ; 3.5 Flash-Lite vise le volume à 0,30/2,50 [S65]. Gemini Omni Flash est en préversion publique depuis le 30 juin.
Poids ouverts
- Alibaba — Qwen3.8-27B sous Apache 2.0 (14 août). Dense et non MoE, 27 milliards de paramètres, nativement multimodal en entrée texte, image et vidéo pour une sortie texte, 262 144 jetons de contexte natif, extension vers ~1 M par YaRN annoncée. La licence autorise usage commercial, modification et redistribution sans seuil de revenu: c’est le fait le plus directement exploitable de ce contrôle pour un usage local. Ordre de grandeur en quantification 4 bits: cible les configurations 24 Go de VRAM, déchargement partiel sur les cartes 12 Go. Tailles quantifiées, vitesses mesurées et qualité FR/NL non établies — n’engagez pas de déploiement local avant vérification [S197].
- Alibaba — Qwen3.8-Max sous licence propriétaire, pas sous Apache 2.0 (12 août, référence Qwen3.8-2.4T-A95B). Concession de style MIT, attribution obligatoire au-delà de 100 M d’utilisateurs actifs mensuels ou 20 M USD de revenu mensuel, licence payante pour les activités de modèle en tant que service ou d’assistant de travail au-delà de 50 M USD sur douze mois glissants, usage strictement interne exclu. Point de contrôle uniquement textuel, sans le contexte de 1 M du produit hébergé. À 2 400 milliards de paramètres, aucune portée d’auto-hébergement pour un particulier ou une PME: la nouveauté est contractuelle, pas opérationnelle. « Poids téléchargeables » n’est pas « licence libre », et la distinction doit figurer dans toute revue de conformité. Réserve: Hugging Face et ModelScope étant refusés, le fichier de licence n’a pas été lu à la source, et la clause générale du dépôt public de l’éditeur — « All our open-weight models are licensed under Apache 2.0 » — contredit cette licence, contradiction non résolue [S198–S199].
- Meta — Muse Glimmer, ~30 B dense sous Apache 2.0, conçu pour l’agent local sur matériel grand public : 131 k de contexte texte+image, plus de 100 langues, appels d’outils avec reprise sur échec, ≈19,3 Go en 4 bits. Une version ouverte de Muse Spark 1.2 est annoncée sans date ferme [S117–S119].
- NVIDIA — Nemotron 3.5 Lightning, 30 B MoE / 3 B actifs, 1 M de contexte, licence permissive OpenMDW-1.1, avec le routeur NeMo Switchyard [S120–S121].
- Cohere — North Mini Code 1.0, 30 B dont 3 B actifs (MoE), Apache 2.0, 256 k de contexte et jusqu’à 64 k de sortie, poids BF16, FP8 et w4a16, GGUF communautaires et image Ollama. Candidat sérieux pour un agent de code sur une seule carte 24 Go [S149–S150].
- Mistral — Shieldstral 1.0, classificateur de sûreté 3 B texte et image, Apache 2.0, tenant sur un GPU 16 Go, dont la politique de modération s’écrit en langage naturel au moment de l’inférence [S122–S123].
- IBM — Granite 4.1, famille de dix modèles (3B/8B/30B, variantes FP8, modèle de sûreté, VLM documentaire, ASR multilingue) [S129].
- DeepSeek — V4-Flash 0731, 284 B, 0,14 USD/M en entrée, Responses API native, adapté à Codex [S128].
- Lettre « Open Weights and American AI Leadership » (24 juillet, 25 signataires dont NVIDIA, Microsoft, Meta, IBM, Mistral, Hugging Face, Mozilla, la Linux Foundation). OpenAI, Anthropic et Google ne l’ont pas signée [S151]. [Déduction] La ligne de fracture n’oppose plus « ouvert » à « fermé » par idéologie : elle sépare ceux dont le modèle économique tolère les poids ouverts de ceux dont il repose sur l’accès exclusif.
Outillage, agents et plateformes
- Spécification MCP 2026-07-28, version courante et finale. Le cœur du protocole devient sans état ; DCR cède la place à CIMD ; Roots, Sampling et Logging sont dépréciés avec au moins douze mois de fonctionnement garanti [S153].
- Agent Plugins 1.0 empaquette compétences d’agent et serveurs MCP dans un greffon installable, publié avec AWS, Anysphere, Microsoft, OpenAI, Vercel et Google, disponible dans VS Code, Copilot CLI et l’application Copilot [S170].
- GitHub Copilot retire Claude Sonnet 3.7, Sonnet 3.7 Thinking, Claude Opus 4 et Gemini 2.0 Flash de toutes ses surfaces le 1er septembre 2026, MAI-Code-1-Flash le 10 septembre [S167]. Les crédits promotionnels Business et Enterprise expirent fin août 2026 [S137].
- Palier de service différé de Google Cloud : le tarif est désormais établi, la latence ne l’est pas. La grille relue en source primaire le 19 août publie une colonne Flex/Batch à 50 % du tarif Standard : Gemini 3.1 Pro Preview passe de 2,00/12,00 à 1,00/6,00 USD/M sous 200 k jetons d’entrée, Gemini 3.7 Flash de 0,75/3,75 à 0,375/1,875 USD/M. Latence contractuelle et liste des régions restent « non publié »,
docs.cloud.google.cométant refusé : la classe de service est arbitrable sur le prix, pas encore sur le délai [S196, S208]. - SDK et CLI officiels, versions prouvées sur les registres ouverts directement :
openai3.1.0,anthropic0.122.0,mistralai2.9.3,google-genai2.18.1 ;@anthropic-ai/claude-code2.1.233,@google/genai2.17.1,@openai/codex0.147.0,@modelcontextprotocol/sdk1.30.0. Un registre prouve la version et sa date, pas le contenu du changement [S188–S189]. [Déduction] À ce rythme de publication, épinglez les versions plutôt que de suivre la dernière en date. - AWS densifie AgentCore : Runtime Instances dédiées, recherche web sur Bedrock, et Dogwood, langage de gouvernance d’agents open-sourcé dont les politiques peuvent dépendre de l’historique des actions de la session [S130]. Bedrock Agents Classic est fermé aux nouveaux clients depuis le 30 juillet [S88–S89].
- Perplexity : Terra et Luna dans Computer, Terra par défaut pour tous les sous-agents [S154], au-dessus d’une couche d’orchestration multi-agents [S132].
- Cursor : Router arbitrant coût, équilibre et intelligence ; Privacy Mode interdit l’entraînement et s’appuie sur des accords de rétention zéro, sous réserve d’enquêtes d’abus [S42, S75]. L’acquisition d’Anysphere par SpaceX (60 Md USD) a vu ses procédures réglementaires finalisées le 12 août ; la clôture est attendue avant fin août et n’est pas actée à la date de ce contrôle [S147]. xAI et Anysphere restent deux entrées distinctes tant que la clôture n’est pas actée. Premier produit annoncé de la combinaison : Grok Bot, à partir de 120 USD/mois [S148].
- Publicité dans ChatGPT : annonces textuelles contextuelles en bas de réponse, signalées comme sponsorisées, aux offres Free et Go, dans six marchés — États-Unis, Royaume-Uni, Mexique, Brésil, Japon, Corée du Sud. La Belgique n’est dans aucune vague annoncée. Les annonceurs n’ont accès ni aux conversations, ni à l’historique, ni à la mémoire ; la sélection s’appuie en revanche sur le sujet de la conversation, les conversations passées et les interactions publicitaires antérieures. Plus, Pro, Business, Enterprise et Edu restent sans publicité.
- Hugging Face a publié une intrusion agentique et recommande la rotation préventive des jetons ; sa reconstruction technique confirme l’importance de l’isolation, des identités courtes et du blocage de l’accès aux métadonnées d’instance [S76–S77].
- Calendrier de dépréciation : trois endpoints Imagen 4 s’arrêtent le 17 août 2026 ; Gemini 2.5 Pro, Flash et Flash-Lite le 16 octobre 2026 [S114, S152]. GitHub Models est retiré depuis le 30 juillet [S73–S74]. Claude Opus 4.1 est retiré de l’API Claude.
Piste suivie, non publiée comme fait
- Anthropic–Decart : Bloomberg rapporte le 13 août des discussions en vue d’une acquisition d’environ 6 milliards USD, largement reprises par des titres indépendants et recontrôlées le 16 août — toutes décrivent des pourparlers à un stade précoce, sans accord signé, et aucune communication officielle des parties ni dépôt réglementaire n’existe trois jours plus tard. Reprises par Fortune et Yahoo Finance. Toutes les sources décrivent un stade précoce ; aucune communication officielle des parties. Des discussions rapportées ne sont pas une acquisition : à ne fonder ni architecture, ni contrat, ni budget dessus [S190].
Prix et Belgique
Taux de référence conservé: 1 EUR = 1,1554 USD (BCE, 5 août 2026) [S79]. Une cotation de marché relevée à 1,1536 le 14 août s’en écarte de 0,16 % — sous le seuil de matérialité, donc pas de recalcul en cascade — et n’a pas pu être confirmée comme taux de référence BCE, le domaine ecb.europa.eu étant bloqué. Donc 20 USD ≈ 17,31 EUR. Le checkout et la facture priment toujours.
Repère grand public pour la Belgique. Les abonnements de référence restent affichés autour de 20 USD/mois (ChatGPT Plus, Claude Pro, Google AI Pro ≈ 19,99 USD, Mistral Vibe Pro 14,99 USD). Ces montants sont des ordres de grandeur: seul le checkout belge fait foi, et il n’a pas pu être simulé lors de ce contrôle.
Les offres explicitement disponibles dans l’EEE incluent notamment Gemini API; OpenAI publie des contrôles de résidence européenne pour certains clients/services [S03, S11]. Pour DeepSeek, Qwen, Kimi et GLM, la disponibilité commerciale en Belgique, la facturation en euros et la localisation des données restent à confirmer avant usage de données personnelles ou confidentielles.
Capacités: ne pas confondre les produits
- Modèle: moteur probabiliste, par exemple GPT-5.6 Sol, Claude Opus 5 ou Gemini 3.7 Flash.
- Application: ChatGPT, Claude, Gemini, Grok, Vibe, Perplexity; elle ajoute recherche, fichiers, mémoire et interface.
- Plateforme API: endpoints, SDK, quotas, cache, batch, observabilité et outils.
- Assistant de code: Copilot ou Cursor, intégré à l’IDE et au dépôt.
- Agent autonome: boucle qui planifie, appelle des outils, modifie des fichiers et peut agir; le coût et le risque s’accumulent à chaque étape.
Sécurité, RGPD et AI Act
Aucun fournisseur ne rend automatiquement un cas d’usage conforme. Pour toute donnée personnelle: finalité, minimisation, base juridique, DPA, transferts, rétention, droits des personnes, journalisation et analyse d’impact si nécessaire. Ceci n’est pas un avis juridique.
Précisions vérifiées ce mois-ci sur l’AI Act [S134]. L’article 50 (transparence: information que l’on parle à une IA, marquage lisible par machine des contenus générés, étiquetage des hypertrucages) s’applique depuis le 2 août 2026 et n’a pas été reporté — contrairement au calendrier haut risque de l’annexe III, repoussé au 2 décembre 2027 par le paquet « Digital Omnibus ». Ne confondez pas les deux: le report très commenté ne vous exonère pas des obligations de transparence. Les systèmes préexistants disposent d’un délai jusqu’au 2 décembre 2026 pour la seule obligation de marquage lisible par machine. Côté modèles à usage général, la Commission dispose depuis le 2 août de son outillage d’exécution — demandes d’information, accès aux modèles, pouvoirs de rappel — et peut infliger des amendes allant jusqu’à 3 % du chiffre d’affaires mondial annuel ou 15 millions d’euros, le montant le plus élevé étant retenu. Cela pèse sur vos fournisseurs, mais si vous déployez un chatbot ou générez des contenus synthétiques, l’obligation de transparence vous vise directement.
Un point de résidence des données à ne pas déduire trop vite. Choisir une région Azure européenne ne garantit pas que tous les modèles du catalogue s’y exécutent: les modèles Anthropic dans Microsoft Foundry tournent sur l’infrastructure d’Anthropic, pas dans la région Azure sélectionnée, une offre « Foundry Europe » étant annoncée pour 2026. Sur AWS Bedrock et Google Vertex AI, ces mêmes modèles s’exécutent en revanche dans l’infrastructure du fournisseur cloud en région UE. Vérifiez modèle par modèle, pas plateforme par plateforme [S131].
Pour les offres grand public, vérifier le réglage d’entraînement. OpenAI API n’entraîne pas par défaut [S03]; GitHub permet l’opt-out pour les plans individuels et n’entraîne pas sur Business/Enterprise [S37]; Cursor Privacy Mode exclut l’entraînement [S42]. Les contrats, régions et rétentions doivent être vérifiés produit par produit.
Décisions à prendre
- Traiter les deux échéances du 1er septembre. D’une part, recenser les modèles épinglés dans les flux et politiques Copilot et ouvrir les remplaçants avant la date ; la fin des crédits promotionnels Copilot reste également à vérifier fin août. D’autre part, l’arbitrage tarifaire Sonnet 5 est clos sur les deux canaux : le tarif de 2/10 USD/M est définitif sur l’API d’Anthropic, et la grille des modèles partenaires de Google Cloud, relue le 20 août, ne porte plus aucune mention du 1er septembre. Il reste utile de contrôler sa propre facture à cette date, la page de Google Cloud ne portant pas de date de mise à jour.
- Poser une échéance au 1er décembre 2026 si vous adoptez Gemini 3.7 Flash. Le tarif de 0,75/3,75 USD/M double au 1er janvier 2027. Une remise à durée déterminée se prend, mais avec la date de fin inscrite au calendrier de réévaluation, pas oubliée dans un budget annuel.
- Si la résidence des données bloque un projet, chiffrer l’endpoint UE Mistral (+10 %) et, pour une charge critique, le Priority Tier (×1,75, SLA 99,5 % en préversion) — en exigeant du fournisseur la liste des sous-traitants susceptibles de recevoir un transfert hors région.
- Si vous suivez Cursor, surveiller la clôture de l’acquisition par SpaceX attendue fin août: contrat, entité facturante, politique de confidentialité et juridiction peuvent changer sans que le produit change.
- Choisir deux fournisseurs maximum pour un pilote de quatre semaines.
- Définir trois tâches réelles, une enveloppe de coût et un jeu d’évaluation reproductible.
- Interdire les secrets et données personnelles tant que DPA, région et rétention ne sont pas validés — et vérifier la résidence modèle par modèle, pas seulement la région de la plateforme.
- Épingler les versions de modèles en production et mettre en place un fournisseur de secours.
- Auditer les intégrations MCP face à la spécification 2026-07-28: sessions au niveau protocole, DCR, Roots, Sampling et Logging sont sur la trajectoire de retrait.
- Mesurer coût par tâche réussie, latence p95, taux d’intervention humaine et incidents, pas seulement prix par jeton — et pour les contextes longs, budgéter la grille long contexte, pas le prix d’entrée de gamme.
Détails et sources: comparatif, analyse, bonnes pratiques, modèles locaux, sources.