En quelques mots
- Moonshot annonce Kimi K3 le 16 juillet 2026 : 2 800 milliards de paramètres, poids ouverts onze jours plus tard.
- La part des modèles américains sur OpenRouter passe d'environ 70 % à 30 % des jetons en un an.
- Confidentialité, coût maîtrisé et spécialisation : trois conséquences concrètes pour une entreprise.
- Optimiser pour un moteur particulier devient un exercice à rendement décroissant.
L'ampleur du basculement
Les chiffres méritent d'être posés parce qu'ils sont peu commentés en France. En douze mois, l'usage mesuré sur les plateformes qui agrègent l'accès à plusieurs modèles s'est inversé.
Sur OpenRouter, qui route aujourd'hui plus de 20 000 milliards de jetons par semaine et constitue l'un des rares signaux d'usage réel et non déclaratif, la part des modèles américains est passée d'environ 70 % à environ 30 % entre juin 2025 et juin 2026. Les modèles d'origine chinoise représentent désormais la majorité des jetons consommés, autour de 61 % en mai 2026. DeepSeek pèse à lui seul plus de 16 % du volume total, et quatre des cinq modèles les plus utilisés sont chinois.
Une précision de méthode s'impose, car les chiffres qui circulent varient de quinze points selon ce qu'on compte. Mesurer la part par origine des modèles ne donne pas le même résultat que compter les fournisseurs, qui ressortent chinois à environ 56 %. Et l'inférence routée ne représente pas tout le marché : ChatGPT, Gemini et Doubao servent en direct des volumes bien supérieurs. Ce qu'OpenRouter mesure bien, c'est l'arbitrage d'un développeur qui choisit un modèle pour une tâche donnée.
Kimi K3, publié par Moonshot le 16 juillet 2026, illustre le mouvement. Une architecture à experts de 2 800 milliards de paramètres, dont seize experts activés sur 896 à chaque passe. Les évaluateurs indépendants le classent deuxième sur l'index Vals AI, troisième sur l'index d'Artificial Analysis, et premier sur l'arène de code frontend. Les poids ont été ouverts le 27 juillet, onze jours après l'annonce. Alibaba a enchaîné en annonçant Qwen 3.8, 2 400 milliards de paramètres, également en poids ouverts.
Meta, qui portait l'étendard de l'ouverture avec Llama, est passé sous 1 % du volume routé. Le basculement n'oppose donc pas ouvert et fermé, il oppose deux géographies.
Ce que « poids ouverts » veut dire concrètement
L'expression circule beaucoup et recouvre une réalité plus exigeante qu'on ne le croit. Il faut la regarder de près avant d'en tirer des conclusions opérationnelles.
Poids ouverts signifie que les paramètres du modèle sont téléchargeables et que vous pouvez le faire tourner où vous voulez. Cela ne signifie ni que les données d'entraînement sont publiques, ni que la licence autorise tout usage commercial, ni que l'exécution est à votre portée.
Le cas de Kimi K3 est parlant. Faire tourner 2 800 milliards de paramètres, même avec seize experts actifs à la fois, demande une infrastructure que très peu d'entreprises françaises possèdent, et que louer revient rarement moins cher qu'un appel d'API. L'auto-hébergement reste une option théorique pour la plupart des organisations.
L'ouverture produit pourtant un effet bien réel, et il est indirect. Elle permet à des hébergeurs tiers de proposer le même modèle immédiatement, partout, à des prix qui s'alignent par concurrence plutôt que par décision d'un fournisseur unique. C'est ce mécanisme, plus que l'auto-hébergement, qui fait bouger les prix.
Un mot sur les licences, parce qu'on les lit peu. Elles diffèrent d'un modèle à l'autre, et certaines comportent des clauses d'usage ou des seuils au-delà desquels les conditions changent. Faites-les lire par votre juriste avant d'engager un produit dessus, plutôt qu'après.
Trois conséquences concrètes pour une entreprise française
Passons de la géopolitique aux décisions que cela change dans une semaine de travail.
La confidentialité d'abord. Un modèle exécuté chez un hébergeur européen, sur des poids ouverts, traite vos données sans les envoyer à un fournisseur américain ou chinois. Pour les documents contractuels, les données de santé ou les informations de ressources humaines, cette possibilité change la nature de la conversation avec la direction juridique. Attention toutefois au raccourci : utiliser un modèle chinois via l'API de son éditeur envoie bien vos données en Chine. Ce sont les poids qui sont ouverts, pas l'usage qui devient local par magie.
Le coût ensuite. Quand un modèle ouvert suffisamment bon coûte une fraction d'un appel d'API propriétaire, l'arbitrage devient mécanique sur les tâches à gros volume : classification, extraction, résumé, enrichissement de fiches. Ce sont rarement les tâches les plus visibles, ce sont souvent celles qui consomment le plus.
La spécialisation enfin. Un modèle ouvert peut être adapté sur votre propre corpus. Pour un vocabulaire métier précis, un modèle moyen bien spécialisé bat régulièrement un modèle généraliste plus puissant. C'est le point le moins exploité en France, et probablement celui qui produit le plus de valeur à court terme.
Pourquoi optimiser pour un moteur devient à rendement décroissant
J'en viens à ce qui me paraît le plus important pour notre métier, et qui dépasse le sujet des modèles chinois.
Tant qu'il existait trois ou quatre assistants grand public, on pouvait imaginer une optimisation par moteur : comprendre les préférences de ChatGPT, celles de Perplexity, celles des Aperçus IA, et adapter. Cette approche supposait un petit nombre de destinations stables et identifiables.
Des modèles ouverts, performants et bon marché se diffusent dans des produits qui ne portent pas leur nom. Un logiciel de gestion, un outil de veille, un assistant interne, un moteur de recherche d'entreprise : chacun peut embarquer Qwen ou DeepSeek sans jamais l'annoncer. Votre contenu se retrouve alors évalué par des systèmes que vous ne pouvez ni nommer, ni tester, ni suivre.
La conséquence est simple à formuler. Optimiser pour un moteur particulier devient un exercice à rendement décroissant, parce que le nombre de moteurs augmente pendant que la visibilité que vous avez sur chacun diminue.
Ce qui reste, en revanche, vaut pour tous : des affirmations vérifiables, datées, attribuées ; une structure qui permet d'extraire une réponse sans avoir à interpréter ; un vocabulaire qui correspond à celui de la question. Ces qualités ne dépendent d'aucun fournisseur, et c'est précisément ce qui les rend durables.
Ce que je ferais, et ce que je ne ferais pas
Je ne bâtirais aucune stratégie sur un classement de modèles. Kimi K3 était troisième d'un index il y a une semaine, il aura changé de rang avant la fin du trimestre, et cela ne changera rien à ce que vous devez écrire.
Je testerais en revanche un modèle ouvert sur une tâche interne à gros volume, chiffres à l'appui : coût par millier d'opérations, taux d'erreur, temps de traitement, comparés à votre solution actuelle. Une semaine de travail suffit à savoir si l'écart justifie un changement.
Je poserais la question de la localisation des traitements avant que la direction juridique ne la pose. Savoir quel modèle traite quelle donnée, chez quel hébergeur, dans quel pays, est devenu une cartographie de base que beaucoup d'entreprises n'ont pas encore faite.
Et je garderais la mesure de mon exposition dans les assistants grand public, parce qu'elle reste la seule observable directement. Le reste, ces moteurs invisibles embarqués dans des produits tiers, ne se mesure pas encore. Je préfère l'écrire clairement plutôt que de laisser croire qu'un outil sait le faire.
Dernier point, sur lequel je reste prudent : l'enjeu demeure marginal pour une clientèle française qui interroge très majoritairement Google, ChatGPT et Gemini. Ce que je décris ici est un mouvement d'infrastructure, dont les effets se verront dans les produits que vous utiliserez dans dix-huit mois, sans que personne vous prévienne.