juin 04, 2026
Après l’ère des abonnements illimités, les géants comme GitHub Copilot ou Claude ont récemment annoncé le basculement vers une tarification basée sur l’usage des tokens. Finie la consommation sans limite : chaque mot, chaque virgule, chaque espace compte désormais.
Pourquoi ce changement ?
Parce que le coût de l’intelligence artificielle explose. Comme le souligne Madrona, l’optimisation des tokens ("tokenmaxxing") devient un enjeu stratégique. Et avec des modèles toujours plus gros la vitesse et l’efficacité ne sont plus des options, ce sont des nécessités. Des innovations comme le Multi-Token Prediction (MTP), désormais disponible dans Gemma 4 ou via llama.cpp, optimisent déjà la génération des tokens. Pourtant, cela ne suffit pas.
Avec la fin des usages illimités, une question s’impose : comment optimiser chaque token, au-delà des améliorations logicielles comme le MTP ? La réponse pourrait bien résider dans une nouvelle génération d’outils intermédiaires que j'appelerais des wrappers d’IA. Ces outils, placés avant, pendant ou après l’appel au LLM, ont un seul but : réduire le gaspillage de tokens tout en améliorant la qualité des résultats. Quelques exemples concrets :
- Prétraitement des données : Pourquoi envoyer un PDF brut à un LLM quand un wrapper peut en extraire uniquement les parties utiles ?
- Conversion de formats : Des outils comme celui de Cloudflare transforment du HTML en Markdown, évitant d’envoyer des balises inutiles au modèle.
- Optimisation des prompts : Reformuler une requête pour la rendre plus concise, sans perdre son sens.
- Post-traitement : Nettoyer ou structurer la réponse du LLM pour éviter de payer pour des tokens superflus.
🔥 Une opportunité... ou une course déjà lancée ?
Cette transition de la gestion des tokens ouvre un nouveau marché. Des startups sont-elles déjà en train de se positionner sur ce créneau ?
- Des solutions clés en main pour diviser par 2 (ou plus) la facture IA pourraient émerger.
- Les fournisseurs de LLM pourraient intégrer ces optimisations nativement dans leurs APIs.
- Les entreprises qui maîtriseront ces outils gagneront un avantage compétitif en réduisant leurs coûts… tout en gardant la même qualité.
❓ Et si, au final, tout cela était logique ?
On optimise l’entrée, on optimise la sortie... pour obtenir le traitement le plus efficace possible. Après tout, n’est-ce pas la base de toute bonne ingénierie ?
💬 Et vous, comment vous préparez-vous à ces nouvelles contraintes sur les tokens ?
- Avez-vous déjà testé des wrappers pour optimiser vos appels aux LLM ?
- Pensez-vous que cette course à l’efficacité va accélérer l’innovation… ou complexifier l’accès à l’IA pour les petits acteurs ?
juin 04, 2026
Commençons avec ce que j'appelerais notre canari dans la mine.
Très connu de la communauté des développeurs — même s’il était déjà en déclin depuis le milieu des années 2010 — Stack Overflow a vu le nombre de questions publiées chuter fortement depuis l’arrivée de ChatGPT. Et par conséquence : moins de visites.
Beaucoup plus récemment, l’un des auteurs de Minecraft.fr a publié une analyse très intéressante (https://minecraft.fr/ce-qui-se-passe-sur-minecraft-fr-quand-vous-posez-une-question-a-une-ia/) sur ce qu’il se passe lorsqu’un utilisateur pose une question à une IA.
En résumé :
les IA citent souvent Minecraft.fr comme source pour répondre aux questions sur Minecraft… mais ces citations ne génèrent presque jamais de visites réelles sur le site. Malgré un bon référencement Google, le nombre de clics a chuté de moitié, y compris sur des requêtes intemporelles. Comme si l’utilisateur ne ressentait plus le besoin d’ouvrir la source une fois la réponse obtenue.
Ils ont pris la décision de continuer à produire du contenu de qualité… alors même que ce contenu sert désormais davantage les IA que leur propre trafic.
D'un autre côté, de plus en plus de site fiable bloquent l'accès aux IA, cela risquerait de dégrader la qualité des résultats fournir par les IA.
Maintenant plusieurs questions me viennent à l'esprit :
-
Quel avenir pour les sites dont le modèle économique dépend principalement de la publicité ?
-
Les IA vont-elles pousser certains contenus derrière des paywalls ou des communautés privées ?
-
Va-t-on voir émerger des modèles de licensing de la donnée pour rémunérer les producteurs de contenu ? On voit apparaître du pay-per-crawl.
-
Comment financer durablement la production de savoir humain si l’interface qui répond capte l’essentiel de la valeur ?
Pendant longtemps, nous avons pensé que le principal problème des IA serait la qualité des réponses. Mais le vrai sujet me semble au final plutôt économique.
Car sans créateurs, journalistes, experts, développeurs, communautés… les IA finiront par ne plus avoir grand-chose d’utile à apprendre ni à citer.
mai 21, 2026
Il y a un mois, je partageais cette vidéo expliquant les bases des LLM en 1 minute. Aujourd’hui, je passe à l’étape supérieure en découvrant "LLM from Scratch" : un workshop où je peux mettre les mains dans la machine. En une soirée et avec un peu de Python, ce workshop nous lance dans la création d'un petit LLM. Cela a piqué ma curiosité. Grâce à ce workshop, je comprends mieux les concepts fondamentaux derrière ces modèles. Et c’est bien moins flippant que ce qu’on imagine !
Prérequis : Connaître un minimum le language Python (si vous savez faire un print("Hello World"), vous êtes qualifiés 🥳 ).
Au programme et sans spoiler :
✅ Étape 1 : La "tokenisation", ou "comment transformer du texte en Lego pour l’ordinateur".
✅ Étape 2 : Les "embeddings", ou "pourquoi votre chat et mon chat ne sont pas le même chat pour l’IA" (spoiler : c’est une histoire de maths).
✅ Étape 3 : L’assemblage, ou "comment faire croire à votre PC qu’il est intelligent" (il ne l’est pas. Désolé.).
✅ Étape 4 : La génération de texte, ou "comment faire parler votre modèle... même s’il dit parfois des bêtises".
Pourquoi c’est cool ?
- Plus besoin de faire semblant de comprendre quand on me parlera de transformers et je ne parle pas du film.
- Lors de ma prochaine soirée mondaine, je pourrais dire : "Moi aussi, j’ai codé un LLM... enfin, un mini-LLM. Mais c’est déjà ça !"
- Je serais en mesure d'expliquer à mon étourage c’est qu’un LLM avec un peu plus de détails... sans avoir l’air de réciter un cours.
🫵 À vous de jouer !
Pour les ambitieux: si cela vous a donné envie d’aller plus loin, ce livre "Build a Large Language Model from Scratch" semble être une bonne référence pour avancer sur votre prochain défi. Attention, votre cerveau pourrait vous en vouloir... mais au moins, vous saurez pourquoi ! 😂
avril 06, 2026
Au début, l’IA (celle qui a explosé avec ChatGPT) rimait avec cloud : puissance déportée, dépendance aux API, latence acceptée comme une certaine fatalité. Et puis, progressivement — presque silencieusement ? — le centre de gravité se rapproche de nos propres machines. Une évolution que je suis depuis un moment, et j’ai l'impression qu’un vrai basculement est en train de se produire.

Ce week-end, Apple a discrètement fait un pas majeur : approbation officielle du pilote de Tiny Corp pour prendre en charge les eGPU NVIDIA sur Mac. Ce pilote est pensé pour l’IA, pas pour les jeux ou usages généraux.
Le message est clair : l’IA locale, embarquée et maîtrisée, devient une réalité. Une IA qui ne dépend plus d’un serveur distant, mais de votre propre matériel — confidentialité, réactivité et souveraineté garanties.
Les puces Apple sont déjà puissantes : M1 à M5 offrent un CPU ultra-optimisé capable de gérer inférence, pipelines rapides et orchestration. Avec un eGPU externe, elles peuvent désormais être associées pour des calculs encore plus ambitieux. Ces associations sont d'ailleurs déjà possible sur PC traditionnel depuis quelques temps.
Concrètement, on peut imaginer :
-
Des copilotes privés ultra-efficient et 100% offline , sans risque d’exposition des données
-
Des outils avancés de création (texte, image, code), fonctionnant en local, sans abonnement ni latence
-
Des workflows IA embarqués dans des apps métiers, pour une réactivité immédiate
-
Des environnements de test rapides, sans friction ni coût variable
On passe d’une logique de consommation à une logique d’appropriation. Plus besoin de dépendre d’une connexion ou d’un budget API pour innover.
La vraie question : comment orchestrer ces synergies CPU+eGPU pour rivaliser, sur certains usages, avec le cloud ? Bien sûr, le cloud reste roi pour le scale, mais "local" ne veut plus dire "limité". Et ça, c’est profondément excitant pour l’avenir de l’IA sur toutes les plateformes.
févr. 01, 2026
Il y a deux ans, il fallait deux datacenters pour faire tourner un modèle de raisonnement avancé. Liquid AI annonce en janvier une prouesse : un modèle capable de raisonner en autonomie, sur un smartphone et utilisant moins de 1 Go de RAM.
Pourquoi est-ce un tournant ?
À l’ère où la mémoire vive coûte cher (on parle de +500% sur 12 mois) et où la "privacy" devient un enjeu critique, cette avancée risque de changer la donne. Plus besoin de cloud, plus besoin de transférer des données sensibles : l’IA pense localement, sur l’appareil, comme un vrai assistant personnel.
Mais c’est quoi, un "modèle de raisonnement" ?
Contrairement aux LLM classiques (ChatGPT, Le Chat,...) qui prédisent des mots en s’appuyant sur des statistiques, les modèles de raisonnement simulent une pensée logique :
- Ils décomposent les problèmes en étapes ("Pour résoudre X, fais d’abord Y, puis Z").
- Ils expliquent leurs démarches (ex. : "Je conclus que ce symptôme correspond à A, car B et C").
- Ils s’adaptent à des tâches complexes sans être réentraînés.
Des cas d’usage qui vont tout changer
Avec des modèles légers et autonomes, imaginons :
- assistants médicaux sur les appareils des médecins sans besoin d'envoyer les données dans le cloud
- analyse automatique de contrats et assistance juridique en direct
- détection de pannes par des robots industriels sur eux-mêmes de manière autonome
Pourquoi est-ce une révolution ?
- Réduction des coûts: pas de besoin en infrastructure distante
- "Privacy" : les données ne sortent pas de l'appareil
- Latence : ça tourne localement, pas d'échange de données nécessaires.
Bientôt, votre grille-pain pourra négocier avec votre frigo pour savoir qui a mangé le dernier morceau de pain. Et votre aspirateur robot vous expliquera pourquoi il a encore coincé sous le canapé (spoiler : c’est votre faute 🤣 ).
Pour en savoir plus sur cette annonce de Liquid.ai
déc. 23, 2025
As 2025 wraps up, one truth is undeniable: we are nearly all becoming spellcasters. No wand or pointy hat required (though both are encouraged) just a keyboard, an internet connection, and a new superpower more game-changing than "Ctrl+C / Ctrl+V": Prompt Engineering!
Picture this: every morning, you wake up as a Level 1 Mage (aka "Copy-Paste Neophyte"), and every AI interaction is a dice roll. Your mission? Go from "Fumble" to "Critical Success" without accidentally summoning something unexpected.
❓What’s Your Prompting Level? Like in any RPG, let's roll the dice and find out!
-
Prompt Newbie (Neophyte): "Uh… can you write me an email?"
-
Prompt Associate (Apprentice): "Write a professional email to my boss about the project, but make it sound like Shakespeare wrote it."
-
Prompt Wizard (Journeyman): "Act as a 1920s detective. Analyze this dataset, find anomalies, and explain it in prose."
-
Prompt Grandmaster (Expert): "Simulate a debate between Socrates, Einstein, and a sarcastic AI about the ethics of time travel."
🫵 Now your turn, what’s YOUR current level?
-
Neophyte (I talk to AI like it’s my cat)
-
Apprentice (I’ve mastered "be creative")
-
Journeyman (I cite sources like a pro)
-
Grandmaster (The AI suggests ideas I hadn’t even thought of)
Where do you want to be in 2026?
Spoiler: Everyone wants to be a Grandmaster… but let’s be realistic, Fumbles make the best stories 😉 Share them if you have one.
If this post made you smile, tag a colleague who still thinks "Ctrl+F" is advanced tech. And remember: in 2026, the real magic is in the prompt! 😁
déc. 17, 2025
L’IA souffrait d’un paradoxe : des modèles toujours plus performants, mais enfermés dans des silos techniques. Les différents acteurs développaient ses propres protocoles d’interconnexion, créant des barrières qui freinaient l’innovation systémique plus globale et la collaboration entre systèmes. Une première question se pose et si une des vraies ruptures ne venait pas de l’IA elle-même, mais de sa capacité à dialoguer ?
Fin 2024, Anthropic (l’un des leaders de l’IA sécurisée et interprétable, connu pour ses modèles comme Claude) a introduit MCP (Model Communication Protocol). Ce protocole ouvert ne se contente pas de standardiser les échanges entre systèmes : il définit un langage universel pour l’IA, comparable à ce que HTTP a été pour le web, SQL pour les bases de données, ou REST pour les API des services web. Une avancée d’autant plus stratégique que MCP est désormais hébergé depuis le début de ce mois par la Linux Foundation – qui supporte déjà plus de 900 projets critiques comme Kubernetes ou RISC-V – garantissant ainsi neutralité et pérennité.
Pourquoi MCP a changé/change la donne ?
-
Fin des silos technologiques : Les entreprises ne sont plus contraintes de dépendre d’un seul fournisseur avec son format d'interconnexion. Elles peuvent désormais orchestrer des modèles hétérogènes (open-source, propriétaires, spécialisés) au sein d’une même architecture, sans friction.
-
Accélération de l’innovation : L’interopérabilité réduit les coûts d’intégration et permet de combiner rapidement des briques IA pour des cas d’usage complexes.
Je partage maintenant un regard critique : entre opportunités et défis. Si MCP représente une avancée majeure, son adoption pose des défis clés :
-
Standardisation vs. différenciation : Les acteurs historiques accepteront-ils de jouer le jeu de l’interopérabilité. De ce que j'observe cela semble le cas.
-
Sécurité et gouvernance : Un protocole ouvert exige des garde-fous robustes pour éviter les abus (fuites de données, manipulations, cyberattaques). La bascule d'Anthropic vers la Linux Foundation va dans le bon sens.
-
MCP pourrait-il devenir le "TCP/IP de l’IA", invisible mais omniprésent ? Si oui, sa gouvernance devrait, de mon point de vue, rester libre et transparente pour éviter les dérives.
Et demain ?
À court terme, MCP va simplifier l’intégration de l’IA dans les processus métiers, réduisant les coûts et accélérant le déploiement de solutions hybrides. C'est une excellente nouvelle. À plus long terme, il pourrait redéfinir les équilibres industriels, en favorisant les écosystèmes ouverts plutôt que les solutions propriétaires. Ce n'est pas la première fois que l'on a pu observer une bataille de "chapelle" par le passé.
Une certitude : l’ère des IA isolées est révolue. Place à celle des systèmes conversants et collaboratifs pour des systèmes et solutions complexes.