•
    9 min de lecture

    Empreinte environnementale de l'IA : ce que pèse une requête

    « Et l'impact environnemental, alors ? » On me pose la question à chaque formation, en comité de direction, à la pause café. La réponse honnête tient en une fourchette qui surprend tout le monde : selon l'usage, une requête d'IA consomme de quelques centièmes de wattheure à plusieurs centaines de wattheures. Un écart de l'ordre de 1 à 10 000, et cet article vous explique d'où il vient.

    Je pose d'abord mon biais sur la table. Je suis co-fondateur de MAIjin et je gagne ma vie en accompagnant des entreprises dans leur adoption de l'IA : chaque mission que je signe augmente, quelque part, le nombre de requêtes envoyées à un data center. J'avais écrit un premier guide sur le sujet en avril 2024. Presque tout ce qu'il contenait est aujourd'hui périmé, y compris des chiffres que je croyais solides.

    Une requête texte ordinaire : environ un quart de wattheure

    Quand vous envoyez un prompt à ChatGPT, Claude ou Gemini, votre texte est découpé en tokens, puis envoyé vers des serveurs équipés de processeurs spécialisés (GPU ou TPU) qui calculent la réponse token par token. C'est la phase d'inférence, à distinguer de l'entraînement, qui a eu lieu en amont. Ces serveurs vivent dans des data centers qui consomment de l'électricité pour calculer et, souvent, de l'eau pour se refroidir.

    Combien pour une requête texte simple ? Trois sources convergent :

    • 0,24 Wh : la mesure publiée par Google en août 2025 pour le prompt texte médian de Gemini, méthodologie à l'appui (Google Cloud) ;
    • 0,34 Wh : le chiffre avancé par Sam Altman pour ChatGPT en juin 2025, sans méthodologie publiée (blog de Sam Altman) ;
    • 0,31 Wh, dans une fourchette de 0,16 à 0,60 Wh : la modélisation d'une équipe de chercheurs publiée dans la revue Joule (arXiv).

    Retenez l'ordre de grandeur : un quart de wattheure. Pour se représenter la chose, Google le compare à moins de 9 secondes de télévision. Une bouilloire qui chauffe un litre d'eau, c'est environ 110 Wh, soit l'équivalent de plusieurs centaines de requêtes.

    Ce chiffre bouge vite : Google indique avoir divisé par 33 l'énergie de son prompt médian entre mai 2024 et mai 2025. Si vous lisez cet article en 2027, les valeurs auront encore changé.

    Si vous vous arrêtez là, l'affaire est pliée : l'IA ne pèse rien. Ne vous arrêtez pas là. Six variables peuvent multiplier ce chiffre par 10, 100 ou 1 000.

    Les 6 variables qui font basculer l'empreinte environnementale de l'IA

    1. Le modèle et son architecture

    Entre un petit modèle et un modèle frontière, l'écart est massif : le MIT Technology Review a mesuré environ ×58 entre Llama 3.1 8B et Llama 3.1 405B, énergie de refroidissement comprise (MIT Technology Review).

    Nuance importante : le nombre de paramètres affiché ne dit pas tout. Les architectures MoE (Mixture of Experts) n'activent qu'une fraction du modèle à chaque token. Kimi K3, par exemple, affiche 2 800 milliards de paramètres mais n'en active que 104 milliards, via 16 experts sur 896 (rapport technique Kimi K3). Ce qui compte pour la consommation, ce sont les paramètres actifs.

    2. La longueur du contexte

    C'est la variable que presque tous les guides oublient. Pour comprendre un document joint, le modèle compare chaque token avec tous les autres : doublez la longueur, et le calcul est multiplié par quatre. Selon Epoch AI, la même question coûte environ 2,5 Wh avec 10 000 tokens de contexte, et environ 40 Wh avec 100 000 tokens, soit à peu près 130 fois une requête simple (Epoch AI).

    Une nuance sauve l'usage conversationnel : grâce aux mécanismes de cache, ce coût n'est pas intégralement repayé à chaque message d'une même conversation.

    3. Le raisonnement

    Les modèles qui « réfléchissent » avant de répondre génèrent des milliers de tokens invisibles. La modélisation publiée dans Joule estime que, sur des requêtes de raisonnement longues, l'énergie médiane est multipliée par 13, pour atteindre environ 3,9 Wh (fourchette de 2 à 7 Wh). En usage courant, les mesures convergent vers un multiplicateur de ×3 à ×10.

    4. L'agentique

    Un agent IA enchaîne de manière autonome des dizaines de requêtes longues, avec raisonnement, pour accomplir une tâche complète : trier des mails, coder une fonctionnalité, préparer un dossier. L'ordre de grandeur que je retiens pour une tâche agentique va de 10 à 100 Wh.

    Les mesures de laboratoire vont plus loin. Des chercheurs du KAIST ont mesuré jusqu'à 136 fois plus d'énergie par requête pour un agent que pour une IA générative classique, soit environ 348 Wh dans leur configuration la plus lourde (EurekAlert / KAIST).

    Et le coût est imprévisible : sur une même tâche, la consommation de tokens peut varier jusqu'à un facteur 30 d'une exécution à l'autre (Bai et al., 2026). L'agentique est l'usage qui croît le plus vite en entreprise, et je n'ai encore rencontré personne qui le mesurait. Si vous déployez des agents, notre guide complet des agents IA pour les PME pose les bases.

    5. La région d'hébergement

    Un data center consomme l'électricité de son réseau, et l'intensité carbone de ce réseau varie énormément. En France, elle était de 19,6 gCO2e/kWh en 2025 selon RTE (RTE). La moyenne mondiale tourne autour de 445 g selon l'IEA (IEA), la Chine autour de 560 g et l'Inde autour de 700 g selon Ember (Ember).

    Résultat : à requête identique, l'empreinte carbone peut être près de 30 fois plus élevée en Chine qu'en France, à cause du seul lieu d'exécution. Encore faut-il savoir où elle s'exécute, et c'est une affaire de contrat. C'est l'une des raisons pour lesquelles la question de l'IA souveraine en Suisse n'est pas qu'un sujet de confidentialité.

    6. L'efficacité du bâtiment (le PUE)

    Le PUE (Power Usage Effectiveness) mesure ce que le bâtiment consomme en plus des serveurs : refroidissement, éclairage, alimentation. Un PUE de 1,5 signifie que pour 1 kWh consommé par les machines, le site en prélève 1,5 sur le réseau.

    Google annonce 1,09 pour sa flotte en 2025, quand la moyenne mondiale reste bloquée à 1,54 depuis six ans selon l'Uptime Institute (Google Data Centers). En France, les petits data centers (500 à 2 500 kW) affichent environ 1,67 selon l'Arcep (Arcep). À calcul identique, un petit site consomme donc environ 50 % d'électricité de plus qu'un hyperscaler. Quant à la salle serveur interne d'une entreprise, aucune enquête ne la mesure, et rien ne laisse penser qu'elle fasse mieux.

    Pour aller plus loin : la mesure d'une requête n'est que le point de départ. Pour une vision complète du sujet, téléchargez le livre blanc MAIjin « L'empreinte environnementale de l'IA ».

    Eau et CO2 : pourquoi deux chiffres honnêtes divergent d'un facteur 173

    À un mois d'intervalle, à l'été 2025, deux acteurs ont publié l'eau consommée par une requête. Google : 0,26 mL. Mistral : 45 mL. Un écart de 173, et pourtant personne ne ment.

    Google compte l'eau utilisée pour refroidir ses data centers, point (papier de Google). Mistral publie une analyse de cycle de vie complète de Mistral Large 2, menée avec Carbone 4 et l'ADEME, qui inclut l'eau consommée par les centrales électriques et celle de la fabrication du matériel, pour une réponse de 400 tokens (The Register). Le périmètre change tout.

    Même constat pour le CO2. Google publie 0,03 gCO2e par prompt en calcul dit market-based : l'entreprise déduit de son bilan les certificats d'électricité renouvelable qu'elle achète. C'est une vraie politique d'achat, mais elle ne décrit pas ce que les réseaux locaux émettent physiquement. Recalculé en location-based, c'est-à-dire avec ce que les réseaux où tournent ses serveurs ont réellement émis (environ 345 g/kWh en 2024, d'après les données de Google), le même prompt pèse environ 0,08 g, presque le triple. C'est le calcul que je détaille dans notre livre blanc sur l'empreinte environnementale de l'IA.

    La règle de lecture que j'en tire, pour cet article comme pour tous les rapports RSE qu'on vous présentera : un chiffre d'impact sans son périmètre, sa date et sa source n'a aucune valeur informative.

    Tableau récapitulatif des ordres de grandeur

    UsageÉnergie indicativeMultiple d'un prompt simple
    Prompt texte court0,2 à 0,5 Wh×1
    Image générée0,5 à 2 Wh×2 à ×8
    Prompt avec raisonnement2 à 7 Wh×3 à ×13
    Contexte de 100 000 tokensenviron 40 Whenviron ×130
    Tâche agentique complète10 à 100 Wh×50 à ×500
    Vidéo générée de 5 secondesenviron 30 Wh à près de 1 000 Wh selon le modèle×100 à ×3 000

    Multipliez maintenant ces variables entre elles : un agent, sur un modèle frontière, hébergé sur un réseau très carboné, dans un vieux data center. Comparez au prompt court sur un petit modèle hébergé en France. Vous retrouvez l'écart de 1 à 10 000. On peut tout faire dire aux chiffres.

    Simulez l'empreinte de votre propre entreprise

    Pour le constater avec vos chiffres, nous avons construit un simulateur gratuit, sans email demandé : le calculateur d'empreinte environnementale de l'IA. Il reprend les six variables ci-dessus. Trois manipulations, dans l'ordre :

    1. Faites passer le raisonnement de léger à étendu, puis à agentique. Entre la question de la pause déjeuner et l'agent que votre DSI veut déployer, il y a trois ordres de grandeur.
    2. Changez la région, de la France vers la Chine. L'énergie ne bouge pas, le CO2 explose. Comparez aussi les colonnes market-based et location-based.
    3. Passez en mode « Mon entreprise ». Pour la plupart des PME, le total annuel se compte en centaines de kWh, l'équivalent de quelques allers-retours Paris-Marseille en voiture.

    Gardez ce chiffre en tête : il est réel, et pourtant votre usage n'est pas le vrai sujet. Votre décision d'achat compte davantage (quel modèle, quel hébergement, quel fournisseur), de même que l'effet rebond qui fait mécaniquement croître les usages à mesure que l'IA devient moins chère.

    Ce que cela change pour un dirigeant

    L'impact environnemental de l'IA ne se résume ni à « ça ne pèse rien » ni à « chaque requête est une bouilloire ». Il dépend de choix que l'entreprise peut piloter : la taille des modèles utilisés, la quantité de contexte envoyée, le recours au raisonnement et aux agents, la localisation et la qualité de l'hébergement.

    C'est précisément ce que nous travaillons avec les équipes que nous accompagnons chez MAIjin : apprendre à choisir le bon modèle pour la bonne tâche, cadrer les usages agentiques, et poser les bonnes questions aux fournisseurs (où tournent les requêtes, avec quel périmètre de mesure). Pour les organisations suisses, cette réflexion rejoint celle des modèles hébergés en Suisse comme Apertus.

    Ce qu'il faut retenir

    • •Une requête texte simple consomme environ un quart de wattheure en 2025-2026, un chiffre qui baisse vite.
    • •Six variables peuvent le multiplier par 10, 100 ou 1 000 : modèle, contexte, raisonnement, agentique, région d'hébergement, PUE.
    • •L'agentique est l'usage le plus lourd, le plus imprévisible et le moins mesuré en entreprise.
    • •Pour l'eau comme pour le CO2, des chiffres très différents peuvent être tous honnêtes : tout dépend du périmètre et de la convention comptable.
    • •Le vrai levier n'est pas tant votre usage individuel que vos décisions d'achat : modèle, hébergeur, localisation.

    Questions fréquentes

    Pour une requête texte simple, les estimations publiées convergent autour de 0,24 à 0,34 Wh. C'est l'équivalent de quelques secondes de télévision. Ce chiffre grimpe fortement avec un long contexte, le raisonnement ou les agents.

    Parce que les périmètres diffèrent. Google compte l'eau de refroidissement de ses data centers (0,26 mL), quand Mistral inclut aussi l'eau des centrales électriques et de la fabrication du matériel (45 mL). Un chiffre sans périmètre ne veut rien dire.

    Oui. Une tâche agentique enchaîne des dizaines de requêtes longues avec raisonnement ; des mesures de laboratoire montrent jusqu'à 136 fois plus d'énergie par requête qu'une IA générative classique. Leur consommation varie aussi fortement d'une exécution à l'autre.

    Commencez par la mesurer avec vos propres chiffres, puis agissez sur les leviers qui pèsent le plus : taille du modèle, contexte envoyé, recours au raisonnement et aux agents, localisation et efficacité de l'hébergement. Le livre blanc MAIjin sur le sujet est le bon point de départ.

    Téléchargez le livre blanc MAIjin « L'empreinte environnementale de l'IA » et passez de la mesure à la décision : maijin.ch/ressources/livres-blancs.

    À propos de l'auteur

    Jean-Baptiste Berthoux est co-fondateur et Chief AI Officer de MAIjin. Depuis 2023, il a accompagné plus de 150 organisations et formé plus de 4 500 professionnels à l'IA générative en Suisse romande. En savoir plus

    Pour recevoir chaque mardi mes analyses de l'IA en entreprise, rejoignez les 5 800+ abonnés de L'hebdo de MAIjin.

    Articles recommandés

    L'hebdo mAIjin