Aller au contenu

GIIG35 · Green IT

L'UE qu'on prend pour un supplément d'éthique et qui traite en réalité de la contrainte de conception numéro un du HPC contemporain : l'énergie. Une Student Cluster Competition se joue sous un budget électrique, et le Green500 classe les machines en performance par watt.

Fiche signalétique

Code GIIG35
Crédits 5 ECTS
Semestre 5, spécialisation — vendredi matin
Responsable LIGOZAT Anne-Laure
Concurrentes sur le créneau aucune sur ce créneau
Choix Une des trois UE de spécialisation, en accord avec l'entreprise
Prérequis Aucun
Effectif max 40

Ce que dit la brochure

Objectifs cités :

« Ce module vise à présenter les solutions qui peuvent être mises en œuvre dans les entreprises et organisations pour réduire l'impact environnemental du numérique, ainsi qu'à approfondir les impacts environnementaux notamment indirects étudiés en S4. »

Contenu cité :

« Les enseignements de ce module aborderont les notions de sobriété numérique, de systémique, d'architecture d'entreprise. Ces notions seront mises en pratique dans des cas d'étude. »

Sur les grilles de compétences

La brochure FISA ne publie pas de grille de compétences par UE, contrairement à la brochure de la formation sous statut étudiant. Les cotations « Expert / Maîtrise / Intermédiaire » citées dans les éditions précédentes de ce document n'ont donc pas d'équivalent ici.

L'UE prolonge le module EEDD11 du semestre 1 (enjeux environnementaux et développement durable) et le volet correspondant de GEDE24.

Ce que ça vaut pour le HPC

Plus élevé que ne le croient les étudiants, pour trois raisons très concrètes.

1. Le budget électrique est une règle de compétition

Fait, consulté le 17 septembre 2026. Le règlement de la Student Cluster Competition de SC26 impose un maximum de 10 000 W pour l'ensemble des composants du cluster, avec une pénalité appliquée dès l'atteinte de ce seuil et une disqualification possible à partir de 11 000 W. Les équipes disposent d'un seul circuit 208 V et d'un boîtier de distribution imposé.

Autrement dit : la compétition ne se gagne pas en achetant plus de matériel, mais en obtenant le maximum de performance dans une enveloppe électrique fixée. C'est un problème d'optimisation sous contrainte, et c'est exactement ce que GIIG35 enseigne à raisonner, à l'échelle d'une organisation plutôt que d'un rack.

Les conséquences pratiques sont nombreuses et techniques : choisir des accélérateurs selon leur performance par watt plutôt que leur performance absolue, appliquer un power cap (une limite de puissance logicielle) sur les GPU et mesurer l'effet sur la performance — le rendement est souvent très favorable, réduire de 20 % la puissance ne coûtant que 5 à 10 % de performance —, désactiver les composants inutiles, et surveiller la consommation en temps réel pour ne pas dépasser pendant les phases de pointe.

2. Le Green500 est un classement à part entière

Le Green500 reprend les machines du Top500 et les classe en GFLOPS par watt. C'est le classement où les architectures hétérogènes dominent, parce que les accélérateurs ont un bien meilleur rendement énergétique par opération que les processeurs généralistes. Comprendre pourquoi est un sujet d'architecture, pas d'écologie.

3. L'énergie est le facteur limitant de l'exascale

La consommation est la raison pour laquelle l'exascale a mis vingt ans à arriver. Un supercalculateur de classe exaflopique consomme quelques dizaines de mégawatts, soit la consommation d'une ville moyenne, et la facture électrique d'un grand centre de calcul est du même ordre que l'amortissement de la machine. C'est pourquoi les « défis pour le passage à l'exaflops » cités dans LOCL24 commencent par l'énergie, et pourquoi l'ouverture de PDSP35 mentionne explicitement l'énergie parmi les défis du domaine.

Le PUE, la métrique à connaître

Le PUE (Power Usage Effectiveness) d'un centre de données est le rapport entre l'énergie totale consommée et l'énergie consommée par les équipements informatiques seuls :

\[ \mathrm{PUE} = \frac{E_{\text{totale}}}{E_{\text{informatique}}} \]

Un PUE de 2,0 signifie qu'un watt de refroidissement et d'infrastructure est consommé pour chaque watt de calcul. Les centres modernes visent 1,1 à 1,2, notamment par refroidissement liquide direct, qui est la norme en HPC — les densités de puissance par rack y sont telles que l'air ne suffit plus.

Attention à la limite de cette métrique : le PUE ne dit rien sur l'efficacité du calcul lui-même. Un centre au PUE de 1,05 qui fait tourner des codes non optimisés gaspille plus qu'un centre au PUE de 1,4 qui fait tourner des codes efficaces. La métrique complète devrait rapporter le résultat scientifique à l'énergie totale, ce qui est très difficile à définir — et c'est le genre de nuance que l'approche systémique de GIIG35 apprend à voir.

Ce que l'UE ne couvrira pas et qu'il faut ajouter

GIIG35 est une UE de management de l'impact environnemental du numérique en organisation. Elle ne traite pas le réglage technique de la consommation d'un calcul. C'est à vous de le faire, et c'est rapide.

Le complément technique, ⏱ 12 h

  1. Savoir mesurer la puissance. Sur processeur Intel et AMD récents, l'interface RAPL (Running Average Power Limit) expose des compteurs d'énergie lisibles par perf stat -e power/energy-pkg/ ou via /sys/class/powercap/. Sur GPU NVIDIA, nvidia-smi -q -d POWER et nvidia-smi dmon donnent la puissance instantanée. Sur un serveur, IPMI expose souvent la consommation à la prise. ⏱ 3 h.
  2. Savoir limiter la puissance. nvidia-smi -pl <watts> fixe un plafond sur un GPU ; cpupower frequency-set et les P-states du processeur jouent le même rôle côté CPU. ⏱ 2 h.
  3. Mesurer la courbe performance-puissance. Pour un code donné, tracer la performance en fonction du plafond de puissance, de 50 % à 100 % du TDP. La courbe est concave : le dernier tiers de puissance achète très peu de performance. C'est l'expérience qui convainc. ⏱ 4 h.
  4. Calculer l'énergie d'un calcul, en joules ou en kilowattheures, et pas seulement la puissance. Un code deux fois plus lent à puissance deux fois moindre consomme la même énergie : la métrique utile est \(E = P \times t\), ou mieux, l'énergie par unité de résultat scientifique. ⏱ 3 h.

Ressources : la documentation RAPL, l'outil PowerAPI ou Scaphandre (français) pour la mesure logicielle, LIKWID qui intègre les compteurs RAPL, et les rapports du Green500 pour la méthodologie de mesure de puissance d'un cluster complet — qui est plus subtile qu'il n'y paraît, entre mesure à la prise, mesure des nœuds seuls, et échantillonnage pendant l'exécution.

Ressources

Priorité 1

  • Les publications de l'équipe de la responsable de l'UE sur l'impact environnemental du numérique et de l'IA. Anne-Laure Ligozat travaille sur l'empreinte environnementale de l'apprentissage automatique ; c'est un domaine où la littérature francophone est de bonne qualité et où les travaux du laboratoire sont pertinents. Demandez-lui ses références.
  • Les rapports de l'ADEME et de l'Arcep sur l'empreinte environnementale du numérique en France. Ce sont les sources chiffrées de référence pour le contexte français, et elles sont régulièrement mises à jour.
  • Le Shift Project, rapports « Lean ICT » et suivants. À lire avec un œil critique — certaines projections ont été contestées, et la controverse méthodologique est elle-même instructive sur la difficulté de ces estimations.

Priorité 2 — la version HPC

  • Les listes et la méthodologie du Green500 (top500.org/lists/green500). Le document de méthodologie de mesure de puissance est court et précis.
  • Les articles sur le power capping en HPC : chercher « power capping HPC performance trade-off » et les travaux sur les gestionnaires de puissance à l'échelle du cluster (par exemple les travaux autour de GEOPM, le Global Extensible Open Power Manager d'Intel).
  • Sur l'empreinte de l'IA : Strubell, Ganesh, McCallum, « Energy and Policy Considerations for Deep Learning in NLP » (ACL 2019), l'article qui a lancé le débat ; et les travaux ultérieurs qui en ont corrigé certaines estimations. Lire les deux côtés est l'exercice.
  • Sur l'analyse de cycle de vie : le point essentiel et souvent ignoré est que pour un équipement numérique, la fabrication représente souvent une part majoritaire de l'impact total sur la durée de vie, surtout pour les terminaux. Pour un serveur de calcul très utilisé, l'usage domine. La conséquence pratique est contre-intuitive : prolonger la durée de vie d'un serveur peut être préférable à le remplacer par un modèle plus efficace, et le calcul du point d'équilibre est un excellent cas d'étude.

Priorité 3

  • Les outils de mesure logicielle : Scaphandre (français, exporte vers Prometheus), PowerAPI, CodeCarbon (estimation de l'empreinte carbone d'un calcul, très utilisé dans la communauté IA).
  • Sur la sobriété et les effets rebond : la notion de paradoxe de Jevons — une amélioration d'efficacité peut augmenter la consommation totale en rendant l'usage moins coûteux. C'est l'argument central du débat sur l'efficacité énergétique, et il s'applique directement au HPC : les machines plus efficaces ne consomment pas moins, elles calculent plus.

Exercices

E1 · ★ ⏱ 2 h — Mesurer la puissance d'un calcul. Avec perf stat -e power/energy-pkg/ sur CPU ou nvidia-smi dmon sur GPU, mesurer la puissance moyenne et l'énergie totale d'un calcul de deux minutes. Convertir en kilowattheures, puis en équivalent carbone avec un facteur d'émission du réseau électrique français et un facteur allemand. Constater l'écart d'un facteur dix : la localisation du centre de calcul pèse plus que l'optimisation du code, ce qui est une conclusion importante et inconfortable.

E2 · ★★ ⏱ 4 h — La courbe performance-puissance. Sur un GPU, faire varier le plafond de puissance avec nvidia-smi -pl de 50 % à 100 % du maximum par pas de 10 %, et mesurer à chaque point la performance d'un noyau de calcul. Tracer performance et énergie-par-opération en fonction du plafond. Identifier le point de meilleur rendement énergétique, qui n'est jamais à 100 %.

C'est un résultat directement exploitable en compétition : sous contrainte de 10 000 W, il vaut souvent mieux faire tourner plus de GPU à puissance limitée que moins de GPU à pleine puissance.

E3 · ★★ ⏱ 3 h — Énergie contre temps. Comparer trois versions d'un même code — séquentielle, parallèle sur la moitié des cœurs, parallèle sur tous les cœurs — en mesurant à la fois le temps et l'énergie totale. Vous constaterez que la version la plus rapide n'est pas toujours la plus économe, et que le point optimal dépend de la puissance statique de la machine (celle consommée même sans calcul). Formaliser : l'énergie est \(E = (P_{\text{statique}} + P_{\text{dyn}}) \times t\), et réduire \(t\) réduit la part statique.

E4 · ★★★ ⏱ 4 h — Le calcul du point d'équilibre. Un serveur de calcul de cinq ans consomme 40 % de plus qu'un modèle récent pour la même performance. À partir de quelle durée d'utilisation le remplacement devient-il préférable en émissions totales, en tenant compte de l'impact de fabrication du nouveau serveur ? Chercher des ordres de grandeur d'impact de fabrication dans la littérature, poser le calcul, et discuter la sensibilité du résultat aux hypothèses. C'est un excellent cas d'étude, et il est directement dans l'esprit de l'UE.

E5 · ★★★ ⏱ 4 h — L'empreinte d'un entraînement. Reprendre le projet d'entraînement de MALE24 et en mesurer l'empreinte énergétique complète avec CodeCarbon ou Scaphandre : énergie du GPU, du CPU, et estimation du refroidissement via un PUE supposé. Puis calculer combien l'optimisation du chargement de données et le passage en précision mixte ont économisé. C'est le pont le plus direct entre GIIG35 et le reste du parcours.

Projet

Projet GIIG35 · Le bilan énergétique d'un cluster de compétition

⏱ 25 h · ★★★

Sujet. Concevoir la configuration d'un cluster de Student Cluster Competition optimale sous contrainte de 10 000 W, avec un bilan énergétique complet et une méthodologie de surveillance.

Les six parties :

  1. Le cahier des charges : 10 000 W maximum, tous composants inclus (nœuds, réseau, stockage, ventilation locale). Les benchmarks visés : HPL, HPL-MxP, MLPerf, et deux applications scientifiques. L'espace : un stand de trois mètres sur trois, matériel en rack de 42 U maximum, 85 dBA de bruit maximum.
  2. L'étude d'architecture : trois configurations candidates, chacune chiffrée en performance attendue et en puissance. Par exemple : peu de nœuds avec beaucoup d'accélérateurs, beaucoup de nœuds sans accélérateur, et une configuration mixte. Justifier les estimations de performance par les fiches techniques et par les résultats publiés du Top500 et du Green500 pour des configurations comparables.
  3. L'optimisation sous contrainte : pour la configuration retenue, déterminer le plafond de puissance optimal par composant. Utiliser la courbe de l'exercice E2 : la question est de trouver le point où la performance totale est maximale sous la contrainte de puissance globale. C'est un problème d'optimisation qu'on peut poser formellement.
  4. Le protocole de surveillance : comment mesurer la puissance en temps réel, quelles alertes, quelle marge de sécurité par rapport aux 10 000 W, que faire en cas de dépassement imminent pendant une exécution de HPL.
  5. Le bilan environnemental complet : au-delà de l'électricité du stand, l'impact de fabrication du matériel, le transport, et une discussion honnête de l'échelle des ordres de grandeur en jeu.
  6. La restitution : un dossier de dix pages et une présentation. Les compétences de conseil étant cotées « Expert » dans cette UE, la qualité argumentative compte.

Pourquoi ce projet. Parce qu'il satisfait complètement les attendus de GIIG35 — analyse d'impact, proposition d'améliorations, approche systémique, cas d'étude — tout en produisant un document directement utilisable pour une candidature à une compétition. C'est l'exemple parfait d'un livrable qui compte deux fois.

Erreurs fréquentes

Cinq confusions sur l'énergie

  1. Confondre puissance et énergie. La puissance se mesure en watts, l'énergie en joules ou en kilowattheures : \(E = P \times t\). Un code qui consomme moins de watts mais tourne plus longtemps peut consommer plus d'énergie. La contrainte de compétition porte sur la puissance instantanée ; l'impact environnemental porte sur l'énergie.
  2. Oublier la puissance statique. Une machine allumée sans calcul consomme déjà une fraction significative de son maximum. Cela change complètement le calcul « faut-il paralléliser pour économiser ? » : oui, souvent, parce que finir plus vite réduit la part statique.
  3. Prendre le TDP pour la consommation réelle. Le TDP est une enveloppe thermique de conception, pas une mesure. La consommation réelle dépend de la charge, et peut dépasser le TDP brièvement (boost) ou rester bien en dessous.
  4. Ignorer le facteur d'émission du réseau électrique. Un kilowattheure n'a pas le même impact carbone selon le pays et selon l'heure. L'écart entre pays européens atteint un ordre de grandeur. Toute conclusion en équivalent carbone doit préciser le facteur utilisé.
  5. Croire que l'efficacité résout le problème. Le paradoxe de Jevons : les machines deviennent plus efficaces et la consommation totale du secteur augmente, parce qu'on calcule davantage. L'approche systémique de l'UE existe précisément pour voir cela.

Comment l'UE s'articule avec le reste

UE ou chapitre Lien
EEDD11 (S1), GEDE24 (S4) Les prédécesseurs, même responsable pour EEDD11
PDSP35 (S5) L'énergie est citée dans l'ouverture sur les défis du HPC
LOCL24 (S4) Les défis de l'exaflops commencent par l'énergie ; IPMI mesure la puissance
PGPU35 (S5) Le Green500 est dominé par les architectures hétérogènes
MALE24 (S4) L'empreinte de l'entraînement des modèles
Énergie et efficacité Le complément technique complet
Anatomie d'une compétition La contrainte des 10 000 W

À retenir

GIIG35 en trois phrases

Ce n'est pas une UE d'appoint : l'énergie est la contrainte de conception numéro un du HPC contemporain, et une Student Cluster Competition se joue sous un budget de 10 000 W avec pénalité au-delà. L'UE apporte le cadre systémique et l'analyse d'impact ; le complément technique — mesurer la puissance avec RAPL et nvidia-smi, appliquer un power cap, tracer la courbe performance-puissance — est à faire soi-même en douze heures. Le résultat le plus utile à connaître est que la courbe performance-puissance est concave : limiter la puissance d'un accélérateur de 20 % ne coûte souvent que 5 à 10 % de performance, ce qui est le levier central d'une compétition sous contrainte électrique.

Chapitre suivant : Semestre 6, stage et projet.