2 · Vidéos et conférences¶
Ce qui se regarde. Le format vidéo est particulièrement adapté à ce domaine : beaucoup de concepts se comprennent mieux avec un diagramme animé qu'avec un paragraphe.
2.1 GPU MODE¶
La ressource vidéo principale du domaine.
github.com/gpu-mode/lectures · chaîne YouTube · serveur Discord
Une série de conférences hebdomadaires portée par la communauté (anciennement CUDA MODE), couvrant le profilage, les noyaux, CUTLASS et le SASS. Les enregistrements sont publiés sur YouTube, et le code et les supports de chaque conférence sont dans le dépôt.
Les conférences les plus utiles, par thème :
| # | Titre | Quand la regarder |
|---|---|---|
| 1 | Profiling and Integrating CUDA kernels in PyTorch | avant la partie 9 |
| 3 | Getting Started With CUDA | avec la partie 2 |
| 4 | Intro to Compute and Memory Architecture | avec la partie 1 |
| 8 | CUDA Performance Checklist | avec la partie 3 |
| 9 | Reductions | avec le chapitre 5 de la partie 2 |
| 12 | Flash Attention | avec le chapitre 3 de la partie 7 |
| 14 | Practitioner's Guide to Triton | avec le chapitre 2 de la partie 5 |
| 15 | CUTLASS | avec le chapitre 3 de la partie 5 |
| 35+ | sujets avancés | au fil de l'eau |
Pourquoi GPU MODE est différent
Les conférences sont données par des praticiens — ingénieurs de PyTorch, de NVIDIA, de laboratoires de recherche — et le code est fourni. Ce n'est pas un cours académique, c'est un partage de pratique.
Le Discord est actif et c'est l'endroit où poser une question technique précise sur un noyau.
Il existe aussi des notes de conférence rédigées par Christian Mills, utiles pour retrouver un point sans revisionner : christianjmills.com.
2.2 Les présentations de Stephen Jones (NVIDIA)¶
Stephen Jones est l'architecte en chef de CUDA. Ses présentations à la GTC sont les meilleures explications existantes du fonctionnement d'un GPU.
| Présentation | Sujet |
|---|---|
| How GPU Computing Works | le compromis débit/latence, la DRAM, pourquoi la bande passante est le goulot |
| How CUDA Programming Works (GTC 2022) | le modèle d'exécution, l'ordonnancement |
| How to Write a CUDA Program (GTC 2023/2024) | la démarche pratique |
| Advanced Strategies for High-Performance GPU Programming | Hopper, l'asynchronisme |
Par où commencer
Si vous ne regardez qu'une vidéo sur le GPU, regardez How GPU Computing Works.
Elle explique, en une heure et sans prérequis, pourquoi un GPU a la forme qu'il a : « le GPU est une machine à débit, le CPU une machine à latence » ; « le goulot n'est pas les FLOPS, c'est la bande passante mémoire » ; le fonctionnement de la DRAM, l'ordonnancement des warps, l'occupancy.
C'est le contenu de la partie 1 de ce document, par la personne qui a conçu le système.
2.3 Les GTC de NVIDIA¶
Les sessions techniques de la GPU Technology Conference sont archivées et accessibles gratuitement (inscription requise) sur nvidia.com/gtc.
Les catégories qui valent le détour :
- les présentations d'architecture à chaque nouvelle génération (Hopper, Blackwell, Rubin) — la source la plus détaillée avant les whitepapers ;
- les sessions CUTLASS — souvent les seules explications publiques de certaines techniques ;
- les sessions sur les bibliothèques (cuBLAS, cuDNN, NCCL) — ce qui a changé et pourquoi ;
- les retours d'expérience d'équipes ayant optimisé une charge réelle.
Recherchez par mot-clé : CUTLASS, Hopper, Blackwell, TMA, warp
specialization, inference optimization.
2.4 Les cours filmés¶
freeCodeCamp — CUDA Programming Course¶
Un cours de 12 heures créé par Elliot Arledge, publié sur la chaîne freeCodeCamp. Couvre les bases jusqu'à l'intégration dans PyTorch.
Format long, rythme accessible, bon pour un premier passage complet.
Les tutoriels officiels NVIDIA¶
La chaîne NVIDIA Developer publie des séries sur les bases, les noyaux, la mémoire, les algorithmes parallèles, la mémoire partagée et Thrust.
Les cours universitaires enregistrés¶
Plusieurs cours de programmation parallèle (Illinois, CMU, Stanford) ont leurs enregistrements accessibles. Qualité variable ; les supports écrits sont souvent plus efficaces.
2.5 Les conférences académiques¶
Pour suivre la recherche :
| Conférence | Domaine | Ce qu'on y trouve |
|---|---|---|
| MLSys | systèmes pour l'apprentissage | les papiers d'inférence et de noyaux |
| ASPLOS | architecture + systèmes | les travaux de co-conception |
| SC (Supercomputing) | HPC | le calcul scientifique sur GPU |
| PPoPP | programmation parallèle | les modèles et les compilateurs |
| ISCA / MICRO | architecture | les analyses de microarchitecture |
| OSDI / SOSP | systèmes | les moteurs d'inférence |
| NeurIPS / ICML | apprentissage | FlashAttention et consorts y sont publiés |
La plupart publient leurs vidéos de présentation, souvent plus digestes que les papiers pour une première approche.
2.6 Les chaînes et les formats courts¶
| Source | Contenu |
|---|---|
| Chips and Cheese | analyses de microarchitecture, y compris GPU |
| SemiAnalysis | analyses matérielles et économiques, dont Nvidia Tensor Core Evolution |
| Modal | vidéos et articles techniques, dont la rétro-ingénierie de FlashAttention-4 |
| PyTorch Conference | les sessions sur Triton, Helion, Inductor |
| AMD ROCm | les sessions sur CDNA et les Matrix Cores |
2.7 Un parcours vidéo suggéré¶
Semaine 1
· Stephen Jones, How GPU Computing Works (1 h)
· GPU MODE 3, Getting Started With CUDA (1 h)
· GPU MODE 4, Intro to Compute and Memory Architecture (1 h)
Semaine 2-3
· freeCodeCamp, CUDA Programming Course (12 h, en plusieurs fois)
· GPU MODE 9, Reductions (1 h)
Semaine 4
· GPU MODE 1, Profiling and Integrating CUDA kernels (1 h)
· GPU MODE 8, CUDA Performance Checklist (1 h)
Ensuite, au fil des besoins
· GPU MODE 12, Flash Attention
· GPU MODE 14, Triton
· GPU MODE 15, CUTLASS
· GTC : la session d'architecture de votre carte
La vidéo ne remplace pas le code
Regarder douze heures de cours donne l'impression d'avoir appris. Ce n'est pas le cas.
Le rapport qui fonctionne : une heure de vidéo pour trois heures de code. Utilisez la vidéo pour comprendre un concept, puis implémentez-le immédiatement.
Chapitre suivant : 3 · Papiers de recherche