Aller au contenu

2 · Vidéos et conférences

Ce qui se regarde. Le format vidéo est particulièrement adapté à ce domaine : beaucoup de concepts se comprennent mieux avec un diagramme animé qu'avec un paragraphe.


2.1 GPU MODE

La ressource vidéo principale du domaine.

github.com/gpu-mode/lectures · chaîne YouTube · serveur Discord

Une série de conférences hebdomadaires portée par la communauté (anciennement CUDA MODE), couvrant le profilage, les noyaux, CUTLASS et le SASS. Les enregistrements sont publiés sur YouTube, et le code et les supports de chaque conférence sont dans le dépôt.

Les conférences les plus utiles, par thème :

# Titre Quand la regarder
1 Profiling and Integrating CUDA kernels in PyTorch avant la partie 9
3 Getting Started With CUDA avec la partie 2
4 Intro to Compute and Memory Architecture avec la partie 1
8 CUDA Performance Checklist avec la partie 3
9 Reductions avec le chapitre 5 de la partie 2
12 Flash Attention avec le chapitre 3 de la partie 7
14 Practitioner's Guide to Triton avec le chapitre 2 de la partie 5
15 CUTLASS avec le chapitre 3 de la partie 5
35+ sujets avancés au fil de l'eau

Pourquoi GPU MODE est différent

Les conférences sont données par des praticiens — ingénieurs de PyTorch, de NVIDIA, de laboratoires de recherche — et le code est fourni. Ce n'est pas un cours académique, c'est un partage de pratique.

Le Discord est actif et c'est l'endroit où poser une question technique précise sur un noyau.

Il existe aussi des notes de conférence rédigées par Christian Mills, utiles pour retrouver un point sans revisionner : christianjmills.com.


2.2 Les présentations de Stephen Jones (NVIDIA)

Stephen Jones est l'architecte en chef de CUDA. Ses présentations à la GTC sont les meilleures explications existantes du fonctionnement d'un GPU.

Présentation Sujet
How GPU Computing Works le compromis débit/latence, la DRAM, pourquoi la bande passante est le goulot
How CUDA Programming Works (GTC 2022) le modèle d'exécution, l'ordonnancement
How to Write a CUDA Program (GTC 2023/2024) la démarche pratique
Advanced Strategies for High-Performance GPU Programming Hopper, l'asynchronisme

Par où commencer

Si vous ne regardez qu'une vidéo sur le GPU, regardez How GPU Computing Works.

Elle explique, en une heure et sans prérequis, pourquoi un GPU a la forme qu'il a : « le GPU est une machine à débit, le CPU une machine à latence » ; « le goulot n'est pas les FLOPS, c'est la bande passante mémoire » ; le fonctionnement de la DRAM, l'ordonnancement des warps, l'occupancy.

C'est le contenu de la partie 1 de ce document, par la personne qui a conçu le système.


2.3 Les GTC de NVIDIA

Les sessions techniques de la GPU Technology Conference sont archivées et accessibles gratuitement (inscription requise) sur nvidia.com/gtc.

Les catégories qui valent le détour :

  • les présentations d'architecture à chaque nouvelle génération (Hopper, Blackwell, Rubin) — la source la plus détaillée avant les whitepapers ;
  • les sessions CUTLASS — souvent les seules explications publiques de certaines techniques ;
  • les sessions sur les bibliothèques (cuBLAS, cuDNN, NCCL) — ce qui a changé et pourquoi ;
  • les retours d'expérience d'équipes ayant optimisé une charge réelle.

Recherchez par mot-clé : CUTLASS, Hopper, Blackwell, TMA, warp specialization, inference optimization.


2.4 Les cours filmés

freeCodeCamp — CUDA Programming Course

Un cours de 12 heures créé par Elliot Arledge, publié sur la chaîne freeCodeCamp. Couvre les bases jusqu'à l'intégration dans PyTorch.

Format long, rythme accessible, bon pour un premier passage complet.

Les tutoriels officiels NVIDIA

La chaîne NVIDIA Developer publie des séries sur les bases, les noyaux, la mémoire, les algorithmes parallèles, la mémoire partagée et Thrust.

Les cours universitaires enregistrés

Plusieurs cours de programmation parallèle (Illinois, CMU, Stanford) ont leurs enregistrements accessibles. Qualité variable ; les supports écrits sont souvent plus efficaces.


2.5 Les conférences académiques

Pour suivre la recherche :

Conférence Domaine Ce qu'on y trouve
MLSys systèmes pour l'apprentissage les papiers d'inférence et de noyaux
ASPLOS architecture + systèmes les travaux de co-conception
SC (Supercomputing) HPC le calcul scientifique sur GPU
PPoPP programmation parallèle les modèles et les compilateurs
ISCA / MICRO architecture les analyses de microarchitecture
OSDI / SOSP systèmes les moteurs d'inférence
NeurIPS / ICML apprentissage FlashAttention et consorts y sont publiés

La plupart publient leurs vidéos de présentation, souvent plus digestes que les papiers pour une première approche.


2.6 Les chaînes et les formats courts

Source Contenu
Chips and Cheese analyses de microarchitecture, y compris GPU
SemiAnalysis analyses matérielles et économiques, dont Nvidia Tensor Core Evolution
Modal vidéos et articles techniques, dont la rétro-ingénierie de FlashAttention-4
PyTorch Conference les sessions sur Triton, Helion, Inductor
AMD ROCm les sessions sur CDNA et les Matrix Cores

2.7 Un parcours vidéo suggéré

Semaine 1
  · Stephen Jones, How GPU Computing Works              (1 h)
  · GPU MODE 3, Getting Started With CUDA               (1 h)
  · GPU MODE 4, Intro to Compute and Memory Architecture (1 h)

Semaine 2-3
  · freeCodeCamp, CUDA Programming Course               (12 h, en plusieurs fois)
  · GPU MODE 9, Reductions                              (1 h)

Semaine 4
  · GPU MODE 1, Profiling and Integrating CUDA kernels  (1 h)
  · GPU MODE 8, CUDA Performance Checklist              (1 h)

Ensuite, au fil des besoins
  · GPU MODE 12, Flash Attention
  · GPU MODE 14, Triton
  · GPU MODE 15, CUTLASS
  · GTC : la session d'architecture de votre carte

La vidéo ne remplace pas le code

Regarder douze heures de cours donne l'impression d'avoir appris. Ce n'est pas le cas.

Le rapport qui fonctionne : une heure de vidéo pour trois heures de code. Utilisez la vidéo pour comprendre un concept, puis implémentez-le immédiatement.


Chapitre suivant : 3 · Papiers de recherche