Aller au contenu

Sources

Toutes les sources effectivement consultées lors de la rédaction, classées par type. Les affirmations chiffrées importantes du document renvoient à l'une d'elles.


Sources primaires

Documentations officielles NVIDIA

Documentations officielles AMD

Autres documentations


Papiers de recherche

Megakernels — le corpus central

Référence Ce qu'elle soutient dans ce document
Gupta, Stuart, Owens, A Study of Persistent Threads Style GPU Programming for GPGPU Workloads, InPar 2012 — eScholarship, GTC 2012 les quatre cas d'usage des persistent threads ; « peut aussi entraîner une perte de performance »
Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs — arXiv:2512.22219, HTML ttGraph, événements, workers/schedulers, 1,0-1,7×, 14,5→12,5 ms, pages de 32 Ko, 352 octets/tâche, fusion gather-GEMM à 11 %
Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel — arXiv:2604.13327 le problème du dynamisme, ETC
Fleet: Hierarchical Task-based Abstraction for Megakernels on Multi-Die GPUs — arXiv:2604.15379 chiplet-tasks, L2 12→54 %, −37 % HBM, 1,3-1,5× vs vLLM
Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search — arXiv:2605.11581, HTML 14,6 % de surcoût de lancement, +23,6 % / +50,2 %, déploiement Baidu
AutoMegaKernel: A Statically-Checked Agent Harness — arXiv:2606.09682 7 160 ordonnancements validés, parité jeton à jeton, 1,25-1,72×, L4/L40S

Microarchitecture

  • Dissecting the NVIDIA Volta GPU Architecture via Microbenchmarking — arXiv:1804.06826
  • Dissecting the NVidia Turing T4 GPU via Microbenchmarking — arXiv:1903.07486
  • Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis — arXiv:2501.12084 → wgmma à 95 % du pic contre 62,9 % pour mma
  • Microbenchmarking NVIDIA's Blackwell Architecture: An in-depth Architectural Analysis — arXiv:2512.02189 → latences tcgen05 (11,0-11,4 cycles), TMEM (256 Ko, 16 To/s, 420 cycles), débits par précision, moteur de décompression

Modèles de performance

  • Williams, Waterman, Patterson, Roofline: An Insightful Visual Performance Model for Multicore Architectures, CACM 52(4), 2009 — DOI
  • Hierarchical Roofline Performance Analysis for Deep Learning Applications — arXiv:2009.05257
  • Volkov, Better Performance at Lower Occupancy, GTC 2010 — PDF
  • Optimization Techniques for GPU Programming, ACM Computing Surveys 55(11) — ACM DL

Attention et noyaux d'IA

Quantification

Compilateurs et DSL

  • Tillet, Kung, Cox, Triton: An Intermediate Language and Compiler for Tiled Neural Network Computations, MAPL 2019 — ACM DL
  • Liger Kernel: Efficient Triton Kernels for LLM Training — arXiv:2410.10989
  • The Anatomy of a Triton Attention Kernel — arXiv:2511.11581
  • Optimal Software Pipelining and Warp Specialization for Tensor Core GPUs — arXiv:2512.18134
  • Mojo: MLIR-Based Performance-Portable HPC Science Kernels — arXiv:2509.21039

MoE et communication

  • SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations — arXiv:2512.14080
  • Demystifying NVSHMEM: A System-Level Analysis on Symmetric Memory and Device-Initiated Operations — arXiv:2606.05951
  • GPU-Initiated Networking for NCCL — arXiv:2511.15076
  • TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference — arXiv:2505.11329
  • Deep Kernel Fusion for Transformers — arXiv:2602.11808
  • Tile-Level Activation Overlap for Efficient LLM Inference — arXiv:2607.02521

Génération automatique de noyaux

  • KernelBench-X: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels — arXiv:2605.04956
  • FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems — arXiv:2601.00227
  • EvoEngineer: Mastering Automated CUDA Kernel Code Evolution with LLMs — arXiv:2510.03760
  • ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants — arXiv:2604.18616
  • Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates — arXiv:2606.26453
  • KForge: Program Synthesis for Diverse AI Hardware Accelerators — arXiv:2511.13274
  • Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU — arXiv:2605.26118

Calcul scientifique et graphique

  • MFC 5.0: An exascale many-physics flow solver — arXiv:2503.07953
  • Aurora: Architecting Argonne's First Exascale Supercomputer — arXiv:2509.08207
  • GPU Performance Portability needs Autotuning — arXiv:2505.03780
  • GPU Acceleration of CFD Simulations in OpenFOAM, MDPI Aerospace 10(9), 792 — MDPI
  • GPU-accelerated simulations of turbulence, Phys. Rev. Fluids — APS
  • Kerbl et al., 3D Gaussian Splatting for Real-Time Radiance Field Rendering, SIGGRAPH 2023 — page projet
  • Cooperative Kernels: GPU Multitasking for Blocking Algorithms — arXiv:1707.01989

Sources primaires — blogs des équipes concernées

Ces billets sont des sources primaires : ils sont écrits par les auteurs des travaux et contiennent des chiffres qu'on ne trouve nulle part ailleurs.

Source Ce qu'elle soutient
Hazy Research, Look Ma, No Bubbles! 1,3 µs par lancement avec CUDA Graphs ; 80 SM inactifs sur 512 blocs ; décompte des 600 µs sur B200 ; 13 pages de 16 Ko ; < 1 ms sur H100, ~680 µs sur B200 ; 78 % de bande passante ; 2,5× vLLM, 1,5× SGLang ; ~770 contre ~1 350 passes/s ; limites de PDL ; barrières à ~60 ns
Hazy Research, We Bought the Whole GPU 23 468 contre 19 170 jetons/s (+22 %) ; recouvrement à trois niveaux (2-6 %, 14,2 %) ; transposition distribuée (trafic ÷8) ; neuf instructions ; > 90 % d'inactivité CPU ; débordements de registres
Kog, Single-kernel LLM inference on MI300X ~4,5 µs par lancement ; 35 % du temps en synchronisation de grille ; sentinelle 7,59-7,88 → 0,80-0,93 µs ; duplication par XCD ; > 3 000 jetons/s ; DTP
Zhihao Jia, Compiling LLMs into a MegaKernel présentation de MPK par son auteur
Catalyst (CMU), page MPK contexte du projet
CMU 15-779, lecture 7 : Mega-Kernel présentation pédagogique

Sources secondaires — analyses et tutoriels

Tutoriels techniques

Blogs NVIDIA et PyTorch

Références et glossaires

Communauté et curriculums

Dépôts de code


Sources de contexte


Méthodologie

Ce qui a été fait et ce qui ne l'a pas été

Fait :

  • consultation directe de chaque source listée ;
  • vérification croisée des chiffres importants entre au moins deux sources quand c'était possible ;
  • attribution de chaque affirmation chiffrée à sa source dans le corps du document ;
  • calculs arithmétiques (intensités, planchers de temps, tailles de cache) refaits et vérifiables au papier.

Pas fait :

  • aucune mesure n'a été reproduite. L'environnement de rédaction ne dispose ni de GPU ni de compilateur CUDA ;
  • aucun code n'a été compilé ni exécuté. Les extraits suivent les documentations citées mais n'ont pas été validés ;
  • les papiers longs ont été lus par leur résumé, leurs figures et leurs sections de résultats, pas intégralement.

Les affirmations chiffrées sont donc des rapports de sources, pas des vérifications indépendantes. Elles sont attribuées comme telles dans tout le document.


Document créé le 22 août 2026.

Retour : Annexes · Index du cours