Referans, şekil/dtype matrisi ve sanitizer temizliği olmadan kernel tamamlanmış sayılmaz.
Kernel’i yaz.
Sistemi anla.
Kanıtla.
CUDA’nın ilk warp’ından vLLM serving ve multi-GPU topolojisine kadar 11 etkileşimli atlas, tek bir 12 haftalık GPU Kernel Engineering uygulamasında.
KERNELNSIGHTCUTLASSÇIKARIMNCCL
Warm-up, quantile, profiler ve kontrollü baseline olmadan hız iddiası kurulmaz.
Gerçek hedef; PyTorch, compile ve serving iş yükü içinde çalışan portföy kalitesinde operatördür.
Tek uygulama.
On bir uzmanlık alanı.
Temelden capstone’a ilerleyen rota. Her atlas kendi etkileşimli laboratuvarını, karar modelini ve kabul çıktısını içerir.
Okuma listesi değil.
Üretim sistemi.
Haftada 14–16 saat. Her hafta çalışan kod, doğruluk kanıtı veya ölçüm raporu üretir.
C++/Linux/CMake ortamı; adım ve yerleşim gözlemi
Izgara, blok, warp, dallanma ve ilk güvenli kernel
HBM, paylaşılan bellek, banka çakışması ve doluluk
torch.library, sahte kernel, opcheck ve ilk Triton kernel
Referans, adıma duyarlı indeksleme ve CUDA/Triton ikilisi
Aktivasyon + çarpım füzyonu; yazmaç baskısı
Kararlı indirgeme, maske ve çevrimiçi softmax
Dağıtma/güncelleme, yarışlar ve geniş test matrisi
Isınma, yüzdelikler, çatı çizgisi ve üç profil çalışması
Döşeme politikası ve ilk uçtan uca birleştirilmiş kernel
vLLM, CUDA Graphs, NCCL ve iletişim maliyeti
TTFT/ITL/iş hacmi raporu, iki %15+ füzyon ve savunma
CUDA/Triton çift uygulama
iki fused kernel medyan kazanç
Nsight incelemesi
vLLM TTFT/ITL/ throughput raporu
mülakat savunması