SM89 / core baselineAda
Warp, bellek, doluluk ve klasik Tensor Core çalışmaları için yerleşik çekirdek taban.
On iki etkileşimli atlas; görsel GPU temellerini, döşeme düzeyi programlamayı, Blackwell farkındalıklı optimizasyonu ve dağıtık çıkarımı, desteklenen mimari ve arka uç sınırlarını görünür kılan 12 haftalık kanıt rotasında birleştirir.
GPU Kernel Atlas’ta teori, kod ve ölçüm yöntemlerini öğren; GEX’te GPU bileşenlerini ve yürütme adımlarını etkileşimli 3B sahneler ve zaman çizelgesiyle keşfet. Ardından buradaki laboratuvarda öğrendiklerini uygula.
GEX eğitim amaçlı kavramsal modeller kullanır; gerçek çip yerleşimi, çevrim doğruluğunda simülasyon veya ölçülmüş performans sonucu sunmaz.
GPU, öğrenme sisteminin hesaplama temelidir. Bu uygulamalar arasında konuya göre ilerle; her uygulama bağımsız çalışır ve ilerleme kaydın aktarılmaz.
Her mimari etiketi, kavramların uygulanabilirliğini ve olgunluğunu gösterir; en yeni donanıma sahip olduğunuzu varsaymaz.
SM89 / core baselineWarp, bellek, doluluk ve klasik Tensor Core çalışmaları için yerleşik çekirdek taban.
SM90 / currentTMA, warp-group MMA, dağıtık paylaşılan bellek ve kalıcı zamanlama için güncel temel.
SM100 · SM120 / currentSM100 ve SM120 farklı hedeflerdir. TMEM ve küme duyarlı SM100 yollarını SM120 için varsayma; Tensor Core ve FP4/FP8 desteğini seçilen kernel ile doğrula.
SM107 / previewYalnızca güncel birinci taraf araç zincirlerinin belgelediği yeteneklerle sınırlı önizleme materyali.
Önizleme içeriği, desteklenen araç zincirlerine bağlıdır.Birinci taraf kaynaklar yayın öncesinde tazelenir; belge güncelliği, özellik olgunluğu ve mimari/backend uygulanabilirliği ayrı değerlendirilir.
Temel: donanım kuşağından bağımsız, tamamlanması gereken beceri ve kanıt.
Güncel: güncel birinci taraf kanıtla desteklenir; mimari ve backend uygulanabilirliği ayrıca doğrulanır.
Önizleme: araç zinciri ya da donanım olgunlaşmasına bağlı keşif yoludur; mezuniyet koşulu değildir.
Etkileşimli laboratuvarlar eğitim amaçlı simülasyonlardır; ölçülmüş donanım sonucu iddia etmez.
Referans, şekil/veri tipi matrisi ve sanitizer temizliği olmadan kernel tamamlanmış sayılmaz.
Isınma, yüzdelik dağılımları, profil oluşturucu kanıtı ve kontrollü bir taban çizgisi olmadan hız iddiası kurulmaz.
Gerçek hedef; PyTorch, derleme ve hizmet iş yükleri içinde çalışan, portföy kalitesinde bir operatördür.
Görsel temellerden bitirme projesine ilerleyen rota. Her atlas kendi etkileşimli laboratuvarını, Kavram Stüdyosu’nu, karar modelini ve kabul çıktısını içerir.
Önerilen tempo haftada 14–16 saat. Tarayıcıda kavramları çalış; çalışan kernel, doğruluk testi ve ölçüm raporunu kendi GPU ortamında üret.
GPU/arka uç, compute capability, araç zinciri ve ölçüm bağlamını kaydet.
Izgara, warp işbirliği, dallanma ve tile düzeyi problem ayrıştırma.
Birleşik erişim, tensor tanımlayıcı, TMA/DSMEM uygulanabilirliği ve TMEM sınırı.
torch.library, triton_op/wrap_triton, opcheck ve yapılandırılmış autotune.
Gruplu iş atama, yönlendirme ve profil kanıtıyla operatör seçimi.
FP8/MXFP8 ölçek metaverisi, birikim ve kalite koruması.
Kararlı softmax, paged KV-cache ve FP4/FP8 uygulanabilirlik sınırları.
Referans, tolerans, alias/determinism, memcheck, racecheck ve TMEM korumaları.
Rapor birleştirme, clustering, instruction mix, scoreboard ve CUDA Graph düğümü.
C++/CuTe → PTX/SASS kanıtı, Tensor Core ve mimariye bağlı kalıcı/gruplu planlama.
Encode/prefill/decode, graph sınırları, DP/TP/PP/EP ve topoloji kanıtı.
TTFT/ITL/iş hacmi raporu, iki %15+ füzyon ve savunma
CUDA/Triton çift uygulama
iki fused kernel medyan kazanç
Nsight incelemesi
vLLM TTFT/ITL/ throughput raporu
mülakat savunması
Bu eşikler önerilen bitirme projesi hedefleridir; garanti edilen hızlanma veya bu uygulamanın ölçtüğü sonuçlar değildir. Kazancı aynı donanım ve iş yükündeki taban çizgisiyle karşılaştır; hedefe ulaşılmadığında sonucu ve darboğazı raporla.