Dünya
V4 Flash, Tek Bir AMD Mı300x Üzerinde Üretim Ortamında Çalıştırmak İçin Gerekli Yapılandırma ve Yamaları İçeren Bir Github Deposu Yayınlandı
Depo, Docker Compose yığını, SHA-256 ile sabitlenmiş dosya katmanları, upstream'e karşı referans farklarını ve ayar tablolarını barındırıyor. Model, ek ağırlık niceleme veya boşaltma olmadan olduğu gibi çalışıyor. Resmi vLLM tarifi NVIDIA ve daha yeni AMD donanımlarını hedeflerken, MI300X üzerinde güvenilir çalışma için FP8 formatı, yüksek eşzamanlılıkta MoE yönlendirmesi, nedensel spekülatif doğrulama, CPU-KV senkronizasyonu ve birkaç ayarlanmamış çekirdek şekli için düzeltmeler gerekti.
MI300X, 192 GB HBM3 ve 5.3 TB/s bellek bant genişliğine sahip; H100 SXM5'in HBM kapasitesinin 2.4 katı. 304B parametreli kontrol noktası için bellek kapasitesi tek GPU dağıtımına olanak tanıyor. MI300X (CDNA3), AMD/Graphcore fnuz E4M3 varyantını uygularken, MI325X ve daha yenileri OCP standart FP8 kullanıyor.
OCP semantiğini varsayan bir çekirdek, MI300X'te ölçek alanında iki kat hatalı olabilir. Yığın, sindirimle sabitlenmiş resmi vLLM RO Cm gece sürümünü kullanıyor: bir MI300X (gfx942, 304 CU, ~192 GiB HBM), çalışan AMD çekirdek sürücüsü, güncel Docker Compose, CPU KV katmanı için ~235 GiB RAM ve ~500 GB disk (model önbelleği ~156 GB). Sağlıklı başlangıç ~5 dakika sürüyor ve grafik yakalamadan sonra rocm-smi --showmeminfo vram çalıştırıldığında ısınmış yüksek su işareti ~205.8 GB'ın 204.5 GB'ı olmalı.
Yamalar arasında MXFP4 yönlendirme düzeltmesi (mask = (offs_local < BLOCK_SIZE) & (offs_global < nonzero_indx_size)), FP8 format uyumluluğu (float8e4b8, FP8_MAX=224.0, karıştırılmış yazma ofsetleri) ve Gumbel gürültü bağımsızlığı yer alıyor. Ayarlanmış çekirdeklerle önbelleksiz ön doldurma, zamanlayıcı bütçesine bağlı olarak 7.9–8.5K tok/s'ye ulaşıyor; üretim profili 2.048 token bütçesiyle 6.988–7.019 tok/s veriyor. 1.024 token uzun ön doldurma sınırıyla 8.9K token istemi C1'de 5.20–5.29K tok/s'ye ulaşıyor.
52K soğuk ön doldurmanın arkasında kısa istek için TTFT 8.2 s'den 0.5 s'ye düşüyor. 380K önbelleğe alınmış tokenin sıcak geri çağrılması, 120–125 s soğuk ön doldurmadan sonra 0.64–2.65 s sürüyor. Yığın, belgeler ve vLLM türevli katmanlar Apache-2.0; AITER türevli katman MIT başlığını koruyor. Model MIT lisanslı.
Kaynak: Hacker News






