Dunia
Repositori Github Merinci Cara Menjalankan Deepseek V4 Flash Pada Satu AMD Mi300x
Checkpoint 304B parameter berjalan tanpa kuantisasi tambahan atau offload. MI300X dengan HBM3 192 GB dan bandwidth 5,3 TB/s memungkinkan penerapan GPU tunggal, dengan harga daftar sekitar setengah dari H100 SXM5. Perbaikan kunci mengatasi ketidakcocokan format FP8, bug routing MoE, dan bentuk kernel. Tumpukan ini menggunakan vLLM RO Cm nightly dengan digest terikat dan AITER 0.1.19. Prefill tanpa cache mencapai 7,9–8,5K tok/s tergantung anggaran penjadwal; profil produksi dengan anggaran 2.048 token menghasilkan 6.988–7.019 tok/s. Pengambilan hangat 380K token cache memakan 0,64–2,65 detik setelah prefill dingin 120–125 detik. Repositori dilisensikan Apache-2.0, dengan model berlisensi MIT.
Sumber: Hacker News






