Web Analytics
20 Eylül 2026, Pazar

NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1'de İlk Kez Sahneye Çıktı

NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1'de İlk Kez Sahneye Çıktı

NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1'deki ilk önizleme sunumunda DeepSeek-R1 ve Qwen3-VL kıyaslamalarında GB300 NVL72'ye kıyasla 3,7 kata kadar daha yüksek verim sundu.

Vera Rubin NVL72'nin MLPerf Inference v6.1 İlk Sunumu

NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1'de ilk önizleme sunumunu gerçekleştirdi. NVIDIA, önizleme sonuçlarını DeepSeek-R1 ve Qwen3-VL kıyaslamalarında sundu. NVIDIA Blog'a göre Vera Rubin NVL72, GB300 NVL72'ye kıyasla 3,7 kata kadar daha iyi verim sunuyor.

Qwen3-VL kıyaslamasında Vera Rubin NVL72, GB300 NVL72'ye kıyasla 3,7 kata kadar daha yüksek verim sundu. Bu sonuçlar NVIDIA Dynamo açık kaynak çıkarım çerçevesiyle vLLM kullanılarak elde edildi. DeepSeek-R1'de ise GB300 NVL72'ye kıyasla 2,5 kata kadar daha yüksek verim sağlandı; bu sonuçlar NVIDIA TensorRT-LLM kütüphanesi kullanılarak elde edildi.

Ölçekleme Verimliliği ve WAN 2.2 Sonuçları

NVIDIA Blog'a göre dört GB300 NVL72 rafına yayılan 288 GPU'lu bir sunum %99 ölçekleme verimliliğine ulaştı. DeepSeek-R1 sunumu tek bir GB300 NVL72 rafından dört rafa ölçeklendiğinde çevrimdışı senaryoda yine %99 ölçekleme verimliliğine ulaşıldı. Ölçekleme verimliliği, raf içinde yüksek bant genişlikli düşük gecikmeli scale-up interconnect'ler, raflar arası yüksek bant genişlikli ağ ve düğümler arası verimli istek orkestrasyonu ile sağlanıyor.

GB300 NVL72, WAN 2.2 metinden videoya kıyaslamasında saniyede 0,65 adet 720p videoya ulaştı. Aynı kıyaslamada video başına 5,7 saniye gecikme elde edildi. NVIDIA Blog'a göre bu sonuçlar tek düğüme kıyasla 9 kat daha yüksek verim ve 7,5 kat daha düşük gecikme anlamına geliyor.

Yazılım Optimizasyonları ve Ajan Kıyaslamaları

NVIDIA Blog'a göre MLPerf Inference v6.1 sunumlarındaki yazılım optimizasyonları v6.0'a kıyasla 1,6 kata kadar daha yüksek performans sağladı. v6.1'de GB300 NVL72'nin Qwen3-VL performansı v6.0 sonuçlarına kıyasla 1,6 kata kadar iyileşti. Qwen3-VL performans kazanımları daha düşük KV önbellek hassasiyeti, ek çekirdek füzyonu, daha iyi çekirdekler ve vLLM ile NVIDIA Dynamo kullanan disaggregated serving yoluyla elde edildi.

AI ajanları, çıkarım performansının ölçülme şeklini yeniden şekillendiriyor. SemiAnalysis AgentX kıyaslamasında Vera Rubin NVL72, önizleme testinde GB300 NVL72'ye kıyasla 30 kat daha iyi performans sundu. MLPerf Endpoints kıyaslaması, geleneksel verim kıyaslamalarının ötesinde ajan tabanlı çıkarım iş yüklerine standart ölçüm getirecek.

Platform Mimarisi ve Ortak Katılımı

Vera Rubin'in gelişmiş Tensor Core'ları ve Transformer Engine'i, çıkarımın hem prefill hem de decode aşamalarını hızlandırıyor. NVFP4 hassasiyeti model ağırlıkları, dikkat ve KV önbelleği genelinde bellek ayak izini azaltıyor. Vera Rubin sunumları, prefill ve decode'u ayıran disaggregated serving ile büyük ölçekli uzman paralelliğini yoğun kullandı. NVIDIA Blog'a göre altıncı nesil NVLink ve NVLink Switch, hazır Ethernet'e kıyasla 10 kat daha yüksek paket hızı ve 3 kat daha düşük gecikme sağlıyor.

19 ortak MLPerf katılımında yer aldı; ortaklardan sekizi çok düğümlü Blackwell NVL72 sistemleri kullandı. Nebius de Vera Rubin NVL72 önizleme sonuçlarını sundu. NVIDIA ayrıca Jetson AGX Thor sonuçlarını yeni tanıtılan Edge-Agentic kıyaslamasında Qwen3.6-27B ile sundu.

MLPerf Inference v6.1 sonuçları Closed Division kapsamındadır ve 16 Eylül 2026'da yayımlandı. NVIDIA platform sonuçları 6.1-0106 ve 6.1-0074 numaralı girdilerden alındı. Ölçekleme sonuçları için NVIDIA platform sonuçları 6.1-0073 ve 6.1-0074 numaralı girdilerden alındı. Sunum sonrası sonuçlar MLCommons tarafından henüz doğrulanmadı.

Diğer Haberler