NVIDIA nastavlja da izvlači maksimum iz svoje Blackwell generacije GPU-ova, i to dok istovremeno uvodi platformu Vera Rubin. Najnoviji rezultati pokazuju dramatična poboljšanja i u performansama i u energetskoj efikasnosti.

GB200 NVL72: 4x više tokena po megavatu
U samo tri meseca, NVIDIA je povećala propusnost po megavatu (TPS/MW) za čak 4x na istoj GB200 NVL72 konfiguraciji koja pokreće DeepSeek R1 0528. Ovo je postignuto kroz 38 većih optimizacija koje su testirane u više od 250.000 simuliranih konfiguracija, što ukupno čini 1,4 miliona GPU sati testiranja. Više od 90% ovih optimizacija primenljivo je i na druge AI modele.

GB300 „Blackwell Ultra“: svetski rekord u pre-treniranju
GB300 NVL72 postiže rekordnih 1.648 TFLOPs po GPU-u na modelu DeepSeek-V3 671B sa 256 GPU-ova kroz Megatron Core – što je 3x više u odnosu na GB200 sa 606 TFLOPs. Uz to, ista konfiguracija beleži 1,5x poboljšanje u poslednjih 6 meseci.

Korišćenjem TorchTitan frameworka, GB300 Ultra rack donosi 6x poboljšanje u odnosu na baznu konfiguraciju bez optimizacija. JAX framework ide još dalje – 1025 TFLOPs/GPU i do 4082 tokena/s po GPU-u, što predstavlja 10x skok u odnosu na januar 2026.

Skalabilnost je takođe impresivna: na konfiguraciji od 1024 GPU-ova, Megatron Core dostiže 98,5% efikasnosti skaliranja, dok TorchTitan i JAX drže do 97%. Ključna komponenta je NVIDIA-in 800 Gb/s Scale-Out networking čip unutar svakog NVL72 racka.
Dok Blackwell i dalje napreduje, Vera Rubin platforma već se uvodi sa još većim skokovima u performansama.



