NVIDIA, Rubin CPX’i yeniden hayata geçiriyor: GDDR7 yerine 168 GB HBM4 geliyor

NVIDIA’nın bir süre önce rafa kaldırdığı Rubin CPX yapay zekâ hızlandırıcısı geri dönüyor. Ancak şirketin yeni planında önemli bir değişiklik var: Daha önce düşünülen 128 GB GDDR7 bellek yerine 168 GB HBM4 kullanılacak.
NVIDIA, Rubin CPX’i yeniden hayata geçiriyor: GDDR7 yerine 168 GB HBM4 geliyor

Tedarik zinciri analisti Ming-Chi Kuo’nun aktardığı bilgilere göre NVIDIA, özellikle büyük dil modellerinin giderek büyüyen bellek ve bant genişliği ihtiyaçlarını karşılamak için Rubin CPX’in tasarımını yeniden ele aldı.

Rubin CPX’in görevi LLM’lerin “prefill” aşamasını hızlandırmak

Rubin CPX, standart Rubin GPU’larının doğrudan alternatifi olmayacak. NVIDIA bunun yerine yapay zekâ çıkarım sürecindeki işleri iki farklı GPU grubuna ayırmayı planlıyor.

CPX GPU’ları prefill, yani modelin kullanıcı tarafından verilen uzun giriş bağlamını ilk kez işlediği aşamaya odaklanacak. Standart Rubin GPU’ları ise sonraki tokenların üretildiği decode işlemini üstlenecek.

Böylece tek GPU grubunun iki farklı iş yükünü aynı anda yürütmesi yerine, her donanım kendi uzmanlaştığı göreve yoğunlaşabilecek.

Bu yaklaşım özellikle trilyonlarca parametreye ulaşan büyük dil modellerinde önemli hale geliyor. Uzun bağlamların ve bunlara bağlı KV önbelleğinin işlenmesi ciddi miktarda bellek kapasitesi ve bant genişliği gerektiriyor.

128 GB GDDR7 planı yerini 168 GB HBM4’e bıraktı

Rubin CPX’in önceki tasarımında 128 GB GDDR7 bellek kullanılması planlanıyordu. Yenilenen sürümde kapasite 168 GB’a çıkarken bellek teknolojisi de HBM4’e geçiyor.

HBM4, yüksek bant genişliği sayesinde özellikle büyük yapay zekâ modellerinin yoğun bellek trafiği oluşturduğu iş yüklerinde GDDR7’ye göre daha uygun bir çözüm olabilir.

Sekiz Rubin CPX GPU içeren tek bir tepsi toplamda yaklaşık 1,34 TB HBM4 belleğe ulaşabilecek. Bu kapasite uzun bağlamlı prefill işlemleri ve bunların KV önbelleklerini doğrudan yüksek hızlı bellekte tutmak için kullanılabilecek.

Paketleme tasarımının da değişmesi gerekiyor

GDDR7’den HBM4’e geçiş yalnızca bellek yongalarını değiştirmek kadar basit değil.

HBM belleklerin GPU ile çok daha yakın şekilde paketlenmesi gerektiğinden NVIDIA’nın Rubin CPX paketini yeniden tasarladığı düşünülüyor. Şirketin bunun için TSMC’nin CoWoS-S veya CoWoS-L gelişmiş paketleme teknolojilerinden birini kullanabileceği belirtiliyor.

Bu değişiklik Rubin CPX’i daha karmaşık ve muhtemelen daha pahalı hale getirecek olsa da bellek bant genişliği tarafında ciddi avantaj sağlayabilir.

Tek GPU’da 30 PetaFLOPS NVFP4 performansı

Rubin CPX’in işlem gücü de oldukça yüksek olacak.

GPU’nun monolitik bir yonga tasarımı kullanarak 30 PetaFLOPS NVFP4 yapay zekâ performansı sunması bekleniyor.

Çip üzerinde ayrıca dört NVENC video kodlama ve dört NVDEC video kod çözme motoru bulunacak. Böylece video ve diğer multimedya iş yüklerinin ek donanıma ihtiyaç duyulmadan doğrudan hızlandırıcı üzerinde işlenmesi mümkün olacak.

Tek rafta 256’ya kadar Rubin CPX kullanılabilecek

NVIDIA’nın Rubin CPX için bağımsız raf sistemleri hazırladığı belirtiliyor. Yapılandırmaya bağlı olarak tek rafta 64 ila 256 CPX GPU bulunabilecek.

NVIDIA’nın önerdiği mimaride prefill ve decode kaynaklarının dengeli kullanılması için CPX GPU’larıyla standart Rubin GPU’larının 1:1 oranında eşleştirilmesi öngörülüyor.

Böyle bir sistemde CPX tarafı uzun istemleri ve KV önbelleğini işlerken Rubin tarafı kullanıcıya gönderilecek tokenların üretilmesine odaklanacak.

Bu ayrıştırılmış mimarinin temel amacı oldukça basit: LLM’lerin uzun girdileri daha hızlı işlemesini ve ilk yanıtı daha kısa sürede üretmesini sağlamak.

Rubin CPX’in GDDR7 yerine HBM4 ile yeniden ortaya çıkması, NVIDIA’nın yeni nesil yapay zekâ altyapısında yalnızca hesaplama gücünü değil, bellek kapasitesi ve bant genişliğini de giderek daha kritik gördüğünü gösteriyor.

Yorum Yaz
Yorum yapabilmek için giriş yap veya üye ol.
Yorumlar