Yapay Zekâ Altyapıları
NVLink Fusion ve NVHBM: Özel AI Çiplerinde Bağlantı ve Bellek Nasıl Gelişiyor?
NVIDIA, kendi yapay zekâ çipini tasarlayan şirketlere iki önemli teknoloji sunuyor: çipleri rack içinde birbirine bağlayan NVLink Fusion ve belleği çipe daha verimli bağlayan NVHBM.

Yapay zekâ modelleri büyüdükçe hızlı bir işlemci tek başına yetmiyor. Üstelik verinin işlemciye ne kadar çabuk geldiği de önem kazanıyor. Bunun yanında çip üzerinde kalan alan ve sistemin toplam güç tüketimi performansı doğrudan etkiliyor. Bu nedenle büyük bulut şirketleri ve yapay zekâ odaklı firmalar kendi hızlandırıcılarını, yani XPU’larını geliştiriyor. Özellikle üç temel soru öne çıkıyor: belleği nasıl daha hızlı besleriz, çipe nasıl daha fazla hesaplama kapasitesi sığdırırız ve güç tüketimini nasıl yönetiriz?
NVIDIA’nın NVLink Fusion ve NVHBM yaklaşımı bu üç soruyu hedefliyor. Aynı zamanda çözüm yalnızca çip seviyesinde kalmıyor; rack ölçeğinde bağlantıyı ve veri akışını da kapsıyor.
NVLink Fusion: kendi çipini NVIDIA altyapısına bağlamak
NVLink Fusion, şirketlerin kendi geliştirdiği CPU ve XPU’ları NVIDIA’nın AI platformuna katmasına yardımcı olan bir bağlantı teknolojisi ve IP paketi. Bu sayede özel çipler NVIDIA’nın ağ yapısını, MGX rack mimarisini ve mevcut ekosistemini kullanıyor. Dolayısıyla şirketler rack ve ağ altyapısını sıfırdan geliştirmek zorunda kalmıyor. Sonuç olarak bu yaklaşım geliştirme süresini ve altyapı karmaşıklığını azaltabiliyor.
Çalışma mantığı oldukça basit. Önce NVLink Fusion chiplet’i, özel XPU ile NVLink ağı arasında köprü görevi görüyor. Ardından aynı rack içindeki XPU’lar ortak bir scale-up alanında bir araya geliyor. CPU ile XPU arasındaki bağlantıyı NVLink-C2C kuruyor. Böylece özel işlemciler ve hızlandırıcılar NVIDIA GPU’larıyla aynı sistemde birlikte çalışıyor.
NVHBM: belleği çipe daha verimli bağlamak
HBM, yapay zekâ hızlandırıcılarında yer alan yüksek bant genişlikli bir bellek teknolojisi. NVHBM ise NVIDIA’nın önde gelen bellek üreticileriyle birlikte geliştirdiği özel bir HBM base-die teknolojisi. NVIDIA’ya göre NVHBM, standart HBM4e’ye kıyasla üç temel alanda avantaj sunuyor: daha yüksek bellek bant genişliği, hesaplama için daha geniş çip alanı ve daha düşük güç tüketimi.
| Alan | NVIDIA’nın bildirdiği kazanım |
|---|---|
| Bellek bant genişliği | Stack başına %30’a kadar daha fazla |
| PHY ve destek alanı | %67’ye kadar küçülme (JEDEC HBM4e’ye göre) |
| Çip üzerinde hesaplama alanı | %25 ila %30’a kadar daha fazla |
| HBM güç tüketimi | %15 daha düşük |
| XPU başına toplam etki | Yaklaşık %30 uçtan uca performans artışı |
Bellek hızı neden bu kadar önemli?
Bir hızlandırıcı çalışırken model ağırlıklarını, aktivasyonları ve KV cache verisini sürekli bellekten okur. Ancak bellek yeterince hızlı değilse işlem birimleri veri beklemek zorunda kalır. Bu nedenle çip kâğıt üzerinde ne kadar güçlü olursa olsun, belleğe yoğun biçimde bağımlı iş yüklerinde gerçek performansı çoğu zaman bellek sistemi belirler. NVHBM’in temel avantajı tam burada ortaya çıkıyor. Stack başına %30’a kadar daha fazla bant genişliği, işlem birimlerinin veriyi daha hızlı almasına yardımcı oluyor. NVIDIA ayrıca bunun büyük model çıkarımında kullanıcı başına token hızını artırabileceğini söylüyor.
Kısacası iki teknoloji farklı seviyelerde çalışıyor. NVHBM, tek bir hızlandırıcının içindeki veri akışını hızlandırıyor. NVLink Fusion ise farklı hızlandırıcıların birbiriyle iletişim kurmasına olanak veriyor. Özellikle Mixture-of-Experts gibi modellerde bu bağlantı daha da önem kazanıyor. Çünkü farklı uzman modeller farklı çiplerde yer alabiliyor. Bu yüzden çipler arasındaki veri trafiği oldukça yoğun olabiliyor.
Çip üzerinde daha fazla yer
Bir AI çipinin fiziksel alanı sınırlı. Matris birimleri, SRAM, cache, kontrol mantığı, ağ bağlantıları ve bellek arayüzü aynı alanı kullanıyor. Dolayısıyla bellek arayüzü ne kadar fazla yer kaplarsa, hesaplama birimlerine o kadar az alan kalıyor. NVHBM bu noktada iki yöntem kullanıyor. İlk olarak bellek kontrolcüsünü 3D HBM yığınının içine taşıyor. Ardından özel bir fiziksel arayüz, yani PHY kullanıyor.
NVIDIA’nın hesabına göre bu yapı, arayüzün ve destek devrelerinin kapladığı alanı JEDEC HBM4e standardına kıyasla %67’ye kadar azaltıyor. Böylece compute die daha fazla alan kazanıyor.
Güç tasarrufu
Güç tüketimi, modern AI veri merkezlerinin en önemli sınırlarından biri. HBM’in harcadığı enerji yalnızca çipi etkilemiyor. Aynı zamanda rack’in elektrik altyapısını ve soğutma planını da doğrudan belirliyor.
NVIDIA, NVHBM’in standart HBM4e’ye göre %15 daha az güç harcadığını söylüyor. Tek bir hızlandırıcıda bu fark küçük görünebilir. Ancak binlerce hızlandırıcıya sahip veri merkezlerinde toplam etki ciddi bir seviyeye çıkıyor.
NVIDIA’nın örnek hesabı
ek XPU için güç payı
Örneğin NVIDIA’nın hesabında HBM tarafındaki %15’lik tasarruf, aşağıdaki koşullarda bu kadar ek hızlandırıcıya yetecek güç alanı açıyor.
veri merkezi kapasitesi
XPU başına güç
daha düşük HBM gücü
İkisi birlikte: rack ölçeğinde sonuç
NVHBM, çip seviyesinde bellek hızını, alanı ve güç verimliliğini iyileştirmeyi hedefliyor. NVLink Fusion ise bu çiplerin aynı rack içinde NVIDIA platformuyla iletişim kurmasını sağlıyor. Dolayısıyla iki teknoloji birbirini tamamlıyor. NVIDIA, bant genişliği, alan ve güç kazanımlarını birleştirdiğinde XPU başına yaklaşık %30’luk uçtan uca performans artışı hesaplıyor.
Bunun yanında ortak bir altyapı kullanmak, özel XPU’larla NVIDIA GPU’larını aynı veri merkezinde çalıştırmayı kolaylaştırabiliyor. Böylece kurumlar kapasiteyi farklı iş yükleri arasında daha esnek dağıtabiliyor. Ancak burada önemli bir nokta var. Yazıdaki yüzdeler NVIDIA’nın kendi açıkladığı “en fazla” kazanımlar. Gerçek sonuç ise çalıştırdığınız iş yüküne, XPU tasarımına ve sistem mimarisine göre farklı çıkabilir.
GTM Teknoloji
AI altyapınızı birlikte planlayalım
GPU, CPU, bellek, ağ, depolama, güç ve soğutma ihtiyaçlarınızı iş yükünüze göre birlikte değerlendirebiliriz.