Skip to main content
search
GPU kümeleri için paralel depolama

GTM HPC Storage

GPU'larınızı bekletmeyen, iki katmanlı yüksek performanslı depolama. NVMe katmanı eğitim verisini ve checkpoint'leri taşır, HDD katmanı petabayt ölçeğinde arşivler. Yerli Magnetar donanımı, açık kaynak BeeGFS ve kurulumdan performans testine GTM.

38–461 TBNVMe scratch, kite göre
0,6–3 PBHDD arşiv, düğüm ekleyerek büyür
~35–120 GB/sscratch hızı (tahmini alt sınır)
2–32adet 8 GPU'lu sunucu için referans kitler
Neden ayrı bir depolama?

GPU'nun en pahalı hali, veri beklerken

Bir GPU sunucusunun saatlik maliyeti yüksektir. Veri yeterince hızlı gelmezse ya da checkpoint yazılırken eğitim duruyorsa, o süre boşa gider. Paralel dosya sistemi bu darboğazı kaldırır.

Veri seti okuma

Görüntü, video ve tıbbi görüntü eğitimlerinde her GPU sunucusu saniyede gigabaytlarca veri okur. Tek bir NAS bunu birden çok sunucuya aynı anda veremez.

Checkpoint yazma

Büyük modellerde tek checkpoint yüzlerce GB ile 1 TB arasıdır. Yazma süresi kısa olmalıdır ki GPU'lar beklemesin.

Paylaşılan ad alanı

Tüm GPU sunucuları aynı dosya sistemini görür; veri kopyalamadan çok düğümlü eğitim yapılır.

Maliyetli kapasite

Her şeyi NVMe'de tutmak pahalıdır. Aktif veri NVMe'de, geri kalanı HDD arşivinde durursa TB maliyeti düşer.

Mimari

Üç ağ, iki katman, tek dosya sistemi

GTM HPC Storage, BeeGFS paralel dosya sistemi üzerine kuruludur. Dosyalar birden çok depolama düğümüne dağıtılır; istemciler RDMA ile doğrudan tüm düğümlerden aynı anda okur ve yazar.

Hesaplama ağı

GPU ↔ GPU

Çok düğümlü eğitimde GPU'lar arası iletişim. InfiniBand NDR/XDR veya Spectrum-X Ethernet; GPU başına bir bağlantı.

Depolama ağı

GPU ↔ HPC Storage

Veri seti okuma ve checkpoint yazma. ConnectX-7 VPI ile InfiniBand NDR veya 400GbE; küçük kümede hesaplama switch'ini paylaşır, büyüdükçe ayrılır.

Yönetim ağı

1GbE + IPMI

Sunucu yönetimi, izleme ve uzaktan erişim. Veri trafiğinden tamamen ayrı.

NVMe scratch katmanı

Aktif veri seti, ara sonuçlar ve güncel checkpoint'ler. RAIDZ1 ile tek disk arızasına dayanıklı.

Metadata

Dosya ve dizin bilgileri NVMe üzerinde, aynalı. Kit 2'den itibaren iki düğümde birden tutulur; bir düğüm düşse de dosya sistemi ayakta kalır.

HDD arşiv katmanı

Tamamlanan deneyler, eski checkpoint'ler, ham veri. RAIDZ2 ile aynı grupta iki disk arızasına dayanıklı; checkpoint'ler buraya otomatik kopyalanır.

Ölçeğe göre mimari

GPU sunucu sayınızı seçin

Her ölçek için GPU sunucuları, switch'ler ve depolama düğümleriyle eksiksiz referans mimari. Bu kitler birer başlangıç noktasıdır; mimariyi projenizin kapasite ve performans ihtiyacına göre birlikte tasarlarız.

SWITCH'SİZ · 2 GPU SUNUCUSUGPU sunucu 1HGX · 8 GPU · yerel NVMeYEREL NVMeGPU sunucu 2HGX · 8 GPU · yerel NVMeYEREL NVMe8 × 400G doğrudan (B300: 8 × 800G)GPU ↔ GPU · switch yokdepolama portu · veri seti kopyasıPaylaşımlı HDD arşiv · NAS 4136GU5 / 4260GX5M60 × HDD · VERİ SETİ ANA KOPYASIOkuma: veri seti → GPUYazma: checkpoint → depolamaKatmanlama: NVMe → HDDGPU ↔ GPUNVMe aktivitesiHDD aktivitesi

2 GPU sunucu · 16 GPU · switch'siz

En sade ve en ekonomik yapı. İki GPU sunucusu birbirine doğrudan bağlanır, switch gerekmez. Hızlı katman GPU sunucularının kendi NVMe diskleridir: veri seti her iki sunucuya kopyalanır, eğitim yerel diskten okur, checkpoint'ler önce yerel diske yazılıp arka planda paylaşımlı HDD arşivine aktarılır. Bir sunucu bakıma alındığında diğeri çalışmaya devam eder.

GPU sunucuları2 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları)
Hesaplama ağıSwitch yok: 8 × 400G (B300'de 8 × 800G) sunucudan sunucuya doğrudan
Depolama ağıSwitch yok: her sunucunun depolama kartından HDD katmanına doğrudan bağlantı
GPU sunucusu → depolama2 portlu depolama kartı: 1 port HDD katmanına, 1 port diğer sunucuya
Depolama düğümleriMagnetar NAS 4136GU5 (~720 TB, 25GbE) veya Magnetar 4260GX5M (1.000 TB, 200G doğrudan)
Yönetim ağı1GbE yönetim switch'i + IPMI
Kit 1-0 · 4 × 3,84 TB

2 GPU sunucusunun yerel NVMe diskleri + paylaşımlı HDD arşiv

Yerel NVMe11,5 TBsunucu başına, RAID5 (3+1)
HDD arşiv720 TB – 1 PBpaylaşımlı HDD arşiv
Yerel okuma~20 GB/stahmini alt sınır
Arşiv hızı~2,5–8 GB/stahmini alt sınır

Başlangıç: fine-tune ve orta boy veri setleri

Kit 1-0 · 8 × 3,84 TBÖnerilen

2 GPU sunucusunun yerel NVMe diskleri + paylaşımlı HDD arşiv

Yerel NVMe27 TBsunucu başına, RAID5 (7+1)
HDD arşiv720 TB – 1 PBpaylaşımlı HDD arşiv
Yerel okuma~40 GB/stahmini alt sınır
Arşiv hızı~2,5–8 GB/stahmini alt sınır

8 diskle iki kat okuma hızı

Kit 1-0 · 8 × 7,68 TB

2 GPU sunucusunun yerel NVMe diskleri + paylaşımlı HDD arşiv

Yerel NVMe54 TBsunucu başına, RAID5 (7+1)
HDD arşiv720 TB – 1 PBpaylaşımlı HDD arşiv
Yerel okuma~40 GB/stahmini alt sınır
Arşiv hızı~2,5–8 GB/stahmini alt sınır

Büyük veri setleri ve daha uzun yerel checkpoint geçmişi

GPU SUNUCULARIAĞGTM HPC STORAGEGPU sunucu 1HGX · 8 GPUGPU sunucu 2HGX · 8 GPUGPU sunucu 3HGX · 8 GPUGPU sunucu 4HGX · 8 GPU64 port switch · hesaplama + depolama bölümleriHibrit düğüm 1 · Magnetar 4260GX5Lön: 6 NVMe scratch + 4 metadataÜSTTEN · 60 × HDD ARŞİVNVMe scratch ~35 GB/s · HDD arşiv ~8 GB/s (Kit 1-2)Okuma: veri seti → GPUYazma: checkpoint → depolamaKatmanlama: NVMe → HDDGPU ↔ GPUNVMe aktivitesiHDD aktivitesi

1–4 GPU sunucu · 32 GPU'ya kadar

Küçük kümede tek switch iki işi birden yapar: GPU'lar arası hesaplama trafiği ve depolama trafiği aynı kutuda, birbirinden ayrılmış bölümlerde akar. Tek hibrit düğüm hem NVMe scratch hem HDD arşiv sunar.

GPU sunucuları1–4 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları)
Hesaplama ağı1 × 64 port switch; hesaplama ve depolama ayrı bölümlerde (partition / VLAN)
Depolama ağıAynı switch üzerinde ayrı depolama bölümü
GPU sunucusu → depolamaSunucu başına 1 × 400G depolama bağlantısı
Depolama düğümleri1 × Hibrit düğüm (Magnetar 4260GX5L)
Yönetim ağı1GbE yönetim switch'i + IPMI
Kit 1-1

1 × hibrit düğüm

NVMe scratch38 TB6 × 7,68 TB
HDD arşiv600 TB36 × 20 TB
Scratch hızı~35 GB/stahmini alt sınır
Arşiv hızı~5 GB/stahmini alt sınır

Başlangıç: veri seti ve checkpoint ihtiyacı orta düzeyde olan ekipler

Kit 1-2Önerilen

1 × hibrit düğüm

NVMe scratch77 TB6 × 15,36 TB
HDD arşiv1.000 TB60 × 20 TB
Scratch hızı~35 GB/stahmini alt sınır
Arşiv hızı~8 GB/stahmini alt sınır

Büyük veri setleri ve uzun süreli checkpoint arşivi

GPU SUNUCULARIAĞGTM HPC STORAGEGPU sunucu 1HGX · 8 GPUGPU sunucu 2HGX · 8 GPUGPU sunucu 3HGX · 8 GPUGPU sunucu × 8–12HGX · 8 GPU… toplam 8–12 × 8 GPUHesaplama ağı · 2 leaf switch (64 port)Depolama ağı · 400GHibrit düğüm 1 · Magnetar 4260GX5Lön: 6 NVMe scratch + 4 metadataÜSTTEN · 60 × HDD ARŞİVHibrit düğüm 2 · Magnetar 4260GX5Lön: 6 NVMe scratch + 4 metadataÜSTTEN · 60 × HDD ARŞİVNVMe scratch ~70 GB/s · HDD arşiv ~16 GB/s (Kit 2-2)Okuma: veri seti → GPUYazma: checkpoint → depolamaKatmanlama: NVMe → HDDGPU ↔ GPUNVMe aktivitesiHDD aktivitesi

8–12 GPU sunucu · 64–96 GPU

Bu ölçekte depolama trafiği kendi switch'ine taşınır; eğitim sırasında GPU'lar arası trafik ile veri yükleme birbirini yavaşlatmaz. İki hibrit düğüm hem kapasiteyi hem hızı ikiye katlar, metadata iki düğümde aynalı tutulur.

GPU sunucuları8–12 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları)
Hesaplama ağı2 leaf switch (64 port); 12 sunucuda spine katmanı eklenir
Depolama ağı1 × 400G switch (ayrı depolama ağı)
GPU sunucusu → depolamaSunucu başına 1 × 400G depolama bağlantısı
Depolama düğümleri2 × Hibrit düğüm (Magnetar 4260GX5L)
Yönetim ağı1GbE yönetim switch'i + IPMI
Kit 2-1

2 × hibrit düğüm

NVMe scratch154 TB2 × 6 × 15,36 TB
HDD arşiv1,2 PB2 × 36 × 20 TB
Scratch hızı~70 GB/stahmini alt sınır
Arşiv hızı~10 GB/stahmini alt sınır

Hız öncelikli; arşiv ihtiyacı orta düzeyde

Kit 2-2Önerilen

2 × hibrit düğüm

NVMe scratch154 TB2 × 6 × 15,36 TB
HDD arşiv2,0 PB2 × 60 × 20 TB
Scratch hızı~70 GB/stahmini alt sınır
Arşiv hızı~16 GB/stahmini alt sınır

Hız ve petabayt arşiv birlikte

GPU SUNUCULARIAĞGTM HPC STORAGEGPU sunucu 1HGX · 8 GPUGPU sunucu 2HGX · 8 GPUGPU sunucu 3HGX · 8 GPUGPU sunucu × 12–16HGX · 8 GPU… toplam 12–16 × 8 GPUHesaplama ağı · 4 leaf + 2 spine (tipik)Depolama ağı · 2 × 400G, yedekliFlash düğümü 1 · AS-1115HS · 12 × NVMeFlash düğümü 2 · AS-1115HS · 12 × NVMeArşiv düğümü 1 · 4260GX5M60 × HDDArşiv düğümü 2 · 4260GX5M60 × HDDNVMe scratch~80 GB/s · 307 TBHDD arşiv ~16 GB/s · 2,0 PBOkuma: veri seti → GPUYazma: checkpoint → depolamaKatmanlama: NVMe → HDDGPU ↔ GPUNVMe aktivitesiHDD aktivitesi

12–16 GPU sunucu · ~128 GPU

Hızlı katman ve kapasite katmanı ayrı düğümlere ayrılır: tümü NVMe flash düğümleri eğitim verisini ve checkpoint'i taşır, arşiv düğümleri petabayt ölçeğinde kapasite ve metadata sunar. Depolama ağı iki switch ile yedeklidir.

GPU sunucuları12–16 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları)
Hesaplama ağıLeaf–spine yapı: 4 leaf + 2 spine (tipik)
Depolama ağı2 × 400G switch (yedekli)
GPU sunucusu → depolamaSunucu başına 1 × 400G depolama bağlantısı
Depolama düğümleri2 × Flash düğümü (Supermicro AS-1115HS-TNR) + 2 × Arşiv düğümü (Magnetar 4260GX5M)
Yönetim ağı1GbE yönetim switch'i + IPMI
Kit 3-1Önerilen

2 × flash düğümü + 2 × arşiv düğümü

NVMe scratch307 TB2 × 12 × 15,36 TB
HDD arşiv2,0 PB2 × 60 × 20 TB
Scratch hızı~80 GB/stahmini alt sınır
Arşiv hızı~16 GB/stahmini alt sınır

Flash düğümlerine ikinci 400G eklenince ~150 GB/s

GPU SUNUCULARIAĞGTM HPC STORAGEGPU sunucu 1HGX · 8 GPUGPU sunucu 2HGX · 8 GPUGPU sunucu 3HGX · 8 GPUGPU sunucu × 24–32HGX · 8 GPU… toplam 24–32 × 8 GPUHesaplama ağı · 8 leaf + 4 spine (tipik, raya göre optimize)Depolama ağı · 2 × 400G, yedekliFlash düğümü 1 · AS-1115HS · 12 × NVMeFlash düğümü 2 · AS-1115HS · 12 × NVMeFlash düğümü 3 · AS-1115HS · 12 × NVMeArşiv düğümü 1 · 4260GX5M60 × HDDArşiv düğümü 2 · 4260GX5M60 × HDDArşiv düğümü 3 · 4260GX5M60 × HDDNVMe scratch~120 GB/s · 461 TBHDD arşiv ~24 GB/s · 3,0 PBOkuma: veri seti → GPUYazma: checkpoint → depolamaKatmanlama: NVMe → HDDGPU ↔ GPUNVMe aktivitesiHDD aktivitesi

24–32 GPU sunucu · ~256 GPU

Veri merkezi ölçeği. Üç flash düğümü ve üç arşiv düğümü; ihtiyaç büyüdükçe flash düğümlerine ikinci 400G eklenerek hız, yeni düğüm eklenerek kapasite büyütülür. Hesaplama ağı proje bazında tasarlanır.

GPU sunucuları24–32 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları)
Hesaplama ağıLeaf–spine yapı: 8 leaf + 4 spine (tipik, raya göre optimize)
Depolama ağı2 × 400G switch (yedekli)
GPU sunucusu → depolamaSunucu başına 1 × 400G veya 2 × 200G depolama bağlantısı
Depolama düğümleri3 × Flash düğümü (Supermicro AS-1115HS-TNR) + 3 × Arşiv düğümü (Magnetar 4260GX5M)
Yönetim ağı1GbE yönetim switch'i + IPMI
Kit 4-1Önerilen

3 × flash düğümü + 3 × arşiv düğümü

NVMe scratch461 TB3 × 12 × 15,36 TB
HDD arşiv3,0 PB3 × 60 × 20 TB
Scratch hızı~120 GB/stahmini alt sınır
Arşiv hızı~24 GB/stahmini alt sınır

Flash düğümlerine ikinci 400G eklenince ~220 GB/s

Referans kitler, projeye özel tasarım

Sayfadaki kitler tipik ihtiyaçlara göre hazırlanmış referans yapılandırmalardır. Veri seti boyutu, checkpoint sıklığı, saklama süresi, mevcut GPU ve ağ altyapınıza göre düğüm sayısını, disk tipini ve kapasitesini, ağ yapısını projenize özel olarak belirliyoruz.

Projemi anlatmak istiyorum

Hız değerleri tahmini alt sınırlardır (PCIe Gen4 NVMe, BeeGFS, RDMA). Teslimde her sistem IOR ve mdtest ile ölçülür, test raporu paylaşılır. Net kapasiteler HDD'de RAIDZ2 (12'li grup), NVMe'de RAIDZ1 (5+1) sonrasıdır; havuzların %80'in üzerinde doldurulmaması önerilir.

Yapı taşları

Üç düğüm tipi, dört ölçek

A · Hibrit düğüm

Magnetar 4260GX5L

NVMe scratch ve HDD arşiv aynı kutuda. Küçük ve orta kümeler için.

  • İşlemci2 × Intel Xeon 4./5. nesil
  • Bellek96 GB DDR5 ECC (scratch işlemcisinde 4, arşiv işlemcisinde 2 kanal)
  • NVMe scratch6 × NVMe, RAIDZ1 (5+1)
  • Metadata2 × 1,92 TB NVMe ayna + 2 × 1,92 TB special vdev
  • HDD arşiv36 veya 60 × 20 TB, RAIDZ2
  • Ağ1 × 400G (scratch) + 1 × 200G (arşiv), ConnectX-7 VPI
4U · 899 mm · ürünü incele
B · Arşiv düğümü

Magnetar 4260GX5M

Petabayt ölçeğinde kapasite katmanı ve metadata. Büyük kümelerde flash düğümleriyle birlikte.

  • İşlemci1 × Intel Xeon 4./5. nesil
  • Bellek128 GB DDR5 ECC (4 × 32 GB)
  • Metadata2 × 1,92 TB NVMe ayna + 2 × 1,92 TB special vdev
  • HDD arşiv60 × 20 TB, RAIDZ2 → 1.000 TB net
  • Ağ1 × 200G ConnectX-7 VPI
4U · 899 mm · ürünü incele
C · Flash düğümü

Supermicro AS-1115HS-TNR

Tümü NVMe hızlı katman. Kapasite ve hız, düğüm eklenerek büyür.

  • İşlemci1 × AMD EPYC 9355P (32 çekirdek)
  • Bellek128 GB DDR5 ECC (4 × 32 GB); 8 yuva büyütmeye hazır
  • NVMe scratch12 × 15,36 TB, 2 × RAIDZ1 → ~154 TB net
  • Ağ1 × 400G ConnectX-7 VPI; ikinci 400G ile hız iki katına çıkar
1U · 747 mm · ürünü incele
Yazılım

Açık kaynak, kilitlenme yok

Tüm yazılım yığını açık kaynaktır; verileriniz standart dosya sistemlerinde durur, tek bir üreticiye bağlı kalmazsınız.

BeeGFS

HPC dünyasında yaygın paralel dosya sistemi. Depolama havuzları ile NVMe ve HDD katmanları, buddy mirroring ile yüksek erişilebilirlik.

OpenZFS

Uçtan uca sağlama toplamı, kendi kendini onarma ve sıkıştırma. HDD arşiv katmanında veri bütünlüğünün temeli.

RDMA

InfiniBand veya RoCE üzerinden, işlemciyi atlayarak doğrudan bellekten belleğe veri aktarımı; düşük gecikme, yüksek hız.

Magnetar ScouT-zFS

Disk sağlığı, havuz doluluğu ve performansın tek panelden izlenmesi; e-posta ve Telegram uyarıları. (Beta)

Nasıl çalışıyoruz

Keşiften test raporuna

  1. Keşif

    GPU kümesi, ağ yapısı, veri seti boyutu ve checkpoint sıklığı birlikte incelenir.

  2. Boyutlandırma

    Gerekli hız ve kapasiteden kit ve düğüm sayısı belirlenir.

  3. Kurulum

    Düğümler, ağ, BeeGFS ve istemciler kurulur; katmanlama kuralları tanımlanır.

  4. Performans testi

    IOR ve mdtest ile ölçüm yapılır, sonuçlar raporla teslim edilir.

  5. Destek

    İzleme, yerinde müdahale ve büyütme planı; Türkçe ve tek muhatap.

Ticari çözümler

DDN, WEKA, VAST ve diğer kurumsal platformlar

Üretici destekli ticari paralel dosya sistemleri de sunuyoruz. İhtiyacınıza göre açık kaynak ya da ticari yolu birlikte değerlendirelim.

HPC & AI Storage
Sık sorulan sorular

GTM HPC Storage hakkında

GTM HPC Storage nedir?

GPU ve HPC kümeleri için paralel dosya sistemine dayalı, iki katmanlı bir depolama çözümüdür: NVMe tabanlı hızlı scratch katmanı eğitim verisini ve checkpoint'leri taşır, HDD tabanlı arşiv katmanı petabayt ölçeğinde kapasite sunar. Donanım yerli Magnetar ve Supermicro sistemlerinden, yazılım açık kaynak BeeGFS ve OpenZFS'ten oluşur; kurulum, test ve destek GTM Teknoloji tarafından verilir.

Neden iki katman?

NVMe hızlıdır ama TB başına pahalıdır; HDD ucuzdur ama rastgele erişimde yavaştır. Aktif veri seti ve checkpoint'ler NVMe katmanında çalışır, tamamlanan deneyler ve eski checkpoint'ler otomatik olarak HDD arşivine taşınır. Böylece GPU'lar hızlı beslenir, kapasite maliyeti düşük kalır.

Kaç GPU sunucusu için hangi kit?

Kitler referans yapılandırmalardır. 2 GPU sunucusu için switch'siz Kit 1-0, 1–4 adet 8 GPU'lu sunucu için Kit 1, 8–12 sunucu için Kit 2, 12–16 sunucu için Kit 3, 24–32 sunucu için Kit 4 önerilir. Mimari, veri seti boyutu, checkpoint sıklığı ve saklama ihtiyacına göre keşif sonrası projeye özel tasarlanır.

InfiniBand mı Ethernet mi?

Depolama düğümlerindeki ConnectX-7 VPI adaptörler hem InfiniBand NDR hem 400GbE (RoCE) ile çalışır. Hangisinin kullanılacağına GPU kümenizin ağına göre karar verilir; donanım değişmez.

Mevcut GPU kümeme eklenebilir mi?

Evet. BeeGFS istemcisi GPU sunucularına kurulur ve mevcut InfiniBand veya Ethernet ağınıza bağlanır. Ek switch portu gerekip gerekmediğini keşifte birlikte belirleriz.

Ticari çözümlerden (DDN, WEKA, VAST) farkı nedir?

Ticari paralel dosya sistemleri kurumsal özellikler ve üretici desteğiyle gelir; maliyetleri de buna göre şekillenir. GTM HPC Storage açık kaynak yazılım ve yerli donanımla aynı mimariyi daha düşük maliyetle kurar. Her iki yolu da sunuyoruz; ticari seçenekler için HPC & AI Storage sayfamıza bakabilirsiniz.

Performans değerleri garanti mi?

Sayfadaki hız değerleri tahmini alt sınırlardır. Teslimde her sistem IOR ve mdtest ile ölçülür ve test raporu sizinle paylaşılır.

Kurulum ve destek nasıl sağlanıyor?

Keşif, boyutlandırma, kurulum, performans testi ve eğitim teslimatın parçasıdır. Donanım, işletim sistemi ve dosya sistemi desteği GTM Teknoloji'den, Türkçe ve yerinde verilir.

Teklif

GPU kümenizi anlatın, depolamayı birlikte boyutlandıralım

GPU sunucu sayısını, veri seti boyutunu ve saklama ihtiyacınızı paylaşın; referans mimari ve yapılandırılmış teklifle dönelim.

[email protected]