GTM HPC Storage
GPU'larınızı bekletmeyen, iki katmanlı yüksek performanslı depolama. NVMe katmanı eğitim verisini ve checkpoint'leri taşır, HDD katmanı petabayt ölçeğinde arşivler. Yerli Magnetar donanımı, açık kaynak BeeGFS ve kurulumdan performans testine GTM.
GPU'nun en pahalı hali, veri beklerken
Bir GPU sunucusunun saatlik maliyeti yüksektir. Veri yeterince hızlı gelmezse ya da checkpoint yazılırken eğitim duruyorsa, o süre boşa gider. Paralel dosya sistemi bu darboğazı kaldırır.
Veri seti okuma
Görüntü, video ve tıbbi görüntü eğitimlerinde her GPU sunucusu saniyede gigabaytlarca veri okur. Tek bir NAS bunu birden çok sunucuya aynı anda veremez.
Checkpoint yazma
Büyük modellerde tek checkpoint yüzlerce GB ile 1 TB arasıdır. Yazma süresi kısa olmalıdır ki GPU'lar beklemesin.
Paylaşılan ad alanı
Tüm GPU sunucuları aynı dosya sistemini görür; veri kopyalamadan çok düğümlü eğitim yapılır.
Maliyetli kapasite
Her şeyi NVMe'de tutmak pahalıdır. Aktif veri NVMe'de, geri kalanı HDD arşivinde durursa TB maliyeti düşer.
Üç ağ, iki katman, tek dosya sistemi
GTM HPC Storage, BeeGFS paralel dosya sistemi üzerine kuruludur. Dosyalar birden çok depolama düğümüne dağıtılır; istemciler RDMA ile doğrudan tüm düğümlerden aynı anda okur ve yazar.
GPU ↔ GPU
Çok düğümlü eğitimde GPU'lar arası iletişim. InfiniBand NDR/XDR veya Spectrum-X Ethernet; GPU başına bir bağlantı.
GPU ↔ HPC Storage
Veri seti okuma ve checkpoint yazma. ConnectX-7 VPI ile InfiniBand NDR veya 400GbE; küçük kümede hesaplama switch'ini paylaşır, büyüdükçe ayrılır.
1GbE + IPMI
Sunucu yönetimi, izleme ve uzaktan erişim. Veri trafiğinden tamamen ayrı.
Aktif veri seti, ara sonuçlar ve güncel checkpoint'ler. RAIDZ1 ile tek disk arızasına dayanıklı.
Dosya ve dizin bilgileri NVMe üzerinde, aynalı. Kit 2'den itibaren iki düğümde birden tutulur; bir düğüm düşse de dosya sistemi ayakta kalır.
Tamamlanan deneyler, eski checkpoint'ler, ham veri. RAIDZ2 ile aynı grupta iki disk arızasına dayanıklı; checkpoint'ler buraya otomatik kopyalanır.
GPU sunucu sayınızı seçin
Her ölçek için GPU sunucuları, switch'ler ve depolama düğümleriyle eksiksiz referans mimari. Bu kitler birer başlangıç noktasıdır; mimariyi projenizin kapasite ve performans ihtiyacına göre birlikte tasarlarız.
2 GPU sunucu · 16 GPU · switch'siz
En sade ve en ekonomik yapı. İki GPU sunucusu birbirine doğrudan bağlanır, switch gerekmez. Hızlı katman GPU sunucularının kendi NVMe diskleridir: veri seti her iki sunucuya kopyalanır, eğitim yerel diskten okur, checkpoint'ler önce yerel diske yazılıp arka planda paylaşımlı HDD arşivine aktarılır. Bir sunucu bakıma alındığında diğeri çalışmaya devam eder.
| GPU sunucuları | 2 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları) |
|---|---|
| Hesaplama ağı | Switch yok: 8 × 400G (B300'de 8 × 800G) sunucudan sunucuya doğrudan |
| Depolama ağı | Switch yok: her sunucunun depolama kartından HDD katmanına doğrudan bağlantı |
| GPU sunucusu → depolama | 2 portlu depolama kartı: 1 port HDD katmanına, 1 port diğer sunucuya |
| Depolama düğümleri | Magnetar NAS 4136GU5 (~720 TB, 25GbE) veya Magnetar 4260GX5M (1.000 TB, 200G doğrudan) |
| Yönetim ağı | 1GbE yönetim switch'i + IPMI |
2 GPU sunucusunun yerel NVMe diskleri + paylaşımlı HDD arşiv
Başlangıç: fine-tune ve orta boy veri setleri
2 GPU sunucusunun yerel NVMe diskleri + paylaşımlı HDD arşiv
8 diskle iki kat okuma hızı
2 GPU sunucusunun yerel NVMe diskleri + paylaşımlı HDD arşiv
Büyük veri setleri ve daha uzun yerel checkpoint geçmişi
1–4 GPU sunucu · 32 GPU'ya kadar
Küçük kümede tek switch iki işi birden yapar: GPU'lar arası hesaplama trafiği ve depolama trafiği aynı kutuda, birbirinden ayrılmış bölümlerde akar. Tek hibrit düğüm hem NVMe scratch hem HDD arşiv sunar.
| GPU sunucuları | 1–4 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları) |
|---|---|
| Hesaplama ağı | 1 × 64 port switch; hesaplama ve depolama ayrı bölümlerde (partition / VLAN) |
| Depolama ağı | Aynı switch üzerinde ayrı depolama bölümü |
| GPU sunucusu → depolama | Sunucu başına 1 × 400G depolama bağlantısı |
| Depolama düğümleri | 1 × Hibrit düğüm (Magnetar 4260GX5L) |
| Yönetim ağı | 1GbE yönetim switch'i + IPMI |
1 × hibrit düğüm
Başlangıç: veri seti ve checkpoint ihtiyacı orta düzeyde olan ekipler
1 × hibrit düğüm
Büyük veri setleri ve uzun süreli checkpoint arşivi
8–12 GPU sunucu · 64–96 GPU
Bu ölçekte depolama trafiği kendi switch'ine taşınır; eğitim sırasında GPU'lar arası trafik ile veri yükleme birbirini yavaşlatmaz. İki hibrit düğüm hem kapasiteyi hem hızı ikiye katlar, metadata iki düğümde aynalı tutulur.
| GPU sunucuları | 8–12 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları) |
|---|---|
| Hesaplama ağı | 2 leaf switch (64 port); 12 sunucuda spine katmanı eklenir |
| Depolama ağı | 1 × 400G switch (ayrı depolama ağı) |
| GPU sunucusu → depolama | Sunucu başına 1 × 400G depolama bağlantısı |
| Depolama düğümleri | 2 × Hibrit düğüm (Magnetar 4260GX5L) |
| Yönetim ağı | 1GbE yönetim switch'i + IPMI |
2 × hibrit düğüm
Hız öncelikli; arşiv ihtiyacı orta düzeyde
2 × hibrit düğüm
Hız ve petabayt arşiv birlikte
12–16 GPU sunucu · ~128 GPU
Hızlı katman ve kapasite katmanı ayrı düğümlere ayrılır: tümü NVMe flash düğümleri eğitim verisini ve checkpoint'i taşır, arşiv düğümleri petabayt ölçeğinde kapasite ve metadata sunar. Depolama ağı iki switch ile yedeklidir.
| GPU sunucuları | 12–16 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları) |
|---|---|
| Hesaplama ağı | Leaf–spine yapı: 4 leaf + 2 spine (tipik) |
| Depolama ağı | 2 × 400G switch (yedekli) |
| GPU sunucusu → depolama | Sunucu başına 1 × 400G depolama bağlantısı |
| Depolama düğümleri | 2 × Flash düğümü (Supermicro AS-1115HS-TNR) + 2 × Arşiv düğümü (Magnetar 4260GX5M) |
| Yönetim ağı | 1GbE yönetim switch'i + IPMI |
2 × flash düğümü + 2 × arşiv düğümü
Flash düğümlerine ikinci 400G eklenince ~150 GB/s
24–32 GPU sunucu · ~256 GPU
Veri merkezi ölçeği. Üç flash düğümü ve üç arşiv düğümü; ihtiyaç büyüdükçe flash düğümlerine ikinci 400G eklenerek hız, yeni düğüm eklenerek kapasite büyütülür. Hesaplama ağı proje bazında tasarlanır.
| GPU sunucuları | 24–32 × 8 GPU (ör. HGX B300 / B200 veya PCIe GPU sunucuları) |
|---|---|
| Hesaplama ağı | Leaf–spine yapı: 8 leaf + 4 spine (tipik, raya göre optimize) |
| Depolama ağı | 2 × 400G switch (yedekli) |
| GPU sunucusu → depolama | Sunucu başına 1 × 400G veya 2 × 200G depolama bağlantısı |
| Depolama düğümleri | 3 × Flash düğümü (Supermicro AS-1115HS-TNR) + 3 × Arşiv düğümü (Magnetar 4260GX5M) |
| Yönetim ağı | 1GbE yönetim switch'i + IPMI |
3 × flash düğümü + 3 × arşiv düğümü
Flash düğümlerine ikinci 400G eklenince ~220 GB/s
Sayfadaki kitler tipik ihtiyaçlara göre hazırlanmış referans yapılandırmalardır. Veri seti boyutu, checkpoint sıklığı, saklama süresi, mevcut GPU ve ağ altyapınıza göre düğüm sayısını, disk tipini ve kapasitesini, ağ yapısını projenize özel olarak belirliyoruz.
Projemi anlatmak istiyorumHız değerleri tahmini alt sınırlardır (PCIe Gen4 NVMe, BeeGFS, RDMA). Teslimde her sistem IOR ve mdtest ile ölçülür, test raporu paylaşılır. Net kapasiteler HDD'de RAIDZ2 (12'li grup), NVMe'de RAIDZ1 (5+1) sonrasıdır; havuzların %80'in üzerinde doldurulmaması önerilir.
Üç düğüm tipi, dört ölçek
Magnetar 4260GX5L
NVMe scratch ve HDD arşiv aynı kutuda. Küçük ve orta kümeler için.
- İşlemci2 × Intel Xeon 4./5. nesil
- Bellek96 GB DDR5 ECC (scratch işlemcisinde 4, arşiv işlemcisinde 2 kanal)
- NVMe scratch6 × NVMe, RAIDZ1 (5+1)
- Metadata2 × 1,92 TB NVMe ayna + 2 × 1,92 TB special vdev
- HDD arşiv36 veya 60 × 20 TB, RAIDZ2
- Ağ1 × 400G (scratch) + 1 × 200G (arşiv), ConnectX-7 VPI
Magnetar 4260GX5M
Petabayt ölçeğinde kapasite katmanı ve metadata. Büyük kümelerde flash düğümleriyle birlikte.
- İşlemci1 × Intel Xeon 4./5. nesil
- Bellek128 GB DDR5 ECC (4 × 32 GB)
- Metadata2 × 1,92 TB NVMe ayna + 2 × 1,92 TB special vdev
- HDD arşiv60 × 20 TB, RAIDZ2 → 1.000 TB net
- Ağ1 × 200G ConnectX-7 VPI
Supermicro AS-1115HS-TNR
Tümü NVMe hızlı katman. Kapasite ve hız, düğüm eklenerek büyür.
- İşlemci1 × AMD EPYC 9355P (32 çekirdek)
- Bellek128 GB DDR5 ECC (4 × 32 GB); 8 yuva büyütmeye hazır
- NVMe scratch12 × 15,36 TB, 2 × RAIDZ1 → ~154 TB net
- Ağ1 × 400G ConnectX-7 VPI; ikinci 400G ile hız iki katına çıkar
Açık kaynak, kilitlenme yok
Tüm yazılım yığını açık kaynaktır; verileriniz standart dosya sistemlerinde durur, tek bir üreticiye bağlı kalmazsınız.
BeeGFS
HPC dünyasında yaygın paralel dosya sistemi. Depolama havuzları ile NVMe ve HDD katmanları, buddy mirroring ile yüksek erişilebilirlik.
OpenZFS
Uçtan uca sağlama toplamı, kendi kendini onarma ve sıkıştırma. HDD arşiv katmanında veri bütünlüğünün temeli.
RDMA
InfiniBand veya RoCE üzerinden, işlemciyi atlayarak doğrudan bellekten belleğe veri aktarımı; düşük gecikme, yüksek hız.
Magnetar ScouT-zFS
Disk sağlığı, havuz doluluğu ve performansın tek panelden izlenmesi; e-posta ve Telegram uyarıları. (Beta)
Keşiften test raporuna
Keşif
GPU kümesi, ağ yapısı, veri seti boyutu ve checkpoint sıklığı birlikte incelenir.
Boyutlandırma
Gerekli hız ve kapasiteden kit ve düğüm sayısı belirlenir.
Kurulum
Düğümler, ağ, BeeGFS ve istemciler kurulur; katmanlama kuralları tanımlanır.
Performans testi
IOR ve mdtest ile ölçüm yapılır, sonuçlar raporla teslim edilir.
Destek
İzleme, yerinde müdahale ve büyütme planı; Türkçe ve tek muhatap.
DDN, WEKA, VAST ve diğer kurumsal platformlar
Üretici destekli ticari paralel dosya sistemleri de sunuyoruz. İhtiyacınıza göre açık kaynak ya da ticari yolu birlikte değerlendirelim.
GTM HPC Storage hakkında
GTM HPC Storage nedir?
GPU ve HPC kümeleri için paralel dosya sistemine dayalı, iki katmanlı bir depolama çözümüdür: NVMe tabanlı hızlı scratch katmanı eğitim verisini ve checkpoint'leri taşır, HDD tabanlı arşiv katmanı petabayt ölçeğinde kapasite sunar. Donanım yerli Magnetar ve Supermicro sistemlerinden, yazılım açık kaynak BeeGFS ve OpenZFS'ten oluşur; kurulum, test ve destek GTM Teknoloji tarafından verilir.
Neden iki katman?
NVMe hızlıdır ama TB başına pahalıdır; HDD ucuzdur ama rastgele erişimde yavaştır. Aktif veri seti ve checkpoint'ler NVMe katmanında çalışır, tamamlanan deneyler ve eski checkpoint'ler otomatik olarak HDD arşivine taşınır. Böylece GPU'lar hızlı beslenir, kapasite maliyeti düşük kalır.
Kaç GPU sunucusu için hangi kit?
Kitler referans yapılandırmalardır. 2 GPU sunucusu için switch'siz Kit 1-0, 1–4 adet 8 GPU'lu sunucu için Kit 1, 8–12 sunucu için Kit 2, 12–16 sunucu için Kit 3, 24–32 sunucu için Kit 4 önerilir. Mimari, veri seti boyutu, checkpoint sıklığı ve saklama ihtiyacına göre keşif sonrası projeye özel tasarlanır.
InfiniBand mı Ethernet mi?
Depolama düğümlerindeki ConnectX-7 VPI adaptörler hem InfiniBand NDR hem 400GbE (RoCE) ile çalışır. Hangisinin kullanılacağına GPU kümenizin ağına göre karar verilir; donanım değişmez.
Mevcut GPU kümeme eklenebilir mi?
Evet. BeeGFS istemcisi GPU sunucularına kurulur ve mevcut InfiniBand veya Ethernet ağınıza bağlanır. Ek switch portu gerekip gerekmediğini keşifte birlikte belirleriz.
Ticari çözümlerden (DDN, WEKA, VAST) farkı nedir?
Ticari paralel dosya sistemleri kurumsal özellikler ve üretici desteğiyle gelir; maliyetleri de buna göre şekillenir. GTM HPC Storage açık kaynak yazılım ve yerli donanımla aynı mimariyi daha düşük maliyetle kurar. Her iki yolu da sunuyoruz; ticari seçenekler için HPC & AI Storage sayfamıza bakabilirsiniz.
Performans değerleri garanti mi?
Sayfadaki hız değerleri tahmini alt sınırlardır. Teslimde her sistem IOR ve mdtest ile ölçülür ve test raporu sizinle paylaşılır.
Kurulum ve destek nasıl sağlanıyor?
Keşif, boyutlandırma, kurulum, performans testi ve eğitim teslimatın parçasıdır. Donanım, işletim sistemi ve dosya sistemi desteği GTM Teknoloji'den, Türkçe ve yerinde verilir.
GPU kümenizi anlatın, depolamayı birlikte boyutlandıralım
GPU sunucu sayısını, veri seti boyutunu ve saklama ihtiyacınızı paylaşın; referans mimari ve yapılandırılmış teklifle dönelim.