Başarı Hikâyesi · AI Süperbilgisayar

122 günde 100.000 GPU: xAI Colossus kümesi nasıl kuruldu?

Elon Musk’ın Memphis’teki AI süperbilgisayarı, yalnızca büyüklüğüyle değil kurulum hızıyla da dikkat çekiyor. Kümenin yapı taşı Supermicro’nun sıvı soğutmalı rafı: raf başına 64 NVIDIA H100, sekizerli gruplarda 512 GPU’luk mini kümeler. Bu yazıda mimarinin nasıl katmanlandığını ve kendi projenize ne söylediğini inceliyoruz.

Supermicro × NVIDIA × xAI Teknik analiz · GTM Teknoloji

Supermicro AS-4125GS-TNHR2-LCC 4U sıvı soğutmalı 8 GPU NVIDIA HGX sunucu

Görsel: GTM Teknoloji kataloğundaki 4U sıvı soğutmalı 8-GPU HGX sistemi — Colossus’ta kullanılan yapı taşının aynı ailesi.

100.000NVIDIA H100 GPU
122 günKurulum süresi
64Raf başına GPU (8 sunucu × 8)
3,6 Tb/sGPU sunucusu başına ağ bant genişliği

Neden bu kurulum önemli?

Colossus’u kayda değer kılan yalnızca 100.000 GPU’luk ölçeği değil; bu ölçeğe 122 günde ulaşılmış olması. Bu hız, tek tek ürünlerin başarısından çok bir yapı taşı yaklaşımının sonucu: aynı sıvı soğutmalı raf tasarımı defalarca çoğaltılıyor, her katman bir öncekinin katı olarak büyüyor. Aşağıdaki tablo, tek bir 4U sunucudan 100.000 GPU’ya kadar ölçeğin nasıl katlandığını gösteriyor.

4U sunucu8 GPU

Sıvı soğutmalı Supermicro 4U Universal GPU sistemi. NVIDIA HGX H100 tepsisi özel sıvı soğutma bloklarıyla soğutulur; CPU tepsisinde iki x86 işlemci bloğu bulunur.

Raf64 GPU

8 adet 4U sunucu + Supermicro CDU (soğutucu dağıtım ünitesi) ve yardımcı donanım bir GPU hesaplama rafını oluşturur.

Raf grubu512 GPU

Raflar sekizerli gruplar hâlinde konumlandırılır; kendi ağıyla birlikte, çok daha büyük sistemin içinde bir mini küme gibi çalışır.

Veri salonu25.000 GPU

Ziyaret sırasında dört veri salonu devredeydi; her biri 25.000 GPU barındırıyordu.

Colossus100.000 GPU

Dört salonun toplamı. Genişleme çalışmaları hızla sürüyor.

Sunucu tasarımında öne çıkan dört karar

Colossus’ta kullanılan 4U Universal GPU sistemi, piyasadaki diğer HGX sunucularından birkaç somut noktada ayrışıyor.

Baştan sıvı soğutmalı, tek elden

Sektördeki yaygın yaklaşım, hava soğutmalı bir tasarımın üstüne sıvı soğutma eklemektir. Supermicro’nun 4U Universal GPU sistemi ise doğrudan sıvı soğutulmak üzere tasarlandı ve bileşenlerin tamamı tek üreticiden geliyor.

PCIe anahtarları anakartta

Neredeyse her HGX sunucusunda kullanılan dört Broadcom PCIe anahtarı, ayrı bir kart yerine doğrudan Supermicro anakartına tümleşik. Bu anahtarlar da özel bir sıvı soğutma bloğuyla soğutuluyor — sektörde eşi olmayan bir tasarım tercihi.

Raftan çıkarmadan servis

Sistemler tepsiler üzerinde; 1U raf manifoldu her sunucuya soğuk sıvıyı getirip ısınmış sıvıyı geri alıyor. Hızlı ayırıcılar (quick disconnect) sayesinde sıvı bağlantısı tek elle sökülebiliyor ve tepsi servis için dışarı çekilebiliyor — sunucuyu raftan çıkarmaya gerek yok.

Alan değiştirilebilir CDU

Her rafın altındaki CDU, dev bir ısı eşanjörü gibi çalışıp raftaki tüm GPU sunucularını besleyen bir sıvı döngüsü kuruyor. Pompaları ve güç kaynakları yedekli; biri arızalanırsa rafı kapatmadan sahada değiştirilebiliyor.

Isı yönetimi: sıvı soğutma tek başına yetmiyor

Bu kurulumun en öğretici tarafı, sıvı soğutmanın hikâyenin yalnızca yarısı olması. Geri kalanı, rafın ürettiği artık ısının veri salonuna hiç verilmeden dışarı taşınması üzerine kurulu.

Rafın ısı nötr olması şart

Sıvı soğutmaya rağmen sunucularda hâlâ fan var: DIMM’ler, güç kaynakları, BMC ve ağ kartları gibi bileşenler havayla soğutuluyor. Colossus’ta her rafın veri salonuna göre ısı nötr olması hedeflenmiş — böylece salona devasa klima santralleri kurmak gerekmiyor.

Arka kapı ısı eşanjörleri

Sunucu fanları önden soğuk havayı alıp arkadan atıyor; bu hava rafın arkasındaki ısı eşanjöründen geçiriliyor. Mantık otomobil radyatörüyle aynı: içinden sıvı geçen petekli bir yapı, ısıyı tesis su döngüsüne aktarıyor.

Yalnızca GPU değil

Arka kapı eşanjörleri sadece sıvı soğutmalı GPU sunucularının artık ısısını değil; depolama, CPU hesaplama kümeleri ve ağ bileşenlerinin ısısını da alıyor. Bu sayede aynı salonda sıvı soğutmalı ve hava soğutmalı ekipman bir arada çalışabiliyor.

Tesis suyu ve çillerler

Soğuk su tesise alınıp her raftaki CDU’dan dolaştırılıyor; GPU’lardan ve arka kapı eşanjörlerinden toplanan ısı burada tesis su döngüsüne aktarılıyor. Isınan su dışarıdaki çillerlerde tekrar kullanılabilecek sıcaklığa indiriliyor.

Ağ: 400GbE’nin dokuz katı

Kümenin en dikkat çekici tercihlerinden biri ağ tarafında. GPU’lar arası RDMA trafiği için InfiniBand yerine Ethernet seçilmiş. Gerekçe ölçek: Ethernet internetin omurgası olduğu için son derece ölçeklenebilir bir teknoloji ve bu büyüklükteki AI kümeleri, daha egzotik teknolojilerin henüz ulaşamadığı ölçeklere çıkıyor.

400GbEOptik bağlantı başına
(yaygın 1GbE’nin 400 katı)
×9Sistem başına bağlantı sayısı
3,6 Tb/sGPU sunucusu başına
toplam bant genişliği

Bant genişliğinin büyük kısmını GPU RDMA ağı kullanıyor; her GPU’nun kendi ağ kartı var. Kurulumda NVIDIA BlueField-3 SuperNIC ve Spectrum-X ağ teknolojisi kullanılıyor. CPU’lar ise tamamen ayrı bir anahtar dokusu üzerinden 400GbE alıyor — GPU ağı ve kümenin geri kalanı için ayrı ağlar kurmak, yüksek başarımlı hesaplamada yaygın bir tasarım tercihidir.

Sıradaki sorun: anahtarların soğutulması

Kaynak belgede dile getirilen önemli bir tespit: bu tesiste en çok göze çarpan eksik, sıvı soğutmalı ağ anahtarları. Modern bir anahtarda optikler, anahtar yongasından daha fazla güç tüketebiliyor. Bu ölçekteki kurulumların sektörü ortak paketlenmiş optiklere (co-packaged optics) ve anahtar tarafında da sıvı soğutmaya doğru itmesi bekleniyor.

Kümenin geri kalanı: depolama, CPU ve güç

Depolama — flash’a geçiş

Farklı üreticilerin depolama yazılımları çalışsa da donanımın neredeyse tamamı Supermicro; ağırlıklı olarak 2,5″ NVMe yuvalı 1U düğümler. Büyük AI kümeleri diskten flash’a kayıyor: petabayt başına maliyet daha yüksek olsa da enerji tasarrufu, performans ve yoğunluk toplam sahip olma maliyetinde flash’ı öne geçiriyor.

CPU hesaplama

Veri hazırlama ve işleme görevleri hâlâ CPU’da çok iyi çalışıyor; GPU’ları eğitim ve çıkarım için ayırmak mantıklı. Bunun için hava soğutmalı 1U sunucu rafları kullanılıyor — ön panelin yaklaşık üçte biri hava girişine ayrılmış durumda.

Güç dalgalanması

AI sunucuları sürekli tam güçte çalışmaz; iş yükü dağıtıldıkça ve sonuçlar toplandıkça güç tüketimi tepe ve dip yapar. Ekip, bu milisaniyelik dalgalanmaları tamponlamak için araya Tesla Megapack bataryaları koymuş.

Yapılandırılmış kablolama

Bu ağ yoğunluğu devasa fiber çekimi demek. Her fiber doğru uzunlukta kesilip sonlandırılmış ve etiketlenmiş; ayrıca yönetim arayüzleri ve ortam sensörleri için daha düşük hızlı ayrı bir ağ bulunuyor.

Bu mimari sizin projeniz için ne anlama geliyor?

Colossus’un asıl dersi 100.000 GPU değil, tekrarlanabilir yapı taşı mantığı. Aynı tasarım tek raflık bir başlangıç için de geçerli: sıvı soğutmalı 8-GPU sunucu, rafın altında CDU, arkada ısı eşanjörü. Ölçeği büyütmek, aynı bloğu çoğaltmaktan ibaret hâle geliyor.

Colossus’ta kullanılan 4U Universal GPU sisteminin muadili, GTM Teknoloji kataloğunda hazır:

Kaynak: Bu analiz, Supermicro sponsorluğunda ServeTheHome (Patrick Kennedy) tarafından hazırlanan “Inside the 100K GPU xAI Colossus Cluster that Supermicro Helped Build for Elon Musk” başlıklı başarı hikâyesindeki teknik verilere dayanmaktadır (Aralık 2024). Metin çeviri değildir; veriler GTM Teknoloji tarafından yorumlanarak Türkçe olarak yeniden yazılmıştır. Ayrıntı ve orijinal görseller için Supermicro NVIDIA çözümleri sayfasına bakabilirsiniz.

Sık Sorulan Sorular

Colossus ne kadar sürede kuruldu?
Ekipler bu dev kümeyi 122 günde kurdu. Milyarlarca dolarlık ve 100.000 NVIDIA H100 GPU’luk bir tesis için bu, sektörde alışılmışın çok dışında bir hız. Kaynak belgede öne çıkarılan ana ders de bu: bu ölçek ancak çok sayıda uzmanın ortak bir vizyonla, tedarikçi ayrımı gözetmeden birlikte çalışmasıyla mümkün olmuş.
Kümenin temel yapı taşı ne?
Supermicro’nun sıvı soğutmalı rafı. Her rafta 8 adet 4U sunucu, her sunucuda 8 NVIDIA H100 var — yani raf başına 64 GPU. Buna rafın CDU’su ve yardımcı donanımı ekleniyor. Raflar sekizerli gruplar hâlinde toplanıyor; bu da kendi ağıyla birlikte 512 GPU’luk mini kümeler oluşturuyor.
Neden InfiniBand değil de Ethernet kullanılmış?
xAI, GPU’lar için RDMA ağını Ethernet üzerine kurmuş — süperbilgisayarlarda yaygın olan InfiniBand yerine. Gerekçe ölçeklenebilirlik: Ethernet internetin omurgası ve bu büyüklükteki kümelerin ulaştığı ölçeğe daha egzotik teknolojiler henüz erişemedi. Sistem başına 9 adet 400GbE bağlantı, GPU sunucusu başına yaklaşık 3,6 Tb/s bant genişliği demek. Her GPU’nun kendi NIC’i var; NVIDIA BlueField-3 SuperNIC ve Spectrum-X kullanılıyor. CPU’lar ise tamamen ayrı bir anahtar dokusu üzerinden 400GbE alıyor.
Sıvı soğutma varken neden hâlâ fan var?
Sıvı soğutma GPU’ları, CPU’ları ve bu tasarımda PCIe anahtarlarını soğutuyor. Ama bellek modülleri, güç kaynakları, yönetim denetleyicisi ve ağ kartları hava ile soğutuluyor. Bu artık ısı, rafın arkasındaki ısı eşanjöründen geçirilerek tesis su döngüsüne aktarılıyor; böylece raf, veri salonu açısından ısı nötr kalıyor.
Depolama tarafında ne kullanılmış?
Farklı üreticilerin depolama yazılımları çalışıyor olsa da neredeyse tüm depolama sunucuları Supermicro. Yoğun olarak 2,5″ NVMe yuvalı 1U düğümler kullanılmış. Büyük AI kümeleri diskten flash’a geçiyor: flash petabayt başına daha pahalı olsa da bu ölçekte enerji tasarrufu, performans ve yoğunluk avantajıyla toplam sahip olma maliyetinde öne geçiyor.
Tesla Megapack’ler ne işe yarıyor?
AI sunucuları 7/24 tam güçte çalışmaz; iş yükü GPU’lara dağıtıldıkça, sonuçlar toplandıkça ve yeni işler başlatıldıkça güç tüketimi tepe ve dip yapar. Bu milisaniyelik dalgalanmalar şebeke açısından yeterince zorlayıcı olduğu için ekip, araya Tesla Megapack bataryaları koyarak dalgalanmayı tamponlamış ve kurulumun genel güvenilirliğini artırmış.
Bu mimari daha küçük ölçekte de kurulabilir mi?
Evet. Colossus’un yapı taşı olan 4U sıvı soğutmalı 8-GPU sistemi standart bir Supermicro ürünü ve GTM Teknoloji kataloğunda yer alıyor. Aynı tasarım mantığı — sıvı soğutmalı GPU sunucusu + CDU + arka kapı ısı eşanjörü — tek raflık bir başlangıç için de geçerli. Ölçeği ihtiyacınıza göre belirleyip [email protected] üzerinden birlikte planlayabiliriz.

AI kümenizi birlikte boyutlandıralım

İster tek raflık bir başlangıç ister çok raflı bir eğitim kümesi olsun; GPU sunucusu, sıvı soğutma, ağ ve depolama tarafını birlikte planlayalım. GTM Teknoloji 2009’dan bu yana Supermicro’nun Türkiye distribütörü ve NVIDIA NPN iş ortağıdır.

Teklif alın GPU sunucularını inceleyin

Yorum bırakın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Scroll to Top