122 günde 100.000 GPU: xAI Colossus kümesi nasıl kuruldu?
Elon Musk’ın Memphis’teki AI süperbilgisayarı, yalnızca büyüklüğüyle değil kurulum hızıyla da dikkat çekiyor. Kümenin yapı taşı Supermicro’nun sıvı soğutmalı rafı: raf başına 64 NVIDIA H100, sekizerli gruplarda 512 GPU’luk mini kümeler. Bu yazıda mimarinin nasıl katmanlandığını ve kendi projenize ne söylediğini inceliyoruz.

Görsel: GTM Teknoloji kataloğundaki 4U sıvı soğutmalı 8-GPU HGX sistemi — Colossus’ta kullanılan yapı taşının aynı ailesi.
Neden bu kurulum önemli?
Colossus’u kayda değer kılan yalnızca 100.000 GPU’luk ölçeği değil; bu ölçeğe 122 günde ulaşılmış olması. Bu hız, tek tek ürünlerin başarısından çok bir yapı taşı yaklaşımının sonucu: aynı sıvı soğutmalı raf tasarımı defalarca çoğaltılıyor, her katman bir öncekinin katı olarak büyüyor. Aşağıdaki tablo, tek bir 4U sunucudan 100.000 GPU’ya kadar ölçeğin nasıl katlandığını gösteriyor.
Sıvı soğutmalı Supermicro 4U Universal GPU sistemi. NVIDIA HGX H100 tepsisi özel sıvı soğutma bloklarıyla soğutulur; CPU tepsisinde iki x86 işlemci bloğu bulunur.
8 adet 4U sunucu + Supermicro CDU (soğutucu dağıtım ünitesi) ve yardımcı donanım bir GPU hesaplama rafını oluşturur.
Raflar sekizerli gruplar hâlinde konumlandırılır; kendi ağıyla birlikte, çok daha büyük sistemin içinde bir mini küme gibi çalışır.
Ziyaret sırasında dört veri salonu devredeydi; her biri 25.000 GPU barındırıyordu.
Dört salonun toplamı. Genişleme çalışmaları hızla sürüyor.
Sunucu tasarımında öne çıkan dört karar
Colossus’ta kullanılan 4U Universal GPU sistemi, piyasadaki diğer HGX sunucularından birkaç somut noktada ayrışıyor.
Sektördeki yaygın yaklaşım, hava soğutmalı bir tasarımın üstüne sıvı soğutma eklemektir. Supermicro’nun 4U Universal GPU sistemi ise doğrudan sıvı soğutulmak üzere tasarlandı ve bileşenlerin tamamı tek üreticiden geliyor.
Neredeyse her HGX sunucusunda kullanılan dört Broadcom PCIe anahtarı, ayrı bir kart yerine doğrudan Supermicro anakartına tümleşik. Bu anahtarlar da özel bir sıvı soğutma bloğuyla soğutuluyor — sektörde eşi olmayan bir tasarım tercihi.
Sistemler tepsiler üzerinde; 1U raf manifoldu her sunucuya soğuk sıvıyı getirip ısınmış sıvıyı geri alıyor. Hızlı ayırıcılar (quick disconnect) sayesinde sıvı bağlantısı tek elle sökülebiliyor ve tepsi servis için dışarı çekilebiliyor — sunucuyu raftan çıkarmaya gerek yok.
Her rafın altındaki CDU, dev bir ısı eşanjörü gibi çalışıp raftaki tüm GPU sunucularını besleyen bir sıvı döngüsü kuruyor. Pompaları ve güç kaynakları yedekli; biri arızalanırsa rafı kapatmadan sahada değiştirilebiliyor.
Isı yönetimi: sıvı soğutma tek başına yetmiyor
Bu kurulumun en öğretici tarafı, sıvı soğutmanın hikâyenin yalnızca yarısı olması. Geri kalanı, rafın ürettiği artık ısının veri salonuna hiç verilmeden dışarı taşınması üzerine kurulu.
Sıvı soğutmaya rağmen sunucularda hâlâ fan var: DIMM’ler, güç kaynakları, BMC ve ağ kartları gibi bileşenler havayla soğutuluyor. Colossus’ta her rafın veri salonuna göre ısı nötr olması hedeflenmiş — böylece salona devasa klima santralleri kurmak gerekmiyor.
Sunucu fanları önden soğuk havayı alıp arkadan atıyor; bu hava rafın arkasındaki ısı eşanjöründen geçiriliyor. Mantık otomobil radyatörüyle aynı: içinden sıvı geçen petekli bir yapı, ısıyı tesis su döngüsüne aktarıyor.
Arka kapı eşanjörleri sadece sıvı soğutmalı GPU sunucularının artık ısısını değil; depolama, CPU hesaplama kümeleri ve ağ bileşenlerinin ısısını da alıyor. Bu sayede aynı salonda sıvı soğutmalı ve hava soğutmalı ekipman bir arada çalışabiliyor.
Soğuk su tesise alınıp her raftaki CDU’dan dolaştırılıyor; GPU’lardan ve arka kapı eşanjörlerinden toplanan ısı burada tesis su döngüsüne aktarılıyor. Isınan su dışarıdaki çillerlerde tekrar kullanılabilecek sıcaklığa indiriliyor.
Ağ: 400GbE’nin dokuz katı
Kümenin en dikkat çekici tercihlerinden biri ağ tarafında. GPU’lar arası RDMA trafiği için InfiniBand yerine Ethernet seçilmiş. Gerekçe ölçek: Ethernet internetin omurgası olduğu için son derece ölçeklenebilir bir teknoloji ve bu büyüklükteki AI kümeleri, daha egzotik teknolojilerin henüz ulaşamadığı ölçeklere çıkıyor.
(yaygın 1GbE’nin 400 katı)
toplam bant genişliği
Bant genişliğinin büyük kısmını GPU RDMA ağı kullanıyor; her GPU’nun kendi ağ kartı var. Kurulumda NVIDIA BlueField-3 SuperNIC ve Spectrum-X ağ teknolojisi kullanılıyor. CPU’lar ise tamamen ayrı bir anahtar dokusu üzerinden 400GbE alıyor — GPU ağı ve kümenin geri kalanı için ayrı ağlar kurmak, yüksek başarımlı hesaplamada yaygın bir tasarım tercihidir.
Sıradaki sorun: anahtarların soğutulması
Kaynak belgede dile getirilen önemli bir tespit: bu tesiste en çok göze çarpan eksik, sıvı soğutmalı ağ anahtarları. Modern bir anahtarda optikler, anahtar yongasından daha fazla güç tüketebiliyor. Bu ölçekteki kurulumların sektörü ortak paketlenmiş optiklere (co-packaged optics) ve anahtar tarafında da sıvı soğutmaya doğru itmesi bekleniyor.
Kümenin geri kalanı: depolama, CPU ve güç
Farklı üreticilerin depolama yazılımları çalışsa da donanımın neredeyse tamamı Supermicro; ağırlıklı olarak 2,5″ NVMe yuvalı 1U düğümler. Büyük AI kümeleri diskten flash’a kayıyor: petabayt başına maliyet daha yüksek olsa da enerji tasarrufu, performans ve yoğunluk toplam sahip olma maliyetinde flash’ı öne geçiriyor.
Veri hazırlama ve işleme görevleri hâlâ CPU’da çok iyi çalışıyor; GPU’ları eğitim ve çıkarım için ayırmak mantıklı. Bunun için hava soğutmalı 1U sunucu rafları kullanılıyor — ön panelin yaklaşık üçte biri hava girişine ayrılmış durumda.
AI sunucuları sürekli tam güçte çalışmaz; iş yükü dağıtıldıkça ve sonuçlar toplandıkça güç tüketimi tepe ve dip yapar. Ekip, bu milisaniyelik dalgalanmaları tamponlamak için araya Tesla Megapack bataryaları koymuş.
Bu ağ yoğunluğu devasa fiber çekimi demek. Her fiber doğru uzunlukta kesilip sonlandırılmış ve etiketlenmiş; ayrıca yönetim arayüzleri ve ortam sensörleri için daha düşük hızlı ayrı bir ağ bulunuyor.
Bu mimari sizin projeniz için ne anlama geliyor?
Colossus’un asıl dersi 100.000 GPU değil, tekrarlanabilir yapı taşı mantığı. Aynı tasarım tek raflık bir başlangıç için de geçerli: sıvı soğutmalı 8-GPU sunucu, rafın altında CDU, arkada ısı eşanjörü. Ölçeği büyütmek, aynı bloğu çoğaltmaktan ibaret hâle geliyor.
Colossus’ta kullanılan 4U Universal GPU sisteminin muadili, GTM Teknoloji kataloğunda hazır:
- Supermicro AS-4125GS-TNHR2-LCC — 4U sıvı soğutmalı, AMD EPYC + NVIDIA HGX H100/H200 8-GPU sunucu
- Supermicro SYS-821GE-TNHR — Intel Xeon işlemcili 8x NVIDIA HGX H200/H100 AI sunucusu
- Sıvı soğutmalı GPU sunucuları — kategorinin tamamı
- NVIDIA HGX B300 / B200 / H200 sunucular — Blackwell nesli çözüm sayfası
Sık Sorulan Sorular
Colossus ne kadar sürede kuruldu?
Kümenin temel yapı taşı ne?
Neden InfiniBand değil de Ethernet kullanılmış?
Sıvı soğutma varken neden hâlâ fan var?
Depolama tarafında ne kullanılmış?
Tesla Megapack’ler ne işe yarıyor?
Bu mimari daha küçük ölçekte de kurulabilir mi?
AI kümenizi birlikte boyutlandıralım
İster tek raflık bir başlangıç ister çok raflı bir eğitim kümesi olsun; GPU sunucusu, sıvı soğutma, ağ ve depolama tarafını birlikte planlayalım. GTM Teknoloji 2009’dan bu yana Supermicro’nun Türkiye distribütörü ve NVIDIA NPN iş ortağıdır.
