Yapay Zeka Altyapıları
GPU Boyutlandırma: AI Inference İş Yüklerinde Performans ve TCO Optimizasyonu
GPU boyutlandırma, AI inference altyapılarında performans ve maliyet dengesini belirler. Bu nedenle ekip model, trafik ve gecikme hedeflerini birlikte inceler. Ardından gerçek kapasite ihtiyacını hesaplar.

GPU boyutlandırma sürecinde yalnızca en güçlü GPU’yu seçmek doğru değildir. Bunun yerine ekip uygulamanın çalışma şeklini inceler. Ayrıca kullanıcı yoğunluğu ve token miktarı kararı etkiler. Gecikme hedefleri de kapasite ihtiyacını belirler.
Gereğinden büyük GPU altyapısı kaynakları boşta bırakabilir. Sonuç olarak toplam sahip olma maliyeti artar. Buna karşılık yetersiz kapasite yanıt sürelerini uzatır.
Bu nedenle ekip yalnızca model boyutuna odaklanmaz. Ayrıca gerçek kullanım davranışını hesaba katar. Böylece daha dengeli bir GPU kapasitesi planlar.
GPU Boyutlandırma Neden Kullanım Senaryosuna Göre Yapılmalıdır?
Her yapay zeka uygulaması GPU üzerinde aynı yükü oluşturmaz. Örneğin chatbot uygulamaları farklı token profilleri kullanır. AI agent sistemleri ise farklı ihtiyaçlar oluşturur.
Bir chatbot uzun bir kullanıcı girdisini işleyebilir. Buna karşılık kısa bir yanıt üretebilir. İçerik üretim araçları kısa bir prompt kullanabilir. Ardından daha uzun bir çıktı oluşturabilir.
AI agent ve deep research senaryolarında ihtiyaç değişir. Özellikle uzun context pencereleri daha fazla bellek tüketir. Ayrıca RAG süreçleri GPU yükünü artırır. Çok adımlı işlemler de ek hesaplama gücü ister.
- Chatbot / Copilot: Uzun girdi ve görece kısa çıktı.
- AI Agent: Uzun context ve çok adımlı işlem süreçleri.
- İçerik üretimi: Kısa girdi ve uzun çıktı.
- Çeviri: Girdi ve çıktı uzunlukları birbirine daha yakındır.
| Kullanım Senaryosu | Cached Input | Input Token | Output Token |
|---|---|---|---|
| Chatbot / Copilot | 1.000–5.000 | 2.000–8.000 | 200–800 |
| AI Agent | >128.000 | 500–1.000 | 200–300 |
| İçerik Üretimi | 50–300 | 200–1.000 | 1.000–4.000 |
| Çeviri | 50–250 | 200–1.000 | 200–1.000 |
Bu değerler örnek niteliğindedir. Ancak gerçek ihtiyaçlar model ve trafik yapısına göre değişir. Performans hedefleri de sonuçları etkiler.
GPU Boyutlandırma İçin Temel Girdiler
Doğru kapasite için yalnızca model adına bakmak yeterli değildir. Bu nedenle ekip uygulamanın çalışma profilini analiz eder. Ardından gerçek kullanım verilerini inceler. Böylece kapasite ihtiyacını daha doğru belirler.
- Model seçimi: Daha büyük model her zaman daha iyi sonuç sunmaz.
- Kullanıcı sayısı: Ekip mevcut kullanıcı sayısını inceler. Ayrıca büyüme beklentisini hesaba katar.
- Concurrency: Aynı anda işlenen istek sayısı GPU ihtiyacını etkiler.
- Token uzunluğu: Token sayısı arttıkça hesaplama yükü de artar.
- Cache hit rate: Cache tekrarlanan girdilerde işlem yükünü azaltır. Böylece sistem GPU kaynaklarını daha verimli kullanır.
- Latency hedefleri: Ekip TTFT ve P99 değerlerini düzenli olarak izler. Ayrıca inter-token latency değerini takip eder.
Core + Flex ile GPU Kapasitesini Dengelemek
AI iş yükleri her zaman aynı seviyede çalışmaz. Örneğin trafik gün içinde değişir. Ayrıca kampanyalar yükü hızla artırabilir. Ürün lansmanları da benzer bir etki yaratabilir.
Core + Flex yaklaşımı bu değişkenliği yönetmeye yardımcı olur. Core katmanı sürekli trafik için temel kapasite sağlar. Buna karşılık Flex katmanı geçici ihtiyaçları karşılar. Böylece sistem ek kaynakları yalnızca gerektiğinde kullanır.
01
Temel GPU Kapasitesi
Core kapasite sürekli iş yüklerini karşılar. Ayrıca tahmin edilebilir trafik için temel kaynak sağlar.
- Sabit ve öngörülebilir trafik
- On-premise veya rezerve GPU
- Öngörülebilir altyapı maliyeti
- Sürekli çalışan production iş yükleri
02
Esnek GPU Kapasitesi
Flex kaynaklar trafik arttığında ek kapasite sağlar. Ayrıca kısa süreli ihtiyaçlarda devreye girer.
- Ani trafik artışları
- Cloud ve on-demand GPU
- Kampanya ve ürün lansmanları
- Kısa süreli AI projeleri
Bu yaklaşım fazla donanım ihtiyacını azaltır. Böylece kurumlar temel kapasiteyi sabit tutar. İhtiyaç arttığında ise ek GPU kaynağı kullanır.
GPU Boyutlandırma ve Kaynak Verimliliği
En büyük GPU her zaman en ekonomik seçenek değildir. Örneğin model GPU belleğine rahatlıkla sığabilir. Buna rağmen sistem düşük kullanım oranıyla çalışabilir.
Kullanılmayan GPU kapasitesi doğrudan maliyet oluşturur. Öte yandan yetersiz kapasite throughput değerlerini düşürür. Bu nedenle ekip iki durum arasında denge kurar.
Model Optimizasyonu GPU İhtiyacını Nasıl Azaltır?
GPU ihtiyacını azaltmanın tek yolu donanımı değiştirmek değildir. Ayrıca model optimizasyonu kaynak ihtiyacını düşürür. Böylece ekip mevcut altyapıdan daha fazla verim alır.
Quantization
Quantization modeli daha düşük precision formatlarında çalıştırır. Böylece model daha az GPU belleği kullanır.
Pruning
Pruning daha az kritik model bileşenlerini kaldırır. Sonuç olarak model daha az hesaplama kaynağı tüketir.
Knowledge Distillation
Knowledge Distillation model bilgisini daha küçük modele aktarır. Böylece küçük model daha az kaynak kullanır.
Quantization ile Bellek Kullanımını Azaltmak
Quantization sırasında ekip FP16 yerine FP8 tercih edebilir. Benzer şekilde BF16 yerine FP8 kullanabilir. Böylece model GPU belleğinde daha az alan kaplar.
16.06 GB
Başlangıç ağırlık belleği
→
9.08 GB
Quantization sonrası
NVIDIA’nın Llama 3.1 8B örneğinde FP8 kullanımı belleği azaltır. Sonuç olarak ağırlık belleğinde yaklaşık %43,5 düşüş oluşur.
GPU Boyutlandırma ve TCO Optimizasyonu
Toplam sahip olma maliyeti yalnızca GPU fiyatından oluşmaz. Ayrıca enerji tüketimi toplam maliyeti etkiler. Soğutma giderleri de hesaba dahil olur.
Veri merkezi alanı ve operasyon giderleri de önemlidir. Bunun yanında GPU kullanım oranı TCO’yu doğrudan etkiler. Dolayısıyla ekip tüm maliyet kalemlerini birlikte inceler.
- GPU ve sunucu yatırım maliyeti
- Enerji tüketimi
- Soğutma maliyeti
- Veri merkezi alanı
- GPU utilization oranı
- Cloud ve on-demand kaynak maliyeti
- Operasyon ve yönetim giderleri
Daha pahalı bir GPU her zaman yüksek TCO oluşturmaz. Benzer şekilde ucuz bir GPU da ekonomik sonuç vermeyebilir. Bu nedenle ekip gerçek kullanım verimliliğine odaklanır.
GPU Boyutlandırma Sürecini Düzenli Olarak Değerlendirmek
GPU boyutlandırma tek seferlik bir işlem değildir. Zaman içinde modeller değişir. Ayrıca kullanıcı sayısı artabilir.
Bu nedenle ekip gerçek kullanım verilerini düzenli olarak izler. Örneğin GPU utilization ve throughput değerlerini takip eder. Ayrıca TTFT değerini izler. Bunun yanında concurrency değerini kapasite planına dahil eder.
Yeni veriler ortaya çıktıkça ekip kapasite planını günceller. Böylece altyapıyı performans açısından dengede tutar. Aynı zamanda maliyet kontrolünü güçlendirir.
Sonuç
Doğru GPU boyutlandırma gerçek iş yükünü anlamakla başlar. Bu nedenle ekip modeli ve token yapısını inceler. Ayrıca kullanıcı yoğunluğunu hesaba katar.
Bunun yanında latency hedefleri kapasite kararını etkiler. Ekip GPU utilization oranını da düzenli olarak izler. Böylece gereksiz kapasite yatırımlarını azaltır.
Sonuç olarak GTM Teknoloji, AI altyapıları için çözümler sunar. Ayrıca kurumların ihtiyaçlarına uygun GPU sunucuları planlar. Böylece kurumlar daha dengeli altyapılar oluşturabilir.
GPU boyutlandırma ile doğru AI altyapısını planlayın
GPU boyutlandırma sürecinde modeliniz, kullanıcı yoğunluğunuz ve performans hedeflerinize
uygun altyapıyı planlamak için GTM Teknoloji ile iletişime geçin.