Yerel yapay zekâ sistemi, yoğun kullanımda bulut API’lerinden daha ucuza gelebiliyor
İki Radeon AI PRO R9700 ekran kartıyla kurulan yaklaşık 18.775 dolarlık iş istasyonu, yüksek hacimli yapay zekâ görevlerinde bazı bulut modellerinin API maliyetlerini aşabiliyor. Hesaplamada donanım, elektrik ve üç yıllık kullanım giderleri dikkate alınırken avantajın modelin yeteneklerine ve kullanım yoğunluğuna bağlı olduğu belirtiliyor.

Yapay zekâ modellerini bulut üzerinden çalıştırmak yerine kendi donanımında barındırmak, belirli bir kullanım seviyesinin ardından ciddi bir maliyet avantajı sağlayabiliyor.
İki adet AMD Radeon AI PRO R9700 ekran kartıyla hazırlanan yaklaşık 18.775 dolarlık iş istasyonu, yüksek hacimli yapay zekâ işlemlerinde GPT-5.6 Sol ve Claude Opus 5 gibi üst seviye bulut modellerinin API maliyetinin altına inebiliyor.
Yapılan hesaplamalarda donanım maliyeti, elektrik tüketimi, modelin ürettiği token miktarı ve sistemin üç yıllık kullanım süresi birlikte değerlendirildi.
Test sisteminde 32 GB GDDR6 belleğe sahip iki Radeon AI PRO R9700 kullanıldı. İki ekran kartı birlikte toplam 64 GB VRAM sunuyor. İş istasyonunda AMD Ryzen Threadripper PRO işlemci, 128 GB RAM ve profesyonel sınıf bir anakart bulunurken test edilen sistemin toplam maliyeti yaklaşık 18.775 dolar olarak hesaplandı. Radeon AI PRO R9700’lerin tek başına toplam maliyeti ise yaklaşık 3.760 dolar seviyesinde.
İki ekran kartı üzerinde Qwen3.6-27B modeli çalıştırıldı. Standart vLLM FP8 Tensor Parallelism yapılandırmasında sekiz eş zamanlı kullanıcı altında sistem saniyede 156,2 token üretebildi.
Multi-Token Prediction, yani MTP tabanlı spekülatif çözümleme etkinleştirildiğinde aynı sistem saniyede 320,2 token seviyesine çıktı. Testte MTP kullanılırken üretilen çıktının standart çözümlemeyle aynı kaldığı belirtildi.
MTP etkin halde tek kullanıcı performansı saniyede 62,75 token olarak ölçülürken dört eş zamanlı kullanıcıda 186,29 token, sekiz kullanıcıda ise 320,23 token elde edildi. Sekiz kullanıcı yükünde iki ekran kartının toplam güç tüketimi yaklaşık 490 watt seviyesinde kaldı. Standart vLLM yapılandırmasında aynı yük altında 480 watt ölçüldü.
Maliyet hesabında yalnızca ekran kartlarının harcadığı elektrik dikkate alınmadı. İşlemci, RAM, depolama, fanlar ve güç kaynağı kayıpları için yaklaşık 300 watt ek sistem tüketimi hesaba katıldı. Elektrik fiyatı kilovatsaat başına 0,1354 dolar, donanımın ekonomik kullanım süresi ise üç yıl olarak kabul edildi.
Bulut tarafında bir milyon çıktı tokenı için GPT-5.6 Sol 30 dolar, Claude Opus 5 25 dolar, Gemini 3.1 Pro ve GPT-5.6 Terra 12 dolar, Claude Sonnet 5 ise 10 dolar seviyesinde hesaplandı.
Daha düşük maliyetli seçeneklerde Gemini 3.6 Flash 7,50 dolar, Claude Haiku 4.5 5 dolar, Gemini 3.1 Flash-Lite 1,50 dolar ve GPT-5.6 Luna 1,20 dolar seviyesinde yer aldı.
MTP açık çift R9700 sistemi, sekiz kullanıcının sürekli yük oluşturduğu senaryoda haftada yalnızca 3,5 saat çalıştırıldığında GPT-5.6 Sol’un token maliyetinin altına inebiliyor. Claude Opus 5 karşısındaki eşik haftada 4,2 saat, Gemini 3.1 Pro ve GPT-5.6 Terra karşısında 8,8 saat, Claude Sonnet 5 karşısında ise 10,5 saat olarak hesaplandı.
Daha ucuz bulut modellerinde tablo değişiyor. Gemini 3.1 Flash-Lite karşısında yerel sistemin haftada yaklaşık 74,2 saat, GPT-5.6 Luna karşısında ise 94,3 saat yoğun şekilde kullanılması gerekiyor.
Bir haftada toplam 168 saat bulunması nedeniyle özellikle GPT-5.6 Luna gibi düşük fiyatlı modellerde yerel donanımın maliyet avantajı ancak uzun süreli ve yüksek kapasiteli kullanımda ortaya çıkıyor.
Aylık 20 milyon çıktı tokenı üreten bir ekip için GPT-5.6 Sol maliyeti üzerinden yapılan hesaplamada yerel sistemin yıllık toplam gideri yaklaşık 6.262 dolar seviyesinde kalıyor. Aynı miktardaki çıktının GPT-5.6 Sol üzerinden alınması yaklaşık 18.000 dolara ulaşıyor. Aradaki yıllık fark yaklaşık 11.738 dolar.
Donanımın tamamını yalnızca yapay zekâ çalıştırmak için satın alınmış kabul etmek ise en ağır maliyet senaryosunu oluşturuyor. Halihazırda güçlü bir Threadripper PRO iş istasyonuna ihtiyaç duyan bir kullanıcı veya şirket için yalnızca R9700 ekran kartlarına yapılan ek yatırım hesaba katıldığında amortisman süresi önemli ölçüde kısalıyor. İki R9700’in temel ekran kartı seçeneğine kıyasla sisteme ek maliyeti 3.283 dolar olarak hesaplandı.
Bu senaryoda çift R9700 yatırımı GPT-5.6 Sol karşısında haftada yaklaşık 1,3 saatlik sürekli kullanımla maliyetini karşılayabiliyor. Claude Opus 5 için 1,5 saat, Gemini 3.1 Pro için 3,2 saat gerekiyor. GPT-5.6 Luna karşısındaki eşik de tüm iş istasyonunun maliyetinin hesaba katıldığı 94,3 saat seviyesinden yaklaşık 37 saate kadar düşüyor.
Tek Radeon AI PRO R9700 ile de daha küçük modeller çalıştırılabiliyor. DeepSeek-R1-Distill-Llama-8B modeli tek kartta saniyede 34,5 token üretirken sekiz eş zamanlı kullanıcı altında toplam performans saniyede 174 tokena ulaştı.
Tek kartın güç tüketimi kullanıcı sayısına bağlı olarak 221 ile 283 watt arasında ölçüldü. Qwen2.5 3B ise tek kullanıcıda saniyede 53,3 token ve sekiz kullanıcı altında 251 token üretti.
Radeon AI PRO R9700’in 32 GB belleği 8 milyar parametreli modelleri FP16 biçiminde çalıştırmaya yeterken iki kartın toplam 64 GB belleği daha yüksek hassasiyetli 27 milyar parametre sınıfındaki modeller için kullanılıyor. Kart başına 640 GB/s bellek bant genişliği bulunuyor ve her R9700 için 300 watt toplam kart gücü değeri veriliyor.
Maliyet karşılaştırması, yerel Qwen3.6-27B modelinin GPT-5.6 Sol, Claude Opus veya Gemini 3.1 Pro ile aynı yapay zekâ yeteneklerine sahip olduğu varsayımıyla yapılmadı. Zorlu akıl yürütme testlerinde yerel açık model, üst seviye bulut modellerinin gerisinde kalıyor.
Kullanılan bağımsız değerlendirmede Qwen3.6-27B 37 puan alırken Gemini 3.1 Pro 46 puana ulaştı. Dolayısıyla hesaplama; özetleme, sınıflandırma, sohbet, araç kullanımı veya yüksek hacimli içerik üretimi gibi görevlerde yerel modelin yeterli olduğu iş yüklerini kapsıyor.
Yerel sistem ayrıca API kullanım sınırları, modelin hizmetten kaldırılması, fiyat değişiklikleri ve hassas verilerin üçüncü taraf sunuculara gönderilmesi gibi bulut kullanımına bağlı unsurları ortadan kaldırıyor. Bunun karşılığında donanım yatırımı, kurulum, bakım ve yerel yapay zekâ altyapısının yönetimi doğrudan kullanıcı veya şirket tarafında kalıyor.
1996 yılında Üsküdar’da doğan Mert Can Aka, sinema, bilim, teknoloji ve tarih alanlarına duyduğu ilgiyle şekillenen kariyerinde teknoloji editörlüğüne odaklandı. Öğrenmeyi ve bilgiyi aktarmayı merkeze alan Aka, farklı kurumlarda çeşitli görevler üstlendi. Bu süreçte MediaMarkt’ın MediaTrend Teknolojik Yaşam dergisini son sayısına kadar yöneterek dergicilik tarafında da deneyim kazandı. Bilgisayar Mühendisliği, Bilgisayar Programcılığı, Web Tasarım ve Kodlama ile birlikte Adalet ve İktisat alanlarında akademik geçmişe sahip olan Aka, bugün Technopat’ta Yazı İşleri Müdürü olarak görev yapıyor. Otomotivden yapay zekaya, donanımdan ev teknolojilerine uzanan geniş bir yelpazede ürettiği on bini aşkın içerik yüz milyonlarca okura ulaştı.
Kaynak: Technopat


