Big data ve AI birleştiğinde asıl değer dashboard'larda veya abartılı vaatlerde değil — ölçeklendirilebilir otomatik kararlarda yatar. Benim ortamımda altyapı loglarını, network trafiğini ve sistem metriklerini bir data pipeline'a besliyoruz, sonra makine öğrenmesi modelleri bir insanın grafik okumasını beklemeden bu veri üzerinde aksiyon alıyor. Big data ve AI birleşik kullanım senaryolarının özü şu: veri katmanı her şeyi saklar, AI katmanı öğrenir, tahmin eder ve bazen sorunları kendi başına çözer.
Bu birleşik senaryoları bir süredir çalıştırıyorum ve "verimiz var" ile "veri bir şey yapıyor" arasındaki fark gece ile gündüz kadar. Üretimde gerçekten kullandıklarımı adım adım anlatayım.
Altyapı için Prediktif Bakım
Muhtemelen en elle tutulur kazanç bu. Bir diskin bozulmasını veya bir sunucunun takılmasını beklemek yerine, SMART verilerini, disk latency metriklerini ve CPU load average'ları bir time-series store'a toplıyorum. Tarihsel arıza kalıplarıyla eğitilmiş bir ML modeli, bozulmaya doğru giden disk ve node'ları işaretliyor.
Pipeline kabaca şöyle görünüyor:
Node exporters → Kafka → ClickHouse → Python model (scikit-learn) → Alertmanager
Model sadece "disk %90 dolu" eşiğini kontrol etmiyor. Hata oranı trendlerine, spin-up latency değişimlerine ve sıcaklık sapmalarına bakıyor. 7 gün içinde arıza tahmin ettiğinde otomatik ticket açıyor.
İpucu: Tarihsel verilerinizi etiketleme adımını atlama. Etiketsiz metriklerle eğitilmiş bir model sadece tahmin yürütüyor.
Network Trafiğinde Gerçek Zamanlı Anomali Tespiti
Ağ yavaşlığının gerçek nedenini bulma yazımda (https://furkanikkan.com/urun/ag-yavasliginin-gercek-nedenini-bulmanin-7-yolu-50) belirttiğim gibi, her flow'u manuel inceleyemezsiniz. Big data ve AI birleşik kullanım senaryolarının network admin'leri için en pratik kısmı burası.
NetFlow ve sFlow verilerini şu işleri yapan bir pipeline'a gönderiyorum:
- Kaynak/hedef/port bazında trafiği 1 dakikalık pencerelerde toplar
- Agregasyon istatistiklerini bir isolation forest modeline besler
- Öğrenilen baseline'dan sapan flow'ları işaretler
- Anomali skoru bir eşiği geçerse uyarı veya geçici firewall bloğu tetikler
Modelin son tahminlerini kontrol etmek için tek bir komut kabaca şöyle:
curl -s http://localhost:5000/api/anomalies?window=15m | jq '.[] | select(.score > 0.8)'
Bu, sabah 3'te ele geçirilmiş bir internal host'un bilinmeyen bir external IP'ye aniden beacon göndermesi gibi şeyleri yakalıyor. Statik eşikler bunu kaçırır çünkü hacim düşük. Model yakalar çünkü kalıp yanlış.
Log Clustering ve Otomatik Incident Triajı
Windows Server veya bir Linux sunucu filosu yöneten herkes bilir ki, log gürültüsü devasa bir sorundur. Windows istemci yavaşlaması yazımda (https://furkanikkan.com/urun/windows-istemci-yavaslamasi-performans-kaybinin-gizli-nedenleri-51) bunun bir kısmını ele aldım ama big data ölçeğinde bunu anlamlandırmak için AI'ye ihtiyacınız var.
Yaptığım şey şu:
- Tüm logları (syslog, Event Log, app logları) bir Elasticsearch cluster'ına gönderirim
- Her 30 dakikada bir clustering modeli çalıştırırım (BERT tabanlı embeddings + HDBSCAN)
- Benzer log satırlarını cluster'lar halinde gruplarım
- Son 30 günde görünmeyen yeni cluster'ları "novel" olarak işaretlerim
- Novel cluster'ları Slack webhook üzerinden nöbetçi mühendise gönderirim
Bu, uyarı yorgunluğunu ciddi şekilde azaltır. 500 ayrı hata satırı yerine "12 host'ta yeni hata kalıbı tespit edildi" diyen tek bir mesaj alırsınız. Bu aksiyon alınabilir.
Backup Arıza Tahmini
Benim dünyamda backup'lar kutsaldır. 3-2-1 backup kuralı yazımda (https://furkanikkan.com/urun/3-2-1-yedekleme-kurali-sadece-yedek-almak-yetmez-49) yazdığım gibi, backup'ların olması ancak gerçekten restore yapılıyorsa işe yarar. Bu yüzden backup job metadata'sını bir tahmin modeline beslemeye başladım.
Model şunlara bakıyor:
- Job süre trendleri (yavaş büyüme = storage darboğazı)
- Hata tipleri ve frekansları
- Backup pencereleri sırasında kaynak sistem yükü
- Hedef storage kapasitesi ve IOPS
Model bir job'un sonraki 3 çalışmasında başarısız olma ihtimali yüksek olduğunu tahmin ettiğinde, arıza olmadan önce işaretliyor. Bu şekilde birkaç yakın ıskayı yakaladım — çalışma süresi sessizce büyüyen ve kritik bir restore penceresinde timeout'a düşecek joblar.
Regresyon Modelleriyle Kapasite Planlama
Bu daha az gösterişli ama para tasarrufu sağlar. Storage ve compute kendiliğinden scale olmaz ve over-provisioning pahalıdır. Her storage tier ve compute cluster'da %80 kapasiteye ne zaman ulaşacağımızı tahmin etmek için tarihsel büyüme verileri üzerinde basit bir regresyon modeli kullanıyorum.
Haftalık çalıştırdığım hızlı bir kontrol:
python3 capacity_forecast.py --cluster prod-storage --weeks 12
Çıktı:
Cluster: prod-storage
Current usage: 64.2%
Predicted 80% hit: week of 2026-03-15
Recommended action: add 20TB by week of 2026-02-28
Confidence: 0.91
Bu bana donanım sipariş etmek veya veri taşımak için haftalarca ön süre veriyor. Tahmin yok, panik alım yok.
Ne Çalışmıyor (Henüz)
Sınırlar hakkında dürüst olayım. Her big data + AI kombinasyonu production-ready değil:
- Tam otomatik remediation: Düzeltmeleri otomatik uygulayan modeller riskli. Production state'ini değiştiren her şey için bir insanı loop'ta tutuyorum.
- Yapılandırılmamış ticket'larda NLP: Kategorizasyon için faydalı ama inceleme olmadan ticket'ları otomatik kapatmak için yeterince güvenilir değil.
- Gerçek zamanlı model yeniden eğitimi: Drift detection çalışıyor ama gerçek zamanlı yeniden eğitim kararsızlık yaratıyor. Takvimli olarak yeniden eğitiyorum.
Data Science Ekibi Olmadan Nasıl Başlanır
Başlamak için bir sürü PhD'ye ihtiyacınız yok. İşte pratik tavsiyem:
- Tek bir veri kaynağıyla başlayın (loglar, metrikler veya network flow'ları)
- Her hafta size zaman kaybettiren bir problemi seçin
- Önce önceden eğitilmiş modeller veya basit istatistiksel baseline'lar kullanın
- Pipeline'ı kurun, sonra modeli geliştirin
Günlük kullandığım araçlar açık kaynak: ingestion için Kafka, storage için ClickHouse ve Elasticsearch, modeller için Python ile scikit-learn ve XGBoost, görselleştirme için Grafana. AI'nin gösterişli olması gerekmez. Sadece gerçek verinizle eğitilmiş ve aksiyon alabileceği bir yere deploy edilmiş olması yeterli.
AI olmadan big data bir bilgi çöplüğüdür. Big data olmadan AI bir tahmindir. İkisini birleştirirsiniz ve tahmin eden, önleyen ve önceliklendiren sistemler elde edersiniz — ve bunu kurmaya değer.
Kapak görseli: ₡ґǘșϯγ Ɗᶏ Ⱪᶅṏⱳդ · CC0 (Openverse / kamu malı) · https://www.flickr.com/photos/148598741@N02/52368542892
