Türkiye'nin en büyük e-ticaret sitelerinden biri olan Hepsiburada, günde 2 milyon kullanıcıya kişiselleştirilmiş ürün önerileri sunuyor. Peki bu kadar büyük ölçekte AI modellerini nasıl stabil tutuyorlar? Cevap: MLOps.
McKinsey'in 2023 araştırmasına göre, şirketlerin %70'i AI modellerini geliştiriyor ama sadece %20'si bu modelleri prodüksiyonda başarıyla çalıştırabiliyor. Geriye kalan %50 nerede kayboluyorlar? İşte tam bu noktada MLOps devreye giriyor.
Biz Hilor olarak, onlarca Türk şirketiyle çalışarak gördük ki MLOps sadece teknik bir süreç değil — işletmenizin AI yatırımından gerçek değer çıkarmasının anahtarı. Bu yazıda, AI modellerinizi prodüksiyonda tutmanın temellerini, gerçek örneklerle anlatacağız.
MLOps Nedir ve Neden Bu Kadar Kritik?
MLOps (Machine Learning Operations), AI modellerinin geliştirilmesinden prodüksiyona alınması ve sürdürülmesine kadar tüm yaşam döngüsünü yöneten metodoloji. DevOps'un AI dünyasındaki karşılığı diyebiliriz.
Geleneksel yazılım geliştirmeden farkı şu: Bir web sitesi bir kez yayınlandığında aynı şekilde çalışmaya devam eder. AI modelleri ise canlı organizma gibi — veri değiştikçe performansları düşer, yeniden eğitim gerektirir.
Türkiye İş Bankası'nın kredi risk değerlendirme sistemi buna mükemmel örnek. 2020'de geliştirdikleri model, pandemi döneminde müşteri davranışları değişince %15 performans kaybetti. MLOps süreçleri sayesinde bu durumu 2 hafta içinde tespit edip modeli yeniden eğittiler.
MLOps'un Temel Bileşenleri
Veri Yönetimi:
- Veri kalitesi izleme
- Veri versiyonlama
- Veri güvenliği ve gizlilik
Model Geliştirme:
- Deneyim takibi (experiment tracking)
- Model versiyonlama
- A/B test altyapısı
Prodüksiyon Yönetimi:
- Otomatik deployment
- Performans izleme
- Hata yönetimi
İş Süreci Entegrasyonu:
- Stakeholder iletişimi
- Compliance ve audit
- ROI takibi
Prodüksiyona Geçiş Sürecinde Karşılaştığınız Zorluklar Nelerdir?
Turkcell'in müşteri churn prediction projesi, prodüksiyon zorluklarının mükemmel bir örneği. Model laboratuvar ortamında %92 doğruluk oranıyla çalışıyordu. Prodüksiyona geçtiğinde bu oran %73'e düştü. Neden?
Veri Kayması (Data Drift)
En yaygın sorun veri kayması. Modelinizi 2022 verisiyle eğittiyseniz, 2024'teki müşteri davranışları farklı olabilir.
Tespit Yöntemleri:
- İstatistiksel testler (Kolmogorov-Smirnov)
- Dağılım karşılaştırmaları
- Otomatik uyarı sistemleri
Çözüm Stratejileri:
- Haftalık model performans raporları
- Otomatik yeniden eğitim tetikleyicileri
- Gradual model update'leri
Model Performans Düşüşü
Migros'un talep tahmin sistemi, Ramazan ayında beklenmedik performans düşüşü yaşadı. Sebep: Özel günlerde değişen alışveriş alışkanlıkları modele öğretilmemişti.
İzleme Metrikleri:
- Doğruluk oranı değişimi
- Tahmin güven aralıkları
- İş metriklerine etkisi (satış, müşteri memnuniyeti)
Teknik Altyapı Sorunları
Yaygın Problemler:
- Latency artışı (response süresi uzaması)
- Memory leak'ler
- API stability sorunları
- Scaling zorlukları
Yapı Kredi'nin real-time fraud detection sistemi, günde 5 milyon işlem analiz ediyor. Bu ölçekte 100ms latency artışı bile müşteri deneyimini etkiliyor.
Model Versiyonlama ve Deployment Stratejileri Nasıl Oluşturulur?
Git-Style Model Versioning
Kod gibi modelleri de versiyonlamalısınız. Her model versiyonu şunları içermeli:
Model Metadata:
- Eğitim tarihi ve süresi
- Kullanılan veri seti versiyonu
- Hiperparametreler
- Performans metrikleri
- Sorumlu geliştirici
Branching Stratejisi:
- Main: Prodüksiyondaki stabil model
- Development: Yeni özellik geliştirmeleri
- Hotfix: Acil performans düzeltmeleri
Deployment Patterns
1. Blue-Green Deployment
İki identik ortam: Blue (mevcut) ve Green (yeni). Trafik bir anda Green'e yönlendiriliyor.
Avantaj: Hızlı rollback Dezavantaj: 2x kaynak maliyeti
Garanti Bankası bu yöntemi kredi skorlama modelinde kullanıyor.
2. Canary Deployment
Trafiğin %5'ini yeni modele yönlendirip sonuçları izliyorsunuz. Başarılıysa kademeli olarak %100'e çıkarıyorsunuz.
Avantaj: Düşük risk Dezavantaj: Yavaş deployment
3. A/B Testing
İki model paralel çalışır, kullanıcılar rastgele gruplara ayrılır.
BiTaksi'nin ETA (Estimated Time of Arrival) sistemi bu şekilde çalışıyor. Sürekli iki farklı algoritma test ediyorlar.
Otomatik Deployment Pipeline
Kod Push → Test Otomasyonu → Model Validation → Staging Deploy → Production Deploy
Validation Checkpoints:
- Unit testler (%95+ coverage)
- Integration testler
- Performance benchmark'ları
- Business logic validation
Monitoring ve Alerting Sistemleri Nasıl Kurulur?
Katmanlı İzleme Stratejisi
1. Teknik Metrikler
- CPU/Memory kullanımı
- Response time
- Throughput (saniyede işlem sayısı)
- Error rate
2. Model Performans Metrikleri
- Accuracy, Precision, Recall
- F1-Score
- AUC-ROC
- Custom business metrikleri
3. İş Etkisi Metrikleri
- Conversion rate değişimi
- Revenue impact
- Müşteri memnuniyet skorları
Real-Time Alerting
Akbank'ın fraud detection sistemi şu alertleri kullanıyor:
Kritik Uyarılar (5dk içinde müdahale):
- Model accuracy %85'in altına düştü
- API response time 500ms'yi geçti
- False positive oranı %20'yi aştı
Orta Seviye Uyarılar (1 saat içinde):
- Günlük işlem hacmi %30 değişti
- Yeni veri pattern'leri tespit edildi
Düşük Seviye Uyarılar (24 saat içinde):
- Haftalık performans trend'i negatif
- Kaynak kullanımı artış trendinde
Dashboard ve Raporlama
Executive Dashboard (C-Level için):
- AI ROI metrikleri
- İş etkisi özetleri
- Risk göstergeleri
Technical Dashboard (DevOps için):
- System health metrikleri
- Model performance trends
- Deployment history
Business Dashboard (Product için):
- User experience metrikleri
- Feature adoption rates
- A/B test sonuçları
Continuous Training ve Model Güncelleme Süreçleri
Otomatik Yeniden Eğitim Tetikleyicileri
Zaman Bazlı:
- Haftalık: Hızla değişen sektorler (fintech, e-ticaret)
- Aylık: Orta hızda değişen sektorler (perakende, lojistik)
- Çeyreklik: Yavaş değişen sektorler (sigorta, bankacılık)
Performans Bazlı:
- Accuracy %5 düştü → Otomatik retrain
- Data drift tespit edildi → Model review
- Business metric'ler etkilendi → Acil müdahale
Trendyol'un ürün öneri sistemi, her gün yeniden eğitiliyor. Çünkü moda trendleri ve kullanıcı tercihleri çok hızlı değişiyor.
Incremental Learning
Tüm veriyi baştan eğitmek yerine, yeni veriyi mevcut modele ekleyerek öğretme.
Avantajları:
- Daha az kaynak kullanımı
- Hızlı güncelleme
- Geçmiş bilgiyi koruma
Dezavantajları:
- Model drift riski
- Karmaşık implementation
- Debugging zorluğu
Model Ensemble Stratejileri
Tek model yerine birden çok model kombinasyonu kullanmak.
Voting Ensemble: 3 model, majority vote ile karar veriyor.
Weighted Ensemble: Performansa göre ağırlıklı ortalama.
Stacking: Meta-model, diğer modellerin çıktılarını input olarak kullanıyor.
İş Bankası'nın kredi skorlama sistemi, 5 farklı algoritmanın ensemble'ını kullanıyor. Tek model %87 accuracy verirken, ensemble %93 veriyor.
Türk Şirketlerinden MLOps Success Stories
Vakıfbank: Real-Time Fraud Detection
Zorluk: Günde 8 milyon işlem, 50ms içinde fraud tespiti Çözüm: Streaming MLOps pipeline Sonuç: %40 fraud reduction, %99.9 uptime
Teknik Stack:
- Apache Kafka (data streaming)
- MLflow (model tracking)
- Kubernetes (container orchestration)
- Prometheus + Grafana (monitoring)
Anadolu Efes: Demand Forecasting
Zorluk: 3000+ SKU için haftalık talep tahmini Çözüm: Automated retraining pipeline Sonuç: %15 inventory cost reduction
MLOps Pipeline:
- Haftalık satış verisi toplanıyor
- Otomatik data quality check'ler
- Model performance validation
- Conditional retraining
- A/B test ile deployment
Pegasus: Dynamic Pricing
Zorluk: 200+ rota için gerçek zamanlı fiyatlandırma Çözüm: Multi-model ensemble system Sonuç: %8 revenue increase, %12 load factor improvement
MLOps Toolchain: Hangi Araçları Seçmelisiniz?
Open Source vs Enterprise
Open Source Avantajları:
- Maliyet etkin
- Topluluk desteği
- Esneklik
- Vendor lock-in yok
Enterprise Avantajları:
- Professional support
- Security compliance
- Integration kolaylığı
- SLA garantileri
Önerilen Tool Stack
Küçük-Orta Ölçekli Şirketler:
- Model Training: Scikit-learn, XGBoost
- Experiment Tracking: MLflow
- Versioning: DVC (Data Version Control)
- Deployment: FastAPI + Docker
- Monitoring: Prometheus + Grafana
- Orchestration: Apache Airflow
Büyük Ölçekli Şirketler:
- Platform: Kubeflow, MLOps platforms
- Model Training: TensorFlow Extended (TFX)
- Feature Store: Feast, Tecton
- Deployment: Kubernetes + Istio
- Monitoring: DataDog, New Relic
- Governance: MLflow, Neptune
Türk Pazarına Özel Considerations
Veri Gizliliği:
- KVKK compliance
- Veri yurtdışı çıkışı kısıtlamaları
- Audit trail gereksinimleri
Yerel Cloud Providers:
- Türk Telekom Bulut
- HAVELSAN AHTAPOT
- Netaş Cloud
Sektörel Düzenlemeler:
- BDDK (bankacılık)
- EPDK (enerji)
- BTK (telekomünikasyon)
Cost Optimization: MLOps Bütçenizi Nasıl Optimize Edersiniz?
Compute Cost Management
Auto-scaling Strategies:
- Horizontal pod autoscaling (HPA)
- Vertical pod autoscaling (VPA)
- Predictive scaling
Garanti BBVA, gece saatlerinde model training cluster'ını %70 küçültüyor. Yıllık $200K tasarruf sağlıyorlar.
Model Optimization Techniques
1. Model Compression
- Pruning: Gereksiz nöronları çıkarma
- Quantization: 32-bit → 8-bit conversion
- Knowledge distillation: Büyük model → küçük model
2. Efficient Architectures
- MobileNet (mobile deployment)
- EfficientNet (balanced accuracy/efficiency)
- DistilBERT (NLP tasks)
3. Edge Deployment
- Client-side inference
- Reduced latency
- Privacy benefits
Resource Sharing
Multi-tenancy: Tek cluster'da birden çok team çalışıyor.
Spot Instances: Training workload'ları için %70 maliyet tasarrufu.
Scheduled Training: Off-peak saatlerde training, peak saatlerde inference.
Security ve Compliance: MLOps Güvenliği
Model Security Threats
1. Adversarial Attacks Input'lara küçük değişiklikler yaparak modeli kandırma.
Savunma:
- Adversarial training
- Input validation
- Anomaly detection
2. Model Inversion Model output'larından training verisi çıkarma.
Savunma:
- Differential privacy
- Output perturbation
- Access control
3. Data Poisoning Training verisine kötü niyetli örnekler ekleme.
Savunma:
- Data validation pipelines
- Outlier detection
- Source verification
KVKK Compliance
Veri Minimizasyonu: Sadece gerekli veriyi kullanın.
Açık Rıza: AI kullanımı için explicit consent.
Silme Hakkı: Model'den kişisel veriyi silme yeteneği.
Veri Taşınabilirliği: Model predictions'ları export edebilme.
Türk şirketlerinin %60'ı KVKV compliance'ı MLOps'un en büyük zorluğu olarak görüyor.
Team Structure ve Roller: MLOps Organizasyonu
Ideal Team Composition
MLOps Engineer (2-3 kişi):
- Pipeline automation
- Infrastructure management
- Monitoring setup
Data Scientist (3-4 kişi):
- Model development
- Feature engineering
- Performance analysis
DevOps Engineer (1-2 kişi):
- Kubernetes management
- CI/CD pipelines
- Security implementation
Product Manager (1 kişi):
- Business requirements
- Stakeholder communication
- ROI tracking
Skill Development Roadmap
Junior → Senior MLOps Engineer:
0-2 Yıl:
- Docker, Kubernetes basics
- Python, SQL
- Git, CI/CD fundamentals
- Cloud platforms (AWS/Azure/GCP)
2-5 Yıl:
- Advanced orchestration (Airflow, Kubeflow)
- Monitoring tools (Prometheus, Grafana)
- Infrastructure as Code (Terraform)
- ML frameworks (TensorFlow, PyTorch)
5+ Yıl:
- Architecture design
- Team leadership
- Business strategy
- Vendor management
Türk İş Piyasası Insights
Maaş Aralıkları (2024):
- Junior MLOps Engineer: 25-35K TL
- Senior MLOps Engineer: 45-65K TL
- MLOps Team Lead: 65-85K TL
En Çok Aranan Skillset:
- Kubernetes (%78)
- Python (%65)
- Docker (%62)
- AWS/Azure (%58)
- MLflow (%45)
Future of MLOps: Gelecekte Neler Değişecek?
Emerging Trends
1. AutoML Integration Model development sürecinin otomasyonu.
2. Edge MLOps IoT cihazlarında model deployment ve management.
3. Federated Learning Veriyi merkezi toplamadan distributed learning.
4. MLOps as Code Infrastructure ve ML pipeline'ların code olarak yönetimi.
Türkiye'de MLOps Adoption
2024 Tahminleri:
- Fortune 500 Türk şirketlerinin %80'i MLOps kullanacak
- Ortalama MLOps team size 5-7 kişi olacak
- Cloud-first approach %90+ adoption
Sektörel Liderler:
- Fintech (%85 adoption)
- E-commerce (%75 adoption)
- Telecom (%70 adoption)
- Manufacturing (%45 adoption)
Investment Priorities
Öncelikli Yatırım Alanları:
- Monitoring ve alerting (%32)
- Automated deployment (%28)
- Data pipeline automation (%25)
- Model governance (%15)
Sonuç: MLOps Yolculuğunuza Nasıl Başlayın?
MLOps bir destination değil, journey. Mükemmel sistem kurmaya çalışmak yerine, iterative olarak gelişin.
İlk 30 Gün Action Plan
Hafta 1-2: Assessment
- Mevcut AI projelerinizi listeleyin
- Prodüksiyon sorunlarınızı dokumenteylyin
- Team skill gap analysis yapın
Hafta 3-4: Quick Wins
- Basit monitoring dashboard'u kurun
- Model versioning sistemi başlatın
- Otomatik backup süreçleri oluşturun
3-6 Ay Roadmap
Ay 1-2:
- CI/CD pipeline kurulumu
- Basic automated testing
- Performance monitoring
Ay 3-4:
- Advanced monitoring
- Automated retraining
- A/B testing framework
Ay 5-6:
- Multi-environment setup
- Advanced security measures
- Cost optimization
Success Metrics
Teknik KPI'lar:
- Deployment frequency (haftalık → günlük)
- Lead time (saatler → dakikalar)
- Mean time to recovery (MTTR)
- Model accuracy stability
İş KPI'ları:
- AI project ROI
- Time to market
- Operational efficiency
- Customer satisfaction
Unutmayın: MLOps sadece teknoloji değil, kültür değişimi. Organizasyonunuzun her seviyesinde AI-first düşünce yapısını yerleştirin.
Başarılı MLOps implementation'ı için en kritik faktör: Doğru team, doğru tools ve doğru process'lerin alignment'ı. Bu üçünü birlikte yönetebilirseniz, AI modelleriniz prodüksiyonda stabil çalışacak ve işletmenize gerçek değer katacak.
Daha fazla MLOps use case'i ve implementation detayları için /tr/use-cases sayfamızı ziyaret edebilir, diğer teknik yazılarımızı /tr/blog sayfasından okuyabilirsiniz.
AI stratejinizi birlikte oluşturmak ister misiniz? Ücretsiz görüşme ayarlayın.
