Problemi doğru sınırlandırın
Planlı node drain ve cluster upgrade sırasında aynı servisin çok fazla pod'unun eşzamanlı kaldırılmasını önlemek için PDB'yi gerçek replica kapasitesiyle tasarlayın.
Bu rehberin odak noktası gönüllü disruption sırasında minimum hizmet kapasitesini korumak. Örnek senaryo gerçek bir müşteri vakası değil, karar mantığını görünür kılmak için hazırlanmış varsayımsal bir çalışma örneğidir: Üç replika API aynı node grubuna dağılmış ve upgrade sırasında iki pod aynı anda evict edilince kalan pod trafik yükünü taşıyamıyor.
Üretim güvenilirliği tek bir araç veya dashboard satın alarak oluşmaz. Deploy, health, yedek, bağımlılık ve performans sinyallerinin hangi kullanıcı etkisini temsil ettiği açık olmadığında ekip çok veri toplar fakat geç karar verir.
Karar çerçevesi
Bu durumda temel karar şudur: PDB minAvailable veya maxUnavailable değerini replica sayısı ve gerçek kapasiteye göre seçin; topology spread ve readiness ile birlikte test edin. Bu kararın değeri, ekip tarafından aynı şekilde yorumlanabilmesi ve testle kanıtlanabilmesidir. Belirsiz ifadeler yerine gözlenebilir davranış, sorumlu sistem ve hata halinde beklenen sonuç yazılmalıdır. Uygulama ayrıntısı: PDB yüksek erişilebilirlik garantisi değildir; yalnız voluntary disruption'ı sınırlar. Gerçek dayanıklılık için replica placement, readiness ve kapasite headroom ayrıca sağlanmalıdır. PDB yüksek erişilebilirlik garantisi değildir; yalnız voluntary disruption'ı sınırlar. Gerçek dayanıklılık için replica placement, readiness ve kapasite headroom ayrıca sağlanmalıdır.
İyi operasyon tasarımı; ölçülebilir eşikler, prova edilmiş geri dönüşler ve sahipliği belirlenmiş aksiyonlardan oluşur. Kontrolün gerçekten çalıştığı düzenli olarak test edilmelidir.
Dört uygulama ve kabul kontrolü
Birinci kontrol “Node drain provası yapın” olmalıdır. Bunun için önce mevcut durumdan örnek kayıt veya trafik seçin, beklenen sonucu önceden yazın ve değişiklikten sonra aynı örnekleri yeniden çalıştırın. Kontrolün sahibi ile kanıtın saklanacağı yer belli değilse, test tamamlandı denmemelidir.
İkinci kontrol “PDB'nin eviction'ı sınırladığını doğrulayın” maddesidir. Bu kontrol yalnızca başarılı senaryoda değil; boş veri, gecikme, tekrar, yetkisiz kullanıcı veya bağlantı sorunu gibi sınır koşullarında da denenmelidir. Böylece sistemin yalnızca demo sırasında değil gerçek operasyon baskısı altında nasıl davrandığı anlaşılır.
Üçüncü kontrol “Bir pod zaten unhealthy iken bakımı test edin” olarak tanımlanmıştır. Uygulama ekibi teknik logları izlerken operasyon ekibi aynı olayın kullanıcı veya iş sonucu üzerindeki etkisini görebilmelidir. İki görünüm arasında ilişki kurulması, sorunun kaynağını daha hızlı ayırmaya yardımcı olur.
Yayın öncesinde gönüllü disruption sırasında minimum hizmet kapasitesini korumak bağlamında autoscaler ile etkileşimi gözleyin için hazırlığı somutlaştırmalısınız. Bu kontrol hangi test verisiyle yapılacak, beklenen davranış nasıl ölçülecek, arızalı sonucun kullanıcıya görüntüsü ne olacak, ve bulunursa veri nasıl düzeltilecek—tüm bunlar yazılı olmalıdır. Sorumlu kişi, kanıt deposu ve geri alma adımları belirlenmek üzere bir form doldurmalısınız.
| # | Kontrol | Kanıt | Zaman |
|---|---|---|---|
| 1 | Node drain provası yapın | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
| 2 | PDB'nin eviction'ı sınırladığını doğrulayın | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
| 3 | Bir pod zaten unhealthy iken bakımı test edin | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
| 4 | Autoscaler ile etkileşimi gözleyin | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
Riskleri yayın öncesinde görünür kılın
Yayından sonra ilk 24 saat kritiktir. Normal durumda beklediğiniz sinyalleri (işlem sayısı, hata oranı, yanıt süresi) önceden yazın; hangi değerler alarm üreteceği ve kim baktığını belirleyin. tüm podların aynı failure domain'de olması gerçekleşirse geri alma kararını kimin vereceği ve kaç dakika içinde uygulanacağı belli olmalıdır. Ardından autoscaler ile etkileşimi gözleyin yeniden çalıştırarak değişikliğin hala güvenli olduğunu kanıtlayın. Kanıt planı: Staging cluster'da drain komutuyla gerçek eviction akışını çalıştırın; servis error rate, available pod sayısı ve bakım süresini ölçerek PDB'nin operasyonu kilitlemeden koruma sağladığını doğrulayın.
| # | Risk | Kontrol yaklaşımı |
|---|---|---|
| 1 | Aşırı sıkı PDB'nin bakım engellemesi | Erken sinyal, etki kapsamı ve geri alma adımı |
| 2 | Replica sayısı düşüp policy'nin anlamsız kalması | Erken sinyal, etki kapsamı ve geri alma adımı |
| 3 | Tüm podların aynı failure domain'de olması | Erken sinyal, etki kapsamı ve geri alma adımı |
Kabul kriterini operasyonla bağlayın
Dördüncü kontrol “Autoscaler ile etkileşimi gözleyin” maddesidir. Bu son adım çoğu projede atlanır; oysa yayın öncesi kabul listesinin bir parçası olduğunda değişikliğin ne zaman gerçekten tamamlandığı netleşir. Kontrol sonuçları tarih, sürüm ve sorumlu ile kaydedilmelidir. Staging cluster'da drain komutuyla gerçek eviction akışını çalıştırın; servis error rate, available pod sayısı ve bakım süresini ölçerek PDB'nin operasyonu kilitlemeden koruma sağladığını doğrulayın.
Birincil kaynaklarla teknik çerçeveyi doğrulayın
Risk analizi üç görünür başlıkta tutulabilir. Birincisi “Aşırı sıkı PDB'nin bakım engellemesi”. Bu risk için erken uyarı sinyali, etkilenebilecek kayıt veya kullanıcı kapsamı ve geri alma adımı yazılmalıdır. İkincisi “Replica sayısı düşüp policy'nin anlamsız kalması”; bunu yalnızca log hatası olarak değil veri veya müşteri etkisi olarak da ölçün. Üçüncüsü “Tüm podların aynı failure domain'de olması”; bu risk gerçekleşmese bile test senaryosunda kasıtlı olarak tetiklenerek kontrolün işe yaradığı kanıtlanabilir.
Yayın, gözlem ve geri dönüş planı
Kabul tablosu proje yönetim aracı yerine geçmez; ekiplerin aynı 'bitti' tanımını kullanmasını sağlar. Her kontrol için örnek veri, beklenen sonuç, gözlem noktası ve sorumlu belirlemek; sonradan yaşanan tartışmayı yayın öncesi karara dönüştürür. Eğer bir kontrol otomatikleştirilebiliyorsa regresyon testine eklenmesi, manuel kalıyorsa tekrar çalıştırılabilecek kısa bir runbook'a bağlanması yararlıdır. Kapsam sınırı: Tek replikalı serviste PDB bakımın sonsuza kadar beklemesine neden olabilir; böyle workload'larda önce replica ve state yönetimi çözülmeden policy eklemek sorunu saklar.
Teknik çerçeveyi kontrol ederken bu rehberde Kubernetes Docs — Pod Disruption Budgets, Kubernetes Docs — Pod Lifecycle birincil dokümantasyonları referans alınmıştır. Bu kaynaklar kullanılan kavramların ve platform davranışlarının resmi açıklamalarını sağlar; ancak sizin veri modeliniz, sözleşmeleriniz, trafik profiliniz ve güvenlik gereksiniminiz için nihai tasarım kararı değildir. Uygulama öncesinde kullanılan ürün/sürüm dokümantasyonu yeniden kontrol edilmelidir.
Yayın planında üç kapı kullanın: önce yapısal doğrulama, sonra sınırlı gerçek kullanım, son olarak genişletme. İlk kapıda şema, yetki, hata ve veri bütünlüğü test edilir. İkinci kapıda gerçek trafik veya temsil edici kullanıcı grubu üzerinden performans ve davranış izlenir. Üçüncü kapıya yalnızca belirlenen hata bütçesi ve iş metriği sınırları içinde kalındığında geçilir. Bu sıra, değişikliği yavaşlatmak için değil geri bildirim maliyetini düşürmek için vardır. Tek replikalı serviste PDB bakımın sonsuza kadar beklemesine neden olabilir; böyle workload'larda önce replica ve state yönetimi çözülmeden policy eklemek sorunu saklar.
Sık sorulan sorular
Kubernetes PodDisruptionBudget için ilk adım nedir?
Önce problemi teknik çözüm adıyla değil iş etkisiyle sınırlayın. Bu rehberdeki senaryoda başlangıç noktası gönüllü disruption sırasında minimum hizmet kapasitesini korumak. Ardından mevcut davranışı ölçün ve ilk kabul kriterini node drain provası yapın şeklinde somutlaştırın.
Bu çalışma tek seferde canlıya alınmalı mı?
Genellikle hayır. En güvenli yaklaşım, değişikliği küçük bir kapsamda doğrulayıp gözlem sinyallerini izlemektir. Özellikle “Aşırı sıkı PDB'nin bakım engellemesi” riski gerçekleştiğinde geri dönüş veya telafi adımının önceden tanımlı olması gerekir.
Güvenlik, Performans ve DevOps projesinde başarı nasıl kabul edilir?
Başarı yalnızca ekranın veya endpoint'in çalışması değildir. PDB'nin eviction'ı sınırladığını doğrulayın ve bir pod zaten unhealthy iken bakımı test edin birlikte doğrulanmalı; hata, tekrar ve yetki gibi sınır durumları için de ölçülebilir kanıt üretilmelidir.
Bu akışı kendi sisteminize uyarlayalım.
Mevcut süreci, kullandığınız sistemleri ve çözmek istediğiniz darboğazı paylaşın. Kapsamı, entegrasyon sınırlarını ve kabul kriterlerini birlikte netleştirelim.
İlgili Ganz hizmetini inceleProjenizi konuşalım →Bu içerikteki senaryo ve kabul örnekleri açıklama amacıyla hazırlanmış varsayımsal örneklerdir; müşteri sonucu, fiyat, sertifikasyon veya performans garantisi değildir. Platform davranışları uygulama tarihinde güncel birincil dokümantasyondan yeniden doğrulanmalıdır.