Güvenlik, Performans ve DevOps / Uygulama rehberi

Kubernetes Graceful Shutdown: SIGTERM, preStop ve Connection Draining Sırası

Pod sonlandırılırken yeni trafik almayı kesip mevcut istekleri tamamlamak için readiness, SIGTERM ve termination grace süresini birlikte tasarlayın.

Ganz Dijital · 11 Eylül 2026 · Yaklaşık 5 dk okuma

Problemi doğru sınırlandırın

Pod sonlandırılırken yeni trafik almayı kesip mevcut istekleri tamamlamak için readiness, SIGTERM ve termination grace süresini birlikte tasarlayın.

Bu rehberin odak noktası deploy veya scale-down sırasında yarım kalan HTTP ve job işlemlerini azaltmak. Örnek senaryo gerçek bir müşteri vakası değil, karar mantığını görünür kılmak için hazırlanmış varsayımsal bir çalışma örneğidir: API pod'u termination başladığı anda process kapanıyor fakat load balancer birkaç saniye daha yeni istek gönderdiği için kullanıcılar connection reset görüyor.

Üretim güvenilirliği tek bir araç veya dashboard satın alarak oluşmaz. Deploy, health, yedek, bağımlılık ve performans sinyallerinin hangi kullanıcı etkisini temsil ettiği açık olmadığında ekip çok veri toplar fakat geç karar verir.

Karar çerçevesi

Bu durumda temel karar şudur: Shutdown sinyalinde readiness'i kapatın, yeni işi kabul etmeyin, aktif request'leri bekleyin ve grace süresi bitmeden temiz çıkış yapın. Bu kararın değeri, ekip tarafından aynı şekilde yorumlanabilmesi ve testle kanıtlanabilmesidir. Belirsiz ifadeler yerine gözlenebilir davranış, sorumlu sistem ve hata halinde beklenen sonuç yazılmalıdır. Uygulama ayrıntısı: preStop hook kullanılıyorsa sabit sleep'i tek çözüm saymayın; uygulama seviyesinde drain state'i ve active request sayacı daha gözlenebilir bir kapanış sağlar. preStop hook kullanılıyorsa sabit sleep'i tek çözüm saymayın; uygulama seviyesinde drain state'i ve active request sayacı daha gözlenebilir bir kapanış sağlar.

İyi operasyon tasarımı; ölçülebilir eşikler, prova edilmiş geri dönüşler ve sahipliği belirlenmiş aksiyonlardan oluşur. Kontrolün gerçekten çalıştığı düzenli olarak test edilmelidir.

Dört uygulama ve kabul kontrolü

Birinci kontrol “SIGTERM handler'ı test edin” olmalıdır. Bunun için önce mevcut durumdan örnek kayıt veya trafik seçin, beklenen sonucu önceden yazın ve değişiklikten sonra aynı örnekleri yeniden çalıştırın. Kontrolün sahibi ile kanıtın saklanacağı yer belli değilse, test tamamlandı denmemelidir.

İkinci kontrol “Readiness false sonrası yeni trafik gelmediğini ölçün” maddesidir. Bu kontrol yalnızca başarılı senaryoda değil; boş veri, gecikme, tekrar, yetkisiz kullanıcı veya bağlantı sorunu gibi sınır koşullarında da denenmelidir. Böylece sistemin yalnızca demo sırasında değil gerçek operasyon baskısı altında nasıl davrandığı anlaşılır.

Üçüncü kontrol “Uzun request'i grace içinde tamamlayın” olarak tanımlanmıştır. Uygulama ekibi teknik logları izlerken operasyon ekibi aynı olayın kullanıcı veya iş sonucu üzerindeki etkisini görebilmelidir. İki görünüm arasında ilişki kurulması, sorunun kaynağını daha hızlı ayırmaya yardımcı olur.

Yayın öncesinde deploy veya scale-down sırasında yarım kalan HTTP ve job işlemlerini azaltmak bağlamında grace aşımında zorla kapanma davranışını gözleyin için hazırlığı somutlaştırmalısınız. Bu kontrol hangi test verisiyle yapılacak, beklenen davranış nasıl ölçülecek, arızalı sonucun kullanıcıya görüntüsü ne olacak, ve bulunursa veri nasıl düzeltilecek—tüm bunlar yazılı olmalıdır. Sorumlu kişi, kanıt deposu ve geri alma adımları belirlenmek üzere bir form doldurmalısınız.

Örnek kabul kontrolü
#KontrolKanıtZaman
1SIGTERM handler'ı test edinÖrnek veri + beklenen sonuç + sorumluYayın öncesi
2Readiness false sonrası yeni trafik gelmediğini ölçünÖrnek veri + beklenen sonuç + sorumluYayın öncesi
3Uzun request'i grace içinde tamamlayınÖrnek veri + beklenen sonuç + sorumluYayın öncesi
4Grace aşımında zorla kapanma davranışını gözleyinÖrnek veri + beklenen sonuç + sorumluYayın öncesi

Riskleri yayın öncesinde görünür kılın

Yayından sonra ilk 24 saat kritiktir. Normal durumda beklediğiniz sinyalleri (işlem sayısı, hata oranı, yanıt süresi) önceden yazın; hangi değerler alarm üreteceği ve kim baktığını belirleyin. worker'ın queue mesajını yarıda bırakması gerçekleşirse geri alma kararını kimin vereceği ve kaç dakika içinde uygulanacağı belli olmalıdır. Ardından grace aşımında zorla kapanma davranışını gözleyin yeniden çalıştırarak değişikliğin hala güvenli olduğunu kanıtlayın. Kanıt planı: Rolling deploy sırasında reset, 5xx ve in-flight request metriğini izleyin; test endpoint'iyle uzun istek başlatıp pod'u aynı anda sonlandırarak gerçek davranışı prova edin.

Örnek risk ve tepki planı
#RiskKontrol yaklaşımı
1Yeni trafik ile kapanan pod yarışmasıErken sinyal, etki kapsamı ve geri alma adımı
2Grace süresinin uzun işlemlerden kısa olmasıErken sinyal, etki kapsamı ve geri alma adımı
3Worker'ın queue mesajını yarıda bırakmasıErken sinyal, etki kapsamı ve geri alma adımı

Kabul kriterini operasyonla bağlayın

Dördüncü kontrol “Grace aşımında zorla kapanma davranışını gözleyin” maddesidir. Bu son adım çoğu projede atlanır; oysa yayın öncesi kabul listesinin bir parçası olduğunda değişikliğin ne zaman gerçekten tamamlandığı netleşir. Kontrol sonuçları tarih, sürüm ve sorumlu ile kaydedilmelidir. Rolling deploy sırasında reset, 5xx ve in-flight request metriğini izleyin; test endpoint'iyle uzun istek başlatıp pod'u aynı anda sonlandırarak gerçek davranışı prova edin.

Birincil kaynaklarla teknik çerçeveyi doğrulayın

Risk analizi üç görünür başlıkta tutulabilir. Birincisi “Yeni trafik ile kapanan pod yarışması”. Bu risk için erken uyarı sinyali, etkilenebilecek kayıt veya kullanıcı kapsamı ve geri alma adımı yazılmalıdır. İkincisi “Grace süresinin uzun işlemlerden kısa olması”; bunu yalnızca log hatası olarak değil veri veya müşteri etkisi olarak da ölçün. Üçüncüsü “Worker'ın queue mesajını yarıda bırakması”; bu risk gerçekleşmese bile test senaryosunda kasıtlı olarak tetiklenerek kontrolün işe yaradığı kanıtlanabilir.

Yayın, gözlem ve geri dönüş planı

Kabul tablosu proje yönetim aracı yerine geçmez; ekiplerin aynı 'bitti' tanımını kullanmasını sağlar. Her kontrol için örnek veri, beklenen sonuç, gözlem noktası ve sorumlu belirlemek; sonradan yaşanan tartışmayı yayın öncesi karara dönüştürür. Eğer bir kontrol otomatikleştirilebiliyorsa regresyon testine eklenmesi, manuel kalıyorsa tekrar çalıştırılabilecek kısa bir runbook'a bağlanması yararlıdır. Kapsam sınırı: Graceful shutdown sonsuz bekleme değildir; bounded timeout sonunda işlemin güvenli retry edilebilmesi için queue ack ve idempotency politikası ayrıca tasarlanmalıdır.

Teknik çerçeveyi kontrol ederken bu rehberde Kubernetes Docs — Pod Lifecycle, Google SRE Book birincil dokümantasyonları referans alınmıştır. Bu kaynaklar kullanılan kavramların ve platform davranışlarının resmi açıklamalarını sağlar; ancak sizin veri modeliniz, sözleşmeleriniz, trafik profiliniz ve güvenlik gereksiniminiz için nihai tasarım kararı değildir. Uygulama öncesinde kullanılan ürün/sürüm dokümantasyonu yeniden kontrol edilmelidir.

Yayın planında üç kapı kullanın: önce yapısal doğrulama, sonra sınırlı gerçek kullanım, son olarak genişletme. İlk kapıda şema, yetki, hata ve veri bütünlüğü test edilir. İkinci kapıda gerçek trafik veya temsil edici kullanıcı grubu üzerinden performans ve davranış izlenir. Üçüncü kapıya yalnızca belirlenen hata bütçesi ve iş metriği sınırları içinde kalındığında geçilir. Bu sıra, değişikliği yavaşlatmak için değil geri bildirim maliyetini düşürmek için vardır. Graceful shutdown sonsuz bekleme değildir; bounded timeout sonunda işlemin güvenli retry edilebilmesi için queue ack ve idempotency politikası ayrıca tasarlanmalıdır.

Sık sorulan sorular

Kubernetes Graceful Shutdown için ilk adım nedir?

Önce problemi teknik çözüm adıyla değil iş etkisiyle sınırlayın. Bu rehberdeki senaryoda başlangıç noktası deploy veya scale-down sırasında yarım kalan HTTP ve job işlemlerini azaltmak. Ardından mevcut davranışı ölçün ve ilk kabul kriterini sIGTERM handler'ı test edin şeklinde somutlaştırın.

Bu çalışma tek seferde canlıya alınmalı mı?

Genellikle hayır. En güvenli yaklaşım, değişikliği küçük bir kapsamda doğrulayıp gözlem sinyallerini izlemektir. Özellikle “Yeni trafik ile kapanan pod yarışması” riski gerçekleştiğinde geri dönüş veya telafi adımının önceden tanımlı olması gerekir.

Güvenlik, Performans ve DevOps projesinde başarı nasıl kabul edilir?

Başarı yalnızca ekranın veya endpoint'in çalışması değildir. Readiness false sonrası yeni trafik gelmediğini ölçün ve uzun request'i grace içinde tamamlayın birlikte doğrulanmalı; hata, tekrar ve yetki gibi sınır durumları için de ölçülebilir kanıt üretilmelidir.

Bu akışı kendi sisteminize uyarlayalım.

Mevcut süreci, kullandığınız sistemleri ve çözmek istediğiniz darboğazı paylaşın. Kapsamı, entegrasyon sınırlarını ve kabul kriterlerini birlikte netleştirelim.

İlgili Ganz hizmetini inceleProjenizi konuşalım →

Bu içerikteki senaryo ve kabul örnekleri açıklama amacıyla hazırlanmış varsayımsal örneklerdir; müşteri sonucu, fiyat, sertifikasyon veya performans garantisi değildir. Platform davranışları uygulama tarihinde güncel birincil dokümantasyondan yeniden doğrulanmalıdır.