Güvenlik, Performans ve DevOps / Uygulama rehberi

PostgreSQL Replication Slot: WAL Birikmesi ve Disk Taşmasını Önleme

Logical veya physical replication slot tüketici geride kaldığında WAL dosyalarının sınırsız büyümesini önlemek için lag, disk ve failover kontrolleri kurun.

Ganz Dijital · 11 Eylül 2026 · Yaklaşık 5 dk okuma

Problemi doğru sınırlandırın

Logical veya physical replication slot tüketici geride kaldığında WAL dosyalarının sınırsız büyümesini önlemek için lag, disk ve failover kontrolleri kurun.

Bu rehberin odak noktası replication güvenilirliği ile primary disk kapasitesini aynı operasyon planında yönetmek. Örnek senaryo gerçek bir müşteri vakası değil, karar mantığını görünür kılmak için hazırlanmış varsayımsal bir çalışma örneğidir: CDC consumer saatlerce kapalı kalıyor ve replication slot eski WAL'ı tuttuğu için primary disk hızla doluyor.

Üretim güvenilirliği tek bir araç veya dashboard satın alarak oluşmaz. Deploy, health, yedek, bağımlılık ve performans sinyallerinin hangi kullanıcı etkisini temsil ettiği açık olmadığında ekip çok veri toplar fakat geç karar verir.

Karar çerçevesi

Bu durumda temel karar şudur: Slot lag byte ve zamanını disk headroom ile birlikte alarmleyin; terk edilmiş slot temizliği ve consumer recovery için sahipli runbook tanımlayın. Bu kararın değeri, ekip tarafından aynı şekilde yorumlanabilmesi ve testle kanıtlanabilmesidir. Belirsiz ifadeler yerine gözlenebilir davranış, sorumlu sistem ve hata halinde beklenen sonuç yazılmalıdır. Uygulama ayrıntısı: Dashboard'da yalnız slot active bayrağı değil retained WAL miktarı, lag süresi ve mevcut disk tüketim hızını birlikte gösterin; alarmı mutlak değer kadar tükenme süresine bağlayın. Dashboard'da yalnız slot active bayrağı değil retained WAL miktarı, lag süresi ve mevcut disk tüketim hızını birlikte gösterin; alarmı mutlak değer kadar tükenme süresine bağlayın.

İyi operasyon tasarımı; ölçülebilir eşikler, prova edilmiş geri dönüşler ve sahipliği belirlenmiş aksiyonlardan oluşur. Kontrolün gerçekten çalıştığı düzenli olarak test edilmelidir.

Dört uygulama ve kabul kontrolü

Birinci kontrol “Slot restart LSN değerini izleyin” olmalıdır. Bunun için önce mevcut durumdan örnek kayıt veya trafik seçin, beklenen sonucu önceden yazın ve değişiklikten sonra aynı örnekleri yeniden çalıştırın. Kontrolün sahibi ile kanıtın saklanacağı yer belli değilse, test tamamlandı denmemelidir.

İkinci kontrol “Consumer kapalıyken WAL büyümesini ölçün” maddesidir. Bu kontrol yalnızca başarılı senaryoda değil; boş veri, gecikme, tekrar, yetkisiz kullanıcı veya bağlantı sorunu gibi sınır koşullarında da denenmelidir. Böylece sistemin yalnızca demo sırasında değil gerçek operasyon baskısı altında nasıl davrandığı anlaşılır.

Üçüncü kontrol “Disk eşik alarmını test edin” olarak tanımlanmıştır. Uygulama ekibi teknik logları izlerken operasyon ekibi aynı olayın kullanıcı veya iş sonucu üzerindeki etkisini görebilmelidir. İki görünüm arasında ilişki kurulması, sorunun kaynağını daha hızlı ayırmaya yardımcı olur.

Yayın öncesinde replication güvenilirliği ile primary disk kapasitesini aynı operasyon planında yönetmek bağlamında terk edilmiş slot silme prosedürünü prova edin için hazırlığı somutlaştırmalısınız. Bu kontrol hangi test verisiyle yapılacak, beklenen davranış nasıl ölçülecek, arızalı sonucun kullanıcıya görüntüsü ne olacak, ve bulunursa veri nasıl düzeltilecek—tüm bunlar yazılı olmalıdır. Sorumlu kişi, kanıt deposu ve geri alma adımları belirlenmek üzere bir form doldurmalısınız.

Örnek kabul kontrolü
#KontrolKanıtZaman
1Slot restart LSN değerini izleyinÖrnek veri + beklenen sonuç + sorumluYayın öncesi
2Consumer kapalıyken WAL büyümesini ölçünÖrnek veri + beklenen sonuç + sorumluYayın öncesi
3Disk eşik alarmını test edinÖrnek veri + beklenen sonuç + sorumluYayın öncesi
4Terk edilmiş slot silme prosedürünü prova edinÖrnek veri + beklenen sonuç + sorumluYayın öncesi

Riskleri yayın öncesinde görünür kılın

Yayından sonra ilk 24 saat kritiktir. Normal durumda beklediğiniz sinyalleri (işlem sayısı, hata oranı, yanıt süresi) önceden yazın; hangi değerler alarm üreteceği ve kim baktığını belirleyin. consumer'ın geri dönemeyeceği kadar wal kaybı gerçekleşirse geri alma kararını kimin vereceği ve kaç dakika içinde uygulanacağı belli olmalıdır. Ardından terk edilmiş slot silme prosedürünü prova edin yeniden çalıştırarak değişikliğin hala güvenli olduğunu kanıtlayın. Kanıt planı: Kontrollü testte consumer'ı kısa süre durdurup WAL artış eğrisini gözleyin, yeniden başlatınca lag'in kapandığını ve disk kullanımının normale döndüğünü kanıtlayın.

Örnek risk ve tepki planı
#RiskKontrol yaklaşımı
1Primary disk dolmasıErken sinyal, etki kapsamı ve geri alma adımı
2Gerekli slotun yanlış silinmesiErken sinyal, etki kapsamı ve geri alma adımı
3Consumer'ın geri dönemeyeceği kadar WAL kaybıErken sinyal, etki kapsamı ve geri alma adımı

Kabul kriterini operasyonla bağlayın

Dördüncü kontrol “Terk edilmiş slot silme prosedürünü prova edin” maddesidir. Bu son adım çoğu projede atlanır; oysa yayın öncesi kabul listesinin bir parçası olduğunda değişikliğin ne zaman gerçekten tamamlandığı netleşir. Kontrol sonuçları tarih, sürüm ve sorumlu ile kaydedilmelidir. Kontrollü testte consumer'ı kısa süre durdurup WAL artış eğrisini gözleyin, yeniden başlatınca lag'in kapandığını ve disk kullanımının normale döndüğünü kanıtlayın.

Birincil kaynaklarla teknik çerçeveyi doğrulayın

Risk analizi üç görünür başlıkta tutulabilir. Birincisi “Primary disk dolması”. Bu risk için erken uyarı sinyali, etkilenebilecek kayıt veya kullanıcı kapsamı ve geri alma adımı yazılmalıdır. İkincisi “Gerekli slotun yanlış silinmesi”; bunu yalnızca log hatası olarak değil veri veya müşteri etkisi olarak da ölçün. Üçüncüsü “Consumer'ın geri dönemeyeceği kadar WAL kaybı”; bu risk gerçekleşmese bile test senaryosunda kasıtlı olarak tetiklenerek kontrolün işe yaradığı kanıtlanabilir.

Yayın, gözlem ve geri dönüş planı

Kabul tablosu proje yönetim aracı yerine geçmez; ekiplerin aynı 'bitti' tanımını kullanmasını sağlar. Her kontrol için örnek veri, beklenen sonuç, gözlem noktası ve sorumlu belirlemek; sonradan yaşanan tartışmayı yayın öncesi karara dönüştürür. Eğer bir kontrol otomatikleştirilebiliyorsa regresyon testine eklenmesi, manuel kalıyorsa tekrar çalıştırılabilecek kısa bir runbook'a bağlanması yararlıdır. Kapsam sınırı: Slot cleanup otomatikleştirilecekse inactivity tek başına yeterli sinyal değildir; planlı bakım ve düşük trafikli consumer'lar için sahiplik metadata'sı ve açık expiry politikası kullanın.

Teknik çerçeveyi kontrol ederken bu rehberde PostgreSQL Docs — WAL Configuration, Google SRE Book birincil dokümantasyonları referans alınmıştır. Bu kaynaklar kullanılan kavramların ve platform davranışlarının resmi açıklamalarını sağlar; ancak sizin veri modeliniz, sözleşmeleriniz, trafik profiliniz ve güvenlik gereksiniminiz için nihai tasarım kararı değildir. Uygulama öncesinde kullanılan ürün/sürüm dokümantasyonu yeniden kontrol edilmelidir.

Yayın planında üç kapı kullanın: önce yapısal doğrulama, sonra sınırlı gerçek kullanım, son olarak genişletme. İlk kapıda şema, yetki, hata ve veri bütünlüğü test edilir. İkinci kapıda gerçek trafik veya temsil edici kullanıcı grubu üzerinden performans ve davranış izlenir. Üçüncü kapıya yalnızca belirlenen hata bütçesi ve iş metriği sınırları içinde kalındığında geçilir. Bu sıra, değişikliği yavaşlatmak için değil geri bildirim maliyetini düşürmek için vardır. Slot cleanup otomatikleştirilecekse inactivity tek başına yeterli sinyal değildir; planlı bakım ve düşük trafikli consumer'lar için sahiplik metadata'sı ve açık expiry politikası kullanın.

Sık sorulan sorular

PostgreSQL Replication Slot için ilk adım nedir?

Önce problemi teknik çözüm adıyla değil iş etkisiyle sınırlayın. Bu rehberdeki senaryoda başlangıç noktası replication güvenilirliği ile primary disk kapasitesini aynı operasyon planında yönetmek. Ardından mevcut davranışı ölçün ve ilk kabul kriterini slot restart LSN değerini izleyin şeklinde somutlaştırın.

Bu çalışma tek seferde canlıya alınmalı mı?

Genellikle hayır. En güvenli yaklaşım, değişikliği küçük bir kapsamda doğrulayıp gözlem sinyallerini izlemektir. Özellikle “Primary disk dolması” riski gerçekleştiğinde geri dönüş veya telafi adımının önceden tanımlı olması gerekir.

Güvenlik, Performans ve DevOps projesinde başarı nasıl kabul edilir?

Başarı yalnızca ekranın veya endpoint'in çalışması değildir. Consumer kapalıyken WAL büyümesini ölçün ve disk eşik alarmını test edin birlikte doğrulanmalı; hata, tekrar ve yetki gibi sınır durumları için de ölçülebilir kanıt üretilmelidir.

Bu akışı kendi sisteminize uyarlayalım.

Mevcut süreci, kullandığınız sistemleri ve çözmek istediğiniz darboğazı paylaşın. Kapsamı, entegrasyon sınırlarını ve kabul kriterlerini birlikte netleştirelim.

İlgili Ganz hizmetini inceleProjenizi konuşalım →

Bu içerikteki senaryo ve kabul örnekleri açıklama amacıyla hazırlanmış varsayımsal örneklerdir; müşteri sonucu, fiyat, sertifikasyon veya performans garantisi değildir. Platform davranışları uygulama tarihinde güncel birincil dokümantasyondan yeniden doğrulanmalıdır.