<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Availability Engineering on SRE Engineering Practice</title><link>https://www.sre.wang/en/tags/availability-engineering/</link><description>Recent content in Availability Engineering on SRE Engineering Practice</description><image><title>SRE Engineering Practice</title><url>https://www.sre.wang/share-card-square.jpg</url><link>https://www.sre.wang/share-card-square.jpg</link></image><generator>Hugo -- gohugo.io</generator><language>en</language><lastBuildDate>Thu, 03 Sep 2026 10:35:10 +0800</lastBuildDate><atom:link href="https://www.sre.wang/en/tags/availability-engineering/index.xml" rel="self" type="application/rss+xml"/><item><title>Pods Stuck for 6 Minutes After Network Partition Injection: Blast Radius Control and 5 Production-Grade Decisions in Fault Injection Testing</title><link>https://www.sre.wang/en/posts/sre-fault-injection-testing/</link><pubDate>Thu, 03 Sep 2026 10:35:10 +0800</pubDate><guid>https://www.sre.wang/en/posts/sre-fault-injection-testing/</guid><description>From Chaos Mesh vs LitmusChaos tool selection to blast radius control: a detailed guide to production-grade fault injection testing covering network partitions, resource exhaustion, and Pod eviction scenarios, including a real-world pitfall where K8s default eviction policies caused a 6-minute gap, plus automated drill pipeline design</description></item></channel></rss>