Problem
Single database = single point of failure. Read load exceeds write capacity. Need geo-distribution.
Also known as: replication, streaming-replication, logical-replication, multi-master
Copy data across database nodes for availability, read scaling, and disaster recovery, understanding sync vs async trade-offs.
Single database = single point of failure. Read load exceeds write capacity. Need geo-distribution.
Medium — replica nodes, network
High — failover drills, lag monitoring, schema coordination
Medium — sync vs async, topology choice
Replica lag spikes: stale reads, failover loses data
Split-brain: network partition → two primaries
Replication gap: WAL files removed before replica catches up
Schema change breaks replication: DDL not replicated
Failover script bug: promotes wrong node, data loss