Problem
A request touches 10 services. Logs are fragmented. Finding the slow service or error root cause takes hours.
Also known as: tracing, opentelemetry, jaeger, zipkin
Track request flow across service boundaries to understand latency, errors, and dependencies.
A request touches 10 services. Logs are fragmented. Finding the slow service or error root cause takes hours.
Medium — collector, storage, query backend
Medium — sampling config, retention, cardinality
Low — intuitive concept, standard APIs
Broken context propagation → fragmented traces
High cardinality attributes → storage explosion
Sampling misses rare errors (tail-based mitigates)
Clock skew → negative durations, wrong ordering