The Tail at Scale
The Tail at Scale explains why rare slowdowns become routine user-visible delays when one request fans out across many machines. Read it for a practical systems lesson: large services need techniques that tolerate latency variability, not only faster average components.
Reading focus: Why waiting on many parallel components makes the slowest response dominate end-to-end latency. How hedged requests and backup work can cut tail latency without duplicating every request. Why tail-tolerant systems combine deadlines, partial results, finer-grained work, and careful resource controls.
Communications of the ACM 2013. Dean and Barroso. 30 min read, easy difficulty.