David Álvarez Rosa 用一个「多线程在锁内自增计数器、线程绑定核心、锁与计数器各占一条缓存行」的基准,逐步把最简单的自旋锁优化到约 5.7 倍速度、能耗降到五分之一以下。第一版用原子布尔加交换忙等:单线程 3.14 纳秒,两线程 61.5 纳秒,四线程 246 纳秒,且四线程时一级缓存未命中率从 1.27% 涨到 61.73%。第二版只把内存序从默认的最强序改成获取/释放,解锁从一次带锁的读改写变成一条普通存储,四线程降到 131 纳秒、能耗从 64.92 焦耳降到 34.45 焦耳。第三版改成测试再测试并加暂停指令,第四版再加指数退避,四线程 43.0 纳秒、能耗 11.92 焦耳。他的结论是大多数代码仍应用标准互斥锁,只有线程绑定到独占核心且实测之后才考虑自旋锁。