メモリコンシステンシの話をしてるんだろうけど
そもそもストアはレジスタに対する出力依存はないから並び替えることによるゲインは小さいし
Core2以降ロードはストアを追い越せるようになってる (memory disambiguation) からOoOの制約については実質的な問題はない
x86の並列度が限界に来てるならJim Kellerがあんなことは言わない
https://www.youtube.com/watch?v=oIG9ztQw2Gc#t=33m23s

最近のプロセッサでOoOの並列度を改善しているのは分岐予測やプリフェッチ機構などのあまり見えない (他社に真似されないように見せたくない) 部分の努力であって
デコーダの数だとか演算器の数だとか見える部分の数字だけ比べても本質は見えない
例えば少し前の実装だがA12の分岐予測精度はSkylakeと比べるとこれだけ優れている
これはISA上の制約とは全く関係なくIPCを上げることに貢献している
https://pbs.twimg.com/media/EiWvQmKXkAEK0Vz.png