
基於全新 Zen 微架構、 AMD Ryzen 7 處理器強勢登場, CPU 內部設計完全推倒重來,大幅改良 Front-End 、運算單元及 Cache 架構,更加入 SMT 同步多線程技術,整體性能提升達 52% ,相較對手同級產品售價便宜一半。 HKEPC 編輯部針對 AMD Zen 微架構進行詳細剖析,並找來全新 Ryzen 7 1800X 處理器,與上代 AMD FX-9590 、對手 INTEL Core i7-6900K 、 7700K 進行詳細測試。
6-Wide INT 整數運算群
有別於 INTEL Core 微架構的 Unified Reservation Station 架構, AMD Zen 微架構分割出獨立的 INT 整數及 FP 浮點運算群,各自擁有專屬的流水線及執行端口,雖然電晶片數目及所需晶片面積增加,但卻擁有更佳的並行運算能力, SMT 同步多線程運算性能更佳。
Zen 微架構的 INT 整數運算群設計,整數運算流水線由上代 4 組增至 6 組 (4 個 ALQ + 2 個 AGQ) ,每個週期可處理 6 個整數 μOps 指令,每組流水線均設有獨立的 Instruction Scheduler 調度單元,能同時處理的 Schedule Queue 總數由上代 48 個增至 84 個。
上代 Excavator 微架構的真實性能,與理論峰值出現嚴重差距, Register File 暫存器與 Retire Queue 單元設計是限制因素之一, Zen 微架構將整數 Register File 暫存器數目由 64 個增至 168 個,令 Zen 微架構擁有更佳的亂序執行能力,避免 μOps 指令不必要地順序執行,從而提升處理器的指令層級並行運算性能。

AMD Zen 微架構的 INT 整數運算群
針對 Retire Queue 單元, Zen 微架構將隊列數目由 128 個增至 192 個,並且每個週期退出指令速度由 4 個增至 8 個,令 Schedule Queue 較為空閒,退出的速度比調度更快,增強了指令排序操作能力。
INT 整數運算群共有 4 個 ALU 整數運算單元及 2 個 AGU 位址生成單元, ALU 單元支援功能大致對稱但非完全相同,當中 2 個 ALU 單元能在單一週期處理 2 個運算分支,其中 1 個 ALU 可處理 IMUL 有符號乘法,只有 1 個可執行 CRC 運算,只有 1 個可執行除法。
整數運算方面, AMD Zen 微架構擁有 4 個 ALU 單元,在數目追平了 INTEL Broadwell/Skylake 微架構,而且 ALU 單元功能大致對稱雖不是完全相同,但明顯功能限制相對 INTEL 較少, INTEL 微架構有不少整數運算需特定 ALU 單元處理器,就算其他單元閒置也無法協助,令 AMD Zen 微架構的整數運算性能,尤其是處理混合指令方面更勝 INTEL 。
4-Wide FP 浮點運算群
Zen 微架構的 FP 浮點運算群設計,每個週期可處理 4 個浮點 μOps 指令,設有 2 組 Instruction Scheduler 調度單元,其中 1 組不具備排序能力降低功耗需求,能同時處理的 Schedule Queue 總數由上代 60 個增至 96 個。
增設 LDCVT 單元連接 Load/Store 單元,能在 Backup Queue 中提取 μOps 指令,能省略再經 Scheduler Queue 提前分派調度。浮點 Register File 暫存器數目由 72 個擴大至 160 個,並可直接與整數暫存器進行交換資料,增加浮點亂序執行能力。
FP 浮點運算群設有 2 個 ADD 加法端口及 2 個 MUL 乘法端口,能夠組成 2 組 128bit FMAC 浮點單元,具備 2 個 AES 運算引擎用作加密 / 解密運算,每個週期可處理 2 個 128bit 浮點指令,支援 x87 、 MMX 、 SSE 、 AVX1/2 、 AES 及 SHA 運算。

AMD Zen 微架構的 FP 浮點運算單元
雖然 AMD ZEN 微架構取消雙核模組共享設計,每個核心均擁有獨立的 FP 浮點運算群,令浮點運算資源及性能相較舊架構提升 1 倍以上,但性能上仍然落後 INTEL Core 微架構,每個週期僅可處理 1 組 256bit AVX 指令,面對 AVX2 指令更需佔用 2 個週期。
對比 Skylake/Kaby Lake 微架構,能在單一週期執行最高 3 個 256bit 浮點 μOps 指令,擁有 2 個 256bit AVX FMA 單元,單一週期可完成 2 個 256bit AVX 指令或 1 個 AVX2 指令,在浮點性能上是 Zen 微架構的兩倍。
優化指令集支援能力

AMD Zen 微架構大幅改良指令集相容能力,能支援所有 ISA 工業標準的擴展指令,包括 AVX 、 AVX2 、 BMI1 、 BMI2 、 AES 、 RDRAND 、 SMEP 等,同時亦追加了 ADX 多精度附加進位、 RDSEED 隨機亂數生成、 SMAP 管理員訪問防護、 SHA1/SHA256 安全散列運算、 CLFLUSHOPT 儲存邊界緩存清除及 XSAVEC/SAVES/XRSTORS 等存取擴展命令等。
同時新增了兩個 AMD 獨有的擴展指令,其中 CLZERO 用作清除緩存線用途, PTE Coalescing 可以將多個 4K page Tables 結合至 1 個 32K Page 之中。
雖然新增了不少擴展指令,但為了節省晶片面積及縮減電晶體數目, AMD Zen 微架重新審視對指令集的支援,刪去較不常用以及對性能影響較低的指令,包括 TBM 、 FMA4 、 XOP 、 LWP 等。