85.3 GFlops: Optimizing FP32 Matrix Multiplication on a Single AMD Zen 3 Core
matrix multiplicationoptimizationAVX2FMAC++AMD Zen 3performance engineeringscientific computing
Author: houslast
Date: 7/17/2026
Article Summary:
This repository contains a systematic exploration of matrix multiplication optimization using AVX2/FMA in C++ intrinsics, achieving 63.5% of the theoretical peak of 134.4 GFLOPS on an AMD Ryzen 5 5500.