llm4funAI HARDWARE, EXPLAINED.
THE WORKBENCH
llm4fun / THE WORKBENCH

Put numbers to the test.

Measured performance helps ground the simulation. Explore the evidence or add your own.

SIMULATINGQwen3 8B
Q4 8K context 30 tok/s target

Theoretical vs measured

How well does the estimator predict real benchmarks? Calibrated errors are leave-one-out: each benchmark is predicted without using itself.

Decode · theory only
±13%
median error · p90 ±31% · n=173
Decode · calibrated
±6%
median error · p90 ±18% · n=173
Prefill · theory only
±24%
median error · p90 ±78% · n=173
Prefill · calibrated
±11%
median error · p90 ±48% · n=173

Calibration fits a correction factor per architecture family × backend, then per exact hardware, shrunk toward 1 so few data points cannot dominate. Efficiency priors per architecture, backend, quantization and model type live indata/calibration.json. Hardware without benchmarks inherits its family's factor (MEDIUM confidence) or stays purely theoretical (LOW).

Fitted correction factors

measured ÷ theoretical, after shrinkage. 1.00 = theory matched reality.

Architecture family | backendDecode nDecode factorPrefill nPrefill factor
amd-rdna3 · llama.cpp-rocm41.0741.19
amd-rdna3 · llama.cpp-vulkan21.1821.44
amd-rdna4 · llama.cpp-rocm20.9921.03
amd-rdna4 · llama.cpp-vulkan21.2921.41
amd-strix-halo · llama.cpp-rocm71.2270.72
amd-strix-halo · llama.cpp-vulkan71.2870.80
apple-m1 · llama.cpp-metal100.92101.15
apple-m2 · llama.cpp-metal201.03201.13
apple-m3 · llama.cpp-metal131.04131.19
apple-m4 · llama.cpp-metal131.15131.19
apple-m5 · llama.cpp-metal141.28143.73
intel-xe2 · llama.cpp-vulkan21.0521.59
nvidia-ada · llama.cpp-cuda121.04121.00
nvidia-ada · llama.cpp-vulkan11.0511.19
nvidia-ampere · llama.cpp-cuda130.89130.98
nvidia-ampere · llama.cpp-vulkan11.0211.26
nvidia-blackwell · llama.cpp-cuda200.95200.86
nvidia-blackwell · llama.cpp-vulkan11.0111.17
nvidia-gb10 · llama.cpp-cuda231.30232.58
nvidia-gb10 · llama.cpp-vulkan21.0922.84
nvidia-hopper · llama.cpp-cuda20.7420.51
nvidia-pascal · llama.cpp-cuda20.9921.78

Add a measured benchmark

Your own llama-bench / LM Studio numbers improve the calibration. Stored only in this browser.

Hardware
Model
Quantization
Backend
Decode (tg) tok/s
Prompt (pp512) tok/s
Context depth
tokens
GPU count
Source (required)
Source URL (optional)

Measured benchmarks (173)

Real observations with sources. Never mixed with estimates.

HardwareModelQuantCtxBackendMeasured tgTheoryCalibrated*Measured ppTheory ppSource
Mac Studio M1 Max (32-core GPU) 32GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)23.032123(-2%)599.53470llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Max (32-core GPU) 32GBllama-2-7bQ8_00llama.cpp (Metal)40.23637(-7%)537.37470llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Max (32-core GPU) 32GBllama-2-7bQ4_00llama.cpp (Metal)61.195354(-11%)530.06470llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Ultra (48-core GPU) 64GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)33.924235(+2%)875.81700llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Ultra (48-core GPU) 64GBllama-2-7bQ8_00llama.cpp (Metal)55.697057(+3%)783.45700llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Ultra (48-core GPU) 64GBllama-2-7bQ4_00llama.cpp (Metal)74.9310086(+15%)772.24700llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Ultra (64-core GPU) 128GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)37.014237(-1%)1168.89940llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Ultra (64-core GPU) 128GBllama-2-7bQ8_00llama.cpp (Metal)59.877061(+2%)1042.95940llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M1 Ultra (64-core GPU) 128GBllama-2-7bQ4_00llama.cpp (Metal)83.7310090(+8%)1030.04940llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Max (38-core GPU) 64GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)24.652124(-1%)755.67600llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Max (38-core GPU) 64GBllama-2-7bQ8_00llama.cpp (Metal)41.833641(-3%)677.91600llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Max (38-core GPU) 64GBllama-2-7bQ4_00llama.cpp (Metal)65.955359(-11%)671.31600llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (60-core GPU) 64GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)39.864239(-2%)1128.59950llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (60-core GPU) 64GBllama-2-7bQ8_00llama.cpp (Metal)62.147066(+6%)1003.16950llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (60-core GPU) 64GBllama-2-7bQ4_00llama.cpp (Metal)88.6410097(+9%)1013.81950llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)41.024243(+5%)1401.851,200llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ8_00llama.cpp (Metal)66.647072(+8%)1248.591,200llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ4_00llama.cpp (Metal)94.27100100(+11%)1238.481,200llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro M3 Max (30-core GPU) 36GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)19.541620(+1%)589.41470llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro M3 Max (30-core GPU) 36GBllama-2-7bQ8_00llama.cpp (Metal)34.32733(-5%)566.4470llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro M3 Max (30-core GPU) 36GBllama-2-7bQ4_00llama.cpp (Metal)56.584046(-18%)567.59470llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro 16-inch M3 Max (40-core GPU) 128GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)25.092125(-1%)779.17620llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro 16-inch M3 Max (40-core GPU) 128GBllama-2-7bQ8_00llama.cpp (Metal)42.753641(-4%)757.64620llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro 16-inch M3 Max (40-core GPU) 128GBllama-2-7bQ4_00llama.cpp (Metal)66.315359(-10%)759.7620llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M3 Ultra (60-core GPU) 96GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)42.244340(-6%)1121.8930llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M3 Ultra (60-core GPU) 96GBllama-2-7bQ8_00llama.cpp (Metal)63.557168(+7%)1085.76930llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M3 Ultra (60-core GPU) 96GBllama-2-7bQ4_00llama.cpp (Metal)88.4100100(+14%)1073.09930llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M3 Ultra (80-core GPU) 512GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)39.784339(-2%)1538.341,200llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M3 Ultra (80-core GPU) 512GBllama-2-7bQ8_00llama.cpp (Metal)63.937165(+1%)1487.511,200llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M3 Ultra (80-core GPU) 512GBllama-2-7bQ4_00llama.cpp (Metal)92.1410094(+2%)1471.241,200llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M4 Pro (14-core CPU, 20-core GPU) 24GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)17.191519(+8%)381.14360llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M4 Pro (14-core CPU, 20-core GPU) 24GBllama-2-7bQ8_00llama.cpp (Metal)30.542631(+1%)367.13360llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M4 Pro (14-core CPU, 20-core GPU) 24GBllama-2-7bQ4_00llama.cpp (Metal)49.643845(-10%)364.06360llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M4 Pro (14-core CPU, 20-core GPU) 24GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)17.181519(+8%)464.48360llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M4 Pro (14-core CPU, 20-core GPU) 24GBllama-2-7bQ8_00llama.cpp (Metal)30.692631(+1%)449.62360llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M4 Pro (14-core CPU, 20-core GPU) 24GBllama-2-7bQ4_00llama.cpp (Metal)50.743845(-12%)439.78360llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M4 Max (32-core GPU) 36GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)24.292327(+11%)736.25570llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M4 Max (32-core GPU) 36GBllama-2-7bQ8_00llama.cpp (Metal)43.873844(+0%)718.56570llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M4 Max (32-core GPU) 36GBllama-2-7bQ4_00llama.cpp (Metal)69.955663(-9%)713.93570llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M4 Max (40-core GPU) 128GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)31.643034(+7%)922.83710llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M4 Max (40-core GPU) 128GBllama-2-7bQ8_00llama.cpp (Metal)54.055056(+3%)891.94710llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M4 Max (40-core GPU) 128GBllama-2-7bQ4_00llama.cpp (Metal)83.067480(-3%)885.68710llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro 14-inch M5 (10-core GPU) 32GBllama-2-7bQ8_00llama.cpp (Metal)18.421520(+9%)715.42180llama.cpp discussion #4167 (Apple Silicon scoreboard)
MacBook Pro 14-inch M5 (10-core GPU) 32GBllama-2-7bQ4_00llama.cpp (Metal)31.882227(-14%)722.79180llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M5 Pro (15-core CPU, 16-core GPU) 24GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)21.391724(+13%)1310.78290llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M5 Pro (15-core CPU, 16-core GPU) 24GBllama-2-7bQ8_00llama.cpp (Metal)38.942939(+1%)1302.59290llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M5 Pro (15-core CPU, 16-core GPU) 24GBllama-2-7bQ4_00llama.cpp (Metal)67.594355(-19%)1340.44290llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M5 Pro (18-core CPU, 20-core GPU) 48GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)21.551724(+11%)1588.78370llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M5 Pro (18-core CPU, 20-core GPU) 48GBllama-2-7bQ8_00llama.cpp (Metal)38.922939(+0%)1553.86370llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac mini M5 Pro (18-core CPU, 20-core GPU) 48GBllama-2-7bQ4_00llama.cpp (Metal)66.334355(-17%)1620.64370llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M5 Max (40-core GPU) 128GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)37.113446(+23%)3158.49730llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M5 Max (40-core GPU) 128GBllama-2-7bQ8_00llama.cpp (Metal)72.425671(-1%)3143.81730llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M5 Max (40-core GPU) 128GBllama-2-7bQ4_00llama.cpp (Metal)119.9282100(-17%)3219.99730llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M5 Ultra (80-core GPU) 256GBllama-2-7bF16 (mostly F16)0llama.cpp (Metal)73.66577(+5%)5207.141,500llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M5 Ultra (80-core GPU) 256GBllama-2-7bQ8_00llama.cpp (Metal)119.01110130(+7%)4910.551,500llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M5 Ultra (80-core GPU) 256GBllama-2-7bQ4_00llama.cpp (Metal)179.1150180(+0%)4944.661,500llama.cpp discussion #4167 (Apple Silicon scoreboard)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bF160llama.cpp (Metal)43.154243(0%)1525.951,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ8_00llama.cpp (Metal)73.117071(-3%)1368.181,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ4_00llama.cpp (Metal)108.8100100(-5%)1391.781,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bF160llama.cpp (Metal)43.244243(0%)1561.351,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ8_00llama.cpp (Metal)73.357071(-3%)1386.971,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ4_00llama.cpp (Metal)109.41100100(-6%)1412.421,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bF160llama.cpp (Metal)49.554243(-14%)1627.821,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ8_00llama.cpp (Metal)82.837071(-15%)1486.511,200llama.cpp discussion #4167 (M2 Ultra history table)
Mac Studio M2 Ultra (76-core GPU) 192GBllama-2-7bQ4_00llama.cpp (Metal)125.21100100(-18%)1488.811,200llama.cpp discussion #4167 (M2 Ultra history table)
RTX 5090 32GBllama-2-7bQ4_00llama.cpp (CUDA)290.02290270(-8%)14073.4112,000llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX PRO 6000 Blackwell Workstation Edition 96GBllama-2-7bQ4_00llama.cpp (CUDA)274.2290250(-10%)14854.6315,000llama.cpp discussion #15013 (CUDA scoreboard, no FA)
H100 80GB SXM5llama-2-7bQ4_00llama.cpp (CUDA)267.81430310(+17%)9918.3429,000llama.cpp discussion #15013 (CUDA scoreboard, no FA)
A100 80GB PCIellama-2-7bQ4_00llama.cpp (CUDA)190.88320240(+27%)4849.5310,000llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 4090 24GBllama-2-7bQ4_00llama.cpp (CUDA)186.21180190(+1%)11992.711,000llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 5080 16GBllama-2-7bQ4_00llama.cpp (CUDA)181.99170170(-6%)8297.366,600llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 5070 Ti 16GBllama-2-7bQ4_00llama.cpp (CUDA)176.85160160(-8%)6952.385,200llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 6000 Ada Generation 48GBllama-2-7bQ4_00llama.cpp (CUDA)176.07180180(+3%)9229.2312,000llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 3090 Ti 24GBllama-2-7bQ4_00llama.cpp (CUDA)171.19180170(-2%)6567.495,300llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 3090 24GBllama-2-7bQ4_00llama.cpp (CUDA)158.16170150(-6%)5174.694,700llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 4080 SUPER 16GBllama-2-7bQ4_00llama.cpp (CUDA)148.33140150(+0%)8125.156,900llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX A6000 48GBllama-2-7bQ4_00llama.cpp (CUDA)138.73140140(-2%)4913.935,100llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 4070 Ti SUPER 16GBllama-2-7bQ4_00llama.cpp (CUDA)132.26130130(+1%)6924.535,800llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX A5000 24GBllama-2-7bQ4_00llama.cpp (CUDA)130.07140130(+2%)4028.163,700llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 5060 Ti 16GBllama-2-7bQ4_00llama.cpp (CUDA)90.948688(-3%)3737.252,800llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 3060 12GBllama-2-7bQ4_00llama.cpp (CUDA)75.577169(-8%)2137.51,700llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 4060 Ti 16GBllama-2-7bQ4_00llama.cpp (CUDA)63.865762(-3%)3394.632,900llama.cpp discussion #15013 (CUDA scoreboard, no FA)
NVIDIA DGX Spark Founders Edition 128GBllama-2-7bQ4_00llama.cpp (CUDA)57.215370(+23%)3062.31910llama.cpp discussion #15013 (CUDA scoreboard, no FA)
Tesla P40 24GBllama-2-7bQ4_00llama.cpp (CUDA)54.745554(-1%)1007.42440llama.cpp discussion #15013 (CUDA scoreboard, no FA)
RTX 5090 32GBllama-2-7bQ4_00llama.cpp (CUDA)300.4290260(-12%)14970.1512,000llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX PRO 6000 Blackwell Workstation Edition 96GBllama-2-7bQ4_00llama.cpp (CUDA)281.11290250(-12%)16618.9815,000llama.cpp discussion #15013 (CUDA scoreboard, with FA)
H100 80GB SXM5llama-2-7bQ4_00llama.cpp (CUDA)280.74430300(+7%)11263.2929,000llama.cpp discussion #15013 (CUDA scoreboard, with FA)
A100 80GB PCIellama-2-7bQ4_00llama.cpp (CUDA)200.9320240(+18%)5285.9610,000llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 4090 24GBllama-2-7bQ4_00llama.cpp (CUDA)188.96180190(-1%)14770.6311,000llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 5080 16GBllama-2-7bQ4_00llama.cpp (CUDA)184.68170170(-8%)9487.76,600llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 5070 Ti 16GBllama-2-7bQ4_00llama.cpp (CUDA)182.43160160(-12%)8419.565,200llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 6000 Ada Generation 48GBllama-2-7bQ4_00llama.cpp (CUDA)179.47180180(+0%)10576.8512,000llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 3090 Ti 24GBllama-2-7bQ4_00llama.cpp (CUDA)172.26180170(-3%)6924.015,300llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 3090 24GBllama-2-7bQ4_00llama.cpp (CUDA)161.89170150(-9%)5560.064,700llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 4080 SUPER 16GBllama-2-7bQ4_00llama.cpp (CUDA)147.48140150(+1%)9439.016,900llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX A6000 48GBllama-2-7bQ4_00llama.cpp (CUDA)144.87140130(-8%)5662.395,100llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX A5000 24GBllama-2-7bQ4_00llama.cpp (CUDA)135.83140130(-5%)4552.153,700llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 4070 Ti SUPER 16GBllama-2-7bQ4_00llama.cpp (CUDA)132.85130130(0%)7612.325,800llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 5060 Ti 16GBllama-2-7bQ4_00llama.cpp (CUDA)93.468688(-6%)4195.532,800llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 3060 12GBllama-2-7bQ4_00llama.cpp (CUDA)76.927169(-11%)2407.671,700llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX 4060 Ti 16GBllama-2-7bQ4_00llama.cpp (CUDA)64.035762(-4%)3803.452,900llama.cpp discussion #15013 (CUDA scoreboard, with FA)
NVIDIA DGX Spark Founders Edition 128GBllama-2-7bQ4_00llama.cpp (CUDA)56.745370(+24%)3661.37910llama.cpp discussion #15013 (CUDA scoreboard, with FA)
Tesla P40 24GBllama-2-7bQ4_00llama.cpp (CUDA)53.735555(+2%)1079.66440llama.cpp discussion #15013 (CUDA scoreboard, with FA)
RTX PRO 6000 Blackwell Workstation Edition 96GBllama-2-7bQ4_00llama.cpp (CUDA)260.42290250(-4%)12742.4815,000llama.cpp discussion #15013 (comment)
RTX PRO 6000 Blackwell Workstation Edition 96GBllama-2-7bQ4_00llama.cpp (CUDA)289.3290250(-15%)14463.1615,000llama.cpp discussion #15013 (comment)
Radeon RX 7900 XTX 24GBllama-2-7bQ4_00llama.cpp (Vulkan)182.63150180(-2%)3726.992,200llama.cpp discussion #10879 (Vulkan scoreboard, no FA)
Radeon AI PRO R9700 32GBllama-2-7bQ4_00llama.cpp (Vulkan)145.67100140(-5%)5609.823,400llama.cpp discussion #10879 (Vulkan scoreboard, no FA)
Arc Pro B60 24GBllama-2-7bQ4_00llama.cpp (Vulkan)68.556569(+1%)522.36190llama.cpp discussion #10879 (Vulkan scoreboard, no FA)
NVIDIA DGX Spark Founders Edition 128GBllama-2-7bQ4_00llama.cpp (Vulkan)58.515258(0%)2789.51640llama.cpp discussion #10879 (Vulkan scoreboard, no FA)
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBllama-2-7bQ4_00llama.cpp (Vulkan)53.594663(+17%)1288.961,100llama.cpp discussion #10879 (Vulkan scoreboard, no FA)
RTX 5090 32GBllama-2-7bQ4_00llama.cpp (Vulkan)273.68270270(-2%)11796.388,600llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
Radeon RX 7900 XTX 24GBllama-2-7bQ4_00llama.cpp (Vulkan)190.92150170(-10%)3889.542,200llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
RTX 4090 24GBllama-2-7bQ4_00llama.cpp (Vulkan)190.1170170(-8%)10830.417,600llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
RTX 3090 24GBllama-2-7bQ4_00llama.cpp (Vulkan)171.61160160(-5%)5200.683,300llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
Radeon AI PRO R9700 32GBllama-2-7bQ4_00llama.cpp (Vulkan)152.7100130(-13%)5907.663,400llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
Arc Pro B60 24GBllama-2-7bQ4_00llama.cpp (Vulkan)70.546568(-4%)274.76190llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
NVIDIA DGX Spark Founders Edition 128GBllama-2-7bQ4_00llama.cpp (Vulkan)60.395257(-6%)3321.91640llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBllama-2-7bQ4_00llama.cpp (Vulkan)534663(+18%)1357.071,100llama.cpp discussion #10879 (Vulkan scoreboard, FA enabled)
Radeon RX 7900 XTX 24GBllama-2-7bQ4_00llama.cpp (ROCm)167.11140160(-6%)3552.272,800llama.cpp discussion #15021 (ROCm/HIP scoreboard, no FA)
Radeon PRO W7900 48GBllama-2-7bQ4_00llama.cpp (ROCm)121.18130130(+10%)3213.172,800llama.cpp discussion #15021 (ROCm/HIP scoreboard, no FA)
Radeon AI PRO R9700 32GBllama-2-7bQ4_00llama.cpp (ROCm)93.849798(+4%)4443.544,400llama.cpp discussion #15021 (ROCm/HIP scoreboard, no FA)
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBllama-2-7bQ4_00llama.cpp (ROCm)50.014456(+12%)911.361,400llama.cpp discussion #15021 (ROCm/HIP scoreboard, no FA)
Radeon RX 7900 XTX 24GBllama-2-7bQ4_00llama.cpp (ROCm)170.12140160(-9%)3874.252,800llama.cpp discussion #15021 (ROCm/HIP scoreboard, with FA)
Radeon PRO W7900 48GBllama-2-7bQ4_00llama.cpp (ROCm)127.43130130(+2%)3472.862,800llama.cpp discussion #15021 (ROCm/HIP scoreboard, with FA)
Radeon AI PRO R9700 32GBllama-2-7bQ4_00llama.cpp (ROCm)97.989795(-3%)4773.074,400llama.cpp discussion #15021 (ROCm/HIP scoreboard, with FA)
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBllama-2-7bQ4_00llama.cpp (ROCm)49.874456(+13%)1003.531,400llama.cpp discussion #15021 (ROCm/HIP scoreboard, with FA)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bgpt-oss 20B MXFP4 MoE (ggml-org/gpt-oss-20b-GGUF)0llama.cpp (CUDA)83.436484(+1%)4505.821,700llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bgpt-oss 20B MXFP4 MoE (ggml-org/gpt-oss-20b-GGUF)4,096llama.cpp (CUDA)79.226281(+3%)4158.341,500llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bgpt-oss 20B MXFP4 MoE (ggml-org/gpt-oss-20b-GGUF)8,192llama.cpp (CUDA)75.226078(+4%)3993.811,400llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bgpt-oss 20B MXFP4 MoE (ggml-org/gpt-oss-20b-GGUF)16,384llama.cpp (CUDA)70.365673(+4%)3449.981,200llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bgpt-oss 20B MXFP4 MoE (ggml-org/gpt-oss-20b-GGUF)32,768llama.cpp (CUDA)61.654964(+5%)2689.42890llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bgpt-oss 120B MXFP4 MoE (ggml-org/gpt-oss-120b-GGUF)0llama.cpp (CUDA)58.724356(-4%)2443.911,200llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bgpt-oss 120B MXFP4 MoE (ggml-org/gpt-oss-120b-GGUF)4,096llama.cpp (CUDA)55.674154(-3%)2309.841,100llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bgpt-oss 120B MXFP4 MoE (ggml-org/gpt-oss-120b-GGUF)8,192llama.cpp (CUDA)52.874052(-1%)2216.68960llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bgpt-oss 120B MXFP4 MoE (ggml-org/gpt-oss-120b-GGUF)16,384llama.cpp (CUDA)49.453749(-2%)1956.31810llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bgpt-oss 120B MXFP4 MoE (ggml-org/gpt-oss-120b-GGUF)32,768llama.cpp (CUDA)42.763343(+0%)1567.08610llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBqwen3-coder-30b-a3bqwen3moe 30B.A3B Q8_0 (ggml-org/Qwen3-Coder-30B-A3B-Instruct-Q8_0-GGUF)0llama.cpp (CUDA)61.065369(+14%)2986.971,700llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBqwen3-coder-30b-a3bqwen3moe 30B.A3B Q8_0 (ggml-org/Qwen3-Coder-30B-A3B-Instruct-Q8_0-GGUF)4,096llama.cpp (CUDA)54.774762(+13%)2633.451,200llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBqwen3-coder-30b-a3bqwen3moe 30B.A3B Q8_0 (ggml-org/Qwen3-Coder-30B-A3B-Instruct-Q8_0-GGUF)8,192llama.cpp (CUDA)48.024256(+17%)2354.14900llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBqwen3-coder-30b-a3bqwen3moe 30B.A3B Q8_0 (ggml-org/Qwen3-Coder-30B-A3B-Instruct-Q8_0-GGUF)16,384llama.cpp (CUDA)40.233647(+17%)1908.86610llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBqwen3-coder-30b-a3bqwen3moe 30B.A3B Q8_0 (ggml-org/Qwen3-Coder-30B-A3B-Instruct-Q8_0-GGUF)32,768llama.cpp (CUDA)30.212735(+17%)1348.17370llama.cpp benches/dgx-spark/dgx-spark.md (linked from discussion #16578, ggerganov)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bMXFP4 (ggml-org GGUF)4,096llama.cpp (CUDA)55.214154(-2%)2412.651,000llama.cpp benches/dgx-spark/dgx-spark.md (llama-batched-bench)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bMXFP4 (ggml-org GGUF)4,096llama.cpp (CUDA)139.0778100(-28%)2413.971,000llama.cpp benches/dgx-spark/dgx-spark.md (llama-batched-bench)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-120bMXFP4 (ggml-org GGUF)4,096llama.cpp (CUDA)262.2110150(-44%)2411.231,000llama.cpp benches/dgx-spark/dgx-spark.md (llama-batched-bench)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bMXFP4 (ggml-org GGUF)4,096llama.cpp (CUDA)78.546281(+4%)4513.911,500llama.cpp benches/dgx-spark/dgx-spark.md (llama-batched-bench)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bMXFP4 (ggml-org GGUF)4,096llama.cpp (CUDA)233.11140180(-22%)4561.441,500llama.cpp benches/dgx-spark/dgx-spark.md (llama-batched-bench)
NVIDIA DGX Spark Founders Edition 128GBgpt-oss-20bMXFP4 (ggml-org GGUF)4,096llama.cpp (CUDA)473.59340440(-7%)4557.521,500llama.cpp benches/dgx-spark/dgx-spark.md (llama-batched-bench)
Mac Studio M3 Ultra (80-core GPU) 512GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (Metal)115.52150140(+19%)2816.472,300llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
Mac Studio M2 Ultra (76-core GPU) 192GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (Metal)116.08140150(+28%)2191.132,200llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
Mac Studio M2 Ultra (76-core GPU) 192GBgpt-oss-120bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (Metal)79.689599(+24%)1244.571,500llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
Mac Studio M4 Max (32-core GPU) 36GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (Metal)92.367991(-1%)1277.421,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
Mac Studio M1 Max (32-core GPU) 64GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (Metal)75.157468(-9%)994.75860llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX PRO 6000 Blackwell Workstation Edition 96GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)249.96360320(+26%)9480.5527,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX PRO 6000 Blackwell Workstation Edition 96GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)286.91360310(+8%)11521.9527,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX PRO 6000 Blackwell Workstation Edition 96GBgpt-oss-120bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)170.62240210(+23%)4494.211,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX PRO 6000 Blackwell Workstation Edition 96GBgpt-oss-120bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)196.31240210(+5%)5518.0711,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 3090 24GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)161.77210190(+19%)5170.568,600llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 4090 24GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)221.95220230(+4%)8022.3320,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 4080 SUPER 16GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)186.51170180(-4%)8170.9513,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 5060 Ti 16GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)111.51100110(-4%)3839.215,100llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 5070 Ti 16GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)189.45200210(+10%)6339.769,500llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 5080 16GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)204.85210210(+5%)7476.5512,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
RTX 5090 32GBgpt-oss-20bMXFP4 (ggml-org gpt-oss GGUF)0llama.cpp (CUDA)282.51360360(+26%)9848.3823,000llama.cpp discussion #15396 (guide: running gpt-oss with llama.cpp)
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-120bgpt-oss-120b-mxfp40llama.cpp (ROCm)51.813644(-16%)625.581,500kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-120bgpt-oss-120b-mxfp432,768llama.cpp (ROCm)36.322734(-7%)589.25940kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-120bgpt-oss-120b-mxfp40llama.cpp (Vulkan)56.613748(-15%)719.911,400kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-120bgpt-oss-120b-mxfp432,768llama.cpp (Vulkan)43.012937(-14%)307.5730kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-20bgpt-oss-20b-mxfp40llama.cpp (ROCm)73.055366(-10%)1786.172,600kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-20bgpt-oss-20b-mxfp432,768llama.cpp (ROCm)52.174151(-2%)1003.111,400kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-20bgpt-oss-20b-mxfp40llama.cpp (Vulkan)79.785673(-8%)1692.492,000kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBgpt-oss-20bgpt-oss-20b-mxfp432,768llama.cpp (Vulkan)61.124356(-8%)555.731,100kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBllama-2-7bllama-2-7b.Q4_00llama.cpp (ROCm)50.594456(+11%)1545.361,400kyuz0 amd-strix-halo-toolboxes benchmark results.json
AMD Ryzen AI Max+ 395 mini PC (generic) 128GBllama-2-7bllama-2-7b.Q4_00llama.cpp (Vulkan)55.734662(+12%)1337.71,100kyuz0 amd-strix-halo-toolboxes benchmark results.json

* Leave-one-out: calibrated prediction made without this row. Skipped rows (unknown model/quant) are not used for calibration.