Согласно последнему анализу блога Nvidia, стоимость GPU Blackwell почти вдвое выше за час по сравнению с поколением Hopper, но при этом они обеспечивают в 35 раз более низкие затраты на инференс в пересчёте на токен. В качестве тестовой модели используется DeepSeek-R1: Blackwell (GB300 NVL72) сдается в аренду по $2,65 за GPU в час против $1,41 для Hopper, однако пропускная способность одного GPU растет с 90 до 6 000 токенов в секунду. Этот 65-кратный прирост пропускной способности снижает затраты на миллион токенов с $4,20 до $0,12.
Показатель $0,12 предполагает полную оптимизацию ПО, включая инференс с низкой точностью FP4 и предсказание нескольких токенов (MTP). Если MTP не включена, затраты на миллион токенов достигают примерно $2,35, но при активной MTP они падают до $0,11, демонстрируя 21-кратное влияние оптимизации только от этой функции.