21.07.2026
В тесте предобучения модели DeepSeek-V3 на 256 GPU платформа NVIDIA GB300 NVL72 достигла 1 648 Тфлопс на каждый ускоритель. Это собственный результат NVIDIA без независимого подтверждения; компания связывает его с сочетанием NVLink, межстоечных сетей и оптимизаций программных фреймворков.
NVIDIA сообщила о достижении 1 648 Тфлопс на GPU в тесте предобучения модели DeepSeek-V3 с 671 млрд параметров. Испытание проводилось на конфигурации из 256 GPU GB300 с использованием библиотеки распределённого обучения Megatron Core. Компания называет результат мировым рекордом, однако независимого подтверждения в публикации не приводит.

DeepSeek-V3 использует архитектуру Mixture of Experts, или «смесь экспертов»: при обработке каждого токена задействуется около 37 млрд из 671 млрд параметров. Такая схема сокращает объём вычислений, но повышает требования к обмену данными между GPU. В стойке GB300 NVL72 установлены 72 ускорителя Blackwell Ultra, объединённые NVLink пятого поколения с пропускной способностью до 1,8 Тбайт/с на GPU; для связи между стойками NVIDIA использовала адаптеры ConnectX-8 со скоростью 800 Гбит/с на GPU.
При масштабировании теста с 256 до 1 024 GPU производительность на один ускоритель, по данным NVIDIA, сохранилась на уровне 98,5% для Megatron Core и 97% для TorchTitan и JAX.

Предыдущий результат на GB200 NVL72 составлял 606 Тфлопс на GPU — примерно в 2,7 раза меньше. При этом сравнение включает не только смену поколения оборудования: для GB200 использовалась ранняя версия программного стека, а для GB300 — актуальная. На неизменной системе GB300 NVL72 программные оптимизации за шесть месяцев повысили показатель с 1 088 до 1 648 Тфлопс на GPU.
Источник: developer.nvidia.com