NVIDIA ускорила развёртывание LLM с помощью передачи весов между GPU

NVIDIA представила ModelExpress — систему доставки весов и других артефактов больших языковых моделей из наиболее быстрого доступного источника. Она может передавать данные напрямую между GPU через RDMA, а при отсутствии готовой реплики — загружать их из объектного или локального хранилища.

NVIDIA представила ModelExpress (MX) — систему, сокращающую время холодного запуска и масштабирования сервисов инференса больших языковых моделей. Перед загрузкой ModelExpress ищет совместимую копию весов и выбирает наиболее быстрый доступный маршрут к памяти GPU.

Архитектура NVIDIA ModelExpress и маршруты загрузки весов модели

Если другая реплика уже обслуживает ту же модель, веса передаются непосредственно между GPU по P2P RDMA с помощью библиотеки NVIDIA Inference Xfer Library (NIXL). Это позволяет обойти повторное обращение к объектному хранилищу, локальным дискам и оперативной памяти узла. При отсутствии подходящей реплики MX может потоково читать файлы safetensors из объектного хранилища или загружать их с локального накопителя, в том числе через GPUDirect Storage.

Управляющий уровень обнаруживает совместимые источники через Redis или метаданные Kubernetes. Система также координирует однократную загрузку общей копии модели в кластерный кеш и умеет передавать между репликами кеши скомпилированных ядер. Заявлены интеграции с vLLM и SGLang, а также поддержка платформ NVIDIA Dynamo и llm-d.

Сравнение времени загрузки модели разными способами в тесте NVIDIA

По данным NVIDIA, в испытании с DeepSeek-V4 Pro на узле с восемью ускорителями B200 и сетевыми адаптерами ConnectX-7 передача весов и кешей JIT-ядер из работающей реплики заняла менее 10 секунд. Общее время запуска сократилось с восьми минут до одной минуты 44 секунд.

Источник: developer.nvidia.com

Связь с редакцией