Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

NVIDIA представила Topograph для планирования GPU-нагрузок с учетом топологии сети

NVIDIA представила открытый инструментарий Topograph, который обнаруживает физическую топологию вычислительных кластеров и передает эти сведения системам управления нагрузкой. Проект поддерживает Kubernetes и Slurm, помогая размещать компоненты распределенных задач в близких сетевых доменах.

NVIDIA представила Topograph — открытый инструментарий для планирования GPU-нагрузок с учетом физической топологии вычислительного кластера.

Topograph получает данные из API облачных платформ или локальных сетевых систем, включая InfiniBand, Spectrum-X и домены Multi-Node NVLink. Затем он преобразует сведения в общую модель и формирует данные для планировщиков: метки узлов Kubernetes, конфигурации топологии Slurm, ресурсы Node Feature Discovery, ConfigMap для Slinky или граф в формате JSON.

Инструмент может обновлять представление топологии при изменениях в кластере. В Kubernetes его можно установить с помощью Helm, а для Slurm предусмотрено создание конфигураций topology/tree и topology/block, в том числе отдельных топологий для разделов кластера.

Исходный код Topograph опубликован под лицензией Apache 2.0. Репозиторий содержит Helm-чарт, контейнерный образ, средства сборки пакетов DEB и RPM, а также модели для тестирования без производственного оборудования.

Источник: developer.nvidia.com

Связь с редакцией