DRAйверы для GPU: как Kubernetes научился выделять устройства через стандартный APIDevice Plugin в Kubernetes сводит GPU...

DRAйверы для GPU: как Kubernetes научился выделять устройства через стандартный APIDevice Plugin в Kubernetes сводит GPU к счётчику на узле: планировщик видит только количество устройств, но не их профиль, объём памяти или режим шаринга. Для ML-задач это быстро становится ограничением. Обучению нужны выделенные карточки целиком, инференсу — управляемые доли, а CI хватит и четвертинки NVIDIA H100 на пять минут. Dynamic Resource Allocation полностью меняет модель управления устройствами. GPU становятся сущностью с инвентарём, атрибутами и правилами выбора. В статье я разбираю устройство DRA и показываю миграцию с device plugin на примере кластера из 8 узлов × 8 NVIDIA H100 без полного переписывания манифестов. А ещё объясняю, почему мы в Deckhouse пишем свой DRA-драйвер. Разобраться с DRAhttps://habr.com/ru/companies/flant/articles/1038000/#gpu #kubernetes #deckhouse_kubernetes_platform #ai #ml #dra #machine_learning

Read Original

Related