Федеративное обучение без единой инфраструктуры: Docker, Kubernetes и Slurm в одной федерации

levashove 8 минут назад Федеративное обучение без единой инфраструктуры: Docker, Kubernetes и Slurm в одной федерации 9 мин 194 Блог компании VK Tech Машинное обучение * Kubernetes * Облачные вычисления *...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. levashove 8 минут назад Федеративное обучение без единой инфраструктуры: Docker, Kubernetes и Slurm в одной федерации 9 мин 194 Блог компании VK Tech Машинное обучение * Kubernetes * Облачные вычисления * IT-инфраструктура * Перевод Автор оригинала: Peter Cnudde, Yuan-Ting Hsieh, Isaac Yang, Chester Chen VK Cloud перевела материал о том, как NVIDIA FLARE помогает участникам проекта федеративного обучения работать вместе, даже если у них разные инфраструктуры. Рассказываем, зачем платформе двухуровневая архитектура и как каждая организация сохраняет контроль над своими данными и вычислительными ресурсами. ВведениеПроекты федеративного обучения (FL) часто начинаются с простой схемы: один сервер, несколько клиентов и по одному набору данных у каждого участника.
Но по мере роста проекта на первый план выходит уже не сам алгоритм, а общая инфраструктура. Нужно выделять GPU под задачи, разграничивать исследования и при этом сохранять за каждой организацией контроль над её данными, секретами и правилами использования вычислительных ресурсов. Задача усложняется, когда участники работают в разных средах.
Технические детали
У одних есть сервер с Docker, у других — кластер Kubernetes, а исследовательский центр может распределять задачи на GPU через Slurm. Если для совместной работы всем придётся перейти на одинаковую инфраструктуру, её унификация станет дополнительным препятствием. NVIDIA FLARE решает эту проблему: отделяет постоянно работающие сервисы федерации от процессов, которые выполняют отдельные задания.
Благодаря двухуровневой архитектуре FLARE каждая площадка может использовать подходящую ей среду выполнения — например, Docker, Kubernetes или Slurm — и при этом оставаться частью одной федерации. Участники сами определяют, как выделять вычислительные ресурсы и какие наборы данных, образы и секреты использовать в каждом исследовании. Правила запуска заданий тоже остаются под их контролем.
Поддержка Docker и Kubernetes доступна в NVIDIA FLARE 2. 9 добавлена поддержка Slurm. Разделение координации федерации и выполнения задачРазвёртывание FLARE состоит из двух операционных слоёв.
Отраслевые последствия
Долгоживущие родительские процессы сервера и клиента поддерживают федерацию, аутентифицируют соединения и координируют работу. Отдельные job worker сервера и клиента выполняют отправленную задачу FL. Благодаря такому разделению задачи выполняются с учётом фактической потребности в ресурсах.
Родительские процессы могут оставаться доступными, не занимая GPU, необходимые для обучения. Когда дата-сайентист отправляет задачу, каждый родительский процесс запускает worker через настроенную для него исполняющую платформу. Worker получает задачу, использует запрошенные ресурсы, возвращает результаты и завершается, когда его работа выполнена.
Задача описывает требования к ресурсам отдельно от деталей платформы. Задача может запросить GPU, целые планируемые единицы CPU и память хоста.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






