Выберите городМосква
Москва
Алматы
Екатеринбург
Тюмень
Новосибирск
Сочи
Москва
Алматы
Екатеринбург
Тюмень
Новосибирск
Сочи
Личный кабинет СДО
Выберите городМосква
Москва
Екатеринбург
Тюмень
Сочи
Москва+7 495 231-23-51
Екатеринбург
Тюмень
Сочи
МТ_СПД_ИИ_ЦОД Новый

Построение комплексных решений для работы с ИИ в ЦОД. Интенсив. v1.0

Тип курса
Авторский
Длительность
40 ак. часов
Ближайшая дата
07 дек 2026
Стоимость
275 000 RUB
275 000 RUB
Описание

Данный курс посвящён проектированию и построению ИИ ЦОД, который представляет из себя специализированную вычислительно-сетевую инфраструктуру для обучения и инференса современных моделей искусственного интеллекта. Во время обучения студенты последовательно изучают темы от архитектуры и аппаратных компонентов GPU-кластера до построения высокопроизводительной сети, технологий RoCEv2/PFC и multipath-механизмов. Далее в курсе рассматривается программный стек GPU-кластеров и систем распределённых вычислений, а также организация инференса LLM и MLOps. Отдельное внимание уделяется масштабированию ИИ ЦОД от небольших AI-кластеров с прямыми соединениями до крупных фабрик, объединяющих множество POD и десятки или сотни тысяч GPU-ускорителей.

Курс «Построение комплексных решений для работы с ИИ в ЦОД. Интенсив. v1.0» является продвинутым интенсивом, и рассчитан на инженеров по сетям передачи данных и ЦОД, архитекторов и технических специалистов, которые имеют опыт проектирования IP/Ethernet-сетей и классических ЦОД, и хотят разобраться в специфике инфраструктуры для масштабируемых ИИ-решений. Он также будет полезен системным инженерам, инженерам по вычислительной инфраструктуре, отвечающим за эксплуатацию GPU-кластеров. Курс фокусируется на построении ИИ ЦОД с максимальным использованием open-source технологий. При этом в курсе также кратко описываются аппаратные и программные экосистемы NVIDIA, AMD и Huawei и особенности их интеграции с сетевой инфраструктурой.

Курс «Построение комплексных решений для работы с ИИ в ЦОД. Интенсив. v1.0» слушатель может пройти как в очном, так и в онлайн формате. В онлайн формате слушатель сможет общаться с преподавателем и другими слушателями, задавать вопросы и комментировать ответы, а записи занятий доступны в любое время суток, что позволит учиться в любом удобном месте.

Документы по итогам обучения

Программа курса «Построение комплексных решений для работы с ИИ в ЦОД. Интенсив. v1.0» разработана в соответствии с профессиональными стандартами «Специалист по администрированию сетевых устройств информационно-коммуникационных систем», «Специалист по автоматизации информационно-аналитической деятельности». По окончании курса выдается удостоверение о повышении квалификации (при наличии среднего профессионального или высшего образования и предоставлении других необходимых для оформления документов). При отсутствии необходимого уровня образования либо документов об образовании выдается сертификат о прохождении обучения УЦ Микротест.

Уровень сложности курса
Экспертный
Кому полезен курс
  • Администраторам сетей
  • Сетевым инженерам
  • Инженерам технической поддержки
  • IT-инженерам
  • Архитекторам IT-инфраструктуры
Необходимая подготовка

  • Глубокое понимание принципов работы протоколов маршрутизации и технологий коммутации на уровне CCNP/HCIP-Datacom
  • Понимание архитектуры сети современных ЦОД, использующих технологию VXLAN/BGP-EVPN.
  Зачисление на курс проводится по итогам предварительного тестирования.

Учебно-методические материалы
Электронные учебные пособия на русском и английском языках
Программа курса
Модуль 1. Архитектура End-to-End AI Platform и ее аппаратная часть (AI Data Center)

Глава 1. Введение в End-to-End AI Platform
  • Обзор End-to-End AI Platform, как специализированной вычислительной инфраструктуры для обучения и инференса моделей ИИ
  • Рассмотрение эволюции ЦОД, ограничений классического ЦОД при построении AI Data Center
  • Рассмотрение архитектуры AI Data Center
Глава 2. Архитектура вычислительного узла
  • Рассмотрение устройства GPU-сервера. Роль CPU, PCIe, GPU, HBM, NIC, DPU и локальных накопителей.
  • Описание пути прохождения данных внутри вычислительного узла
Глава 3. Аппаратные решения и экосистемы
  • Описание решений компаний NVIDIA, AMD, Huawei. Сравнение решений разных производителей
Глава 4. Соединительные интерфейсы внутри сервера
  • Описание шин PCIe Gen5/6, CXL, NVLink, NVSwitch, Infinity Fabric, HCCS.
Глава 5. Программный стек GPU
  • Обзор программных стеков CUDA, ROCm, CANN.
  • NCCL, RCCL, UCX. Краткое описание программного стека отдельно в экосистемах NVIDIA, AMD и Huawei.
Модуль 2. Архитектура сети AI Data Center

Глава 1. Эволюция сетей ЦОД и требования AI-нагрузок
  • Рассмотрение перехода от three-tier-архитектуры (доступ-агрегация-ядро) к Clos/Spine-Leaf-фабрикам
  • Описание профиля AI-трафика: East-West, Elephant Flows, incast, microburst и синхронные коллективные операции.
  • Определение ключевых требований к задержке, пропускной способности, потере пакетов и предсказуемости сети.
Глава 2. Топологии сетей AI Factory
  • Описание Direct Attach, Ring, Full Mesh, Single-Switch, Spine-Leaf, Dragonfly+.
  • Сравнение масштаба, числа путей, отказоустойчивости, кабельной сложности и возможностей расширения.
  • Разбор областей применения каждой топологии от микрокластера до фабрики на 100 000+ GPU.
Глава 3. Масштабирование: сервер, стойка, POD и SuperPOD
  • Описание уровней масштабирования AI-решения от одного GPU-сервера до стойки, POD, SuperPOD и межкластерной фабрики.
  • Рассмотрение повторяемого POD-дизайна, меж-POD-соединений, bisection bandwidth и failure domain.
  • Связь сетевой архитектуры с locality-aware scheduling и размещением распределенных задач
Глава 4. Ethernet и InfiniBand
  • Сравнение InfiniBand и Ethernet/RoCEv2 по архитектуре, управлению, масштабированию и экосистеме.
  • Описание Lossless Ethernet, L2/L3-фабрик, underlay/overlay и подходов Ultra Ethernet.
  • Описание сценариев, где важнее вертикально интегрированное решение или открытая мультивендорная среда.
Глава 5. NIC, SmartNIC и DPU
  • Описание архитектуры NIC, SmartNIC и DPU, включая очереди, Traffic Classes, GPUDirect RDMA и телеметрию.
  • Сравнение ConnectX, BlueField, AMD Pensando и Huawei Intelligent NIC/DPU.
  • Определение задач, которые следует оставлять на CPU, переносить на NIC или выносить на DPU.
Глава 6. Коммутаторы AI Fabric
  • Описание switching ASIC, port radix, буферов, Cut-Through, ECMP и адаптивной балансировки.
  • Сравнение NVIDIA Spectrum/Quantum, Broadcom Tomahawk/Jericho, Huawei CloudEngine и white-box SONiC.
  • Разбор влияния ASIC, буферной модели и механизмов телеметрии на поведение AI-фабрики под нагрузкой.
Глава 7. Методика выбора сетевой архитектуры
  • Последовательное проектирование сетей для кластеров на 16, 128, 1 024, 10 000 и 100 000+ GPU.
  • Выбор топологии, числа NIC, коммутаторов, oversubscription и модели отказоустойчивости.
  • Формирование итогового чек-листа архитектурного решения.
Модуль 3. Технологии RDMA, RoCEv2, PFC, ECN, MRC и протокол SRv6

Глава 1. Основы RDMA
  • Описание Kernel Bypass, Zero Copy, Memory Registration, DMA, Queue Pair и Completion Queue.
  • Сравнение RDMA Read, Write, Send/Receive и Atomic с точки зрения обмена данными между GPU-серверами.
  • Разбор жизненного цикла RDMA-соединения и требований к приложению, ОС и NIC.
Глава 2. Архитектура RoCEv2
  • Описание инкапсуляции RDMA в Ethernet, IP и UDP, структуры заголовков и идентификаторов
  • Разбор прохождения RoCEv2-пакета через маршрутизируемую фабрику.
  • Требования к MTU, QoS, DSCP/PCP. Маршрутизация и требования к настройке NIC и коммутаторов.
Глава 3. Lossless Ethernet и PFC
  • Описание DCB, Priority Flow Control (PFC), ETS и задания приоритетов для RDMA-трафика.
  • Разбор механизма Pause по отдельным классам трафика и его влияния на очереди.
  • Анализ Head-of-Line Blocking, PFC Storm, deadlock и ограничений lossless-подхода.
Глава 4. ECN и управление перегрузкой
  • Описание маркировки ECN, генерации CNP и замкнутого контура регулирования скорости отправителем.
  • Рассмотрение порогов очередей и DCQCN-подобных алгоритмов.
  • Разбор совместной работы ECN, PFC и аппаратных механизмов congestion control в NIC.
Глава 5. MRC и масштабируемый multipath transport
  • Анализ ограничений классического Reliable Connection при росте числа GPU, QP и одновременных потоков.
  • Описание Multipath Reliable Connection и распределения трафика по нескольким путям.
  • Оценка влияния multipath на отказоустойчивость, загрузку фабрики и переупорядочивание пакетов.
Глава 6. Балансировка трафика
  • Сравнение ECMP, resilient hashing, Packet Spraying и Adaptive Routing.
  • Описание flow polarization, hash collision и packet reordering.
  • Связь алгоритма балансировки с транспортом, телеметрией и топологией AI-фабрики.
Глава 7. SRv6 в AI Data Center
  • Описание Segment Routing Header, SID, Network Programming, Traffic Engineering и Fast Reroute.
  • Применение SRv6 для распределения трафика между POD, выбора fabric plane (комплект оборудования + контроллер) и построения сервисных цепочек.
  • Разбор телеметрии, изоляции и межкластерного транспорта на основе SRv6.
Глава 8. Проектирование и диагностика транспортной сети
  • Сведение MTU, QoS, PFC, ECN, маршрутизации, multipath и параметров NIC в единую конфигурационную модель.
  • Описание счетчиков и признаков packet loss, congestion, PFC storm и неравномерной балансировки.
  • Разбор последовательности диагностики деградации коллективных операций.
Модуль 4. Linux, Kubernetes, программный стек, LLM и основы AgentOps

Глава 1. Linux для AI-узлов
  • Описание NUMA, HugePages, CPU Pinning, IRQ Affinity, PCIe locality и interrupt moderation.
  • Разбор привязки процессов, GPU и NIC к NUMA-доменам.
  • Оценка влияния настроек Linux на пропускную способность GPU-NIC и стабильность RDMA.
Глава 2. Kubernetes для AI Platform
  • Описание Control Plane, Worker Node, CRI, CNI, CSI и Scheduler в контексте GPU-кластера.
  • Разбор GPU Operator, Device Plugin, Node Feature Discovery и RDMA Device Plugin.
  • Рассмотрение topology-aware scheduling, квот, изоляции и размещения распределенных задач.
Глава 3. Open-source программный стек AI
  • Обзор PyTorch, TensorFlow, JAX, Ray, DeepSpeed, Megatron-LM, UCX и OpenMPI.
  • Описание взаимодействия фреймворка, runtime, коммуникационной библиотеки, драйвера GPU и RDMA-сети.
  • Сопоставление компонентов стека для обучения, инференса и распределенного выполнения.
Глава 4. Коллективные коммуникации
  • Описание Broadcast, Reduce, AllReduce, AllGather, ReduceScatter и All-to-All.
  • Сравнение Ring, Tree, Hierarchical и topology-aware алгоритмов.
  • Разбор влияния сетевой топологии, числа rail и размера сообщения на время коллективной операции.
Глава 5. Распараллеливание обучения LLM
  • Описание Data, Tensor, Pipeline, Sequence, Expert и Hybrid Parallelism.
  • Разбор коммуникационного профиля каждого метода и размещения rank по GPU и узлам.
  • Оценка влияния сети на обучение MoE-моделей и крупномасштабных LLM.
Глава 6. Распределенный инференс LLM
  • Описание стадий Prefill и Decode, KV Cache, Continuous Batching, Prefix Cache и Paged Attention.
  • Обзор vLLM, SGLang, TGI и TensorRT-LLM.
  • Разбор disaggregated inference с разделением Prefill- и Decode-узлов и его сетевых требований.
Глава 7. Интеграция стеков и введение в AgentOps
  • Описание сквозного пути запроса от Kubernetes Pod и AI-фреймворка через NCCL/RCCL, UCX и RDMA к удаленному GPU.
  • Введение в архитектуру AI-агента: LLM, planner, tools, RAG, memory и agent workflow.
  • Описание agent trace и причин, по которым метрик обычного инференса недостаточно для эксплуатации агентных систем.
Модуль 5. Эксплуатация AI Platform, MLOps и AgentOps

Глава 1. Мониторинг AI Platform
  • Обзор Prometheus, Grafana, DCGM, Node Exporter, streaming telemetry, gNMI, INT и sFlow.
  • Описание единой модели метрик GPU, CPU, NIC, коммутаторов, хранилища и приложений.
  • Связь инфраструктурных показателей с производительностью обучения и инференса.
Глава 2. Диагностика сети AI
  • Описание диагностики RoCE, PFC, ECN, packet loss, congestion, PFC storm и неравномерной балансировки.
  • Разбор счетчиков NIC и коммутаторов, packet capture, NCCL debug и synthetic tests.
  • Формирование последовательности локализации неисправности по слоям.
Глава 3. Жизненный цикл моделей и AI-агентов
  • Описание жизненного цикла модели и агентного приложения: данные, обучение, registry, prompts, tools, agent graph, deployment и monitoring.
  • Версии моделей, prompts, инструментов, памяти, policy и evaluation datasets.
  • Разделение ответственности между разработкой, платформенной командой и эксплуатацией.
Глава 4. MLOps и AgentOps
  • Сравнение MLOps, LLMOps и AgentOps и управляемых ими артефактов.
  • Описание tracing агентного запроса: LLM calls, retrieval, tool calls, memory, retries и межагентные взаимодействия.
  • Обзор evaluation, метрик качества, latency и стоимости, а также OpenTelemetry, OpenInference, Langfuse, Phoenix и governance.
Глава 5. CI/CD, GitOps и evaluation pipelines
  • Описание GitHub Actions, GitLab CI, Tekton, Argo CD и GitOps для моделей и агентных приложений.
  • Разбор regression testing, Canary, Shadow, A/B, Blue-Green и rollback.
  • Контроль версий модели, prompt, toolset, agent graph, policy и evaluation-наборов.
Глава 6. Эксплуатация и надежность AI Platform
  • Описание отказов GPU, NIC, коммутаторов, rail, rack, POD и агентных сервисов.
  • Рассмотрение SLA, SLO, SLI, capacity planning, резервирования, security и policy-as-code.
  • Формирование регламента обновлений и реагирования на инциденты.
Глава 7. Итоговое проектирование End-to-End AI Platform
  • Последовательное проектирование фабрик на 16, 256, 2 048 и 100 000+ GPU.
  • Сведение выбора серверов, ускорителей, NIC, коммутаторов, топологии, транспорта, программного стека, MLOps и AgentOps.
  • Формирование итоговой архитектурной схемы и чек-листа приемки решения.

! Данный курс может быть заказан согласно 44-ФЗ, 223-ФЗ (закупка, аукцион, запрос котировок, конкурсные процедуры)

Доступные формы обучения
Описание фомата

Очная форма – это классическая форма обучения. Студенты посещают занятия в специально оборудованном классе на территории учебного центра в соответствии с установленным расписанием.

Занятие длится 8 академических часов в день, стандартное время начала обучения – 10:00.

Преимущество очного обучения – это личный контакт с тренером-преподавателем и с остальными студентами курса. Во время обучения студенты сдают лабораторные работы вендоров, к которым предоставляется доступ, а также лабораторные работы, специально разработанные тренерами-преподавателями. Обучающиеся выполняют практические занятия, получая доступ к оборудованию или при помощи его эмуляции.

Описание фомата

Дистанционное (онлайн) обучение проводится с применением Системы Дистанционного обучения УЦ Микротест - системы Mirapolis. По форме и содержанию дистанционное обучение полностью совпадает с аналогичными очными курсами.

Занятие длится 8 академических часов в день, стандартное время проведения обучения с 10:00 до 17.00.

Обучение проходит в реальном времени с преподавателем. В процессе обучения вы сможете задавать вопросы – в чате или голосом во время занятия. В зависимости от программы курса, каждому студенту предоставляется доступ к стенду с лабораторными работами. Для закрепления материала курса вам будут доступны записи прошедших вебинаров в вашем личном кабинете в ЛК Mirapolis.

Данный формат обучения позволяет существенно сократить командировочные издержки.

Расписание курса
Выберите удобную для вас дату
дек 2026
07 дек - 11 дек
Москва
Очная Очная
Преподаватель курса
Ожидается назначение
Стоимость
275 000 RUB
дек 2026
07 дек - 11 дек
Москва
Дистанционная Дистанционная
Преподаватель курса
Ожидается назначение
Стоимость
275 000 RUB
фев 2027
15 фев - 19 фев
Москва
Дистанционная Дистанционная
Преподаватель курса
Ожидается назначение
Стоимость
275 000 RUB
фев 2027
15 фев - 19 фев
Москва
Очная Очная
Преподаватель курса
Ожидается назначение
Стоимость
275 000 RUB
Если в расписании нет удобных для Вас дат, напишите нам - мы разработаем удобные варианты специально для Вас!
Слушатели рекомендуют нас
yandexКод PHP">
5.0
googleКод PHP">
5.0
FAQ

Онлайн обучение реализуется в Системе Дистанционного Обучения УЦ Микротест — Mirapolis и проходит в реальном времени с преподавателем. За несколько дней до начала обучения вы получаете необходимые ссылки для подключения к курсу и доступ к Личному кабинету.

Более подробно вы можете ознакомиться с информацией на странице дистанционного обучения.

Если у вас остались вопросы, то обратитесь к нам любым удобным для вас способом (тел. +7(495) 231-23-51 или training@training-microtest.ru), и мы ответим на все ваши вопросы.

Очное обучение проходит на территории Учебного центра Микротест по адресу: 127083, г. Москва, ул. Мишина, дом 35

За несколько дней до начала обучения участник получает приглашение, в котором указан адрес места проведения и другая полезная информация для обучения.

Если вы не получили приглашение — обратитесь к нам любым удобным для вас способом (тел. +7(495) 231-23-51 или training@training-microtest.ru), и мы ответим на ваши вопросы и продублируем приглашение на вашу почту.

  1. Обучение проходит в реальном времени с преподавателем, вы можете задавать свои вопросы и разбирать интересные кейсы сразу в процессе обучения.
  2. Вашу учебную группу будет сопровождать координатор, которому можно задавать организационные вопросы.
  3. Если вы по каким-то причинам пропустили онлайн-занятие, то все записи будут доступны 24/7 в вашем личном кабинете в Системе Дистанционного Обучения. Также вы можете их использовать для закрепления материала.
  4. Дополнительно для вашего удобства мы создаем чат в Telegram вашей группы, где вы сможете задавать вопросы преподавателю, координатору и обмениваться опытом с коллегами по обучению.

По итогу прохождения обучения слушатели получают либо Сертификат Учебного центра о прохождении курса, либо Удостоверение о повышении квалификации, зарегистрированное в ФРДО (Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении).

Помимо этого, по факту прохождения авторизованных курсов вендоров Eltex, PostgresPro, Astra Linux, QTECH, АЭРОДИСК и др. выдается электронный сертификат вендора.

В основном корпусе в Москве по адресу ул. Мишина, дом 35. Рядом муниципальная платная парковка на всех прилегающих улицах.

По поводу остальных филиалов и корпусов — уточняйте информацию у наших менеджеров. Мы постараемся сделать всё возможное для вашего комфортного обучения.

Да, во время занятий для слушателей всегда доступны чай, кофе, печенье и другие снеки на кофе-брейках.

Наш центр работает с корпоративными и частными клиентами. Для каждой категории клиентов мы разработали различные варианты сотрудничества, позволяющие гибко подходить к ценообразованию и вариантам оплаты.

Обо всех специальных условиях читайте в разделе Спецпредложения или обратитесь к нам любым удобным для вас способом (тел. +7(495) 231-23-51 или training@training-microtest.ru)

Также подпишитесь на новости нашего учебного центра, где вы первыми узнаете про интересные предложения от нас.

Не нашли подходящиего курса?
Оставьте заявку на обучение для вашей организации
Почему выбирают обучение у нас
Техническая
экспертиза

Эксперты в обучении:

  • Сети передачи данных и связь
  • ОС Linux и платформы виртуализации
  • Центры обработки данных и СХД

Опытные преподаватели с мультивендорной экспертизой

Расширенный лабораторный полигон для практики

Подготовка ИТ-специалистов по государственным профессиональным стандартам

Образовательный девелопер

Проектирование и реализация мультивендорных образовательных решений, программ «под ключ»

Разработка и реализация технологических решений для оценки компетенций: тесты, лабораторные полигоны и стенды

Большой опыт создания технологических партнерств с ИТ-вендорами, дистрибьюторами и крупными интеграторами

Пул экспертов в управлении образовательными проектами + разработчики, методологи, педагогические дизайнеры

Подпишитесь и будьте в курсе
Информация о новинках, скидках и акциях. Уже более 36 000 подписчиков!