Абстрактный
Поскольку искусственный интеллект (ИИ) быстро развивается, традиционные сети центров обработки данных сталкиваются с серьезными проблемами при передаче трафика ИИ. Высокая загрузка полосы пропускания и небольшое количество сложных потоков могут сделать традиционную балансировку нагрузки по-потокам неэффективной, что приведет к перегрузкам и потерям пакетов, что значительно увеличит время обучения модели ИИ и время выполнения заданий. В этом техническом документе рассматривается технология динамической интеллектуальной маршрутизации, которая сочетает-информацию в реальном времени с интеллектуальным принятием решений-. Он использует измерение качества пути-, синхронизацию расширенных-атрибутов BGP, динамическую взвешенную-многопутевую стоимость (WCMP), удаление ненормального-пути и
Автоматическая балансировка нагрузки (ALB) на уровне Flowlet- для улучшения планирования трафика в средах искусственного интеллекта. В проекте также используется виртуализация для обеспечения изоляции нескольких-арендаторов, а также предлагаются сценарии приложений и рекомендации по планированию эффективных, стабильных и интеллектуальных сетей центров обработки данных с искусственным интеллектом.
Введение: Эволюция сети в сфере искусственного интеллекта Эра
Почему традиционные сети борются с ИИ Трафик
В традиционных сетях центров обработки данных большое количество небольших потоков позволяет распределять нагрузку по-потокам для достижения приемлемого распределения и предотвращения перегрузок даже без информации в-режиме времени о состоянии сети. Трафик ИИ совсем другой: загрузка полосы пропускания чрезвычайно высока, а в трафике часто доминируют лишь несколько слоновьих потоков. Таким образом, коллизии хэшей могут привести к тому, что несколько крупных потоков попадут на один и тот же путь, в то время как другие пути останутся недостаточно используемыми. В случае потери пакетов время завершения всей рабочей нагрузки ИИ может значительно увеличиться. По этой причине отрасль все больше внимания уделяет оптимизированным алгоритмам-балансировки нагрузки для фабрик искусственного интеллекта, чтобы трафик распределялся более равномерно по нескольким путям.

Рис. 1. Сравнение трафика слонового-потока AI и традиционного трафика с небольшим-потоком.
Сочетание динамической осведомленности с интеллектуальным принятием решений-
Динамическая интеллектуальная маршрутизация – это технология-распределения нагрузки-на основе осведомленности. Он использует качество пути, определяемое коммутаторами в фабрике, для настройки выбора локального пути и поддерживает динамически взвешенную балансировку нагрузки. Эта технология, основанная на BGP, определяет новый расширенный атрибут-сообщества.
Многомерные, высокоточные-измерения используются для оценки качества пути, а результат распространяется через BGP для управления последующей пересылкой трафика. Это улучшает-распределение нагрузки по всей сети и сокращает время отклика приложений [1].

Рисунок 2. Динамическое понимание, принятие решений и рабочий процесс.
Основные технологии: интеллектуальное планирование трафика
Основные подходы к балансировке сетевой нагрузки- включают в себя:
- По-поточный ECMP: наиболее распространенный подход, основанный на пяти-хеш-кортежах. Он хорошо работает, когда имеется много потоков, и сохраняет порядок пакетов, но коллизии хэшей могут привести к плохой балансировке, когда количество потоков невелико, как при обучении ИИ [1].
- Балансировка на основе-потоков: зависит от правильной настройки зазора между-потоками. Точная настройка затруднена, если неизвестна задержка на уровне глобального пути-[1].
- По-пакетный ECMP: обеспечивает отличный теоретический баланс, но может привести к значительному переупорядочению пакетов на получателе [1].
Подход к динамической интеллектуальной маршрутизации, используемый коммутаторами XingRongyuan CX-N серии RoCE (на базе SONiC-), сочетает в себе балансировку на основе -потоков ECMP и Flowlet-. Он представляет динамический WCMP (многопутевой доступ с взвешенной стоимостью) и ALB на основе Flowlet- (автоматическая балансировка нагрузки) [1].
Измерение качества пути
Система оценивает качество сетевого пути, используя факторы, которые сильно влияют на структуру кластера AI, включая использование полосы пропускания, использование очередей и задержку пересылки.
Статистические счетчики
Пропускная способность и использование очереди измеряются аппаратными счетчиками ASIC с точностью до сотен-миллисекунд. ASIC записывает счетчики-переадресации портов и очереди-переадресации в режиме реального времени. Плоскость управления SONiC считывает счетчики через интерфейс SAI с точностью до секунды и сохраняет их в Redis. Процесс управления маршрутизацией- оценивает качество интерфейса с помощью этих счетчиков и объявляет результат через BGP. Чтобы ограничить нагрузку на контрольную-плоскость, рекламные объявления в настоящее время рассылаются с интервалами второго-уровня, при этом к нескольким выборкам применяется средневзвешенное значение; более поздние образцы получают больший вес.
Внутри-диапазонная телеметрия
Измерение-задержки пересылки основано на INT (внутриполосная сетевая телеметрия) и может достигать точности наносекундного-уровня. HDC (High Delay Capture) захватывает пакеты с большой задержкой внутри ASIC. Когда пакет превышает порог задержки,-определенный пользователем, коммутатор отправляет сборщику первые 150 байтов исходного пакета вместе с метаданными, включая входящий порт, выходной порт и задержку. В этой конструкции ЦП действует как сборщик и анализатор HDC, обеспечивая высокую-точность измерения-задержек при пересылке и более точную оценку-качества пути.

Рисунок 3. Распространение качества пути-и установка WCMP.
В этой технологии используется новый атрибут расширенного-сообщества BGP — расширенное сообщество пропускной способности пути, чтобы указать совокупное качество пути к месту назначения. Старший-байт поля расширенного-типа – 0x00, а младший-байт — 0x05. В поле значения подполе «Глобальный администратор» представляет номер AS. Качество пути кодируется четырьмя байтами с использованием формата плавающей-точки IEEE и выражается в ГБ/с.
Когда NIC1 связывается с NIC2, NIC2 сначала объявляет свой IP-адрес Leaf2. Leaf2 объявляет адрес Spine вместе со значением качества канала-по отношению к NIC2, умноженным на вес нисходящего канала Leaf2. Spine добавляет свое собственное взвешенное качество канала и передает накопленное значение в Leaf1. Leaf1 суммирует качество пути и устанавливает маршруты, которые направляют пересылку. В двухуровневой структуре -Leaf-Spine порты классифицируются как восходящие каналы Leaf, нисходящие каналы Leaf и порты Spine с настраиваемыми расчетными коэффициентами для каждого класса.
Динамический WCMP
Балансировка нагрузки распределяет трафик по нескольким каналам. В средах искусственного интеллекта это важно для создания структуры Ethernet без потерь с минимальными потерями пакетов, задержкой и снижением пропускной способности. ECMP – это традиционный механизм в центрах обработки данных. WCMP расширяет ECMP, распространяя
трафик пропорционально по ссылкам. При динамической интеллектуальной маршрутизации веса WCMP корректируются в реальном времени в зависимости от качества пути. Например, если между NIC1 и NIC2 существуют два пути, система может рассчитать соотношение 3:7. По мере изменения трафика обновленная информация о качестве пути- передается через BGP на каждый конечный коммутатор, где генерируются динамические маршруты WCMP для управления пересылкой.
Удаление аномального пути
Когда совокупное качество пути падает ниже согласованного порога, путь считается непригодным для рабочей нагрузки ИИ и удаляется из пересылки. Остальные пути продолжают передавать трафик через динамический WCMP. Как только путь возвращается в нормальное состояние, он восстанавливается. Хотя это может временно оставить некоторую емкость неиспользованной, это предотвращает более серьезную перегрузку и потерю пакетов [1].
Интеллектуальная балансировка нагрузки (ALB)
ALB обеспечивает распределение нагрузки на основе-Flowlet. ASIC измеряет нагрузку и задержку на разных портах в режиме реального времени и направляет каждый Flowlet на канал с меньшей нагрузкой или меньшей задержкой. Это обеспечивает более детальное-детализированное планирование поверх традиционного ECMP. ALB также поддерживает аварийное переключение портов и автоматически перераспределяет трафик при выходе из строя исходящего канала [1].
Виртуализация
В интерфейсных сетях-часто требуется поддержка нескольких-клиентов, чтобы разные ресурсы графического процессора могли быть выделены разным пользователям. Решение использует VRF (виртуальную маршрутизацию и пересылку) для изоляции клиентов, при этом каждому пользователю назначается один VRF. Подсети,-связанные с графическим процессором, помещаются в VRF пользователя, а списки ACL PRE в ASIC классифицируют входящий трафик так, что трафик каждого пользователя пересылается только в пределах соответствующего VRF [1].
Сценарии применения
1. Как динамический WCMP поглощает скачки трафика
Для структуры с 256 портами графического процессора x 400G можно спроектировать двух-архитектуру Clos с коэффициентом конвергенции нисходящего канала-к-восходящего канала 1:1 для поддержания высокой пропускной способности, высокой пропускной способности и симметричной емкости. Подходящие модели продукта включают XingRongyuan CX864E-N или CX732Q-N [1]. При использовании обычного ECMP небольшое количество потоков AI-слонов может хешироваться в одном и том же Spine, что приводит к перегрузке восходящего канала или потере пакетов. Динамический WCMP постоянно корректирует распределение трафика в соответствии с качеством пути в-режиме реального времени, уменьшая скачки трафика и избегая перегрузок [1].
2.Flowlet-Уровень балансировки нагрузки
В одной и той же структуре графических процессоров 256 x 400G не каждое устройство или рабочая нагрузка лучше всего обслуживается динамическим WCMP. Коммутатор может динамически выбирать ALB на основе Flowlet-. ALB измеряет нагрузку и задержку каналов в группе ECMP и отправляет Flowlets на каналы с меньшим использованием или задержкой. Если интерфейс перегружен или его задержка пересылки увеличивается, ASIC автоматически избегает этого выхода до тех пор, пока условия не вернутся в норму [1].
Планирование и проектирование сетей искусственного интеллекта
Услуги ИИ обычно включают три этапа: сбор и предварительная обработка данных, обучение модели и вывод ИИ. Каждый этап предъявляет к сети разные требования.
1. Сбор и предварительная обработка данных.
Глобальная сеть-сбора и предварительной обработки данных обучения должна предоставлять крупномасштабные-эластичные ресурсы общедоступного IP-адреса и пропускной способности, чтобы можно было эффективно собирать огромные наборы необработанных данных из глобального Интернета. Конструкция должна обеспечивать безопасную и стабильную передачу, одновременно улучшая производительность агрегации данных и предварительной обработки [2].
1.1 Сегментация VPC
Проект VPC для сбора данных в облаке-должен следовать принципам минимальных-привилегий, многоуровневой изоляции, контроля безопасности и эластичного масштабирования. Можно использовать либо несколько VPC, либо несколько подсетей внутри одного VPC [2].
- Сегментация по этапам обслуживания: разверните сбор, предварительную обработку, хранение, обучение и вывод данных в отдельных подсетях или VPC. Разместите точки входа сбора в DMZ VPC или общедоступную подсеть; разместить предобработку и временные данные в выделенном VPC для обработки; размещайте конфиденциальные необработанные данные и обучение ИИ в VPC с высоким-защищенным доступом без прямого публичного доступа.
- Изолируйте по уровню безопасности: создавайте VPC или подсети с высоким-, средним{1}} и низким-безопасностью и используйте группы безопасности, сетевые списки управления доступом (ACL) и частное подключение для управления трафиком между-VPC и меж-подсетями.
- Изолировать по арендатору или проекту: назначьте отдельные VPC разным арендаторам или проектам для изоляции ресурсов, сетей и данных.
1.2 Выходная сеть сбора данных
Шлюз NAT: используйте пул EIP и SNAT через шлюз NAT, позволяя программам сбора получать доступ к Интернету со случайно выбранных общедоступных IP-адресов.
Самостоятельно созданный-прокси-сервер: разверните прокси-серверы, которые поддерживают сопоставление между процессами сбора данных и общедоступными IP-адресами, а также распределяйте один запрос на сбор данных между несколькими прокси-серверами.
Поставщик IP-услуг: подключитесь к поставщику IP-услуг через частную облачную сеть для снижения затрат, контролируемой безопасности и стабильного качества [2].
1.3 Межрегиональное агрегирование и предварительная обработка данных-данных
Выберите регион OSS в соответствии с планом кластера предварительной обработки-и создайте VPC-агрегации данных в том же регионе. Создайте транзитный маршрутизатор (TR) в каждом регионе, подключите локальные VPC и соедините между собой TR, чтобы VPC регионального сбора могли напрямую обращаться к центральному OSS. Такие службы, как PAI-iTAG, MaxCompute и Flink, затем могут выполнять маркировку и предварительную обработку данных в регионе OSS [2].
2. Модельная обучающая сеть
Сеть обучения-модели тесно интегрирована с сетью сбора и предварительной обработки, образуя глобальную структуру, соединяющую облачные центры обработки данных, пограничные узлы и локальные IDC.
Высокоскоростное-межсоединение обеспечивает низкую-задержку и высокую-пропускную способность передачи данных, при этом полоса пропускания, политики безопасности, контроль доступа и аварийное восстановление должны быть разработаны комплексно [2].
- В-региональном-пуле вычислений кластера: транзитный маршрутизатор соединяет несколько VPC в одном регионе. Серверные ENI подключаются к коммутаторам VPC и могут быть настроены на необходимую пропускную способность и RDMA.
- Меж-пул облачных вычислений. Выделенные каналы подключают IDC или другое облако к VPC того же-региона. Облачные VBR Alibaba подключаются к одноранговому устройству на уровне 3 с помощью BGP, BFD и быстрого переключения при отказе для быстрой конвергенции.
Глобальный пул вычислений. Межрегиональные соединения между-TR между регионами предоставляются в соответствии с пиковым межрегиональным трафиком, с дополнительным межрегиональным качеством обслуживания для создания единого пула вычислений для всех регионов [2].
3. Глобальный вывод-Сеть обслуживания
Глобальная сеть вывода выбирает модели развертывания в соответствии с ресурсами и облачными сервисами, доступными в каждом регионе, и обеспечивает эффективное распределение и доступ к сервисам [2].
- Развертывание модели или агента. Используйте развертывание MaaS Model Studio, развертывание PAI-EAS или Function Compute PaaS или развертывание IaaS на EGS, ACK, ACS или голой-металлической инфраструктуре Lingjun внутри клиентского VPC.
- Распространение услуг: создайте VPC-распределения логических данных и подключитесь к частным сетям с помощью пиринга VPC, связанных облачных-сервисных VPC или PrivateLink. Разверните ALB или расширенный ALB в качестве точки доступа и прокси-запросов к различным моделям или агентам.
- Доступ к услуге: локальные пользователи Интернета могут получить прямой доступ к расширенному ALB; удаленные пользователи могут использовать Global Accelerator (GA); Внутренние или внешние корпоративные пользователи Alibaba Cloud могут подключаться конфиденциально через PrivateLink.
Заключение и перспективы
В этом информационном документе объясняются проблемы, с которыми сталкиваются сети IDC в эпоху искусственного интеллекта, и то, как динамическая интеллектуальная маршрутизация может их решить. Динамическая осведомленность, интеллектуальное принятие решений,-принятие решений, виртуализация WCMP, ALB и VRF повышают-эффективность балансировки нагрузки, уменьшают перегрузку и потерю пакетов, а также ускоряют обучение и обработку ИИ. В разделе планирования особое внимание уделяется сегментации VPC,-проектированию исходящего сбора данных, межрегиональной агрегации и предварительной обработке, обучению моделей и предоставлению глобальных выводов. Поскольку ИИ продолжает развиваться, к сетям центров обработки данных будут предъявляться более строгие требования. Динамическая интеллектуальная маршрутизация будет продолжать совершенствоваться для периферийного ИИ, федеративного обучения и других сложных сценариев. Будущие сети IDC будут уделять больше внимания конвергенции вычислительных-сетей, энергоэффективности и автоматизации операций, создавая более интеллектуальную, эффективную и надежную основу для цифровой экономики.
Ссылки
Технический исходный документ,-предоставленный пользователем.
Технический документ о сети Alibaba Cloud AI. По состоянию на 27 мая 2026 г.
https://help.aliyun.com/zh/cloud-network-хорошо-архитектурный-design/alibaba-cloud-ai-network-white-paper

