NVIDIA представила революционную технологию MRC (Multipath Reliable Connection) для сетевой архитектуры Spectrum-X Ethernet, которая обещает ликвидировать одно из самых болезненных узких мест в AI-датацентрах. Проблема не в дефиците чипов, а в том, что даже самые мощные системы простаивают из-за задержек в сети.
MRC позволяет одному RDMA-соединению использовать несколько маршрутов одновременно, динамически перераспределяя нагрузку и обходя перегруженные участки. Это не просто оптимизация — это вопрос миллионов долларов экономии. По данным NVIDIA, даже кратковременные задержки в сети могут останавливать обучение больших языковых моделей, что приводит к простоям тысяч GPU стоимостью до 500 тысяч долларов в месяц. Технология MRC уже прошла проверку в production на базе Spectrum-X и теперь открыта для сообщества через Open Compute Project.
В её разработке приняли участие не только NVIDIA, но и AMD, Broadcom, Intel, Microsoft и OpenAI — редкий случай, когда конкуренты объединяются ради общей цели.
Специалисты отмечают, что MRC делает сеть таким же критически важным компонентом AI-фабрики, как графические процессоры или SuperNIC. Теперь инженеры могут забыть о том, что часть кластера простаивает из-за сетевых заторов. Система автоматически перераспределяет трафик, минимизируя риски простоев и ускоряя обучение моделей.
По словам представителей NVIDIA, внедрение MRC может сократить время обучения на 20-30%, что в масштабах дата-центра с сотнями тысяч GPU оборачивается миллионами сэкономленных долларов. Эксперты индустрии считают, что MRC станет новым стандартом для AI-датацентров.
Технология уже интегрирована в Spectrum-X и доступна для заказчиков NVIDIA. Открытая спецификация через Open Compute Project позволяет другим вендорам и дата-центрам адаптировать MRC под свои нужды, что ускоряет её внедрение по всему миру. В ближайшие годы этот протокол может стать таким же обязательным элементом инфраструктуры, как NVLink или InfiniBand.