Почему гарантия на GPU не заменяет приемку. Проверяем два сервера Supermicro

Клиент приобрел два сервера Supermicro AS-4125GS-TNRT. Каждый с двумя AMD EPYC 9274F и парой NVIDIA RTX PRO 6000 Blackwell на 96 ГБ.

Оборудование поставлялось с гарантией производителя. Казалось бы, включил и работай. Но гарантия не защищает от дефектов, которые проявляются только под нагрузкой или после нескольких суток непрерывной работы.

Поэтому перед передачей заказчику оба сервера прошли комплексную проверку. В ServerICT мы считаем такие проверки обязательной частью подготовки GPU-серверов к эксплуатации.

Вот что из этого вышло.

Гарантия производителя не означает, что все работает как надо

Современный GPU проходит четыре стадии: формирование кристалла на TSMC, упаковка с HBM-памятью, тепловой прожиг и финальная проверка. На каждом этапе — потери.

Джейсон Хоффман, физик-исследователь с опытом в Гарварде и Аргоннской национальной лаборатории, подробно разбирает эту цепочку. При умеренных потерях на каждом этапе совокупный выход годных модулей около 75%. При освоении нового техпроцесса падает до 60% и ниже.

Все эти потери уже зашиты в цену каждого проданного GPU. Покупатель платит за отбракованные экземпляры, просто никогда их не видит. Но часть дефектов до покупателя все же добирается. Потому что не весь брак виден при стандартной приемке, он проявляется позже: когда нагрузка устойчивая, температура вышла на рабочий режим, несколько компонентов работают одновременно.

Puget Systems, крупный американский интегратор, в 2021 году опубликовал интересный отчет: 15% партии Quadro RTX 4000 прошли заводской контроль NVIDIA, но не прошли их собственную приемку. Причина — заводской дефект порта, который проявлялся только в реальной работе. Продажи остановили.

Что бывает, если не проверить

Introl документирует такой случай: производственный AI-кластер встал через 72 часа после развертывания. Всего 2 000 GPU H100, синхронные задачи обучения, тепловая аккумуляция. Приемочный стресс-тест длился четыре часа при неполной нагрузке, и этого не хватило.

Есть сценарий хуже видимого отказа. Дефектная HBM-память не вызывает краша. Счетчики ECC фиксируют исправленные ошибки, модель обучается, метрики выглядят нормально. Но веса постепенно деградируют. Обнаруживается это при оценке качества, когда уже потеряны дни или недели работы.

Что мы проверяем и зачем

Мы прошли семь направлений на обоих серверах:

  1. Платформа и питание. BMC собирает данные со всех датчиков шасси. RTX PRO 6000 Blackwell потребляет до 600 Вт на карту. Нестабильный блок питания при пиковой нагрузке перезагрузит сервер прямо в ходе обучения, с потерей прогресса с последнего чекпоинта.
  2. NVMe SMART и RAM. Дефектный диск с битыми блоками или упавшей скоростью чтения заставляют GPU простаивать в ожидании данных. В худшем случае сервер полностью зависает при попытке сохранить чекпоинт.
  3. PCIe. Сбои в линиях снижают пропускную способность: мощный GPU простаивает в ожидании данных от CPU.
  4. NVLink. Если NVLink неисправен, обмен между GPU идет резервными путями. Это долго и не всегда стабильно.
  5. ECC и память. Двухбитовые нескорректированные ошибки означают аппаратный сбой, данные не восстановить. ECC-счетчики выявляют такую память до запуска в продуктив.
  6. Стресс-тест. Дефект монтажа теплоотвода не виден при осмотре. Под нагрузкой температура упирается в лимит, драйвер снижает частоты. Сервер работает, производительность падает до 60% от паспортной, и без мониторинга это никак не заметить.
  7. VBIOS. Рассинхронизация версий прошивок между узлами кластера порождает плавающие баги: воспроизводимость случайная, симптомы неустойчивые. Проверка до отгрузки закрывает этот класс рисков целиком.

Нюанс с архитектурой Blackwell

Чипы на архитектуре Blackwell — относительно свежее поколение. Первые месяцы в сообществе выявили специфические проблемы с GSP-прошивкой. На форумах NVIDIA зафиксированы проблемные случаи при длительном инференсе: GPU уходит в невосстанавливаемое состояние, которое лечится только полным выключением питания. Воспроизводится при 28°C — программно-аппаратный баг, не тепловая проблема.

Поэтому при тестировании недостаточно просто убедиться, что карты работают. Нужно проверить совпадение версий VBIOS на обоих серверах. Рассинхронизацию при кластеризации потом очень сложно диагностировать.

Как мы работали

Электролимит на складе не позволял выйти на полную мощность, пришлось адаптировать программу тестирования под реальный потолок. Типичная ситуация для предотгрузочных проверок вне дата-центра.

Работали удаленно: стенд с remote access, SSH и IPMI. Все выполняется дистанционно. Физически нужно только подключить стенд.

Дефектов не нашли. Оба сервера Supermicro прошли проверку и ушли к клиенту с документированными результатами по каждому направлению.

Подробнее о том, как именно проверять GPU-серверы до запуска, какие инструменты использовать и какие метрики смотреть, читайте в полном материале по ссылке.

Почему гарантия на GPU не заменяет приемку. Проверяем два сервера Supermicro