К обсуждениям

ConnectX‑4: High temperature и Surprise Link Down — когда остановить нагрузку

Редакция VOne Технологии

Как связать по времени сообщение mlx5_core High temperature, поднятие высокоскоростного линка и PCIe Surprise Link Down, не повторяя стресс-тест и не меняя airflow без vendor-границ.

Сначала прекратите повторную нагрузку

Если mlx5_core уже записал High temperature, а система потеряла PCIe link или перезагрузилась, не поднимайте высокоскоростной линк снова ради подтверждения. Сохраните питание в безопасном состоянии по процедуре владельца оборудования и дайте компонентам остыть. NVIDIA документирует автоматический thermal shutdown ConnectX‑4 при high-temperature event, нарушении теплового контакта или снятии радиатора. Это подтверждает защитный механизм, но не доказывает, что именно расположение соседней карты вызвало конкретное событие.

Постройте временную шкалу без нового теста

Из уже существующих журналов выпишите время поднятия линка, первое сообщение High temperature, health-compromised event, Surprise Link Down или AER и перезагрузку. Добавьте только уже записанные температуры, скорость линка и workload state. Не публикуйте MAC, IP, топологию сети и полные kernel logs. Если high-temperature предшествует link down, последовательность согласуется с тепловой веткой, но причинность требует vendor/OEM анализа. Если порядок обратный или временные отметки не совпадают, не объединяйте события в один диагноз.

Проверьте точные варианты карт

Запишите точный OPN ConnectX‑4, тип радиатора и наличие active или passive cooling у каждой соседней карты. AMD указывает, что пассивные Alveo U200/U250 нельзя питать без принудительного airflow и что альтернативное направление потока допустимо только в протестированной OEM-конфигурации. Поэтому фотографии корпуса и общая фраза «вентилятор работает» недостаточны. Нужны vendor datasheet, поддерживаемая конфигурация workstation, направление потока и фактическая роль кожухов, а не универсальный совет переставить карты.

Передайте решение владельцу платформы

Не устанавливайте самодельный вентилятор, не снимайте радиатор и не переставляйте карты под нагрузкой. Перед любым изменением сохраните slot map, power requirements, cooling type, firmware versions, ambient conditions и журнал события; затем сверяйте план с OEM или квалифицированным инженером. После одобренного изменения проверка должна начинаться с мониторинга на минимальной штатной нагрузке и заранее заданного температурного stop threshold из документации конкретного OPN. Без такого порога и независимого наблюдения повторный 100G-тест не является безопасной диагностикой.

Материал подготовлен редакцией VOne с применением ИИ для stop-first чек-листа; thermal shutdown и airflow requirements вручную сверены с руководствами NVIDIA и AMD, без повторения опасного теста.

Источники и проверка

Информация актуальна на дату публикации. Правила сервисов, приложений и сетей могут меняться.

Ответы

0 опубликовано
Ответов пока нет. Вы можете начать обсуждение.

Ваш ответ

Добавьте свой опыт или уточнение по теме.

Вы публикуете как Аноним Аватар отличает разговоры, но не раскрывает личные данные.

Ответ появится сразу. Не публикуйте личные данные, ключи и приватные ссылки.