до переліку новин
31
Серп
2026
Серп
2026
31 Серп 2026
Як датацентр проводить технічне обслуговування без відключення клієнтів
Обладнання датацентру працює цілодобово: сервери, системи охолодження, джерела живлення, мережеве обладнання. Усе це зношується, вимагає оновлення прошивок, заміни фільтрів, перевірки батарей.
Для того, щоб проводити ці роботи та не зупиняти клієнтський трафік, центр обробки даних має відповідну архітектуру. Він проєктується так, щоб кожен критичний компонент мав резервний аналог, готовий прийняти навантаження, коли основний виводиться з експлуатації.
Розглянемо, як це працює на рівні живлення, охолодження, мережі та організації робіт персоналу.

Резервування живлення: N+1 і 2N
Основа безперебійної роботи — схема резервування електроживлення. У ЦОД застосовують дві базові моделі.
N+1 означає, що до кількості обладнання, необхідного для покриття навантаження (N), додається один резервний елемент. Якщо для роботи потрібно чотири джерела безперебійного живлення (ДБЖ), встановлюють п'яте.
Коли одне з чотирьох виводиться на обслуговування, п'яте бере на себе його функцію, і сумарна потужність системи не падає нижче необхідного рівня.
2N — повне дублювання. Вся інфраструктура живлення існує у двох незалежних, повністю автономних контурах: два вводи від різних підстанцій, два комплекти ДБЖ, два набори дизель-генераторів. Один контур може повністю зупинитися на обслуговування, а другий у цей час несе повне навантаження.
Це модель, яку використовують датацентри рівня Tier IV за класифікацією Uptime Institute. Вона розрахована на те, що будь-яка окрема відмова обладнання або планове відключення не впливає на клієнтів.
Дизель-генератори при цьому регулярно тестують під навантаженням, щоб переконатися, що вони запустяться і витримають навантаження в разі реальної потреби.
Охолодження без перерв
Сервери безперервно виділяють тепло, і зупинка систем кондиціонування може призвести до їх перегріву.
Тому системи охолодження також дублюють за схемою N+1 або 2N. Кілька незалежних кондиціонерних установок (CRAC/CRAH) обслуговують одну й ту саму залу, і вихід однієї з них на обслуговування компенсують інші.
Додатковий рівень захисту — розділення залів на гарячі та холодні коридори. Це фізична конфігурація стійок, коли гаряче повітря із задньої частини серверів не змішується з холодним повітрям, що подається спереду.
Завдяки такому поділу навіть тимчасове зниження потужності однієї установки не призводить до різкого стрибка температури, бо система має запас часу на компенсацію.

Мережева надлишковість
Мережеве обладнання — комутатори, маршрутизатори, канали зв'язку з провайдерами — також дублюють. Клієнтський трафік підключають щонайменше через два незалежні мережеві шляхи, які фізично прокладені різними трасами й підключені до різних провайдерів верхнього рівня.
Коли інженер оновлює прошивку на комутаторі або замінює модуль, трафік перед цим переводять на резервний шлях за допомогою протоколів динамічної маршрутизації (наприклад, BGP) або механізмів failover на рівні L2/L3.
Клієнт у цей момент може навіть не помітити перемикання. Затримка становить мілісекунди, а пакети не губляться завдяки буферизації й попередньо узгодженим маршрутам.
Планування вікон обслуговування
Резервна архітектура — необхідна, але недостатня умова. Її потрібно доповнити чіткою процедурою планування робіт.
Перед будь-яким втручанням інженерна команда:
- визначає, який саме компонент виводиться з експлуатації і яке резервне обладнання прийме навантаження;
- перевіряє поточний стан резервного контуру — переконується, що він справний і не завантажений понад норму;
- узгоджує час проведення робіт із періодом мінімального навантаження, якщо це можливо;
- інформує моніторингову команду про заплановане відключення конкретного вузла, щоб автоматичні системи оповіщення не сприймали це як аварію;
- проводить роботи поетапно, з перевіркою стабільності системи на кожному кроці, перш ніж переходити до наступного компонента.
Такий підхід називають concurrent maintainability — здатність обслуговувати або замінювати будь-який компонент інфраструктури без зупинки роботи центру обробки даних. Це один із формальних критеріїв, за якими Uptime Institute присвоює рівень Tier III й вище.

Моніторинг у реальному часі
Системи моніторингу відстежують стан кожного компонента інфраструктури: температуру, вологість, напругу, навантаження на канали, стан батарей ДБЖ. Дані оновлюються з інтервалом у секунди.
Це дає дві переваги. По-перше, персонал бачить проблему до того, як вона вплине на клієнтів — наприклад, поступове падіння місткості батареї ДБЖ помітно за тижні до критичного стану.
По-друге, під час планового обслуговування моніторинг підтверджує, що резервний контур справді прийняв навантаження коректно.
Висновок
Безперебійна робота датацентру під час технічного обслуговування — результат поєднання трьох речей: резервної архітектури на рівні живлення, охолодження і мережі; чіткого регламенту проведення робіт; постійного моніторингу стану обладнання.
Разом вони дозволяють замінювати компоненти, оновлювати систему та проводити планові перевірки, не перериваючи роботу клієнтських сервісів.
Коментарі
GigaCenter
Читати ще
GigaCenter
Ваш коментар