در شرایط جنگی یا بحرانهای امنیتی، سرور فیزیکی فقط یک دستگاه در رک نیست؛ محل نگهداری اطلاعات مالی، فایلهای سازمانی، نرمافزارهای حسابداری و CRM، تلفنهای VoIP و ماشینهای مجازی شرکت است. قطعی برق، نوسان ولتاژ، اختلال اینترنت، آسیب احتمالی به ساختمان و محدودیت رفتوآمد میتواند در چند دقیقه سرویسهای حیاتی را از دسترس خارج کند. بنابراین هدف اصلی، «خاموش نگهداشتن سرور» نیست؛ بلکه باید تداوم کسبوکار، حفاظت از داده و امکان بازگشت سریع سرویس را تضمین کرد. در این مقاله، مهمترین نکات نگهداری سرور فیزیکی HP و HPE و سایر سرورها در وضعیت جنگی را بهصورت عملی بررسی میکنیم.
۱. اول از همه: از اطلاعات نسخه پشتیبان واقعی بگیرید
مهمترین دارایی شرکت، خودِ سرور نیست؛ دادههای روی آن است. اگر سرور آسیب ببیند اما بکاپ قابل بازیابی داشته باشید، کسبوکار قابل بازگشت است. اما بهترین سرور هم بدون نسخه پشتیبان مناسب، ریسک بزرگی برای شرکت ایجاد میکند.
برای بکاپ، قانون ۳-۲-۱ را اجرا کنید:
- حداقل ۳ نسخه از اطلاعات مهم داشته باشید.
- این نسخهها روی حداقل ۲ نوع رسانه یا محل متفاوت نگهداری شوند؛ برای مثال NAS و هارد اکسترنال رمزگذاریشده.
- حداقل ۱ نسخه خارج از محل شرکت باشد؛ مانند سایت دوم، دفتر دیگر یا فضای ابری مطمئن.
بکاپ باید شامل ماشینهای مجازی ESXi، دیتابیسها، فایلسرور، تنظیمات نرمافزارهای حسابداری، تنظیمات VoIP و در صورت نیاز تنظیمات iLO و RAID باشد. فقط گرفتن بکاپ کافی نیست؛ هر ماه یک بار بازیابی آزمایشی انجام دهید تا مطمئن شوید فایل بکاپ واقعاً سالم و قابل استفاده است.
۲. برق اضطراری و محافظت در برابر نوسان را جدی بگیرید
در بحران، احتمال قطع ناگهانی برق یا نوسان شدید ولتاژ بیشتر است. خاموشی ناگهانی میتواند باعث خرابی فایلسیستم، از بین رفتن ماشین مجازی، خراب شدن آرایه RAID یا آسیب به پاور و کنترلر شود.
برای سرور فیزیکی این موارد توصیه میشود:
- استفاده از UPS آنلاین با ظرفیت متناسب با مصرف واقعی سرور، استوریج و تجهیزات شبکه.
- اتصال UPS از طریق USB یا شبکه به سرور تا در زمان اتمام باتری، خاموشسازی کنترلشده انجام شود.
- استفاده از دو پاور سرور و اتصال هر پاور به مسیر برق جداگانه یا UPS جداگانه، در صورت وجود زیرساخت مناسب.
- بررسی سلامت باتری UPS و اجرای تست دورهای؛ UPS با باتری ضعیف در لحظه بحران کمکی نمیکند.
- استفاده از محافظ برق صنعتی و ارت مناسب برای رک و تجهیزات شبکه.
برای بسیاری از شرکتهای کوچک، حتی ۱۵ تا ۳۰ دقیقه برق اضطراری کافی است تا یا سرویس ادامه پیدا کند یا سرورها بهشکل امن خاموش شوند. برای سازمانهای حساس، ژنراتور و سوخت ذخیره نیز باید بخشی از برنامه تداوم کسبوکار باشد.
۳. سرور را در محل امن و قابل کنترل نگهداری کنید
رک سرور نباید کنار پنجره، دیوار بیرونی، مسیر آب، انبار مواد قابل اشتعال یا محل رفتوآمد زیاد قرار داشته باشد. در شرایط بحرانی، خطر ضربه، گردوغبار، آبگرفتگی و دسترسی غیرمجاز افزایش پیدا میکند.
بهتر است اتاق سرور این ویژگیها را داشته باشد:
- رک قفلدار و پیچشده به کف یا دیوار، متناسب با وزن تجهیزات.
- دوری از پنجرهها و شیشهها؛ در صورت امکان، انتخاب بخش داخلی ساختمان.
- سنسور دما، رطوبت، دود و نشت آب.
- کپسول آتشنشانی مناسب تجهیزات الکتریکی، مانند CO₂ یا نوع مورد تأیید کارشناسان ایمنی؛ از پاشیدن آب مستقیم روی تجهیزات برقدار خودداری کنید.
- تهویه کافی و مسیر گردش هوای آزاد در جلو و پشت سرور.
- ثبت برچسب کابلها، شماره پورتها و اطلاعات رک برای جلوگیری از اشتباه در زمان اضطرار.
دمای بالا یکی از دلایل اصلی خرابی در سرورهای فیزیکی است. هشدارهای دمایی iLO، کنترلر RAID و UPS را فعال کنید و مسیر ورودی و خروجی هوای رک را با کابل و کارتن مسدود نکنید.
۴. پایش از راه دور را قبل از بحران آماده کنید
وقتی دسترسی به محل شرکت دشوار میشود، مدیریت از راه دور اهمیت دوچندان پیدا میکند. در سرورهای HPE، ابزار iLO امکان مشاهده سلامت سختافزار، لاگ خطا، وضعیت فن و پاور، روشن و خاموشکردن سرور و دسترسی کنسول را فراهم میکند.
پیشنهاد میشود پیش از بروز بحران این کارها را انجام دهید:
- برای iLO، RAID، UPS، فایروال، سوئیچ و ESXi رمز عبور قوی و مجزا تعریف کنید.
- دسترسی مدیریتی را فقط از IPها یا VPN مجاز فراهم کنید؛ پنلهای مدیریتی را مستقیماً روی اینترنت باز نگذارید.
- اطلاعات ورود اضطراری را بهصورت امن و در اختیار حداقل دو نفر مورد اعتماد قرار دهید.
- هشدارهای ایمیلی یا پیامرسان برای خرابی هارد، افزایش دما، قطعی پاور و خطای RAID فعال شود.
- از تنظیمات شبکه، فایروال، سوئیچ، iLO و RAID نسخه پشتیبان بگیرید.
اگر اینترنت ثابت شرکت قطع شد، داشتن اینترنت پشتیبان مانند مودم 4G/5G با IP یا VPN مناسب میتواند امکان مانیتورینگ و دسترسی اضطراری را حفظ کند.
۵. RAID جای بکاپ نیست؛ سلامت آن را بررسی کنید
بسیاری از مدیران تصور میکنند چون سرور RAID دارد، اطلاعات کاملاً امن است. RAID فقط تا حدی در برابر خرابی دیسک محافظت میکند؛ اما در برابر حذف اشتباه فایل، باجافزار، آتشسوزی، خرابی کنترلر، سرقت سرور یا آسیب همزمان چند هارد راهحل کامل نیست.
در شرایط پرریسک، وضعیت RAID را بررسی کنید:
- هیچ هاردی نباید در وضعیت Failed، Predictive Failure یا Degraded باشد.
- یک یا چند هارد یدکی سازگار با مدل سرور و کنترلر در محل داشته باشید.
- وضعیت باتری یا خازن کنترلر RAID را کنترل کنید؛ خرابی آن میتواند عملکرد و امنیت Write Cache را تحت تأثیر قرار دهد.
- لاگهای Smart Storage Administrator یا کنترلر RAID را بازبینی کنید.
- در زمان Rebuild، سرور را جابهجا یا بیدلیل خاموش نکنید.
برای سرور HP مدل Gen9 و Gen10، کنترلرهای P440ar و P408i-a و برای مدلهای جدیدتر Smart Array یا MegaRAID، باید از طریق ابزار مدیریتی مربوطه بهطور دورهای بررسی شوند.
۶. امنیت سایبری در جنگ به اندازه امنیت فیزیکی مهم است
در زمان بحران، حملات فیشینگ، باجافزار، حملات DDoS و تلاش برای ورود به سرویسهای ریموت بیشتر میشود. سروری که از نظر فیزیکی سالم است ولی به باجافزار آلوده میشود، عملاً از دسترس خارج خواهد شد.
اقدامات ضروری شامل موارد زیر است:
- بهروزرسانی سیستمعامل، ESXi، فایروال، آنتیویروس و Firmware سرور طبق برنامه و پس از بررسی سازگاری.
- غیرفعالکردن حسابهای قدیمی و دسترسیهای غیرضروری.
- فعالسازی احراز هویت دومرحلهای برای VPN، ایمیل و پنلهای مهم.
- جداکردن شبکه بکاپ از شبکه کاربران در حد امکان.
- نگهداری حداقل یک بکاپ آفلاین یا غیرقابلتغییر (Immutable) در برابر باجافزار.
- ثبت لاگ و بررسی ورودهای غیرعادی، بهویژه ورودهای مدیریتی خارج از ساعت کاری.
بهروزرسانی اضطراری بدون تست میتواند خودش باعث اختلال شود؛ ابتدا از تنظیمات و ماشینهای مجازی بکاپ بگیرید و Firmware یا Patch را طبق مستندات سازنده اجرا کنید.
۷. برنامه تداوم کسبوکار و سناریوی خاموشسازی داشته باشید
در شرایط جنگی ممکن است لازم باشد سرور برای مدت طولانی بهصورت کنترلشده خاموش شود یا سرویسها به محل دیگری منتقل شوند. این کار نباید تصمیم لحظهای باشد.
یک چکلیست مکتوب تهیه کنید که پاسخ این پرسشها در آن مشخص باشد:
- کدام سرویسها حیاتیاند و باید اول برگردند؟ مثلاً حسابداری، CRM، فایلسرور یا تلفن سازمانی.
- مسئول تصمیم برای خاموشکردن یا روشنکردن سرور چه کسی است؟
- ترتیب صحیح خاموشکردن ماشینهای مجازی، سرور، استوریج و تجهیزات شبکه چیست؟
- آخرین بکاپ کجاست و چه کسی به آن دسترسی دارد؟
- اگر محل اصلی قابل استفاده نبود، سرویسها روی کدام سرور، دفتر یا فضای ابری بازیابی میشوند؟
- شماره تماس پشتیبان سختافزار، اینترنت، نرمافزار و برق کجاست؟
برای شرکتهایی که ESXi دارند، اول ماشینهای مجازی را بهشکل درست Shut Down کنید، سپس Host را خاموش کنید. خاموشکردن ناگهانی از طریق قطع برق فقط باید آخرین راهحل باشد.
۸. قطعات یدکی و مدارک فنی را آماده کنید
در روزهای بحران، تهیه سریع قطعه ممکن است دشوار شود. داشتن چند قطعه کمهزینه اما حیاتی، زمان خواب سرویس را بهشدت کاهش میدهد.
قطعات پیشنهادی بر اساس نوع سرور عبارتاند از:
- هارد یا SSD هممدل و سازگار برای جایگزینی RAID.
- پاور اضافی برای سرورهای دارای Redundant PSU.
- کابل برق، کابل شبکه، کابل SAS و ماژول SFP/SFP+ یدکی.
- فن سازگار در مدلهایی که سابقه کارکرد طولانی دارند.
- باتری یا ماژول Cache کنترلر RAID در صورت استفاده از مدلهای قدیمیتر.
همچنین مدل دقیق سرور، سریال، شماره قطعات، نسخه Firmware، نقشه کابلکشی و کانفیگ RAID را در یک فایل امن و قابل دسترس خارج از سرور ثبت کنید.
۹. اگر جابهجایی سرور لازم شد، با برنامه انجام دهید
انتقال فیزیکی سرور یا استوریج در شرایط ناپایدار ریسک بالایی دارد. اگر ناچار به جابهجایی شدید، ابتدا بکاپ جدید بگیرید و مطمئن شوید همه ماشینهای مجازی و سیستمعاملها بهطور کامل خاموش شدهاند.
برای جابهجایی:
- هاردهای Hot-Plug را با برچسب شماره Slot مشخص کنید تا ترتیب آنها بههم نخورد.
- از تجهیزات در برابر ضربه، رطوبت، گردوغبار و الکتریسیته ساکن محافظت کنید.
- سرور را در بستهبندی مناسب و ترجیحاً با ضربهگیر حمل کنید.
- بعد از نصب در محل جدید، اتصالات، وضعیت RAID، دما، فنها و لاگهای iLO را پیش از راهاندازی کامل بررسی کنید.
در آرایههای RAID معمولی، حفظ ترتیب دیسکها اهمیت زیادی دارد. بدون شناخت ساختار ذخیرهسازی، هاردها را جابهجا یا روی سرور دیگری Initialize نکنید.
جمعبندی
نگهداری سرور فیزیکی در شرایط جنگی ترکیبی از سه موضوع است: حفاظت از داده، پایداری برق و شبکه، و آمادگی برای مدیریت یا بازیابی سرویس از محل دیگر. بکاپ چندلایه، UPS سالم، رک امن، کنترل RAID، دسترسی راه دور امن و یک سناریوی مکتوب برای خاموشسازی و بازیابی، مهمترین اقداماتی هستند که باید پیش از بحران انجام شوند.
اگر شرکت شما از سرور HP G10 مانند DL380، DL360 یا ML350 استفاده میکند، بررسی دورهای سلامت سختافزار، وضعیت iLO، کنترلر RAID و ظرفیت بکاپ میتواند تفاوت میان یک وقفه کوتاه و از دست رفتن جدی اطلاعات را رقم بزند.
سوالات متداول
آیا RAID نیاز به بکاپ را از بین میبرد؟
خیر. RAID برای ادامه کار در برابر خرابی یک یا چند هارد طراحی شده است؛ اما در برابر باجافزار، حذف اطلاعات، آتشسوزی، سرقت یا خرابی کنترلر جایگزین بکاپ نیست.
در زمان قطع برق، سرور را خاموش کنیم یا روشن نگه داریم؟
اگر UPS ظرفیت کافی دارد و پایداری برق نامشخص نیست، میتوان سرویس را ادامه داد. اما در خاموشی طولانی یا نامطمئن، خاموشسازی کنترلشده ماشینهای مجازی و سپس سرور، ایمنتر از خالیشدن کامل باتری UPS است.
برای سرور HPE کدام ابزار مدیریت از راه دور کاربردی است؟
iLO ابزار مدیریتی اختصاصی HPE است و برای مشاهده وضعیت سختافزار، لاگها، کنسول ریموت و کنترل پاور سرور کاربرد دارد. دسترسی به آن باید از طریق VPN یا شبکه مدیریت ایمن شود.
مهمترین اقدام فوری برای یک شرکت کوچک چیست؟
ابتدا یک بکاپ کامل و قابل بازیابی از دادهها و ماشینهای مجازی تهیه کنید، سپس سلامت UPS، RAID و دسترسی امن ریموت را بررسی کنید.
