وقتی یک شرکت از یک سرویس نرمافزاری، شبکه، سرور یا زیرساخت IT استفاده میکند، فقط در دسترس بودن آن سرویس اهمیت ندارد؛ بلکه باید مشخص باشد چه سطحی از خدمات باید ارائه شود، چگونه اندازهگیری میشود و در صورت رعایت نشدن تعهدات چه اتفاقی میافتد. اینجاست که مفهوم SLA یا Service Level Agreement اهمیت پیدا میکند.
SLA توافقی مشخص میان ارائهدهنده خدمات و مشتری است که در آن سطح موردانتظار خدمات، شاخصهای قابل اندازهگیری، مسئولیت طرفین و نحوه رسیدگی به عدم تحقق تعهدات تعیین میشود. به همین دلیل، SLA یکی از ابزارهای مهم در مدیریت خدمات IT و پایش عملکرد زیرساختها محسوب میشود.
SLA چیست و چه مفهومی دارد؟

SLA مخفف Service Level Agreement و به معنی «توافقنامه سطح خدمات» است. در این توافق مشخص میشود که یک سرویس باید با چه کیفیت و سطح عملکردی در اختیار مشتری قرار گیرد.
برای مثال، ممکن است یک شرکت ارائهدهنده خدمات IT متعهد شود:
- یک سرویس با Availability معادل 99.9 درصد ارائه دهد.
- درخواستهای بحرانی را حداکثر طی ۳۰ دقیقه بررسی کند.
- مشکلات مشخص را در مدت تعیینشده برطرف کند.
- وضعیت سرویس را بهصورت دورهای گزارش دهد.
بنابراین SLA صرفاً یک قرارداد کلی درباره ارائه خدمات نیست؛ بلکه تعهدات خدماتی را به شاخصهای قابل اندازهگیری تبدیل میکند.
اجزای اصلی SLA چیست؟
یک SLA میتواند بسته به نوع سرویس جزئیات متفاوتی داشته باشد، اما معمولاً چند بخش اصلی دارد.
- تعریف سرویس: ابتدا باید مشخص شود دقیقاً چه سرویسی تحت SLA قراردارد. این سرویس میتواند شامل میزبانی سرور، پشتیبانی شبکه، نرمافزار سازمانی، زیرساخت دیتاسنتر یا یک سرویس ابری باشد.
- سطح موردانتظار خدمات: در این بخش مشخص میشود سرویس باید چه سطحی از عملکرد، کیفیت و دسترسپذیری داشته باشد.
- شاخصهای اندازهگیری: SLA باید بر اساس معیارهایی تعریف شود که بتوان آنها را اندازهگیری و گزارش کرد؛ مانند Availability، زمان پاسخگویی یا زمان رفع مشکل.
- مسئولیت طرفین: وظایف ارائهدهنده و مشتری باید مشخص باشد تا در زمان بروز مشکل، ابهامی در مسئولیت هر بخش نداشته باشد.
- پیامد عدم تحقق SLA: در برخی قراردادها، برای رعایت نشدن سطح توافقشده خدمات، اقدامات اصلاحی، جبران خسارت یا Service Credit در نظر گرفته میشود.
SLA چه شاخصهایی را اندازهگیری میکند؟
یکی از مهمترین ویژگیهای SLA این است که تعهدات آن باید تا حد امکان قابل اندازهگیری باشند. بسته به نوع سرویس، شاخصهای مختلفی میتوانند در توافقنامه قرار بگیرند.
Uptime و Availability
یکی از شناختهشدهترین شاخصها، میزان در دسترس بودن سرویس است.

برای مثال، اگر در SLA میزان Availability برابر با 99.9 درصد تعیین شده باشد، سرویس باید در بازه مورد توافق تقریباً همیشه در دسترس باشد و Downtime آن از مقدار مشخصی بیشتر نشود.
بهطور تقریبی:
- 99% یعنی حدود ۳ روز و ۱۵ ساعت Downtime در سال
- 99.9% یعنی حدود ۸ ساعت و ۴۶ دقیقه Downtime در سال
- 99.99% یعنی حدود ۵۲ دقیقه Downtime در سال
- 99.999% یعنی حدود ۵ دقیقه Downtime در سال
این اعداد نشان میدهند که حتی اختلاف ظاهراً کوچک بین 99.9 و 99.99 درصد میتواند از نظر عملیاتی قابل توجه باشد.
Response Time
Response Time مدت زمانی است که طول میکشد تا تیم پشتیبانی پس از دریافت یک درخواست یا هشدار، رسیدگی به آن را آغاز کند. برای مثال، ممکن است SLA تعیین کند که درخواستهای بحرانی حداکثر طی ۱۵ دقیقه پاسخ اولیه دریافت کنند.
Resolution Time
Resolution Time با زمان پاسخ اولیه متفاوت است. این شاخص مشخص میکند مشکل در چه مدت باید برطرف شود.
برای نمونه، ممکن است در SLA تعیین شود:
- مشکل بحرانی در کمتر از ۴ ساعت برطرف شود.
- مشکل با اولویت متوسط در کمتر از یک روز کاری بررسی و رفع شود.
- مشکلات کماهمیت در بازه زمانی مشخصی رسیدگی شوند.
مقادیر واقعی این شاخصها باید بر اساس نوع سرویس و توافق طرفین تعیین شوند.
SLA چه تفاوتی با قرارداد خدمات دارد؟
این توافقنامه و قرارداد خدمات به هم مرتبط هستند، اما دقیقاً یک مفهوم نیستند. قرارداد خدمات معمولاً چارچوب کلی همکاری، هزینهها، شرایط پرداخت، مدت قرارداد و مسئولیتهای طرفین را مشخص میکند. در مقابل، SLA روی سطح و کیفیت خدمات تمرکز دارد. به بیان ساده، قرارداد مشخص میکند: “چه خدمتی ارائه میشود و شرایط همکاری چیست؟”
اما SLA مشخص میکند: “این خدمت باید با چه سطحی از عملکرد و در چه بازهای ارائه شود؟” به همین دلیل، این توافق میتواند بخشی از یک قرارداد خدمات بزرگتر باشد.
SLA در خدمات IT و پشتیبانی شبکه چه کاربردی دارد؟
در محیطهای IT، بسیاری از سرویسها باید بهصورت مداوم در دسترس باشند. قطع شدن شبکه، سرور، نرمافزار یا یک سرویس حیاتی میتواند مستقیماً روی فعالیت سازمان تأثیر بگذارد.
در چنین شرایطی SLA کمک میکند انتظارات دو طرف از قبل مشخص شود.
برای مثال، در یک قرارداد پشتیبانی شبکه میتوان تعیین کرد:
- وضعیت سرویسهای حیاتی بهصورت مستمر بررسی شود.
- هشدارهای مربوط به خرابی یا قطعی در زمان مشخصی بررسی شوند.
- مشکلات بحرانی اولویت بالاتری داشته باشند.
- Availability سرویسها بهصورت دورهای گزارش شود.
- عملکرد واقعی با سطح تعیینشده در SLA مقایسه شود.
این موضوع باعث میشود ارزیابی عملکرد خدمات فقط بر اساس برداشت کاربران یا گزارشهای دستی انجام نشود.
نقش مانیتورینگ در SLA چیست؟
اینجا ارتباط میان SLA و Monitoring اهمیت پیدا میکند.
فرض کنید در SLA نوشته شده است که یک سرویس میبایست 99.9 درصد Availability داشته باشد. این عدد زمانی قابل ارزیابی است که سیستم مشخصی برای اندازهگیری وضعیت سرویس وجود داشته باشد.
مانیتورینگ میتواند:
- وضعیت سرویسها را بهصورت مداوم بررسی کند.
- زمان قطعی و بازیابی سرویس را ثبت کند.
- Downtime را محاسبه کند.
- هشدارهای مربوط به اختلال را ایجاد کند.
- اطلاعات عملکرد را در قالب گزارش و نمودار نمایش دهد.
بنابراین رابطه این دو را میتوان به شکل ساده اینطور در نظر گرفت:
SLA هدف را مشخص میکند ← Monitoring عملکرد واقعی را اندازهگیری میکند ← گزارشها میزان تحقق SLA را نشان میدهند.
بدون دادههای واقعی، بررسی اینکه یک سرویس SLA تعیینشده را رعایت کرده یا نه، دشوار خواهد بود.
اگر SLA رعایت نشود چه اتفاقی میافتد؟
عدم رعایت این توافقنامه میتواند شکلهای مختلفی داشته باشد. برای مثال، ممکن است Availability سرویس از مقدار توافقشده کمتر شود یا زمان پاسخگویی و رفع مشکل از محدوده تعیینشده فراتر رود.
در این شرایط، بسته به قرارداد، اقدامات مختلفی ممکن است انجام شود:
- بررسی علت اصلی مشکل
- ثبت Incident و گزارش آن
- انجام اقدامات اصلاحی
- ارائه گزارش عملکرد
- جبران بخشی از هزینه خدمات
- بازنگری در زیرساخت یا فرایند پشتیبانی
البته پیامدهای دقیق عدم رعایت SLA باید در خود قرارداد مشخص شده باشند تا هنگام بروز اختلاف، معیار مشخصی برای تصمیمگیری وجود داشته باشد.
یک نمونه ساده از SLA برای خدمات IT
برای درک بهتر، فرض کنیم یک شرکت برای یک سرویس سازمانی SLA مشخصی تعریف کرده است.
در این توافق میتوان موارد زیر را تعیین کرد:
- Availability: حداقل 99.9 درصد
- Response Time برای مشکل بحرانی: حداکثر ۱۵ دقیقه
- Resolution Time: حداکثر ۴ ساعت
- گزارش عملکرد: بهصورت ماهانه
- پایش سرویس: بهصورت 24/7
در چنین نمونهای، صرفاً تعیین عدد 99.9 درصد کافی نیست. سازمان باید بتواند Availability واقعی را اندازهگیری کند و مشخص کند در طول دوره موردنظر چه میزان Downtime اتفاق افتاده است.
نقش سامانه مانیتورینگ سپهر در پایش SLA
برای پایش این توافقنامه، وجود دادههای مستمر از وضعیت تجهیزات و سرویسها اهمیت زیادی دارد. سامانه مانیتورینگ سپهر میتواند با جمعآوری و نمایش اطلاعات مربوط به وضعیت زیرساخت، به تیمهای IT در مشاهده عملکرد سرویسها و شناسایی اختلالات کمک کند.

در یک سناریوی مانیتورینگ، اطلاعاتی مانند وضعیت سرویس، Availability، رخدادها و هشدارها میتوانند مبنایی برای بررسی عملکرد واقعی زیرساخت باشند.
به این ترتیب، مانیتورینگ جایگزین SLA نیست؛ بلکه ابزاری برای اندازهگیری و مستندسازی عملکرد در برابر معیارهای SLA است.
برای سازمانهایی که سرویسها و تجهیزات متعددی دارند، این موضوع اهمیت بیشتری پیدا میکند؛ زیرا بررسی دستی وضعیت تجهیزات و سرویسها، مخصوصاً در زیرساختهای بزرگ، دشوار و زمانبر خواهد بود.
جمعبندی
توافقنامه سطح خدمات چارچوبی برای مشخص کردن سطح مورد انتظار خدمات و تبدیل تعهدات کلی به معیارهای قابل اندازهگیری است. شاخصهایی مانند Availability ،Uptime Response Timeو Resolution Time کمک میکنند عملکرد سرویسها بهشکل دقیقتری ارزیابی شود.
با اینحال، تعریف SLA بهتنهایی کافی نیست. برای بررسی میزان تحقق تعهدات، لازم است وضعیت سرویسها بهصورت مستمر پایش، ثبت و تحلیل شود. به همین دلیل، مانیتورینگ نقش مهمی در اندازهگیری و مستندسازی عملکرد سرویسها در برابر SLA دارد.
در اینزمینه، سپهر انفورماتیک با ارائه راهکارهای مانیتورینگ و پایش زیرساخت، امکان مشاهده وضعیت تجهیزات و سرویسها، دریافت هشدار و بررسی دادههای عملکردی را فراهم میکند و میتواند بخشی از فرایند پایش و ارزیابی SLA در سازمانها باشد.


