چه شاخصهایی برای پایش عملکرد ایمنی فرآیند مهمترند؟
خلاصه مقاله
در بسیاری از سازمانها، وقتی صحبت از عملکرد ایمنی میشود، اولین چیزهایی که روی داشبورد میآید معمولاً نرخ حوادث، تعداد جراحات، ساعات آموزش و تعداد ممیزیها است. این شاخصها مهماند، اما برای ایمنی فرایند کافی نیستند. چون ممکن است یک واحد ماهها یا حتی سالها بدون حادثه قابلثبت کار کند، اما همزمان barrierها ضعیف شده باشند، bypassها طولانی شده باشند، تستهای حیاتی عقب افتاده باشند، انحرافهای فرایندی تکرار شوند و سازمان بدون اینکه بداند به حادثه بزرگ نزدیک شود.
برای مدیران، مسئله اصلی این است که اگر داشبورد سازمان فقط آرامش ظاهری نشان دهد، تصمیمگیری هم دیرهنگام و واکنشی میشود. بنابراین خواندن این مقاله مهم است، چون کمک میکند بین شاخصهای عمومی HSE و شاخصهای واقعی Process Safety Performance تفاوت بگذاریم و بفهمیم کدام شاخصها واقعاً میتوانند قبل از حادثه، سیگنال ضعف سیستم را بدهند.
این مقاله برای کارشناسان PSM شاغل در صنعت نفت نوشته شده است تا بدانند کدام شاخصها برای پایش عملکرد ایمنی فرایند مهمترند، چگونه آنها را دستهبندی کنند، از چه خطاهایی در انتخاب KPI پرهیز کنند، و چگونه شاخصها را به زبان تصمیم مدیریتی تبدیل کنند.
اول باید یک سوءبرداشت را کنار بگذاریم: هر KPI ایمنی، KPI ایمنی فرایند نیست
یکی از خطاهای رایج این است که سازمان فکر میکند اگر شاخص ایمنی دارد، پس عملکرد PSM را هم میسنجد.
اما در عمل:
- TRIR پایین لزوماً به معنی PSM خوب نیست.
- ساعات آموزش بالا لزوماً به معنی readiness بهتر نیست.
- تعداد ممیزی بیشتر لزوماً به معنی barrier قویتر نیست.
- بستهشدن actionها لزوماً به معنی کاهش ریسک نیست.
چرا؟ چون ایمنی فرایند بیشتر به این سؤالات مربوط است:
- آیا احتمال از دست رفتن مهار فرایند در حال افزایش است؟
- آیا لایههای حفاظتی در حال تضعیف هستند؟
- آیا شرایط غیرعادی بیشتر شدهاند؟
- آیا فرضیات ایمن طراحی و عملیات هنوز معتبرند؟
- آیا تغییرات، آزمونها، بازرسیها و آمادگی راهاندازی واقعاً تحت کنترلاند؟
پس KPIهای Process Safety باید بتوانند ریسک حادثه بزرگ را ببینند، نه فقط فعالیت اداری یا پیامدهای فردی را.
شاخصهای Process Safety را باید در دو دسته دید: پسنگر و پیشنگر
برای پایش درست، فقط دیدن آنچه رخ داده کافی نیست. باید هم نشانههای وقوع را دید و هم نشانههای نزدیکشدن به وقوع را.
شاخصهای پسنگر
اینها نشان میدهند چه اتفاقی افتاده است:
- رویدادهای loss of containment
- releaseهای فرایندی
- fire/explosion ناشی از انحراف فرایندی
- activation ناخواسته shutdown
- overpressure یا overfill واقعی
- رویدادهای Tier 1 و Tier 2
این شاخصها مهماند، اما معمولاً وقتی دیده میشوند که بخشی از شکست قبلاً رخ داده است.
شاخصهای پیشنگر
اینها ضعفهای درحالتشکیل را نشان میدهند:
- backlog تست و بازرسی تجهیزات بحرانی
- bypassهای فعال
- overdue بودن actionهای پرریسک
- alarm flooding
- deviation از operating envelope
- MOCهای after-the-fact
- PSSRهای ناقص
- LOCهای کوچک و تکراری
- temporary repairهای طولانی
این شاخصها ارزش زیادی دارند چون قبل از حادثه، افت عملکرد سیستم را نشان میدهند.
مهمترین اصل: شاخص باید به سناریوی ریسک وصل باشد
هر KPI که انتخاب میکنید باید به یکی از سناریوهای مهم حادثه بزرگ در واحد وصل شود.
مثلاً اگر سناریوی مهم شما اینهاست:
- overpressure
- overfill
- toxic release
- loss of containment
- runaway reaction
- ignition of flammable release
آنگاه باید بپرسید:
- کدام شاخصها نشان میدهند barrierهای این سناریو در حال ضعیفشدناند؟
- کدام شاخصها به من میگویند assumptions قبلی دیگر معتبر نیست؟
- کدام شاخصها به من زودتر از حادثه هشدار میدهند؟
اگر KPI به سناریو وصل نباشد، بیشتر به یک عدد مدیریتی تبدیل میشود تا ابزار تصمیم.
شاخصهای مهم در پایش Process Safety Performance
در ادامه، مهمترین شاخصها را بهصورت کاربردی مرور میکنیم.
1) رویدادهای Loss of Containment یا از دست رفتن مهار فرایند
این یکی از بنیادیترین شاخصهاست.
چه چیزی را میسنجد؟
تعداد و شدت releaseهای ناخواسته از خطوط، مخازن، تجهیزات، فلنجها، PSVها، drains، vents یا سایر مرزهای مهار.
چرا مهم است؟
چون LOC هسته بسیاری از حوادث بزرگ فرایندی است. حتی releaseهای کوچک و تکراری هم میتوانند نشانه ضعف MI، خوردگی، عملیات، طراحی یا نگهداری باشند.
در تفسیر آن باید به چه چیزی دقت کرد؟
- فقط تعداد را نبینید؛ شدت، ماده، محل و تکرارپذیری را هم ببینید.
- LOCهای کوچک اما مزمن را دستکم نگیرید.
- LOC را با نشتی عادیشده اشتباه نگیرید.
سؤال مدیریتی که بهتر میکند
آیا واحد در حال نزدیکشدن به شکست واقعی مهار فرایند است؟
2) تعداد و مدت bypass روی interlock، shutdown و سایر barrierهای کلیدی
چه چیزی را میسنجد؟
چند barrier کلیدی موقتاً از سرویس خارج شدهاند و چه مدت در این وضعیت ماندهاند.
چرا مهم است؟
چون ممکن است سازمان روی کاغذ سیستم حفاظتی داشته باشد، اما در عمل همان لایهها موقتاً غیرفعال باشند.
باید چه ابعادی را پایش کرد؟
- تعداد bypass فعال
- مدت فعالبودن هر bypass
- bypassهای تکرارشونده
- bypassهای همزمان روی یک سناریوی واحد
- bypass بدون کنترل جبرانی مؤثر
سؤال مدیریتی که بهتر میکند
آیا ما داریم با تکیه بر barrierهای غیرفعال، واحد را در سرویس نگه میداریم؟
3) backlog تست، بازرسی و نگهداری تجهیزات ایمنی-بحرانی
چه چیزی را میسنجد؟
حجم و سن تأخیر در آزمون، کالیبراسیون، inspection و PM تجهیزات و safeguardهای بحرانی.
چرا مهم است؟
چون تجهیز ممکن است ظاهراً در سرویس باشد، اما قابلیت اتکای آن برای سناریوی خطر نامشخص شده باشد.
نمونه اقلام مهم
- PSV
- SIS / interlock
- detectorها
- shutdown valve
- level trip
- pressure protection
- equipment subject to corrosion monitoring
نکته کلیدی
فقط تعداد backlog مهم نیست؛ باید criticality-based دیده شود. تأخیر روی تجهیز کماهمیت با تأخیر روی barrier حیاتی یکسان نیست.
سؤال مدیریتی که بهتر میکند
کدام بخش از دفاع ما روی تجهیزاتی استوار شده که قابلیت اتکایشان تأیید نشده است؟
4) تعداد MOCهای after-the-fact و تغییرات ثبتنشده
چه چیزی را میسنجد؟
تغییراتی که بعد از اجرا وارد MOC شدهاند یا اصلاً از مسیر رسمی MOC عبور نکردهاند.
چرا مهم است؟
چون این شاخص مستقیماً نشان میدهد سازمان در کنترل تغییرات چقدر بالغ است. حادثههای زیادی از همین تغییرات کوچک، موقت یا غیررسمی شروع میشوند.
چه چیزهایی باید دیده شوند؟
- after-the-fact MOC
- temporary modificationهای طولانی
- تغییرات نرمافزاری/logic بدون بازبینی کافی
- تغییر set point بدون ارزیابی کامل
- تغییرات عملیاتی که وارد رویه و آموزش نشدهاند
سؤال مدیریتی که بهتر میکند
آیا تغییرات واقعی واحد جلوتر از سیستم کنترل تغییر در حال رخدادن هستند؟
5) actionهای بازمانده و overdue مرتبط با سناریوهای پرریسک
چه چیزی را میسنجد؟
اقدامات اصلاحی باز، بهویژه آنهایی که از PHA، incident investigation، audit، MOC، PSSR و integrity review بیرون آمدهاند و به سناریوهای مهم حادثه بزرگ مرتبطاند.
چرا مهم است؟
چون action tracking یکی از جاهایی است که فاصله بین «دانستن» و «اقدامکردن» خود را نشان میدهد.
اشتباه رایج
فقط درصد بستهشدن actionها را گزارش میکنند. در حالیکه مهمتر این است:
- کدام actionها overdue هستند؟
- کدامها به barrierهای حیاتی مربوطاند؟
- کدامها چند بار تمدید شدهاند؟
- کدامها با اقدام اداری بسته شدهاند ولی ریسک را کم نکردهاند؟
سؤال مدیریتی که بهتر میکند
آیا ریسکهای شناختهشده داریم که آگاهانه با آنها زندگی میکنیم؟
6) deviation از حدود عملیاتی ایمن
چه چیزی را میسنجد؟
میزان و تکرار خروج فرایند از operating envelope تعریفشده؛ مثل فشار، دما، سطح، دبی، ترکیب، زمان ماند یا سایر حدود ایمن.
چرا مهم است؟
چون بسیاری از حوادث قبل از اینکه به release برسند، با افزایش انحرافهای فرایندی خود را نشان میدهند.
چگونه باید پایش شود؟
- تعداد deviationها
- مدت deviation
- شدت deviation
- واحدها یا loopهای پرتکرار
- deviationهای رخداده در start-up/shutdown
سؤال مدیریتی که بهتر میکند
آیا واحد دارد بیشتر از گذشته در حاشیه ایمنبودن کار میکند؟
7) alarm flooding و آلارمهای پرتکرار یا بیاثر
چه چیزی را میسنجد؟
تراکم آلارمها، آلارمهای مزاحم، آلارمهای تکراری و وضعیتهایی که اپراتور با حجم غیرقابلمدیریت هشدار روبهروست.
چرا مهم است؟
چون در بسیاری از رویدادهای فرایندی، آلارم وجود داشته اما قابل اقدام، واضح یا قابلمدیریت نبوده است.
معیارهای مهم
- تعداد alarm در بازه زمانی
- standing alarm
- bad actor alarm
- alarmهای بدون response روشن
- alarmهای مرتبط با shutdown/start-up
سؤال مدیریتی که بهتر میکند
آیا آلارمهای ما در لحظه بحران به اپراتور کمک میکنند یا او را غرق میکنند؟
8) وضعیت PSSR پیش از start-up یا restart
چه چیزی را میسنجد؟
کیفیت و کفایت بازبینی پیش از راهاندازی، نه فقط تکمیل چکلیست.
شاخصهای مفید
- تعداد PSSRهای انجامشده
- تعداد finding بحرانی باز در زمان راهاندازی
- تعداد راهاندازی با punch itemهای ریسکدار
- درصد actionهای PSSR که قبل از start-up بسته نشدهاند
- تعداد start-upهایی که با deviation approved انجام شدهاند
چرا مهم است؟
چون start-up و restart از پرریسکترین دورههای فرایندی هستند.
سؤال مدیریتی که بهتر میکند
آیا ما واحد را بر مبنای readiness واقعی راهاندازی میکنیم یا صرفاً completion؟
9) temporary repair، deferral و ادامه بهرهبرداری با کنترل جبرانی
چه چیزی را میسنجد؟
حجم تعمیرات موقت، تعویق تعمیرات حساس و مدت زمانی که واحد با کنترل جبرانی کار میکند.
چرا مهم است؟
چون این شاخص نشان میدهد سازمان چقدر دارد روی «تحمل موقت» بهجای «رفع واقعی» تکیه میکند.
موارد قابل پایش
- تعداد temporary repair
- سن هر temporary repair
- تعداد deferral روی تجهیز بحرانی
- مدت ادامه کار با safeguard degraded
- تعداد approvalهای تمدیدشده
سؤال مدیریتی که بهتر میکند
آیا داریم شرایط موقت را به وضعیت دائمی تبدیل میکنیم؟
10) near missها و رویدادهای فرایندی با پتانسیل بالا
چه چیزی را میسنجد؟
رویدادهایی که به حادثه بزرگ ختم نشدهاند، اما میتوانستند شوند.
چرا مهم است؟
چون اگر فقط حوادث واقعی را بشمارید، بخش بزرگی از یادگیری را از دست میدهید.
نکته مهم
کیفیت این شاخص از تعداد آن مهمتر است. اگر near miss زیاد گزارش شود ولی همه آنها سطحی یا رفتاری باشند، هنوز تصویر Process Safety ناقص است.
سؤال مدیریتی که بهتر میکند
آیا سازمان دارد از هشدارهای قبل از حادثه یاد میگیرد یا فقط از خود حادثه؟
11) یافتههای Mechanical Integrity با ریسک بالا
چه چیزی را میسنجد؟
مواردی مانند خوردگی بحرانی، کاهش ضخامت، failure modeهای فعال، خرابی تکراری، ضعف در isolation، مشکل در PSV، شیرهای معیوب و سایر یافتههای integrity که مستقیماً به LOC وصل میشوند.
چرا مهم است؟
چون MI یکی از ستونهای اصلی PSM است و ضعف آن معمولاً قبل از حادثه با سیگنالهای فنی خودش را نشان میدهد.
سؤال مدیریتی که بهتر میکند
کدام تجهیزات بحرانی در حال نزدیکشدن به نقطهای هستند که assumptions ایمنبودن دیگر قابل دفاع نیست؟
12) کیفیت و بهروزبودن اطلاعات ایمنی فرایند
این شاخص کمتر دیده میشود، اما بسیار مهم است.
چه چیزی را میسنجد؟
وضعیت بهروزبودن:
- P&ID
- cause & effect
- line list
- relief basis
- operating envelope
- procedure
- process safety information
چرا مهم است؟
اگر اطلاعات پایه قدیمی باشد، PHA، MOC، PSSR، training و عملیات هم بر پایه فرضهای قدیمی جلو میروند.
شاخصهای مفید
- درصد مدارک بحرانی بهروزرسانینشده
- تأخیر متوسط در update پس از تغییر
- تعداد مغایرتهای میدان با مدارک
- تعداد start-up یا MOC با documentation incomplete
سؤال مدیریتی که بهتر میکند
آیا تصمیمهای ما بر مبنای واقعیت واحد گرفته میشوند یا بر مبنای مدارک قدیمی؟
13) کیفیت investigation رویدادهای فرایندی
چه چیزی را میسنجد؟
اینکه بررسی رویدادهای فرایندی چقدر از سطح خطای انسانی عبور میکند و به barrier failure، MOC، MI، design، procedure و readiness میرسد.
شاخصهای مفید
- درصد investigationهایی که علل سیستمی شناسایی کردهاند
- درصد investigationهایی که barrier analysis دارند
- درصد اقدامهای اصلاحی فنی/سیستمی در برابر اداری
- زمان بستهشدن actionهای critical
چرا مهم است؟
چون اگر investigation ضعیف باشد، سازمان از رویدادها یاد نمیگیرد.
سؤال مدیریتی که بهتر میکند
آیا ما در حال حذف علائم هستیم یا علتهای واقعی را اصلاح میکنیم؟
14) شاخصهای مربوط به competence در نقشهای حساس فرایندی
چه چیزی را میسنجد؟
صلاحیت واقعی افراد در فعالیتهای بحرانی، نه فقط حضور در کلاس.
موارد قابل پایش
- تکمیل qualification برای نقشهای حساس
- ارزیابی competence پیش از start-up
- revalidation دورهای
- پوشش آموزشی تغییرات عملیاتی مهم
- شکاف competence در شیفتها یا تیمهای خاص
چرا مهم است؟
چون در شرایط upset یا start-up، competence واقعی میتواند تعیینکننده باشد.
سؤال مدیریتی که بهتر میکند
آیا افراد کلیدی واقعاً برای مواجهه با سناریوهای فرایندی آمادهاند یا فقط آموزش دیدهاند؟
اگر فقط بخواهیم 10 شاخص مهمتر را انتخاب کنیم
اگر سازمان بخواهد یک داشبورد فشردهتر داشته باشد، این 10 شاخص معمولاً از مهمترینها هستند:
- تعداد و شدت Loss of Containment
- تعداد و مدت bypass روی barrierهای کلیدی
- backlog و overdue بودن تست و بازرسی تجهیزات بحرانی
- MOCهای after-the-fact و تغییرات ثبتنشده
- actionهای overdue مرتبط با سناریوهای پرریسک
- deviation از operating envelope
- alarm flooding و bad actor alarmها
- کیفیت و findingهای باز PSSR
- تعداد و سن temporary repair / deferral
- near missهای فرایندی با پتانسیل بالا
اگر این 10 مورد درست تعریف، طبقهبندی و تحلیل شوند، تصویر بسیار بهتری از سلامت واقعی سیستم PSM میدهند.
خطاهای رایج در انتخاب شاخصهای Process Safety
در بسیاری از سازمانها مشکل فقط نبود KPI نیست؛ مشکل این است که KPIهای اشتباه انتخاب میشوند.
خطاهای رایج:
- انتخاب شاخصهایی که فقط فعالیت را میسنجند، نه اثربخشی
- زیادبودن تعداد KPIها تا حدی که تمرکز از بین برود
- یکیگرفتن KPI عمومی HSE با KPI فرایندی
- نداشتن تفکیک بین شاخصهای پیشنگر و پسنگر
- گزارشدادن عدد بدون تحلیل ریسک
- نادیدهگرفتن severity و criticality
- پایش شاخص بدون مالک تصمیم
- نبود trend analysis
- نداشتن threshold روشن برای escalation
- استفاده از KPIهایی که به سناریوی واقعی واحد وصل نیستند
شاخص خوب فقط یک عدد نیست؛ باید رفتار تصمیمگیری را تغییر دهد.
چطور شاخص را به ابزار تصمیم مدیریتی تبدیل کنیم؟
یک KPI زمانی ارزش دارد که مدیریت را به تصمیم بهتر برساند. برای این کار:
- شاخص را به سناریوی ریسک وصل کنید.
- trend چندماهه و چندشیفته را نشان دهید.
- شاخص را بر اساس criticality تفکیک کنید.
- threshold هشدار و threshold اقدام تعریف کنید.
- کنار عدد، پیام مدیریتی بنویسید: «این یعنی چه؟»
- برای هر KPI مالک اقدام مشخص کنید.
- اگر شاخص بدتر شد، تصمیم قابل انتظار را از قبل روشن کنید.
مثلاً بهجای اینکه فقط بگویید:
- «backlog تست تجهیزات 18 درصد افزایش یافته»
بهتر است بگویید:
- «backlog تست تجهیزات بحرانی در این ماه 18 درصد افزایش یافته و 4 مورد آن مربوط به barrierهای سناریوی overpressure است؛ اگر تا قبل از start-up بعدی تعیینتکلیف نشود، قابلیت اتکای لایه حفاظتی اصلی زیر سؤال میرود.»
این همان چیزی است که مدیر میتواند بر مبنای آن تصمیم بگیرد.
جمعبندی
برای پایش Process Safety Performance، مهمترین شاخصها آنهایی نیستند که صرفاً فعالیت، انطباق یا آمار عمومی ایمنی را نشان میدهند؛ مهمترین شاخصها آنهایی هستند که ضعف در barrierها، افت یکپارچگی تجهیزات، انحراف از حدود ایمن، ضعف در مدیریت تغییر، آمادگی ناکافی راهاندازی و نزدیکشدن به loss of containment را آشکار میکنند.
در صنعت نفت، اگر داشبورد PSM فقط آرامش اداری نشان دهد، سازمان ممکن است در حالیکه همهچیز ظاهراً تحت کنترل است، به سمت حادثه بزرگ حرکت کند. بنابراین کارشناس PSM باید شاخصهایی را انتخاب کند که هم ریسکمحور باشند، هم به سناریوهای واقعی واحد وصل شوند، و هم به زبان تصمیم مدیریتی ترجمه شوند.
تمرین و تکلیف پیشنهادی
تمرین 1: غربالگری KPIهای فعلی سازمان
فهرست KPIهای فعلی HSE و PSM سازمان خود را تهیه کنید.
برای هر شاخص مشخص کنید:
- این شاخص عمومی است یا فرایندی؟
- پیشنگر است یا پسنگر؟
- به کدام سناریوی ریسک وصل است؟
- آیا واقعاً تصمیم مدیریتی را بهتر میکند؟
تمرین 2: طراحی داشبورد 10 شاخصه PSM
برای یک واحد عملیاتی واقعی، 10 KPI اصلی Process Safety انتخاب کنید.
برای هرکدام بنویسید:
- تعریف شاخص
- واحد اندازهگیری
- منبع داده
- دوره گزارشدهی
- threshold هشدار
- threshold اقدام
- مالک تصمیم
تمرین 3: تحلیل یک شاخص گمراهکننده
یک شاخص را پیدا کنید که در سازمان شما خوب به نظر میرسد اما تصویر واقعی ریسک را نشان نمیدهد.
توضیح دهید:
- چرا گمراهکننده است؟
- چه چیزی را پنهان میکند؟
- چه شاخص جایگزینی باید کنار آن قرار بگیرد؟
تمرین 4: اتصال KPI به سناریوی حادثه
سه سناریوی مهم حادثه بزرگ در واحد خود را بنویسید.
برای هر سناریو:
- barrierهای کلیدی را مشخص کنید
- برای هر barrier یک یا دو KPI پایش تعریف کنید
- توضیح دهید اگر شاخص بدتر شود، چه تصمیمی باید گرفته شود
تمرین 5: ساخت اسلاید مدیریتی
یک اسلاید یکصفحهای با عنوان زیر آماده کنید:
10 شاخص مهم برای پایش Process Safety Performance در واحد ما
در اسلاید این موارد را بیاورید:
- 10 شاخص اصلی
- 3 شاخصی که الآن در وضعیت هشدار هستند
- ریسک تصمیمنگرفتن درباره آنها
- 3 اقدام فوری برای مدیریت

دیدگاهتان را بنویسید
برای نوشتن دیدگاه باید وارد بشوید.