تداوم و تاب‌آوری

بازیابی از فاجعه و دسترس‌پذیری بالا

بازیابی‌ای که اثباتش کرده‌اید، نه بازیابی‌ای که وعده‌اش را داده‌اید.

بازیابی از فاجعه و دسترس‌پذیری بالا یک پلتفرم تداوم در سطح اپلیکیشن است. این پلتفرم خودِ اپلیکیشن را — فضاهای نام، بارهای کاری، StatefulSetها، سرویس‌ها، پیکربندی، سکرت‌ها و والیوم‌های پایا — به ترتیب وابستگی و تا رسیدن به وضعیت در حال اجرا و راستی‌آزمایی‌شده بازیابی می‌کند. ابزارهای متعارف ماشین‌ها را بازمی‌گردانند و تصمیم درباره اینکه چه چیزی و با چه ترتیبی باید بالا بیاید را، آن هم در میانه حادثه، به تیم عملیات واگذار می‌کنند.

قطعی در یک سازمان تحت مقررات فقط از دست رفتن درآمد نیست؛ یک رویداد نظارتی است. نهادهای ناظر بیش از پیش خواهان اهداف بازیابی مستندی هستند که در عمل آزموده شده باشند، و خواهان ردّ ممیزی‌ای که نشان دهد این اهداف برقرارند. نئور اهدافی به شما می‌دهد که می‌توانید آنها را پیکربندی کنید، تمرین کنید و شواهدشان را ارائه دهید — روی زیرساختی که مالک آن هستید و درون مرزی که خودتان کنترل می‌کنید.

معماری

چگونه ساخته شده است

05

ارکستراسیون بازیابی

بازگردانی در سطح namespace با فیلتر کردن بر پایهٔ label-selector؛ به این ترتیب یک سرویس از کار افتاده را می‌توان بدون دست زدن به بارهای کاری کنار آن بازگرداند.

04

موتور راه‌اندازی جایگزین

بررسی پیوستهٔ سلامت همهٔ کلاسترهای ثبت‌شده؛ به‌محض آنکه یک کلاستر بیش از دورهٔ مهلت خود ناسالم بماند، موتور آن را taint می‌کند، podها را با تخلیهٔ کنترل‌شده (graceful eviction) خارج می‌کند و آن‌ها را روی ظرفیت سالم زمان‌بندی مجدد می‌کند.

03

لایه کنترل سراسری

یک کلاستر مدیریتی که خودتان میزبانی می‌کنید و زمان‌بندی میان‌سایتی، سیاست راه‌اندازی جایگزین و وضعیت سلامت کل مجموعه را نگه می‌دارد.

02

کلاسترهای عضو

کلاسترهای عملیاتی، آماده‌به‌کار و کلاسترهای اختصاصیِ بازیابی، در مراکز دادهٔ خودتان یا محیط‌های میزبانی‌شده، به‌عنوان اعضای مدیریت‌شده ثبت می‌شوند و بارهای کاری بر پایهٔ وزن یا ظرفیت در دسترس روی آن‌ها قرار می‌گیرند.

01

پشتیبان‌گیری و ذخیره‌گاه وضعیت

اسنپ‌شات‌های کامل و افزایشیِ زمان‌بندی‌شده از namespaceهای برنامه و وضعیت کلاستر، که در بک‌اند ذخیره‌سازی مورد نظر شما نوشته می‌شوند: فضای ذخیره‌سازی شیئی سازگار با S3، NFS در محل، یا یک ذخیره‌ساز شیئی خصوصی.

قابلیت‌ها

بازیابی در سطح اپلیکیشن

namespaceها، deploymentها، stateful setها، سرویس‌ها، config mapها، secretها و persistent volumeها را به ترتیب وابستگی بازیابی می‌کند و به وضعیت یک برنامهٔ در حال اجرا می‌رساند، نه به یک ایمیج ماشین که سرِهم‌کردن آن همچنان بر عهدهٔ خودتان است.

تشخیص و راه‌اندازی جایگزین خودکار

سلامت کلاستر به‌طور پیوسته مانیتور می‌شود؛ وقتی یک کلاستر از آستانهٔ ناسالمی خود عبور کند، تخلیه و زمان‌بندی مجدد به‌صورت خودکار آغاز می‌شود، بدون انتظار برای مداخلهٔ اپراتور.

راه‌اندازی جایگزین بین‌سایتی و بین‌ابری

راه‌اندازی جایگزین میان کلاسترهای یک سایت، میان مراکز دادهٔ جداگانه، و میان محیط‌های در محل و میزبانی‌شده اجرا می‌شود، از جمله استقرارهای توزیع‌شدهٔ جغرافیایی در سراسر زون‌های دسترس‌پذیری و مناطق.

فعال-فعال و فعال-آماده‌به‌کار

هر دو توپولوژی زیر یک لایه کنترل واحد پشتیبانی می‌شوند، همراه با مانیتورینگ پیوستهٔ سلامت و تحمل‌های تخلیهٔ قابل پیکربندی.

اهداف پیکربندی‌پذیر و قابل ممیزی

بازه‌های مانیتورینگ، دوره‌های مهلت ناسالمی و مهلت‌های زمانی تخلیه به‌صراحت تنظیم می‌شوند؛ به این ترتیب RPO و RTO به پارامترهای مهندسی‌ای تبدیل می‌شوند که می‌توانید بخوانید، تغییر دهید و گزارش کنید، نه اعدادی در یک سند سیاست‌گذاری.

بازیابی تمرین‌شده و مستند

یک مانور همان مسیر خودکاری را طی می‌کند که یک رخداد واقعی طی می‌کرد، و هر اجرا یک سابقهٔ قابل ممیزی به‌جا می‌گذارد؛ بنابراین بازیابی نشان داده می‌شود، نه ادعا.

بازگردانی گزینشی و کامل

بازگردانی در سطح namespace پاسخگوی از کار افتادن یک سرویس در محیط عملیاتی است؛ بازگردانی کامل از اسنپ‌شات پاسخگوی از دست رفتن یک کلاستر کامل است. اولی شعاع اثر را محدود می‌کند و دومی زمان بازسازی را.

ارکستراسیون حاکمیتی

پلتفرم به‌طور کامل درون محیط شما اجرا می‌شود و هیچ نیازی به ارتباط با بیرون (call-home) ندارد؛ بنابراین تصمیم‌های راه‌اندازی جایگزین، دستورالعمل‌های بازیابی و داده‌های پشتیبان‌گیری هرگز از مرزی که در کنترل شما نیست عبور نمی‌کنند.

کجا به کار می‌آید

  • یک پلتفرم تراکنش اصلی باید از دست رفتن یک مرکز داده کامل را تاب بیاورد، و هیئت‌مدیره می‌خواهد زمان جابه‌جایی ثبت شود.
  • یک ممیز مدرک می‌خواهد که طرح بازیابی امسال تمرین شده است، نه صرفاً نوشته و بایگانی شده.
  • شبانه یک سرویس در محیط عملیاتی از کار می‌افتد و باید به‌تنهایی بازیابی شود، بدون آنکه بارهای کاری در حال اجرا در کنار آن مختل شوند.
  • اپلیکیشن‌ها میان یک سایت درون‌سازمانی و یک ناحیه میزبانی‌شده تقسیم شده‌اند، و راه‌اندازی جایگزین امروز یعنی دو دستورالعمل اجرایی دستی جداگانه که هرگز با هم اجرا نشده‌اند.
  • یک سامانه بخش عمومی باید همه نسخه‌های داده‌های خود را داخل مرزهای ملی نگه دارد و در عین حال یک سایت فعال دوم برای تداوم داشته باشد.

آنچه در نهایت به دست می‌آورید

یک توانمندی تداوم که تمام‌وکمال مالک آن هستید: اهداف بازیابی که پیکربندی می‌شوند، خودکار می‌شوند، تمرین می‌شوند و شواهدشان ثبت می‌شود، و روی زیرساخت خودتان و درون حوزه قضایی خودتان اجرا می‌شوند.

بقیهٔ استک

ملاقات آنلاین

به راحتی زمان مورد‌نظر خود را برای ارتباط ۳۰ دقیقه‌ای با تیم متخصص نئور انتخاب کنید.

Ali Salmaji

علی سلماجی

طراح سیستم‌های مبتنی بر فرآیند دوآپس

کمک بیشتری نیاز دارید؟

از تقویم زیر زمان آزاد خود را برای جلسه انتخاب کنید.

هم‌اکنون قرار ملاقات برگزار کنیم