محاسبات با کارایی بالا

Sovereign HPC

شبیه‌سازی و هوش مصنوعی روی یک کلاستر واحد، درون مرزهای خودتان.

Sovereign HPC، محاسبات پرکارایی کلاسیک و بارهای کاری بومی ابر را روی یک مجموعه فیزیکی واحد اجرا می‌کند. کدهای شبیه‌سازی که به صف دسته‌ای سپرده می‌شوند و کارهای هوش مصنوعی کانتینری که با Kubernetes ارکستره می‌شوند، همگی از یک استخر محاسباتی واحد، یک لایه ذخیره‌سازی پرگذردهی و یک فابریک کم‌تأخیر استفاده می‌کنند. این پلتفرم در مراکز داده خودتان، روی سخت‌افزاری که مالک آن هستید و تحت کنترل‌های هویت و ممیزی خودتان مستقر می‌شود.

بسیاری از سازمان‌ها در عمل مالک دو ماشین می‌شوند: یک کلاستر پژوهشی که هفته‌ها جلوتر رزرو شده، و یک پلتفرم کانتینری که تیم‌های اپلیکیشن آن را همیشه‌روشن فرض می‌کنند. هر دو در ساعت‌های متفاوتی بیکار می‌مانند و سرمایه دو بار درگیر می‌شود. یکپارچه‌کردن آنها این ظرفیت آزاد را بازمی‌گرداند و اجازه می‌دهد یک برنامه هوش مصنوعی روی زیرساختی که سازمان همین حالا دارد آغاز شود، نه روی یک حساب ابری خارجی.

معماری

چگونه ساخته شده است

05

ارسال بار کاری

پژوهشگران، مهندسان و تیم‌های داده کارها را از طریق کنسول وب، خط فرمان یا API ارسال می‌کنند؛ اسکریپت‌های کار دسته‌ای، خطوط لوله کانتینری و اجراهای آموزش، همگی از یک درگاه واحد وارد می‌شوند.

04

زمان‌بندی یکپارچه

یک لایه زمان‌بندی واحد جای هر کار را تعیین می‌کند و میان صف‌های دسته‌ای و بارهای کاری کانتینری، بر پایه سیاست‌های اولویت، محلی‌بودن داده، نوع شتاب‌دهنده و انرژی داوری می‌کند.

03

رانتایم‌ها و محیط‌ها

ایمیج‌های کانتینری تکرارپذیر، رانتایم‌های MPI و شتاب‌دهنده‌های پارتیشن‌شده، به هر کار یک محیط اجرای تثبیت‌شده و قابل حمل روی نودهای x86 یا ARM می‌دهند.

02

داده و فابریک

یک فایل‌سیستم موازی با توان عبور بالا داده‌های در حال کار را نگه می‌دارد، ذخیره‌سازی شیئی مجموعه‌داده‌ها، نقاط بازرسی و نتایج را نگه می‌دارد و یک اتصال داخلی RDMA ترافیک میان نودها را با تأخیر کم منتقل می‌کند.

01

زیرساخت حاکمیتی

پردازش، ذخیره‌سازی و شبکه در مراکز داده و سایت‌های لبه خودتان قرار دارند؛ تحت هویت، ممیزی و کنترل تغییر شما و بدون وابستگی به یک اپراتور خارجی.

قابلیت‌ها

کارهای دسته‌ای و کانتینرها در کنار هم

یک صف دسته‌ای و یک کلاستر Kubernetes همان نودها را به اشتراک می‌گذارند، بنابراین کارهای شبیه‌سازی و سرویس‌های کانتینری به‌جای دو ماشین جداگانه از یک استخر پردازشی واحد بهره می‌گیرند.

کلاسترهای کشسان بنا به تقاضا

پارتیشن‌های دسته‌ای به‌فراخور نیاز برنامه‌ها ایجاد و برچیده می‌شوند و به یک گروه پژوهشی برای تمام مدت یک پروژه کلاستر خصوصی می‌دهند، بدون آنکه سخت‌افزار اختصاصی برای آن خریداری شود.

زمان‌بندی بین‌سایتی

سیاست‌های جانمایی، عمق صف، محلی‌بودن داده، نوع شتاب‌دهنده و ظرفیت سایت را می‌سنجند تا تعیین کنند یک کار روی کلاستر مرکزی یا هر سایت ثانویه یا لبه متصل اجرا شود.

شبکه و ذخیره‌سازی کم‌تأخیر

کارهای MPI با جفت‌شدگی تنگاتنگ، از یک اتصال داخلی RDMA و یک فایل‌سیستم موازی با توان عبور بالا بهره می‌برند و پشت آن ذخیره‌سازی شیئی برای مجموعه‌داده‌ها، نقاط بازرسی و نتایج قرار دارد.

محیط‌های تکرارپذیر برای اجرای کار

کارها به‌صورت کانتینر با وابستگی‌های تثبیت‌شده بسته‌بندی می‌شوند و برای هر دو معماری x86 و ARM ساخته می‌شوند، تا بتوان یک اجرا را بعداً روی سخت‌افزار متفاوت و در همان محیط تکرار کرد.

تخصیص ریزدانهٔ GPU

شتاب‌دهنده‌ها پارتیشن‌بندی و میان کارها به اشتراک گذاشته می‌شوند، به‌جای آنکه برای تمام مدت یک رزرو به‌طور کامل در اختیار بمانند؛ بنابراین گام‌های کوتاه استنتاج و پیش‌پردازش، کار آموزش را مسدود نمی‌کنند.

مشاهده‌پذیری یکپارچه

متریک‌ها، لاگ‌ها و حسابداری کارها از هر دو سمت دسته‌ای و کانتینری در یک جا گرد می‌آیند، از جمله انرژی مصرف‌شده به‌ازای هر کار، تا بتوان مصرف انرژی را به یک پروژه نسبت داد و آن را به سیاست زمان‌بندی بازخورد داد.

مدل عملیاتی حاکمیتی

همکاری‌ها شامل دسترسی به کد منبع، پایه‌های متن‌باز سازگار با upstream و انتقال دانش ساختاریافته است، تا کارکنان خودتان بتوانند کلاستر را بدون وابستگی به ما اجرا و توسعه دهند.

کجا به کار می‌آید

  • یک مؤسسه پژوهشی صف‌های شبیه‌سازی را روی یک کلاستر و تیم‌های هوش مصنوعی را روی کلاستری دیگر اجرا می‌کند؛ هر دو بازه‌های طولانی بی‌کار می‌مانند و هیچ‌کدام نمی‌تواند ظرفیت دیگری را قرض بگیرد.
  • یک گروه مدل‌سازی اپیدمیولوژیک به هزاران اجرای سناریو نیاز دارد و باید بتواند هر یک از آن‌ها را ماه‌ها بعد برای بازبینی عیناً بازتولید کند.
  • یک سازمان هواشناسی باید اجراهای پیش‌بینی خود را در یک بازه ثابت روزانه تحویل دهد، صرف‌نظر از اینکه چه چیز دیگری روی ماشین در صف قرار گرفته است.
  • یک تیم مهندسی شبیه‌سازی‌های MPI با جفت‌شدگی تنگاتنگ اجرا می‌کند که به اتصال داخلی با تأخیر پایین نیاز دارند، در حالی که تیم علم داده در کنار آن‌ها همان شتاب‌دهنده‌ها را برای آموزش می‌خواهد.
  • یک برنامه ملی کشاورزی یا مانیتورینگ شبکه برق، داده‌ها را در سایت‌های دورافتاده جمع‌آوری می‌کند، آن‌ها را در لبه پیش‌پردازش می‌کند و تحلیل سنگین را به کلاستر مرکزی می‌سپارد.

آنچه در نهایت به دست می‌آورید

یک مجموعه پرکارایی واحد که سازمان به‌صورت سرتاسری آن را کنترل می‌کند — سخت‌افزاری که مالک آن است، کد منبعی که می‌تواند بخواند و تغییر دهد، و دانش عملیاتی لازم برای اجرای هر دو — با شبیه‌سازی و هوش مصنوعی که در کنار هم و درون مرزهای خودش اجرا می‌شوند.

بقیهٔ استک

زیرساخت ابری

Sovereign IaaS

ماشین‌های مجازی و کانتینرها روی یک لایه کنترل.

مشاهده

پلتفرم به‌عنوان سرویس

Sovereign PaaS

سیستم‌عامل ابری‌بومی برای کل زیرساخت شما.

مشاهده

پلتفرم هوش مصنوعی به‌عنوان سرویس

Sovereign AI PaaS

کارخانه کامل هوش مصنوعی شما، درون مرزهای خودتان.

مشاهده

Kubernetes به‌عنوان سرویس

Sovereign KaaS

Kubernetes عملیاتی؛ بهره‌برداری با ما، مالکیت با شما.

مشاهده

پلتفرم GPU به‌عنوان سرویس

Sovereign GPaaS

شتاب‌دهنده‌هایی را که هم‌اکنون در اختیار دارید به سرویسی با مصرف اندازه‌گیری‌شده تبدیل کنید.

مشاهده

مدیریت یکپارچه چندابری

پلتفرم چندابری

یک لایه کنترل واحد روی همه‌ی ابرها؛ داده‌های مشمول مقررات داخل کشور می‌ماند.

مشاهده

تداوم و تاب‌آوری

بازیابی از فاجعه و دسترس‌پذیری بالا

بازیابی‌ای که اثباتش کرده‌اید، نه بازیابی‌ای که وعده‌اش را داده‌اید.

مشاهده

از ابر تا لبه

پلتفرم اینترنت اشیا و لبه

همه‌ی سایت‌ها را از یک کنسول اداره کنید، حتی وقتی ارتباط قطع می‌شود.

مشاهده

ملاقات آنلاین

به راحتی زمان مورد‌نظر خود را برای ارتباط ۳۰ دقیقه‌ای با تیم متخصص نئور انتخاب کنید.

Ali Salmaji

علی سلماجی

طراح سیستم‌های مبتنی بر فرآیند دوآپس

کمک بیشتری نیاز دارید؟

از تقویم زیر زمان آزاد خود را برای جلسه انتخاب کنید.

هم‌اکنون قرار ملاقات برگزار کنیم