پلتفرم GPU به‌عنوان سرویس

Sovereign GPaaS

شتاب‌دهنده‌هایی را که هم‌اکنون در اختیار دارید به سرویسی با مصرف اندازه‌گیری‌شده تبدیل کنید.

Sovereign GPaaS یک لایه کنترل است که شتاب‌دهنده‌های سراسر مجموعه شما را در قالب یک منبع واحد و قابل زمان‌بندی یکپارچه می‌کند. تیم‌ها از طریق یک API کسری از یک GPU، یک کارت کامل یا یک گروه چندنودی درخواست می‌دهند و پلتفرم کار را جای‌گذاری می‌کند، سهمیه را اعمال می‌کند و مصرف را ثبت می‌کند. این سرویس روی سخت‌افزاری که همین حالا مالک آن هستید، داخل مرکز داده خودتان و بر پایه Kubernetes آپ‌استریم و بدون فورک اختصاصی اجرا می‌شود.

شتاب‌دهنده‌ای که بیکار مانده، همچنان فضای رک، برق و خنک‌سازی می‌گیرد و سرمایه پشت آن تا وقتی منتظر است هیچ بازدهی ندارد. یکپارچه‌سازی منابع، تخصیص کسری و صف‌بندی، بخش بیشتری از آن سرمایه را در برابر کار واقعی قرار می‌دهد و اندازه‌گیری مصرف به تفکیک هر مستأجر به شما امکان می‌دهد هزینه مصرف را به یک واحد کسب‌وکار منتقل کنید یا برای یک مستأجر بیرونی صورت‌حساب صادر کنید. میزان بهره‌برداری بیش از آنکه یک تصمیم سخت‌افزاری باشد، یک تصمیم پلتفرمی است: به این بستگی دارد که کار در لایه بالای کارت‌ها چگونه جای‌گذاری، تفکیک و صف‌بندی می‌شود.

معماری

چگونه ساخته شده است

06

مصرف و تسهیم هزینه

یک پورتال سلف‌سرویس و API که تیم‌ها از آن ظرفیت درخواست می‌کنند. هر تخصیص بر حسب مستأجر، پروژه و مدت زمان اندازه‌گیری می‌شود و این سوابق، ورودی صدور صورت‌حساب، showback یا chargeback داخلی است.

05

جداسازی چندمستأجری

مرزهای namespace، شبکه و دستگاه، مستأجرها را از هم جدا نگه می‌دارند، همراه با سوابق آماده ممیزی از اینکه چه کسی، چه چیزی و چه زمانی مصرف کرده است.

04

زمان‌بندی بار کاری

صف‌ها، اولویت‌ها، سیاست سهم منصفانه و زمان‌بندی گروهی (gang scheduling) کارهای آموزش، تنظیم دقیق (fine-tune) و استنتاج را روی شتاب‌دهنده درست می‌نشانند، بی‌آنکه تیم درخواست‌کننده نیاز داشته باشد بداند کار روی کدام کارت نشسته است.

03

استخرسازی و پارتیشن‌بندی GPU

برش نرم‌افزاری و پارتیشن‌بندی در سطح سخت‌افزار، کارت‌های مجزا را به یک استخر واحد از کسرها، دستگاه‌های کامل و گروه‌های چندنودی تبدیل می‌کند.

02

بستر بومی ابر

Kubernetes بالادستی (upstream) با شبکه آگاه از شتاب‌دهنده، از جمله RDMA، به‌همراه مشاهده‌پذیری و مدیریت چرخه عمر روی میزبان‌های x86 و ARM.

01

سخت‌افزار ناهمگون

شتاب‌دهنده‌هایی از چند سازنده و چند نسل سخت‌افزاری که از طریق یک رابط یکسان در اختیار بارهای کاری قرار می‌گیرند.

قابلیت‌ها

تخصیص کسری GPU

یک شتاب‌دهنده را میان چند بار کاری تقسیم کنید تا کارهای کوچک دیگر کارت‌های کاملی را که نمی‌توانند پر کنند اشغال نکنند.

استخر یکپارچه شتاب‌دهنده‌ها

یک استخر واحد که چند سازنده و چند نسل سخت‌افزاری را در بر می‌گیرد، تا تیم‌ها ظرفیت را از کل دارایی برداشت کنند، نه از یک ماشین مشخص.

سهمیه و صف‌بندی

سهمیه به تفکیک مستأجر، اولویت‌ها، صف‌های سهم منصفانه و زمان‌بندی گروهی، استخر را پرکار نگه می‌دارد، بدون آنکه یک تیم بقیه را از منابع محروم کند.

سنجش مصرف هر مستأجر

هر تخصیص بر حسب مستأجر، پروژه و مدت زمان ثبت می‌شود و آماده chargeback، showback یا صدور صورت‌حساب بیرونی است.

چندمستأجری سخت‌گیرانه

جداسازی در سطح namespace، شبکه و دستگاه، با اعمال محدودیت حافظه و محاسبات برای هر تخصیص و سوابق دسترسی آماده ممیزی.

سرویس‌دهی آمادهٔ استنتاج

رانتایم‌های سرویس‌دهی با تفکیک prefill و decode و بازاستفاده از کش attention، استخر را به‌جای ظرفیت خام، به‌صورت یک نقطه پایانی استنتاج اندازه‌گیری‌شده ارائه می‌کنند.

تأمین منابع سلف‌سرویس

تیم‌ها به‌جای ثبت تیکت برای یک ماشین فیزیکی، ظرفیت را از یک API و پورتال واحد برمی‌دارند.

باز و قابل انتقال

رابط‌های استاندارد Kubernetes، دسترسی کامل به کد منبع و انتقال دانش، تا مهندسان خودتان بتوانند از پلتفرم بهره‌برداری کنند و اگر خواستند آن را جابه‌جا کنند.

کجا به کار می‌آید

  • یک تیم پژوهشی هفته‌ای چند ساعت به شتاب‌دهنده نیاز دارد، اما یک کارت کامل را به‌طور دائم در اختیار دارد، چون راهی برای دادن سهم کمتر به آن وجود ندارد.
  • تیم‌های ریسک، تقلب و خدمات مشتری هرکدام GPUهای خودشان را خریده‌اند و هیچ‌کدام نمی‌تواند ظرفیت مازادش را به دیگری قرض دهد.
  • واحد مالی نمی‌تواند بگوید کدام واحد کسب‌وکار مسئول ردیف شتاب‌دهنده در بودجه زیرساخت است.
  • یک اپراتور می‌خواهد ظرفیت GPU را به مستأجران بیرونی بفروشد، اما راهی برای جداسازی، اندازه‌گیری مصرف و صدور صورت‌حساب آن‌ها ندارد.
  • یک ممیز می‌پرسد کدام مستأجر به کدام شتاب‌دهنده و کدام داده دسترسی داشته است، و پاسخ باید از سوابق به دست آید، نه از حافظه.

آنچه در نهایت به دست می‌آورید

مشتری در نهایت مالک یک سرویس GPU چندمستأجری با اندازه‌گیری مصرف می‌شود، روی شتاب‌دهنده‌های خودش و در مرکز داده خودش؛ سیاست زمان‌بندی، مرزهای جداسازی و سوابق صورت‌حساب در کنترل اوست و مهندسانش برای اجرای آن آموزش دیده‌اند.

بقیهٔ استک

ملاقات آنلاین

به راحتی زمان مورد‌نظر خود را برای ارتباط ۳۰ دقیقه‌ای با تیم متخصص نئور انتخاب کنید.

Ali Salmaji

علی سلماجی

طراح سیستم‌های مبتنی بر فرآیند دوآپس

کمک بیشتری نیاز دارید؟

از تقویم زیر زمان آزاد خود را برای جلسه انتخاب کنید.

هم‌اکنون قرار ملاقات برگزار کنیم