فناوری · GPU و هوش مصنوعی
Gateway API Inference Extension در دزکوب
مسیریابی آگاه به استنتاج
- لایسنس
- Apache 2.0
- گروه در استک
- GPU و هوش مصنوعی
Gateway API Inference Extension چیست
افزونهای بر Gateway API که مسیریابی را برای بار کاری استنتاج بهینه میکند — چون درخواست به یک مدل زبانی، با یک درخواست HTTP معمولی فرق دارد: طولانیتر است، منابع بیشتری میگیرد، و توزیع بارِ ساده برایش خوب کار نمیکند.
چرا این را انتخاب کردیم
| گزینهای که رد شد | چرا نه |
|---|---|
| توزیع بار round-robin ساده | نمونهای که یک درخواست سنگین دارد، همانقدر درخواست میگیرد که نمونهٔ بیکار |
| مسیریابی اختصاصی خودمان | استانداردِ در حال شکلگیری همین است؛ همسو ماندن بهتر از واگرا شدن است |
ما دقیقاً چطور استفادهاش میکنیم
- مسیریابی بین نمونههای یک مدل سروشده، با آگاهی از بار واقعی.
- همکاری با لایهٔ گیتوی هوش مصنوعی، که سیاست و مجوز را اعمال میکند.
برای شما چه چیزی عوض میشود
- توزیع بار کورمسیریابی آگاه به بار
- تأخیر نامتوازن بین نمونههاتوزیع بهتر
مرزها و محدودیتها
این سکشن در هر صفحهٔ فناوری اجباری است. هر ابزاری مرزی دارد؛ صفحهای که مرزش را نگوید، بقیهاش هم قابل اتکا نیست.
- این استاندارد نسبتاً جوان است و در حال تکامل. ما آن را بهعنوان یک لایهٔ بهینهسازی استفاده میکنیم، نه بهعنوان مسیر حیاتی — یعنی اگر لازم شود، بدون آن هم کار میکند.
اینها را هم ببینید
این را روی زیرساخت خودتان ببینید.
همین مؤلفه را در کلاستر شما پیکربندی میکنیم و نشان میدهیم.