راهاندازی هوش مصنوعی در محل برای سازمانی که به کنترل داده، اتصال داخلی یا استقلال عملیاتی نیاز دارد قابل بررسی است. اما خرید H100 یا H200 پیش از شناخت بار کاری میتواند به ظرفیت نامتناسب منجر شود. انتخاب سرور باید از مدل، طول ورودی، تعداد درخواست همزمان و هدف زمان پاسخ شروع شود.
این راهنما درباره ظرفیتسنجی فنی است. قیمت و موجودی تجهیزات باید هنگام تأمین بررسی شود و نتیجه نهایی به آزمون روی پیکربندی واقعی نیاز دارد. اجرای محلی نیز بهتنهایی امنیت یا قطع کامل ارتباط بیرونی را تضمین نمیکند؛ مسیر داده و وابستگیهای نرمافزار باید بررسی شوند.
ابتدا نوع کار را مشخص کنید
اجرای مدل برای پاسخگویی با آموزش کامل مدل یک نیاز سختافزاری ندارد. تنظیم سبک مدل با آداپتور نیز با آموزش از صفر متفاوت است. ممکن است سازمان فقط به چتبات اسناد یا استخراج متن نیاز داشته باشد و یک مدل کوچکتر پاسخ کافی بدهد.
فهرست کنید چه مدل یا خانواده مدلی بررسی میشود، داده متنی است یا تصویر و صوت، حداکثر طول درخواست چقدر است و چه تعداد کاربر همزمان پاسخ میخواهند. برای انتخاب روش نرمافزاری، مقایسه RAG و تنظیم مدل را پیش از تصمیم سختافزار بخوانید.
حافظه وزن مدل فقط نقطه شروع است
برای یک برآورد آموزشی، مدل هفت میلیارد پارامتری با دو بایت برای هر پارامتر حدود ۱۴ میلیارد بایت حافظه برای وزنها نیاز دارد. این عدد تقریباً ۱۴ گیگابایت دهدهی است و حافظه لازم برای اجرای کامل نیست. حافظه موقت، کش توجه، بافرها و سربار نرمافزار نیز باید در نظر گرفته شوند.
با افزایش طول گفتگو و درخواستهای همزمان، مصرف حافظه میتواند افزایش پیدا کند. کمدقتسازی وزنها ممکن است مصرف را کم کند، اما پشتیبانی موتور اجرا و اثر روی کیفیت باید بررسی شود. عدد تبلیغاتی ظرفیت مدل را بدون نسخه مدل، نوع دقت و طول ورودی مبنای خرید قرار ندهید.
تفاوت H100 و H200 را با مدل دقیق دستگاه بخوانید
در مشخصات رسمی، H100 SXM با ۸۰ گیگابایت حافظه و H100 NVL با ۹۴ گیگابایت برای هر GPU معرفی شدهاند؛ این دو را نباید صرفاً با نام H100 یکسان فرض کرد. صفحه رسمی H100 فرم سختافزار و مشخصات هر گزینه را جدا نشان میدهد.
برای H200 SXM و H200 NVL، مشخصات رسمی NVIDIA ظرفیت ۱۴۱ گیگابایت و پهنای باند حافظه ۴٫۸ ترابایت بر ثانیه را درج میکند. ظرفیت بالاتر میتواند برای بارهای حافظهمحور مفید باشد، اما نسبت سرعت یک آزمایش مشخص را نباید برای هر مدل و تعداد کاربر تعمیم داد.
مدل GPU، فرم SXM یا PCIe، سازگاری سرور، ارتباط بین کارتها و توان مصرفی کل سامانه را با هم بررسی کنید. افزایش تعداد کارتها همیشه به افزایش خطی سرعت منجر نمیشود؛ ارتباط و تقسیم کار نیز بخشی از طراحی است.
سرور فقط کارت گرافیک نیست
RAM میزبان، پردازنده، ذخیرهسازی و شبکه روی آمادهسازی مدل و پاسخگویی اثر دارند. انتقال داده، بارگذاری وزن و ثبت رخدادها میتوانند گلوگاه ایجاد کنند. برق، خنککاری و فضای رک باید برای پیکربندی واقعی سنجیده شوند، نه صرفاً برای یک کارت.
- مدل دقیق GPU و تعداد کارتها همراه با سازگاری شاسی ثبت شود.
- ظرفیت RAM و فضای لازم برای چند نسخه مدل و داده آزمایشی مشخص باشد.
- مسیر شبکه کاربران، سرویس احراز هویت و منابع داده طراحی شود.
- پایش دما، حافظه، خطا و صف درخواست فعال باشد.
- برنامه پشتیبانگیری و بازیابی تنظیمات، داده و نسخه مدل آماده شود.
برای استقرار بدون اینترنت، دانلود اولیه، مجوز مدل، بستههای نرمافزاری و فرایند بهروزرسانی نیز باید برنامه داشته باشند. عبارت «آفلاین» باید در آزمون واقعی قطع ارتباط خارجی بررسی شود.
آزمون ظرفیت را چگونه انجام دهیم؟
چند گروه درخواست بسازید: متن کوتاه، متن بلند، پاسخ کوتاه و پاسخ بلند. سپس تعداد درخواست همزمان را مرحلهای افزایش دهید. زمان رسیدن اولین بخش پاسخ، زمان تکمیل، درصد خطا و اوج حافظه را ثبت کنید. میانگین خوب نباید انتظار طولانی گروهی از کاربران را پنهان کند.
در راهنمای بهینهسازی vLLM رابطه تنظیمات حافظه و پردازش درخواستها توضیح داده میشود. انتخاب تنظیمات باید با گزارش آزمون پروژه همراه باشد. قبل و بعد از تغییر دقت یا محدودیت طول، کیفیت پاسخ را هم دوباره بسنجید.
هزینه کل بهرهبرداری را بسنجید
هزینه محلی شامل سختافزار، نگهداری، برق، فضای میزبانی و زمان تیم عملیاتی است. سرویس بیرونی ساختار هزینه دیگری دارد. برای مقایسه، حجم مصرف واقعی و هزینه هر کار موفق را معیار قرار دهید؛ ساعتهایی که سرور بدون استفاده میماند هم در هزینه مالکیت اثر دارند.
پیکربندی مناسب باید امکان رشد و جایگزینی نسخه مدل را داشته باشد. همزمان، ظرفیت ذخیره بیش از نیاز بدون دلیل فنی هزینه ایجاد میکند. گزارش پایلوت بهترین ابزار برای انتخاب میان سرور کوچکتر، چند GPU یا معماری ترکیبی است.
برای سفارش استقرار در محل چه اطلاعاتی لازم است؟
نوع کار، مدلهای مورد بررسی، تعداد کاربران، طول معمول ورودی، سطح محرمانگی و مشخصات زیرساخت موجود را آماده کنید. در خدمات راهاندازی هوش مصنوعی در محل ستایش میتوانید دامنه بررسی و استقرار را ببینید. درخواست مناسب باید به طراحی، آزمون ظرفیت و تحویل عملیاتی منتهی شود؛ نام یک کارت گرافیک بهتنهایی مشخصات پروژه نیست.




دیدگاهها(0)