دسته‌بندی نشده

زیرساخت مورد نیاز برای ساخت AI در مقیاس بزرگ چیست؟

راه‌اندازی زیرساخت هوش مصنوعی فقط در یک GPU رده‌بالا خلاصه نمی‌شود. به‌محض بزرگ شدن پروژه متوجه می‌شوید که حافظه، فضای ذخیره‌سازی، شبکه و حتی تهویه تا چه حد حیاتی هستند. برای ساخت AI در مقیاس بزرگ باید همه این اجزا براساس نوع کار پروژه و به‌صورت هماهنگ طراحی شوند. در این مقاله پس از شناخت نحوه انتخاب GPU و زیرساخت مورد نیاز برای ساخت هوش مصنوعی، نیاز به سیستم‌های چندگانه و تجهیزات شبکه را بررسی می‌کنیم و در نهایت برای انتخاب بهترین سرور هوش مصنوعی میان زیرساخت ابری، اختصاصی و داخلی به شما کمک خواهیم کرد.

زیرساخت هوش مصنوعی چیست و چه تفاوتی با زیرساخت‌های سنتی دارد؟

زیرساخت هوش مصنوعی مجموعه‌ای از منابع پردازشی، حافظه، شبکه، فضای ذخیره‌سازی، نرم‌افزار و امکانات عملیاتی است که برای آموزش، تنظیم دقیق و اجرای مدل‌های هوش مصنوعی استفاده می‌شود. تفاوت آن با زیرساخت معمول فناوری اطلاعات در این است که پروژه‌های هوش مصنوعی معمولاً به پردازش موازی بیشتر، انتقال سریع‌تر داده و منابع قابل‌توسعه نیاز دارند.

برای نمونه، استفاده از یک سرویس آماده هوش مصنوعی با اجرای مستقیم یک مدل روی زیرساخت اختصاصی، یکسان نیست. در حالت دوم، اندازه مدل، حجم داده، تعداد کاربران و نوع بار کاری مشخص می‌کنند زیرساخت مورد نیاز برای ساخت هوش مصنوعی چه مشخصاتی داشته باشد.

مهم‌ترین تفاوت‌های زیرساخت هوش مصنوعی با  زیرساخت سنتی را می‌توان در این موارد دید:

  • پردازش موازی بیشتر: مدل‌های یادگیری عمیق حجم زیادی محاسبه را همزمان انجام می‌دهند و به GPU، TPU یا دیگر شتاب‌دهنده‌ها نیاز دارند.
  • حافظه بیشتر و سریع‌تر: ظرفیت حافظه و سرعت دسترسی به آن می‌تواند مستقیماً روی عملکرد مدل اثر بگذارد.
  • ارتباط سنگین میان پردازنده‌ها: در سامانه‌های چند GPU، حجم زیادی داده باید بین پردازنده‌ها جابه‌جا شود.
  • ذخیره‌سازی سریع‌تر: مجموعه داده، مدل و فایل‌های میانی باید بدون وقفه در اختیار بخش پردازشی قرار بگیرند.
  • حساسیت بیشتر به تاخیر: در سرویس‌های برخط، تاخیر شبکه یا ذخیره‌سازی می‌تواند زمان پاسخ را افزایش دهد.
  • مصرف برق و گرمای بیشتر: یک سرور AI چند GPU معمولاً نسبت به سرورهای عمومی به برق و خنک‌سازی بیشتری نیاز دارد.
  • نیاز به توسعه‌پذیری: معماری باید بتواند از یک GPU به چند GPU یا چند سرور گسترش پیدا کند.

به همین دلیل، زیرساخت AI را باید یک سیستم یکپارچه در نظر گرفت؛ یعنی پردازنده، حافظه، شبکه، ذخیره‌سازی و مدیریت منابع باید با ظرفیت نزدیک به هم انتخاب شوند.

اجزای اصلی زیرساخت مورد نیاز برای ساخت AI

اجزای اصلی زیرساخت مورد نیاز برای ساخت AI

برای انتخاب درست زیرساخت محاسباتی AI بهتر است ابتدا تصویر کلی سیستم مشخص باشد. هر بخش وظیفه مشخصی دارد و ضعف در هر لایه می‌تواند عملکرد کل سامانه را محدود کند.

لایهاجزای نمونهنقش اصلی
پردازشGPU، CPU، TPUاجرای محاسبات مدل
حافظهRAM، VRAM، HBMنگهداری مدل و داده فعال
شبکهEthernet، InfiniBand، NVLinkانتقال داده بین پردازنده‌ها و سرورها
ذخیره‌سازیNVMe، ذخیره‌سازی فایلی و شیءنگهداری داده، مدل و فایل‌های میانی
نرم‌افزارLinux، CUDA، ROCm، PyTorchاجرای مدل و ارتباط با سخت‌افزار
مدیریت منابعKubernetes، زمان‌بندتقسیم منابع میان کارها
عملیات مدلMLOps، پایشمدیریت چرخه عمر مدل
دیتاسنتربرق، خنک‌سازی، UPSپایداری فیزیکی زیرساخت

این جدول نشان می‌دهد که زیرساخت هوش مصنوعی به یک قطعه خاص وابسته نیست. GPU قوی در کنار شبکه یا ذخیره‌سازی ضعیف، همان کارایی مورد انتظار را ایجاد نمی‌کند. بنابراین بهتر است طراحی را از پردازش و حافظه شروع کنیم و بعد به سرور، شبکه و ذخیره‌سازی برسیم.

GPU، CPU و حافظه؛ هسته محاسباتی زیرساخت AI

پردازنده گرافیکی (GPU) یکی از مهم‌ترین اجزای سخت افزار مورد نیاز هوش مصنوعی است؛ چون می‌تواند تعداد زیادی محاسبه را به‌صورت موازی انجام بدهد. به همین دلیل، GPU برای هوش مصنوعی در آموزش مدل‌های بزرگ، تنظیم دقیق و اجرای تعداد زیادی درخواست همزمان کاربرد گسترده‌ای دارد.

بااین‌حال، CPU هنوز بخش مهمی از سیستم است. آماده‌سازی داده، بارگذاری فایل‌ها، اجرای سیستم‌عامل و بخشی از پردازش اولیه روی CPU انجام می‌شود. اگر CPU نتواند داده را با سرعت مناسب آماده کند، GPU نیز بخشی از زمان خود را منتظر می‌ماند.

در کنار GPU، پردازنده‌های TPU، NPU و شتاب‌دهنده‌های تخصصی هوش مصنوعی نیز وجود دارند. انتخاب میان این گزینه‌ها باید براساس نیاز واقعی پروژه انجام شود، نه صرفاً براساس نام شرکت سازنده یا یک عدد بنچمارک.

هنگام انتخاب GPU یا AI Accelerator به چه مشخصاتی توجه کنیم؟

برای انتخاب GPU برای هوش مصنوعی چند معیار باید همزمان بررسی شوند. تمرکز صرف روی قدرت پردازشی می‌تواند باعث انتخاب نامناسب شود.

  • ظرفیت VRAM یا HBM: مشخص می‌کند چه مقدار از مدل و داده فعال می‌تواند نزدیک پردازنده نگهداری شود.
  • پهنای باند حافظه: هرچه انتقال داده میان حافظه و GPU سریع‌تر باشد، احتمال معطل ماندن پردازنده کمتر می‌شود.
  • دقت محاسبات: قالب‌هایی مانند FP16، BF16 و FP8 می‌توانند در برخی مدل‌ها مصرف حافظه و زمان پردازش را کاهش دهند.
  • واحدهای تنسوری: در بعضی GPUها، عملیات رایج مدل‌های هوش مصنوعی با این واحدها سریع‌تر انجام می‌شوند.
  • اتصال میان GPUها: اگر قرار است چند GPU با هم کار کنند، سرعت ارتباط آن‌ها اهمیت زیادی دارد.
  • پشتیبانی نرم‌افزاری: درایور، کتابخانه‌ها و چارچوب پروژه باید از سخت‌افزار پشتیبانی کنند.
  • توان مصرفی و خنک‌سازی: ممکن است یک GPU از نظر پردازشی مناسب باشد، اما سرور نتواند برق یا خنک‌سازی لازم را فراهم کند.
  • امکان توسعه: اگر قرار است پروژه بعداً بزرگ‌تر شود، مسیر اضافه کردن GPUهای بیشتر باید از ابتدا در نظر گرفته شود.

در نتیجه، نمی‌توان یک مدل مشخص را برای همه پروژه‌ها «بهترین GPU برای هوش مصنوعی» دانست. AMD Instinct همراه ROCm یکی از گزینه‌های غیر NVIDIA است و Google نیز TPU را برای بارهای مختلف هوش مصنوعی توسعه داده است. انتخاب شتاب‌دهنده باید از نوع مدل و شیوه استفاده از آن شروع شود.

RAM، VRAM و HBM چقدر اهمیت دارند؟

حافظه اصلی سیستم (RAM) بیشتر در اختیار CPU، سیستم‌عامل و برنامه‌های جانبی قرار می‌گیرد. در مقابل، حافظه ویدئویی (VRAM) نزدیک GPU قرار دارد و وزن مدل، داده فعال و بخشی از اطلاعات پردازش را نگه می‌دارد. حافظه با پهنای باند بالا (HBM) نیز برای شتاب‌دهنده‌های دیتاسنتری طراحی شده و سرعت انتقال بالاتری دارد.

برای تخمین اولیه حافظه موردنیاز وزن مدل می‌توان از این فرمول استفاده کرد:

حافظه پایه وزن‌ها تعداد پارامترها × تعداد بایت هر پارامتر

به‌طور تقریبی:

  • FP32 حدود ۴ بایت
  • FP16 یا BF16 حدود ۲ بایت
  • INT8 حدود ۱ بایت
  • ۴-bit حدود ۰.۵ بایت

این عدد فقط وزن مدل را نشان می‌دهد. هنگام آموزش، گرادیان‌ها، وضعیت بهینه‌ساز، فعال‌سازی‌ها و حافظه موقت نیز فضا می‌گیرند. در اجرای مدل‌های زبانی بزرگ هم حافظه کش با افزایش طول متن ورودی و تعداد درخواست‌ها بیشتر می‌شود.

بنابراین در زیرساخت محاسباتی AI باید حافظه را براساس اندازه مدل، دقت محاسبات، اندازه دسته داده و طول ورودی تخمین زد. در بسیاری از پروژه‌ها، محدودیت اصلی پیش از توان پردازشی، همین حافظه است.

سرور مناسب برای AI چه ویژگی‌هایی دارد؟

سرور مناسب برای AI چه ویژگی‌هایی دارد؟

سرور هوش مصنوعی یا سرور AI سیستمی است که GPU، CPU، RAM، مسیرهای ارتباطی، ذخیره‌سازی، شبکه، برق و خنک‌سازی آن برای بارهای هوش مصنوعی با یکدیگر هماهنگ شده باشند. بنابراین داشتن چند اسلات GPU به‌تنهایی یک سیستم را به بهترین سرور برای هوش مصنوعی تبدیل نمی‌کند.

برای انتخاب یک سرور برای AI این موارد اهمیت بیشتری دارند:

  • تعداد و نوع GPU قابل‌نصب
  • نحوه اتصال GPUها به یکدیگر
  • نسل PCIe و تعداد مسیرهای در دسترس
  • تعداد هسته‌های CPU و توان آن در آماده‌سازی داده
  • ظرفیت RAM
  • تعداد و ظرفیت درایوهای NVMe
  • سرعت کارت شبکه
  • منبع تغذیه افزونه
  • توان واقعی قابل تامین برای کل سیستم
  • ظرفیت خنک‌سازی
  • امکان ارتقای GPU، حافظه و ذخیره‌سازی
  • مدیریت از راه دور

این معیارها باید در کنار هم بررسی شوند. برای مثال، نصب چند GPU روی یک سرور AI زمانی مفید است که مسیرهای ارتباطی، برق و خنک‌سازی نیز توان پشتیبانی از آن‌ها را داشته باشند.

اگر پروژه به چند GPU، منابع اختصاصی یا کنترل مستقیم روی سخت‌افزار نیاز دارد، بررسی خرید سرور می‌تواند منطقی باشد. بااین‌حال، انتخاب مدل سرور باید بعد از مشخص شدن حجم مدل، حافظه موردنیاز و مسیر توسعه انجام شود.

از طرف دیگر، همه بخش‌های پروژه به GPU Server نیاز ندارند. توسعه نرم‌افزار، API، خودکارسازی، آماده‌سازی سبک داده یا بعضی مدل‌های کوچک را می‌توان روی منابع عمومی‌تر اجرا کرد. در چنین شرایطی، خرید vps برای سرویس‌های جانبی گزینه قابل بررسی است، اما برای آموزش سنگین یا کلاستر GPU انتخاب مناسبی نیست.

توسعه زیرساخت هوش مصنوعی: نقش Multi-GPU و Multi-Node در مقیاس‌پذیری (Scaling)

وقتی یک GPU از نظر حافظه یا توان پردازشی کافی نباشد، زیرساخت هوش مصنوعی به چند GPU یا چند سرور گسترش پیدا می‌کند. در این مرحله، افزایش تعداد GPUها به‌تنهایی تضمین نمی‌کند سرعت به همان نسبت بیشتر شود.

دلیل آن روشن است: پردازنده‌ها باید اطلاعات را با یکدیگر ردوبدل کنند، نتایج میانی را هماهنگ کنند و همزمان داده را از ذخیره‌سازی دریافت کنند. بنابراین شبکه، ذخیره‌سازی و زمان‌بندی منابع وارد مسیر اصلی پردازش می‌شوند.

در یک GPU Cluster نامتوازن ممکن است پردازنده‌ها بخش زیادی از زمان منتظر داده یا ارتباط با سرور دیگر بمانند. به همین دلیل، توسعه زیرساخت محاسباتی AI باید به‌صورت مرحله‌ای و براساس اندازه‌گیری واقعی انجام شود.

تفاوت Scale-Up (مقیاس عمودی) و Scale-Out (افقی) در زیرساخت AI

افزایش تعداد شتاب‌دهنده‌ها در یک سیستم یا دامنه نزدیک، مقیاس عمودی (Scale-Up) نام دارد. در این حالت، GPUها با مسیرهای ارتباطی سریع در فاصله نزدیک به هم کار می‌کنند.

در مقابل، مقیاس افقی (Scale-Out) یعنی چند سرور به یک کلاستر متصل شوند. در این ساختار، سرعت شبکه میان سرورها نقش مهم‌تری دارد.

در حالت Multi-GPU چند پردازنده روی یک کار مشترک فعالیت می‌کنند. در حالت Multi-Node، همین کار بین چند سرور تقسیم می‌شود. هرچه تعداد GPU و Node بیشتر شود، زمان هماهنگ‌سازی نیز افزایش پیدا می‌کند.

به همین دلیل، دوبرابر کردن تعداد GPUها لزوماً سرعت را دوبرابر نمی‌کند. بخشی از زمان صرف جابه‌جایی داده، هماهنگ‌سازی و دسترسی به فضای ذخیره‌سازی می‌شود.

نقش Network در کلاسترهای هوش مصنوعی

پهنای باند (Bandwidth) نشان می‌دهد چه حجم داده‌ای در مدت مشخص می‌تواند منتقل شود. تاخیر (Latency) نیز مدت زمان لازم برای ارسال داده یا هماهنگی میان دو بخش است. در یک GPU Cluster هر دو معیار اهمیت دارند.

فناوری‌های رایج این بخش شامل موارد زیر هستند:

  • NVLink: برای ارتباط سریع میان GPUهای نزدیک
  • NVSwitch: برای اتصال تعداد بیشتری GPU در یک دامنه
  • InfiniBand: برای شبکه‌های کم‌تاخیر در کلاسترهای محاسباتی
  • Ethernet: گزینه رایج برای ارتباط شبکه‌ای میان سرورها
  • RDMA: برای انتقال مستقیم‌تر داده با دخالت کمتر CPU
  • شبکه ذخیره‌سازی: برای انتقال سریع داده میان فضای ذخیره‌سازی و سرورهای پردازشی

بنابراین شبکه داخل یک سرور هوش مصنوعی با شبکه میان چند سرور تفاوت دارد. هرچه پروژه از یک سرور فاصله بگیرد، طراحی شبکه تاثیر بیشتری بر عملکرد واقعی پیدا می‌کند.

چرا Storage و Data Pipeline در جلوگیری از هدررفت منابع AI ضروری هستند؟

چرا Storage و Data Pipeline در جلوگیری از هدررفت منابع AI ضروری هستند؟

قدرت GPU برای هوش مصنوعی زمانی به کار می‌آید که داده بدون تاخیر در اختیار آن قرار گیرد. اگر فضای ذخیره‌سازی کند باشد یا آماده‌سازی داده طول بکشد، GPU منتظر می‌ماند و بخشی از ظرفیت پردازشی هدر می‌رود.

به همین دلیل، ذخیره‌سازی در زیرساخت AI فقط محل نگهداری فایل نیست و مستقیماً روی سرعت پردازش اثر دارد.

نوع ذخیره‌سازیکاربرد معمول
NVMeداده موقت، کش و ذخیره سریع Checkpoint
SSDنگهداری محلی داده
ذخیره‌سازی فایلیداده مشترک میان چند سرور
ذخیره‌سازی شیءآرشیو، Data Lake و داده حجیم
ذخیره‌سازی بلوکیدیسک موردنیاز سرویس‌ها و ماشین‌های مجازی

در کنار آن، خط لوله داده (Data Pipeline) مسئول خواندن، آماده‌سازی و رساندن داده به بخش پردازشی است. اگر این مسیر کند باشد، اضافه کردن GPU بیشتر مشکل را حل نمی‌کند.

در ساخت AI در مقیاس بزرگ بهتر است حجم Dataset، سرعت خواندن، تعداد سرورها و محل نگهداری Checkpoint همزمان بررسی شوند. این کار کمک می‌کند Storage با افزایش تعداد GPUها به گلوگاه تبدیل نشود.

مطالعه موردی WRITER: توسعه و مقیاس‌پذیری زیرساخت آموزش مدل‌های زبانی بزرگ (LLM)

شرکت WRITER از سال ۲۰۲۳ مهاجرت خود را به AWS آغاز کرد و در رویداد re:Invent 2025 به‌عنوان شرکتی با زیرساخت تمام‌ابری (Cloud-Native) معرفی شد. با بزرگ‌تر و پیچیده‌تر شدن مدل‌های زبانی Palmyra، آموزش مدل‌ها روی یک سرور دیگر پاسخ‌گوی نیاز آن‌ها نبود و چالش‌های جدیدی مانند نیاز به ارتباط سریع میان GPUها، دسترسی پرسرعت به داده و بازیابی خودکار پس از خرابی سخت‌افزار خود را نشان دادند.

این شرکت برای آموزش مدل‌های هوش مصنوعی در مقیاس بزرگ از کلاسترهای Amazon SageMaker HyperPod با سرورهای مجهز به GPUهای H200، شبکه پرسرعت EFA و ذخیره‌سازی FSx for Lustre استفاده کرد. زمان‌بندی کارها نیز با Slurm انجام شد تا منابع چند سرور هماهنگ مدیریت شوند.

دستاوردهای این تغییر معماری عبارت بودند از:

  • ۳ برابر شدن سرعت در چرخه توسعه و آزمایش مدل‌ها
  • کاهش ۹۰ درصدی خطاهای خط لوله آموزش (Training Pipeline)
  • توزیع کاملاً خودکار کارها بدون نیاز به دخالت دستی

این نمونه نشان می‌دهد در ساخت AI در مقیاس بزرگ، نتیجه فقط به GPU وابسته نیست و شبکه، Storage، زمان‌بندی و بازیابی خطا نیز باید در کنار Compute طراحی شوند.

Software Stack و MLOps در زیرساخت AI

پس از مشخص شدن سخت افزار مورد نیاز هوش مصنوعی، لایه نرم‌افزاری تعیین می‌کند که این سخت‌افزار چقدر قابل استفاده باشد. یک سرور AI قوی با درایور ناسازگار، کتابخانه نامناسب یا مدیریت ضعیف منابع نمی‌تواند عملکرد مطلوبی ارائه دهد.

Software Stack پایه

در این بخش معمولاً چند جزء اصلی وجود دارد:

  • Linux: سیستم‌عامل رایج در بسیاری از سرورها و کلاسترهای هوش مصنوعی
  • درایور: واسطه ارتباط سیستم‌عامل با GPU
  • CUDA یا ROCm: بستر نرم‌افزاری برای استفاده از شتاب‌دهنده
  • PyTorch یا TensorFlow: چارچوب اجرای مدل
  • Docker: برای ساخت محیط اجرای یکسان و قابل انتقال
  • Kubernetes: برای تخصیص و مدیریت منابع کلاستر
  • مدیریت کلاستر: برای کنترل وضعیت سرورها و منابع
  • زمان‌بندی کارها: برای تعیین محل اجرای هر کار
  • اجرای مدل: برای ارائه خروجی مدل به برنامه یا کاربر

در زیرساخت هوش مصنوعی بزرگ، Kubernetes فقط برای اجرای کانتینر استفاده نمی‌شود؛ بلکه می‌تواند منابع GPU را میان چند تیم یا چند سرویس تقسیم و مدیریت کند.

MLOps چه چیزی به Infrastructure اضافه می‌کند؟

عملیات یادگیری ماشین (MLOps) کمک می‌کند مدل از مرحله آزمایش تا محیط عملیاتی قابل پیگیری باشد. بدون این لایه، ممکن است مشخص نباشد یک مدل با کدام داده، تنظیمات و نسخه نرم‌افزاری ساخته شده است.

روند معمول آن شامل این مراحل است:

ثبت آزمایش نسخه‌بندی مدل استقرار پایش به‌روزرسانی یا بازگشت به نسخه قبل

به‌این‌ترتیب، زیرساخت AI فقط پردازش را انجام نمی‌دهد؛ بلکه مدیریت نسخه، کنترل تغییرات و پایش عملکرد مدل نیز ممکن می‌شود. این بخش برای پروژه‌هایی که چند مدل یا چند محیط اجرایی دارند اهمیت بیشتری پیدا می‌کند.

تفاوت زیرساخت Training و Inference

یکی از تصمیم‌های اصلی در طراحی زیرساخت مورد نیاز برای ساخت هوش مصنوعی این است که سیستم برای آموزش ساخته می‌شود یا برای اجرای مدل آماده. نیاز این دو حالت از نظر حافظه، شبکه و هزینه یکسان نیست.

در آموزش، وزن‌های مدل تغییر می‌کنند و پردازش‌های بیشتری برای محاسبه گرادیان و به‌روزرسانی مدل انجام می‌شود. در استنتاج، مدل از قبل آماده است و هدف اصلی، پاسخ سریع و پایدار به درخواست‌هاست.

معیارآموزشاستنتاج
هدفیادگیری و تغییر وزن‌هااجرای مدل آماده
اولویت اصلیتوان پردازش و توسعه‌پذیریسرعت پاسخ و تعداد درخواست
حافظهمدل، گرادیان، بهینه‌ساز و فعال‌سازیمدل، محیط اجرا و کش
توسعه منابعآموزش توزیع‌شدهتکثیر یا تقسیم مدل
شبکههماهنگ‌سازی سنگینوابسته به معماری سرویس
دسترس‌پذیریبیشتر به‌صورت کار زمان‌داربیشتر به‌صورت سرویس دائمی
معیار هزینهزمان و هزینه آموزشهزینه هر درخواست یا Token

Fine-tuning معمولاً از آموزش کامل سبک‌تر است، اما از نظر نیاز زیرساختی بیشتر به Training نزدیک است، چون هنوز بخشی از پارامترهای مدل تغییر می‌کنند.

بنابراین معماری مناسب آموزش لزوماً برای استنتاج بهترین انتخاب نیست. این تفاوت باید پیش از انتخاب سرور AI یا GPU مشخص شود.

انتخاب بهترین زیرساخت برای هوش مصنوعی:Cloud، GPU Cloud، VPS، Dedicated یا On-Premise؟

انتخاب بهترین زیرساخت برای هوش مصنوعی:Cloud، GPU Cloud، VPS، Dedicated یا On-Premise؟

بعد از مشخص شدن نوع پردازش و منابع موردنیاز، باید محل اجرای پروژه انتخاب شود. برای ساخت AI در مقیاس بزرگ یک گزینه ثابت برای همه پروژه‌ها وجود ندارد.

زیرساخت ابری هوش مصنوعی (AI Cloud Infrastructure) امکان شروع سریع و افزایش یا کاهش منابع را فراهم می‌کند. GPU Cloud نیز دسترسی به GPU را بدون خرید سخت‌افزار فراهم می‌کند. در مقابل، سرور اختصاصی و زیرساخت داخلی کنترل بیشتری روی داده و سخت‌افزار می‌دهند.

جدول زیر تفاوت کلی گزینه‌ها را نشان می‌دهد:

معیارVPSGPU CloudDedicatedOn-PremiseHybrid
سرعت شروعزیادزیادمتوسطکممتوسط
افزایش منابعمتوسطزیادکم/متوسطمتوسطزیاد
کنترل سخت‌افزارکممتوسطزیادزیادزیاد
هزینه اولیهکمکممتوسطزیادمتوسط
هزینه متغیرمتوسطزیادمتوسطکم/متوسطمتوسط
مدیریت زیرساختکمکم/متوسطمتوسطزیادزیاد
مناسب کلاستر GPUکمزیادمتوسط/زیادزیادزیاد
کنترل دادهمتوسطمتوسطزیادزیادزیاد

به‌صورت خلاصه:

  • VPS: برای توسعه، API و کارهای سبک مناسب است.
  • GPU Cloud: برای دسترسی سریع و انعطاف‌پذیر به GPU مناسب است.
  • سرور GPU اختصاصی: کنترل بیشتری روی منابع ایجاد می‌کند.
  • زیرساخت داخلی: کنترل کامل‌تری روی داده و سخت‌افزار دارد، اما نگهداری آن برعهده سازمان است.
  • مدل ترکیبی: منابع داخلی را با ظرفیت ابری تکمیل می‌کند.

بنابراین انتخاب زیرساخت ابری AI یا سرور اختصاصی باید براساس مدت استفاده، حساسیت داده، میزان تغییر بار و نیاز به کنترل انجام شود.

امنیت زیرساخت AI چگونه طراحی می‌شود؟

امنیت در زیرساخت هوش مصنوعی باید از همان ابتدای طراحی در نظر گرفته شود. داده آموزشی، وزن مدل، اطلاعات ورود و APIها می‌توانند دارایی‌های حساس پروژه باشند.

موارد اصلی عبارت‌اند از:

  • کنترل دسترسی به Dataset و فضای ذخیره‌سازی
  • نگهداری امن رمزها و کلیدهای دسترسی
  • تعریف حداقل سطح دسترسی برای کاربران و سرویس‌ها
  • جداسازی بخش‌های مختلف شبکه
  • محدود کردن دسترسی به API مدل
  • رمزنگاری داده هنگام انتقال و ذخیره
  • تهیه نسخه پشتیبان
  • نسخه‌بندی مدل و داده
  • جداسازی منابع در محیط‌های چندکاربره
  • پیش‌بینی روش بازیابی پس از خطا

در محیط عملیاتی، دسترس‌پذیری بالا و تحمل خطا نیز باید در نظر گرفته شوند. به این ترتیب، زیرساخت AI در زمان خرابی یک بخش، سریع‌تر قابل بازیابی خواهد بود.

چرا توسعه GPU Cluster بدون ارتقای برق و خنک‌سازی (Cooling) متوقف می‌شود؟

با افزایش تعداد GPUها، زیرساخت هوش مصنوعی دیگر فقط یک مسئله نرم‌افزاری و سخت‌افزاری نیست. یک AI Data Center یا دیتاسنتر هوش مصنوعی باید توان برق و خنک‌سازی متناسب با تعداد سرورها داشته باشد.

محاسبه برق باید مصرف کل سرور هوش مصنوعی را در نظر بگیرد؛ یعنی GPU، CPU، RAM، کارت شبکه و فضای ذخیره‌سازی همگی در مصرف نهایی سهم دارند. منبع تغذیه، توزیع برق و UPS نیز باید براساس این بار واقعی انتخاب شوند.

در بخش خنک‌سازی هم تراکم رک اهمیت دارد. خنک‌سازی هوایی برای همه طراحی‌ها کافی نیست و در رک‌های پرتراکم، خنک‌سازی مایع می‌تواند اهمیت بیشتری پیدا کند.

بنابراین در یک AI Data Center، افزایش تعداد GPU بدون بررسی برق و خنک‌سازی می‌تواند توسعه زیرساخت را متوقف کند.

نحوه محاسبه هزینه راه‌اندازی زیرساخت AI

نحوه محاسبه هزینه راه‌اندازی زیرساخت AI

برای زیرساخت مورد نیاز برای ساخت هوش مصنوعی نمی‌توان یک هزینه ثابت تعیین کرد. هزینه یک سرور تک GPU با یک GPU Cluster چندسروری تفاوت زیادی دارد.

مدل ساده هزینه کل مالکیت را می‌توان به این شکل نوشت:

هزینه کل پردازش + سرور + ذخیره‌سازی + شبکه + برق + خنک‌سازی + دیتاسنتر یا Cloud + نگهداری + عملیات

اگر سخت‌افزار خریداری شود، هزینه اولیه اهمیت بیشتری پیدا می‌کند. در GPU Cloud نیز مدت استفاده، میزان مصرف GPU، فضای ذخیره‌سازی و ترافیک شبکه روی هزینه اثر می‌گذارند.

برای استنتاج، هزینه هر درخواست یا Token معیار مفیدی است. برای آموزش نیز مدت اجرای کار، تعداد GPU و میزان استفاده واقعی از منابع اهمیت بیشتری دارد.

به همین دلیل، هزینه واقعی زیرساخت AI پس از اجرای یک نمونه کوچک و اندازه‌گیری مصرف منابع دقیق‌تر مشخص می‌شود.

چگونه زیرساخت مناسب پروژه AI را انتخاب کنیم؟

انتخاب زیرساخت هوش مصنوعی باید از نیاز واقعی پروژه شروع شود، نه از نام GPU یا قیمت سرور. این ترتیب کمک می‌کند منابع متناسب با مدل و بار کاری انتخاب شوند.

  1. نوع کار را مشخص کنید. آموزش، Fine-tuning یا استنتاج؟
  2. اندازه مدل و دقت محاسبات را تعیین کنید.
  3. حجم Dataset، اندازه Batch و طول ورودی را بررسی کنید.
  4. VRAM، HBM و RAM موردنیاز را تخمین بزنید.
  5. مشخص کنید یک GPU کافی است یا چند GPU و چند سرور لازم دارید.
  6. سرعت موردنیاز شبکه و ذخیره‌سازی را محاسبه کنید.
  7. مدل استقرار را انتخاب کنید؛ Cloud، سرور اختصاصی، زیرساخت داخلی یا ترکیبی.
  8. امنیت، برق، خنک‌سازی و دسترس‌پذیری را بررسی کنید.
  9. ابتدا یک بنچمارک کوچک اجرا کنید و سپس منابع را افزایش دهید.

اصل طراحی زیرساخت مورد نیاز برای ساخت هوش مصنوعی روشن است: ابتدا بار کاری را بشناسید، سپس یک معماری متعادل بسازید و فقط بعد از اندازه‌گیری واقعی آن را توسعه دهید.

چک‌لیست نهایی زیرساخت AI: ۱۰ اشتباه رایج در مقیاس‌پذیری سرورها

بخش زیادی از مشکلات زیرساخت محاسباتی AI از زمانی شروع می‌شود که تصمیم‌گیری فقط براساس GPU انجام شود. در عمل، چند اشتباه تکراری بیشتر از بقیه دیده می‌شوند:

  • خرید GPU پیش از مشخص شدن نوع Workload
  • توجه به قدرت پردازش و نادیده گرفتن VRAM
  • انتظار افزایش خطی سرعت با اضافه کردن GPU
  • استفاده از شبکه ضعیف در معماری چندسروری
  • انتخاب Storage کند برای داده‌های حجیم
  • استفاده از CPU یا RAM نامتناسب
  • طراحی یکسان برای Training و Inference
  • نادیده گرفتن برق و خنک‌سازی
  • نبود پایش برای پیدا کردن گلوگاه‌ها
  • نداشتن برنامه برای توسعه و بازیابی پس از خرابی

پیش از نهایی کردن سرور AI یا معماری Cloud، بهتر است این موارد در همان مرحله طراحی بررسی شوند. رفع آن‌ها بعد از گسترش زیرساخت معمولاً دشوارتر و پرهزینه‌تر است.

سخن پایانی

زیرساخت هوش مصنوعی با انتخاب قوی‌ترین GPU ساخته نمی‌شود؛ عملکرد واقعی زمانی به دست می‌آید که پردازش، حافظه، شبکه، ذخیره‌سازی و بخش عملیاتی با هم متعادل باشند. برای ساخت AI در مقیاس بزرگ ابتدا نوع کار، اندازه مدل و حجم داده را مشخص کنید و سپس سرور هوش مصنوعی، حافظه و روش استقرار را انتخاب کنید.بهترین پیشنهاد این است که پیش از توسعه همه‌جانبه، پروژه را در ابعاد کوچک اجرا کنید تا گلوگاه‌های پنهان سیستم به‌موقع شناسایی شوند.

نمایش بیشتر
دکمه بازگشت به بالا