سلام‌نو پلاس

راز قدرت ChatGPT و مدل‌های زبانی بزرگ؛ چرا هزاران GPU و سرور اختصاصی لازم است؟

در این مقاله، نحوه عملکرد این سیستم‌ها، تفاوت CPU و GPU و نقش سرور اختصاصی در اجرای مدل‌های هوش مصنوعی را بررسی می‌کنیم.

چرا ChatGPT به GPU نیاز دارد و معماری مدل‌های زبانی بزرگ چه تفاوتی با نرم‌افزارهای عادی دارد؟ برای درک اینکه ChatGPT چگونه کار می‌کند، باید بدانید که این سیستم‌ها بر پایه میلیاردها محاسبه ریاضی همزمان عمل می‌کنند؛ برخلاف نرم‌افزارهای سنتی که دستورات را به‌صورت خطی و متوالی پردازش می‌کنند. پاسخ‌دهی بلادرنگ (Real-time) این مدل‌ها به دو فاکتور حیاتی وابسته است: توان پردازش موازی (Parallel Computing) و پهنای باند بالای حافظه (Memory Bandwidth)؛ دقیقاً به همین دلیل، بهره‌گیری از GPU Server در یک سرور هوش مصنوعی نقش تعیین‌کننده‌ای در تامین این توان پردازشی دارد و سازمان‌ها برای توسعه زیرساخت AI به‌سراغ خرید سرور اختصاصی هوش مصنوعی می‌روند. در ادامه، نحوه عملکرد این سیستم‌ها، تفاوت CPU و GPU و نقش سرور اختصاصی در اجرای مدل‌های هوش مصنوعی را بررسی می‌کنیم.

ChatGPT چگونه به سوال شما پاسخ می‌دهد و چرا GPU در این فرایند نقش کلیدی دارد؟

پاسخ ChatGPT به یک سوال، حاصل چند مرحله پردازشی است که از دریافت متن شروع می‌شود و با تولید پاسخ به پایان می‌رسد. برای اینکه بدانید ChatGPT چگونه کار می‌کند، ابتدا باید بگوییم که متن ورودی چگونه به داده قابل پردازش برای مدل تبدیل می‌شود.

مدل‌های زبانی بزرگ ابتدا متن را به Tokenهای کوچک‌تر تقسیم کرده و سپس این Tokenها را در لایه‌های مختلف مدل پردازش می‌کنند. بخش زیادی از این پردازش شامل عملیات عددی و ماتریسی است؛ به همین دلیل، GPU در اجرای مدل‌های هوش مصنوعی نقش مهمی دارد. در مقیاس بالاتر نیز استفاده از GPU Server و سرور هوش مصنوعی به تامین توان محاسباتی، حافظه و سرعت پردازش موردنیاز کمک می‌کند.

​ChatGPT چگونه متن را به توکن (Token) تبدیل می‌کند؟

مدل‌های زبانی بزرگ (LLM) مانند ChatGPT زبان انسان را به‌صورت متنی پردازش نمی‌کنند؛ بلکه ورودی‌ها را طی یک فرآیند سه‌مرحله‌ای به مقادیر عددی قابل‌محاسبه برای شبکه‌های عصبی تبدیل می‌کنند. مراحل تبدیل متن به داده‌های قابل‌پردازش:

  1. توکنایزیشن (Tokenization): در گام نخست، متن ورودی به واحدهای کوچک‌تری به نام Token شکسته می‌شود. یک توکن لزوماً یک کلمه کامل نیست و می‌تواند شامل یک کلمه، بخشی از کلمه (Subword)، تک‌حرف یا حتی علائم نگارشی باشد.
  2. تخصیص شناسه عددی (Token IDs): در این مرحله، توکن‌ها به شناسه‌های عددی تبدیل می‌شوند و این شناسه‌ها برای ورود به شبکه عصبی آماده می‌شوند.
  3. بردارسازی یا امبدینگ (Embedding): شناسه‌های عددی وارد لایه Embedding شده و به بردارهایی در فضای چندبُعدی تبدیل می‌شوند. این بردارها ارتباطات معنایی و بافت کلمات را مشخص می‌کنند تا شبکه عصبی بتواند محاسبات وزن‌دهی و توجه (Attention) را روی آن‌ها انجام دهد.

نکته کلیدی: مدل‌های زبانی درک انسانی از کلمات ندارند؛ بلکه متن را به مجموعه‌ای از نمایش‌های عددی تبدیل می‌کنند و روی آن‌ها محاسبه انجام می‌دهند.

به همین دلیل، اجرای مدل‌های هوش مصنوعی فقط به قدرت پردازشی وابسته نیست و ظرفیت حافظه و سرعت جابه‌جایی داده نیز اهمیت دارد. در پروژه‌هایی که مدل روی زیرساخت اختصاصی اجرا می‌شود، انتخاب سرور اختصاصی مناسب باید براساس اندازه مدل، مقدار VRAM، نوع Workload و تعداد درخواست‌ها انجام شود.

 

چرا پردازش میلیاردها پارامتر در LLM به پردازش موازی و GPU نیاز دارد؟

پارامترهای هوش مصنوعی، همان وزن‌های محاسباتی مدل هستند که در فرآیند آموزش (Training) شکل می‌گیرند و رفتار شبکه عصبی را تعیین می‌کنند. در مدل‌های زبانی بزرگ (LLM)، تولید هر توکن به انجام میلیاردها عملیات ریاضی میان این پارامترها وابسته است؛ اگر این محاسبات به‌صورت ترتیبی و پشت‌سرهم انجام شوند، پاسخ‌دهی مدل با تاخیر زیادی روبه‌رو خواهد شد.

در معماری ترنسفورمر ​برای حل این چالش، محاسبات لایه‌های مدل به عملیات ماتریسی مستقل تبدیل می‌شوند تا به‌جای پردازش خطی، بخش عظیمی از داده‌ها در کسری از ثانیه و به‌صورت همزمان پردازش شوند. در معماری ترنسفورمر، میلیاردها پارامتر پشت‌سرهم و قطاری پردازش نمی‌شوند؛ بلکه به بلوک‌های ماتریسی تفکیک شده و به‌طور همزمان روی هزاران هسته پردازشی اجرا می‌شوند. این عملیات، قابلیت Parallel Computing یا پردازش موازی دارند و همین ویژگی یکی از دلایل اصلی مناسب بودن GPU برای اجرای LLM است. GPU می‌تواند تعداد زیادی عملیات مشابه را به‌صورت موازی پردازش کند و در نتیجه برای محاسباتی که در Training و Inference مدل‌های هوش مصنوعی انجام می‌شوند، گزینه‌ای مناسب باشد.

تفاوت CPU و GPU در اجرای مدل‌های زبانی (LLM)

تفاوت اصلی CPU و GPU به معماری هسته‌ها و نوع پردازش داده‌ها بازمی‌گردد؛ CPU برای پردازش‌های خطی و چندمنظوره بهینه‌سازی شده است، درحالی‌که GPU توان پردازش موازی و انبوه موردنیاز در یادگیری عمیق (Deep Learning) را فراهم می‌کند.

  • پردازنده مرکزی (CPU): تعداد کمتری هسته قدرتمند دارد که برای وظایف متوالی (Sequential)، مدیریت سیستم‌عامل، پیش‌پردازش داده‌ها و هماهنگی ارتباط بین اجزای سرور ایدئال است.
  • پردازنده گرافیکی (GPU): مجهز به هزاران هسته سبک‌تر است که می‌توانند دستورات مشابه را به‌صورت همزمان اجرا کنند. این ساختار مستقیماً برای ضرب ماتریس‌ها و پردازش بردارها در مدل‌های زبانی بزرگ طراحی شده است.

البته GPU جایگزین کامل CPU نیست؛ در یک سرور اختصاصی هوش مصنوعی، CPU وظیفه مدیریت و ارسال داده‌ها را برعهده دارد و GPU بار محاسبات سنگین ریاضی را پردازش می‌کند.

ویژگی کلیدیمعماری مرکزی (CPU)معماری گرافیکی (GPU)اهمیت استراتژیک برای LLM
شیوه پردازشمدیریت ترتیبی و سیستم‌عاملParallel Computing (پردازش موازی)اجرای سریع و بی‌نقص محاسبات شبکه عصبی
کاربرد اصلیکنترل کلی سرور اختصاصیماشین لرنینگ و Machine Learningپایه‌ریزی ساختار AI Infrastructure
پهنای باندمحدود و مناسب پردازش عادیMemory Bandwidth بسیار بالادسترسی فوری به پارامترهای مدل و ماتریس‌ها
مرحله آموزشدر Training بسیار کند و ناکارآمداستاندارد بی‌رقیب برای Trainingکاهش زمان آموزش در AI Datacenter
مرحله استنتاجفقط برای Inference بسیار سبکحیاتی برای Inference در مقیاس بالاحفظ Latency پایین و Throughput بالا

در نتیجه، برای اینکه بدانید CPU چیست و GPU چیست، باید به نوع Workload توجه کرد. در اجرای مدل‌های هوش مصنوعی، GPU به دلیل توان پردازش موازی و Memory Bandwidth بالا نقش مهمی دارد و CPU همچنان برای مدیریت سیستم، آماده‌سازی داده و بسیاری از وظایف جانبی ضروری است.

آیا ChatGPT روی یک GPU یا کامپیوتر شخصی قابل‌اجراست؟

مدل‌های متن‌باز و سبک‌تر (Open-Source) را می‌توان روی کارت‌های گرافیک شخصی اجرا کرد، اما اجرای مدل‌های تجاری و بزرگ در مقیاس ChatGPT روی یک سیستم خانگی یا حتی یک GPU مجزا ممکن نیست. چالش‌های اصلی اجرای مدل‌های بزرگ روی یک پردازنده گرافیکی شامل موارد زیر است:

  • ​محدودیت حافظه گرافیکی (VRAM): علاوه‌بر حجم سنگین وزن‌های مدل، نگهداری تاریخچه مکالمه در پنجره زمینه (Context Window) و داده‌های KV Cache نیازمند حافظه اختصاصی یزرگی است که از ظرفیت یک کارت گرافیک معمولی فراتر می‌رود.
  • ​نیاز به موازی‌سازی مدل (Model Parallelism): ابعاد مدل‌های پیشرفته به‌قدری بزرگ است که پارامترها باید به بخش‌های کوچک‌تر تفکیک شده و به‌صورت توزیع‌شده روی چندین پردازنده گرافیکی بارگذاری شوند.

بنابراین، سازمان‌ها برای راه‌اندازی پروژه‌های بزرگ به‌جای سیستم‌های شخصی، به سراغ پرسرعت ترین سرور اختصاصی و پیکربندی تخصصی GPU Server می‌روند.

چرا مدل‌های زبانی بزرگ به هزاران GPU و سرور اختصاصی نیاز دارند؟

دلیل اینکه چرا ChatGPT به GPU نیاز دارد فقط به قدرت کارت گرافیک مربوط نمی‌شود؛ مسئله اصلی، مقیاس پردازش و تعداد درخواست‌هایی است که باید همزمان پاسخ داده شوند. در یک AI Datacenter، GPUها برای Training، Inference و پاسخ‌گویی به کاربران در قالب یک زیرساخت توزیع‌شده کنار هم قرار می‌گیرند. بنابراین، وقتی از هزاران GPU صحبت می‌کنیم، منظور ظرفیت کل یک سرویس بزرگ است، نه اینکه هر سوال ChatGPT روی هزاران GPU پردازش شود. در چنین مقیاسی، GPU Cluster و سرور اختصاصی به مدیریت بار پردازشی و حفظ Throughput کمک می‌کنند.

چرا یک GPU برای اجرای ChatGPT کافی نیست؟

زیرا یک GPU ممکن است به دلیل محدودیت VRAM برای اجرای یک مدل بزرگ کافی نباشد یا برای پاسخ‌گویی به حجم بالای درخواست‌ها ظرفیت لازم را نداشته باشد. برای مدل‌های بزرگ، می‌توان با Model Parallelism بخش‌های مختلف مدل را روی چند GPU قرار داد. از طرف دیگر، هرچه Context Window طولانی‌تر و تعداد درخواست‌ها بیشتر باشد، مصرف حافظه برای KV Cache هم افزایش پیدا می‌کند. بنابراین، در یک سرویس پرترافیک ممکن است به چند GPU یا چند Replica نیاز باشد تا پاسخ‌گویی در سطح موردنظر حفظ شود.

هزاران GPU چگونه در دیتاسنترهای هوش مصنوعی با هم کار می‌کنند؟

وقتی تعداد GPUها زیاد می‌شود، نحوه ارتباط آن‌ها به‌اندازه قدرت پردازشی هر GPU اهمیت پیدا می‌کند. چند GPU داخل یک سرور می‌توانند از فناوری‌هایی مانند NVLink برای ارتباط سریع استفاده کنند. در مقیاس بزرگ‌تر، سرورها از طریق شبکه‌هایی مانند InfiniBand به یکدیگر متصل می‌شوند. مجموعه این سرورها و GPUها یک GPU Cluster را تشکیل می‌دهد و نرم‌افزارهای توزیع‌شده، وظایف را میان آن‌ها تقسیم می‌کنند.

در چنین معماری‌هایی هدف این است که محاسبات و داده‌ها بین منابع مختلف تقسیم شوند و یک GPU یا یک سرور به گلوگاه سیستم تبدیل نشود.

NVIDIA برای توضیح این رویکرد از مفهوم AI Factory استفاده می‌کند؛ یعنی زیرساختی که در آن محاسبات، شبکه، انرژی، خنک‌سازی و نرم‌افزار برای اجرای Workloadهای هوش مصنوعی در کنار یکدیگر طراحی می‌شوند.

«در تحول صنعتی جدید، AI Datacenter‌های سنتی جای خود را به کارخانه‌های هوش مصنوعی (AI Factory) می‌دهند؛ زیرساخت‌هایی عظیم که تنها هدفشان تولید و پردازش بی‌وقفه هوشمندی است.»

برای نمونه، NVIDIA H100 از NVLink نسل چهارم پشتیبانی می‌کند و در معماری Blackwell، NVLink نسل پنجم برای ارتباط سریع‌تر GPUها عرضه شده است. در GB200 NVL72 نیز ۷۲ GPU در یک دامنه NVLink به یکدیگر متصل می‌شوند. این نمونه‌ها نشان می‌دهند که در زیرساخت‌های بزرگ AI، ارتباط میان GPUها بخش مهمی از طراحی سیستم است.

هزینه زیرساخت ChatGPT از کجا ناشی می‌شود؟

هزینه‌های نگهداری یک AI Server فقط به خرید قطعات گرافیکی محدود نمی‌شود. در حقیقت، وقتی معماری Deep Learning و Machine Learning را در مقیاس AI Datacenter پیاده‌سازی می‌کنیم، با طیف گسترده‌ای از هزینه‌ها روبه‌رو می‌شویم. این مخارج شامل:

  • کابل‌کشی InfiniBand
  • تامین برق نجومی سرور هوش مصنوعی و سیستم‌های خنک‌کننده پیشرفته

است. در نتیجه، پاسخ به اینکه چرا ChatGPT به GPU نیاز دارد، به‌طور مستقیم با هزینه‌های حفظ پایداری GPU Cluster در ارتباط است. طبق گزارش IEA، مصرف برق دیتاسنترها در سال ۲۰۲۵ حدود ۱۷ درصد افزایش داشته است؛ موضوعی که نشان می‌دهد انرژی به یکی از عوامل مهم توسعه AI Infrastructure تبدیل شده است.

آیا کسب‌وکارها هم می‌توانند مدل‌های هوش مصنوعی را روی سرور اختصاصی اجرا کنند؟

بله، کسب‌وکارها می‌توانند با در نظر گرفتن تکنیک‌هایی مانند Quantization و مدیریت دقیق منابع، شبکه‌های متن‌باز را بر روی زیرساخت خود مستقر کنند. البته، اجرای مدل‌های هوش مصنوعی سازمانی به دانش دقیق از پارامترهای مدل و انتخاب هوشمندانه سرور اختصاصی نیاز دارد. این فرایند اگرچه با Training یک مدل غول‌پیکر تفاوت دارد، اما همچنان برای Inference روان، به یک GPU Server قابل‌اتکا نیازمند است.

چه مدل‌هایی روی یک سرور اختصاصی قابل اجرا هستند؟

مدل‌هایی مانند Qwen، Llama، Gemma و Mistral را می‌توان روی زیرساخت اختصاصی اجرا کرد، اما نیاز سخت‌افزاری آن‌ها یکسان نیست. برای مثال، خانواده Qwen2.5 مدل‌هایی از ۰.5B تا 72B پارامتر دارد. طبیعتاً اجرای یک مدل کوچک با نسخه‌ای در مقیاس 72B به منابع یکسانی نیاز ندارد.

Quantization نیز می‌تواند با کاهش دقت ذخیره‌سازی پارامترها، مقدار VRAM موردنیاز را کمتر کند. بااین‌حال، برای انتخاب سرور هوش مصنوعی باید علاوه‌بر وزن مدل، KV Cache، Context Window و تعداد درخواست‌های هم‌زمان را هم در نظر گرفت.

هنگام انتخاب سرور اختصاصی برای AI به چه مشخصاتی توجه کنیم؟

برای انتخاب سرور اختصاصی مناسب AI، فقط به مدل GPU یا قدرت محاسباتی آن نگاه نکنید. حافظه و ارتباط میان اجزای سیستم هم اهمیت زیادی دارند. مهم‌ترین موارد عبارت‌اند از:

  • VRAM: باید برای وزن‌های مدل و حافظه موردنیاز هنگام اجرا کافی باشد.
  • Memory Bandwidth: روی سرعت جابه‌جایی داده میان حافظه و واحدهای محاسباتی اثر می‌گذارد.
  • نوع و تعداد GPU: باید با اندازه مدل و تعداد کاربران متناسب باشد.
  • CUDA و Tensor Core: برای اجرای بسیاری از Workloadهای AI روی GPU اهمیت دارند.
  • PCIe: مسیر ارتباط GPU با سایر اجزای سرور است و در سیستم‌های چندGPU اهمیت بیشتری پیدا می‌کند.
  • NVLink و شبکه: برای ارتباط سریع میان GPUها و Nodeها در معماری‌های بزرگ کاربرد دارند.
  • RAM و NVMe: برای داده‌ها، مدل‌ها، Cache و پردازش‌های جانبی موردنیاز هستند.
  • خنک‌سازی: برای اجرای مداوم Workloadهای سنگین باید متناسب با مصرف سخت‌افزار باشد.

سخن پایانی: راز واقعی قدرت ChatGPT چیست؟

در نهایت، پاسخ به این پرسش که چرا ChatGPT به GPU نیاز دارد، در هماهنگی بی‌نظیر سخت‌افزار و نرم‌افزار خلاصه می‌شود. مدل‌های زبانی بزرگ (LLM) بدون وجود یک زیرساخت توزیع‌شده از پردازنده‌های گرافیکی، هرگز قادر به پاسخگویی در لحظه نیستند. درد اینجا گفتیم که ChatGPT چگونه کار می‌کند و چگونه با ترکیب معماری Transformer، محاسبات ماتریس و حافظه VRAM سرور GPU، کلمات را می‌فهمد. چه هدف شما Training مدل باشد و چه Inference سازمانی، موفقیت شما در اجرای مدل‌های هوش مصنوعی، کاملاً به پایداری AI Infrastructure، کیفیت سرور هوش مصنوعی و انتخاب درست در مسیر خرید سرور اختصاصی بستگی دارد.

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *


دکمه بازگشت به بالا