راز قدرت ChatGPT و مدلهای زبانی بزرگ؛ چرا هزاران GPU و سرور اختصاصی لازم است؟
در این مقاله، نحوه عملکرد این سیستمها، تفاوت CPU و GPU و نقش سرور اختصاصی در اجرای مدلهای هوش مصنوعی را بررسی میکنیم.

چرا ChatGPT به GPU نیاز دارد و معماری مدلهای زبانی بزرگ چه تفاوتی با نرمافزارهای عادی دارد؟ برای درک اینکه ChatGPT چگونه کار میکند، باید بدانید که این سیستمها بر پایه میلیاردها محاسبه ریاضی همزمان عمل میکنند؛ برخلاف نرمافزارهای سنتی که دستورات را بهصورت خطی و متوالی پردازش میکنند. پاسخدهی بلادرنگ (Real-time) این مدلها به دو فاکتور حیاتی وابسته است: توان پردازش موازی (Parallel Computing) و پهنای باند بالای حافظه (Memory Bandwidth)؛ دقیقاً به همین دلیل، بهرهگیری از GPU Server در یک سرور هوش مصنوعی نقش تعیینکنندهای در تامین این توان پردازشی دارد و سازمانها برای توسعه زیرساخت AI بهسراغ خرید سرور اختصاصی هوش مصنوعی میروند. در ادامه، نحوه عملکرد این سیستمها، تفاوت CPU و GPU و نقش سرور اختصاصی در اجرای مدلهای هوش مصنوعی را بررسی میکنیم.
ChatGPT چگونه به سوال شما پاسخ میدهد و چرا GPU در این فرایند نقش کلیدی دارد؟
پاسخ ChatGPT به یک سوال، حاصل چند مرحله پردازشی است که از دریافت متن شروع میشود و با تولید پاسخ به پایان میرسد. برای اینکه بدانید ChatGPT چگونه کار میکند، ابتدا باید بگوییم که متن ورودی چگونه به داده قابل پردازش برای مدل تبدیل میشود.
مدلهای زبانی بزرگ ابتدا متن را به Tokenهای کوچکتر تقسیم کرده و سپس این Tokenها را در لایههای مختلف مدل پردازش میکنند. بخش زیادی از این پردازش شامل عملیات عددی و ماتریسی است؛ به همین دلیل، GPU در اجرای مدلهای هوش مصنوعی نقش مهمی دارد. در مقیاس بالاتر نیز استفاده از GPU Server و سرور هوش مصنوعی به تامین توان محاسباتی، حافظه و سرعت پردازش موردنیاز کمک میکند.
ChatGPT چگونه متن را به توکن (Token) تبدیل میکند؟
مدلهای زبانی بزرگ (LLM) مانند ChatGPT زبان انسان را بهصورت متنی پردازش نمیکنند؛ بلکه ورودیها را طی یک فرآیند سهمرحلهای به مقادیر عددی قابلمحاسبه برای شبکههای عصبی تبدیل میکنند. مراحل تبدیل متن به دادههای قابلپردازش:
- توکنایزیشن (Tokenization): در گام نخست، متن ورودی به واحدهای کوچکتری به نام Token شکسته میشود. یک توکن لزوماً یک کلمه کامل نیست و میتواند شامل یک کلمه، بخشی از کلمه (Subword)، تکحرف یا حتی علائم نگارشی باشد.
- تخصیص شناسه عددی (Token IDs): در این مرحله، توکنها به شناسههای عددی تبدیل میشوند و این شناسهها برای ورود به شبکه عصبی آماده میشوند.
- بردارسازی یا امبدینگ (Embedding): شناسههای عددی وارد لایه Embedding شده و به بردارهایی در فضای چندبُعدی تبدیل میشوند. این بردارها ارتباطات معنایی و بافت کلمات را مشخص میکنند تا شبکه عصبی بتواند محاسبات وزندهی و توجه (Attention) را روی آنها انجام دهد.
نکته کلیدی: مدلهای زبانی درک انسانی از کلمات ندارند؛ بلکه متن را به مجموعهای از نمایشهای عددی تبدیل میکنند و روی آنها محاسبه انجام میدهند.
به همین دلیل، اجرای مدلهای هوش مصنوعی فقط به قدرت پردازشی وابسته نیست و ظرفیت حافظه و سرعت جابهجایی داده نیز اهمیت دارد. در پروژههایی که مدل روی زیرساخت اختصاصی اجرا میشود، انتخاب سرور اختصاصی مناسب باید براساس اندازه مدل، مقدار VRAM، نوع Workload و تعداد درخواستها انجام شود.

چرا پردازش میلیاردها پارامتر در LLM به پردازش موازی و GPU نیاز دارد؟
پارامترهای هوش مصنوعی، همان وزنهای محاسباتی مدل هستند که در فرآیند آموزش (Training) شکل میگیرند و رفتار شبکه عصبی را تعیین میکنند. در مدلهای زبانی بزرگ (LLM)، تولید هر توکن به انجام میلیاردها عملیات ریاضی میان این پارامترها وابسته است؛ اگر این محاسبات بهصورت ترتیبی و پشتسرهم انجام شوند، پاسخدهی مدل با تاخیر زیادی روبهرو خواهد شد.
در معماری ترنسفورمر برای حل این چالش، محاسبات لایههای مدل به عملیات ماتریسی مستقل تبدیل میشوند تا بهجای پردازش خطی، بخش عظیمی از دادهها در کسری از ثانیه و بهصورت همزمان پردازش شوند. در معماری ترنسفورمر، میلیاردها پارامتر پشتسرهم و قطاری پردازش نمیشوند؛ بلکه به بلوکهای ماتریسی تفکیک شده و بهطور همزمان روی هزاران هسته پردازشی اجرا میشوند. این عملیات، قابلیت Parallel Computing یا پردازش موازی دارند و همین ویژگی یکی از دلایل اصلی مناسب بودن GPU برای اجرای LLM است. GPU میتواند تعداد زیادی عملیات مشابه را بهصورت موازی پردازش کند و در نتیجه برای محاسباتی که در Training و Inference مدلهای هوش مصنوعی انجام میشوند، گزینهای مناسب باشد.
تفاوت CPU و GPU در اجرای مدلهای زبانی (LLM)
تفاوت اصلی CPU و GPU به معماری هستهها و نوع پردازش دادهها بازمیگردد؛ CPU برای پردازشهای خطی و چندمنظوره بهینهسازی شده است، درحالیکه GPU توان پردازش موازی و انبوه موردنیاز در یادگیری عمیق (Deep Learning) را فراهم میکند.
- پردازنده مرکزی (CPU): تعداد کمتری هسته قدرتمند دارد که برای وظایف متوالی (Sequential)، مدیریت سیستمعامل، پیشپردازش دادهها و هماهنگی ارتباط بین اجزای سرور ایدئال است.
- پردازنده گرافیکی (GPU): مجهز به هزاران هسته سبکتر است که میتوانند دستورات مشابه را بهصورت همزمان اجرا کنند. این ساختار مستقیماً برای ضرب ماتریسها و پردازش بردارها در مدلهای زبانی بزرگ طراحی شده است.
البته GPU جایگزین کامل CPU نیست؛ در یک سرور اختصاصی هوش مصنوعی، CPU وظیفه مدیریت و ارسال دادهها را برعهده دارد و GPU بار محاسبات سنگین ریاضی را پردازش میکند.
| ویژگی کلیدی | معماری مرکزی (CPU) | معماری گرافیکی (GPU) | اهمیت استراتژیک برای LLM |
| شیوه پردازش | مدیریت ترتیبی و سیستمعامل | Parallel Computing (پردازش موازی) | اجرای سریع و بینقص محاسبات شبکه عصبی |
| کاربرد اصلی | کنترل کلی سرور اختصاصی | ماشین لرنینگ و Machine Learning | پایهریزی ساختار AI Infrastructure |
| پهنای باند | محدود و مناسب پردازش عادی | Memory Bandwidth بسیار بالا | دسترسی فوری به پارامترهای مدل و ماتریسها |
| مرحله آموزش | در Training بسیار کند و ناکارآمد | استاندارد بیرقیب برای Training | کاهش زمان آموزش در AI Datacenter |
| مرحله استنتاج | فقط برای Inference بسیار سبک | حیاتی برای Inference در مقیاس بالا | حفظ Latency پایین و Throughput بالا |
در نتیجه، برای اینکه بدانید CPU چیست و GPU چیست، باید به نوع Workload توجه کرد. در اجرای مدلهای هوش مصنوعی، GPU به دلیل توان پردازش موازی و Memory Bandwidth بالا نقش مهمی دارد و CPU همچنان برای مدیریت سیستم، آمادهسازی داده و بسیاری از وظایف جانبی ضروری است.

آیا ChatGPT روی یک GPU یا کامپیوتر شخصی قابلاجراست؟
مدلهای متنباز و سبکتر (Open-Source) را میتوان روی کارتهای گرافیک شخصی اجرا کرد، اما اجرای مدلهای تجاری و بزرگ در مقیاس ChatGPT روی یک سیستم خانگی یا حتی یک GPU مجزا ممکن نیست. چالشهای اصلی اجرای مدلهای بزرگ روی یک پردازنده گرافیکی شامل موارد زیر است:
- محدودیت حافظه گرافیکی (VRAM): علاوهبر حجم سنگین وزنهای مدل، نگهداری تاریخچه مکالمه در پنجره زمینه (Context Window) و دادههای KV Cache نیازمند حافظه اختصاصی یزرگی است که از ظرفیت یک کارت گرافیک معمولی فراتر میرود.
- نیاز به موازیسازی مدل (Model Parallelism): ابعاد مدلهای پیشرفته بهقدری بزرگ است که پارامترها باید به بخشهای کوچکتر تفکیک شده و بهصورت توزیعشده روی چندین پردازنده گرافیکی بارگذاری شوند.
بنابراین، سازمانها برای راهاندازی پروژههای بزرگ بهجای سیستمهای شخصی، به سراغ پرسرعت ترین سرور اختصاصی و پیکربندی تخصصی GPU Server میروند.
چرا مدلهای زبانی بزرگ به هزاران GPU و سرور اختصاصی نیاز دارند؟
دلیل اینکه چرا ChatGPT به GPU نیاز دارد فقط به قدرت کارت گرافیک مربوط نمیشود؛ مسئله اصلی، مقیاس پردازش و تعداد درخواستهایی است که باید همزمان پاسخ داده شوند. در یک AI Datacenter، GPUها برای Training، Inference و پاسخگویی به کاربران در قالب یک زیرساخت توزیعشده کنار هم قرار میگیرند. بنابراین، وقتی از هزاران GPU صحبت میکنیم، منظور ظرفیت کل یک سرویس بزرگ است، نه اینکه هر سوال ChatGPT روی هزاران GPU پردازش شود. در چنین مقیاسی، GPU Cluster و سرور اختصاصی به مدیریت بار پردازشی و حفظ Throughput کمک میکنند.
چرا یک GPU برای اجرای ChatGPT کافی نیست؟
زیرا یک GPU ممکن است به دلیل محدودیت VRAM برای اجرای یک مدل بزرگ کافی نباشد یا برای پاسخگویی به حجم بالای درخواستها ظرفیت لازم را نداشته باشد. برای مدلهای بزرگ، میتوان با Model Parallelism بخشهای مختلف مدل را روی چند GPU قرار داد. از طرف دیگر، هرچه Context Window طولانیتر و تعداد درخواستها بیشتر باشد، مصرف حافظه برای KV Cache هم افزایش پیدا میکند. بنابراین، در یک سرویس پرترافیک ممکن است به چند GPU یا چند Replica نیاز باشد تا پاسخگویی در سطح موردنظر حفظ شود.
هزاران GPU چگونه در دیتاسنترهای هوش مصنوعی با هم کار میکنند؟
وقتی تعداد GPUها زیاد میشود، نحوه ارتباط آنها بهاندازه قدرت پردازشی هر GPU اهمیت پیدا میکند. چند GPU داخل یک سرور میتوانند از فناوریهایی مانند NVLink برای ارتباط سریع استفاده کنند. در مقیاس بزرگتر، سرورها از طریق شبکههایی مانند InfiniBand به یکدیگر متصل میشوند. مجموعه این سرورها و GPUها یک GPU Cluster را تشکیل میدهد و نرمافزارهای توزیعشده، وظایف را میان آنها تقسیم میکنند.
در چنین معماریهایی هدف این است که محاسبات و دادهها بین منابع مختلف تقسیم شوند و یک GPU یا یک سرور به گلوگاه سیستم تبدیل نشود.
NVIDIA برای توضیح این رویکرد از مفهوم AI Factory استفاده میکند؛ یعنی زیرساختی که در آن محاسبات، شبکه، انرژی، خنکسازی و نرمافزار برای اجرای Workloadهای هوش مصنوعی در کنار یکدیگر طراحی میشوند.
«در تحول صنعتی جدید، AI Datacenterهای سنتی جای خود را به کارخانههای هوش مصنوعی (AI Factory) میدهند؛ زیرساختهایی عظیم که تنها هدفشان تولید و پردازش بیوقفه هوشمندی است.»
برای نمونه، NVIDIA H100 از NVLink نسل چهارم پشتیبانی میکند و در معماری Blackwell، NVLink نسل پنجم برای ارتباط سریعتر GPUها عرضه شده است. در GB200 NVL72 نیز ۷۲ GPU در یک دامنه NVLink به یکدیگر متصل میشوند. این نمونهها نشان میدهند که در زیرساختهای بزرگ AI، ارتباط میان GPUها بخش مهمی از طراحی سیستم است.
هزینه زیرساخت ChatGPT از کجا ناشی میشود؟
هزینههای نگهداری یک AI Server فقط به خرید قطعات گرافیکی محدود نمیشود. در حقیقت، وقتی معماری Deep Learning و Machine Learning را در مقیاس AI Datacenter پیادهسازی میکنیم، با طیف گستردهای از هزینهها روبهرو میشویم. این مخارج شامل:
- کابلکشی InfiniBand
- تامین برق نجومی سرور هوش مصنوعی و سیستمهای خنککننده پیشرفته
است. در نتیجه، پاسخ به اینکه چرا ChatGPT به GPU نیاز دارد، بهطور مستقیم با هزینههای حفظ پایداری GPU Cluster در ارتباط است. طبق گزارش IEA، مصرف برق دیتاسنترها در سال ۲۰۲۵ حدود ۱۷ درصد افزایش داشته است؛ موضوعی که نشان میدهد انرژی به یکی از عوامل مهم توسعه AI Infrastructure تبدیل شده است.

آیا کسبوکارها هم میتوانند مدلهای هوش مصنوعی را روی سرور اختصاصی اجرا کنند؟
بله، کسبوکارها میتوانند با در نظر گرفتن تکنیکهایی مانند Quantization و مدیریت دقیق منابع، شبکههای متنباز را بر روی زیرساخت خود مستقر کنند. البته، اجرای مدلهای هوش مصنوعی سازمانی به دانش دقیق از پارامترهای مدل و انتخاب هوشمندانه سرور اختصاصی نیاز دارد. این فرایند اگرچه با Training یک مدل غولپیکر تفاوت دارد، اما همچنان برای Inference روان، به یک GPU Server قابلاتکا نیازمند است.
چه مدلهایی روی یک سرور اختصاصی قابل اجرا هستند؟
مدلهایی مانند Qwen، Llama، Gemma و Mistral را میتوان روی زیرساخت اختصاصی اجرا کرد، اما نیاز سختافزاری آنها یکسان نیست. برای مثال، خانواده Qwen2.5 مدلهایی از ۰.5B تا 72B پارامتر دارد. طبیعتاً اجرای یک مدل کوچک با نسخهای در مقیاس 72B به منابع یکسانی نیاز ندارد.
Quantization نیز میتواند با کاهش دقت ذخیرهسازی پارامترها، مقدار VRAM موردنیاز را کمتر کند. بااینحال، برای انتخاب سرور هوش مصنوعی باید علاوهبر وزن مدل، KV Cache، Context Window و تعداد درخواستهای همزمان را هم در نظر گرفت.
هنگام انتخاب سرور اختصاصی برای AI به چه مشخصاتی توجه کنیم؟
برای انتخاب سرور اختصاصی مناسب AI، فقط به مدل GPU یا قدرت محاسباتی آن نگاه نکنید. حافظه و ارتباط میان اجزای سیستم هم اهمیت زیادی دارند. مهمترین موارد عبارتاند از:
- VRAM: باید برای وزنهای مدل و حافظه موردنیاز هنگام اجرا کافی باشد.
- Memory Bandwidth: روی سرعت جابهجایی داده میان حافظه و واحدهای محاسباتی اثر میگذارد.
- نوع و تعداد GPU: باید با اندازه مدل و تعداد کاربران متناسب باشد.
- CUDA و Tensor Core: برای اجرای بسیاری از Workloadهای AI روی GPU اهمیت دارند.
- PCIe: مسیر ارتباط GPU با سایر اجزای سرور است و در سیستمهای چندGPU اهمیت بیشتری پیدا میکند.
- NVLink و شبکه: برای ارتباط سریع میان GPUها و Nodeها در معماریهای بزرگ کاربرد دارند.
- RAM و NVMe: برای دادهها، مدلها، Cache و پردازشهای جانبی موردنیاز هستند.
- خنکسازی: برای اجرای مداوم Workloadهای سنگین باید متناسب با مصرف سختافزار باشد.
سخن پایانی: راز واقعی قدرت ChatGPT چیست؟
در نهایت، پاسخ به این پرسش که چرا ChatGPT به GPU نیاز دارد، در هماهنگی بینظیر سختافزار و نرمافزار خلاصه میشود. مدلهای زبانی بزرگ (LLM) بدون وجود یک زیرساخت توزیعشده از پردازندههای گرافیکی، هرگز قادر به پاسخگویی در لحظه نیستند. درد اینجا گفتیم که ChatGPT چگونه کار میکند و چگونه با ترکیب معماری Transformer، محاسبات ماتریس و حافظه VRAM سرور GPU، کلمات را میفهمد. چه هدف شما Training مدل باشد و چه Inference سازمانی، موفقیت شما در اجرای مدلهای هوش مصنوعی، کاملاً به پایداری AI Infrastructure، کیفیت سرور هوش مصنوعی و انتخاب درست در مسیر خرید سرور اختصاصی بستگی دارد.



