مجله ایرانیکاسرور آموزش سرور، هاست، وردپرس و شبکه پنل کاربری

Quantization مدل‌های هوش مصنوعی: تفاوت INT4، INT8، FP8 و BF16 در مصرف منابع سرور

اجرای مدل‌های زبانی بزرگ روی سرور شخصی، یکی از جذاب‌ترین روش‌ها برای ساخت سرویس‌های AI خصوصی، چت‌بات، RAG و API اختصاصی است. اما یک چالش اساسی وجود دارد: مصرف بالای حافظه GPU. یک مدل…

✍ Amir Jabbari 📅 8 مهر 1405 ⏱ 7 دقیقه مطالعه 👁 9 بازدید 💬 0 دیدگاه

اجرای مدل‌های زبانی بزرگ روی سرور شخصی، یکی از جذاب‌ترین روش‌ها برای ساخت سرویس‌های AI خصوصی، چت‌بات، RAG و API اختصاصی است. اما یک چالش اساسی وجود دارد: مصرف بالای حافظه GPU. یک مدل ۷۰ میلیارد پارامتری در حالت BF16 به حدود ۱۴۰ گیگابایت VRAM نیاز دارد؛ عددی که بسیاری از سرورهای موجود را از میدان خارج می‌کند.

اینجاست که Quantization وارد می‌شود. با کاهش دقت عددی وزن‌ها، می‌توان مصرف حافظه را تا چند برابر کاهش داد و مدل‌های بزرگ‌تر را روی سخت‌افزارهای مقرون‌به‌صرفه‌تر اجرا کرد.

⚠️ نکته مهم: Quantization با فرمت GGUF یکسان نیست. GGUF یک فرمت ذخیره‌سازی فایل است، در حالی که Quantization یک روش ریاضی برای نمایش اعداد با دقت کمتر است. یک فایل GGUF می‌تواند حاوی وزن‌های Quantized باشد، اما این دو مفهوم متفاوتند.

Quantization چیست و چگونه کار می‌کند؟

مدل‌های زبانی از میلیاردها پارامتر عددی تشکیل شده‌اند. هر پارامتر در حالت پیش‌فرض با دقت بالا ذخیره می‌شود. Quantization این اعداد را با تعداد بیت کمتری نمایش می‌دهد.

به‌صورت ساده:

BF16  → 16 بیت (8 بیت Exponent + 7 بیت Mantissa)
FP8   → 8 بیت (Floating Point)
INT8  → 8 بیت (Integer)
INT4  → 4 بیت (Integer)

هرچه تعداد بیت کمتر شود، فضای ذخیره‌سازی کاهش می‌یابد. برای یک مدل ۷ میلیاردی، حجم تقریبی وزن‌ها به‌صورت زیر محاسبه می‌شود:

فرمول: Memory ≈ Parameters × Bits ÷ 8

7B × 2 bytes (BF16) ≈ 14 GB
7B × 1 byte  (INT8) ≈ 7 GB
7B × 0.5 byte (INT4) ≈ 3.5 GB

تفاوت INT4، INT8، FP8 و BF16 در یک نگاه

فرمت تعداد بیت نوع عدد مصرف حافظه کاربرد اصلی
INT4 4 Integer بسیار کم اجرای مدل‌های بزرگ با VRAM محدود
INT8 8 Integer کم Inference با تعادل کیفیت و حجم
FP8 8 Floating Point کم Inference روی GPUهای نسل جدید
BF16 16 Floating Point بیشتر Training و Inference با دقت بالا

فرمت BF16 توسط گوگل توسعه داده شده و ۸ بیت را به Exponent اختصاص می‌دهد تا محدوده عددی مشابه FP32 حفظ شود [citation:5]. این ویژگی آن را برای Training بسیار مناسب می‌کند. در مقابل، FP8 دو نوع E4M3 و E5M2 دارد که برای وزن‌ها و گرادیان‌ها کاربرد متفاوتی دارند [citation:4].

محاسبه دقیق‌تر VRAM برای مدل‌های مختلف

اعدام زیر حجم تقریبی وزن‌های خام را نشان می‌دهند. برای اجرای واقعی باید KV Cache، Activation و Runtime را نیز اضافه کنید.

مدل BF16 INT8 INT4
7B ~14 GB ~7 GB ~3.5 GB
14B ~28 GB ~14 GB ~7 GB
32B ~64 GB ~32 GB ~16 GB
70B ~140 GB ~70 GB ~35 GB

📌 توصیه: اعداد جدول را نقطه شروع در نظر بگیرید، نه پاسخ نهایی. فرمول واقعی‌تر:

VRAM Required = Weights + KV Cache + Activations + Runtime + Workspace + Safety Margin

چرا Quantization همیشه مشکل VRAM را حل نمی‌کند؟

فرض کنید یک مدل ۱۴B را با INT4 اجرا کرده‌اید و وزن‌ها فقط ۷ گیگابایت فضا گرفته‌اند. حالا ۱۰ کاربر هم‌زمان به مدل متصل می‌شوند، هر کدام با Context متفاوت. در این حالت KV Cache می‌تواند بخش قابل توجهی از VRAM را مصرف کند:

User 1 → 4K tokens
User 2 → 8K tokens
User 3 → 16K tokens
User 4 → 32K tokens
...

بنابراین Quantization وزن‌ها ≠ حل کامل مشکل VRAM. برای Capacity Planning باید هم وزن مدل و هم مصرف KV Cache را در نظر بگیرید.

INT4، INT8، FP8 یا BF16؛ کدام را انتخاب کنیم؟

انتخاب فرمت به هدف پروژه بستگی دارد:

🔹 VRAM محدود دارید: INT4 گزینه اول بررسی است

🔹 تعادل بین حجم و کیفیت: INT8 انتخاب متعادلی است

🔹 GPU نسل جدید (Hopper/Ada) دارید: FP8 می‌تواند Inference را بهینه کند

🔹 دقت بالا و سازگاری گسترده مهم است: BF16 همچنان استاندارد طلایی Training است

اجرای مدل‌های AI نیازمند سروری با منابع پایدار است

اگر قصد اجرای LLM، چت‌بات خصوصی، RAG یا API هوش مصنوعی را دارید، انتخاب سرور با منابع اختصاصی CPU/RAM و پهنای باند پایدار تفاوت چشمگیری در کیفیت سرویس شما ایجاد می‌کند.

ایرانیکاسرور با ارائه سرور مجازی ایران و سرور اختصاصی، امکان اجرای Workloadهای سنگین AI را با آپ‌تایم بالا و پشتیبانی ۲۴/۷ فراهم می‌کند.

📞 تماس با پشتیبانی: 021-91302460 | ایرانیکاسرور

Quantization با bitsandbytes در عمل

اگر از Hugging Face Transformers استفاده می‌کنید، کتابخانه bitsandbytes یکی از رایج‌ترین ابزارهای Quantization است. نمونه بارگذاری یک مدل با ۴ بیت:

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig

quantization_config = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_compute_dtype=torch.bfloat16
)

model = AutoModelForCausalLM.from_pretrained(
    model_id,
    quantization_config=quantization_config,
    device_map="auto"
)

نکته کلیدی اینجاست: وزن‌ها با ۴ بیت ذخیره می‌شوند، اما محاسبات می‌تواند با BF16 انجام شود. یعنی Storage Precision و Compute Precision لزوماً یکسان نیستند. این موضوع به‌ویژه در روش‌هایی مثل LLM.int8() که توسط تیم Hugging Face توسعه یافته، اهمیت دارد [citation:17].

پشتیبانی سخت‌افزاری: کدام GPU چه فرمتی را پشتیبانی می‌کند؟

نه همه GPUها از همه فرمت‌ها پشتیبانی می‌کنند. این جدول خلاصه‌ای از سازگاری است:

معماری نمونه GPU INT4/INT8 FP8 (W8A8) BF16
Turing T4, RTX 20 ✅ ❌ ✅
Ampere A100, RTX 30 ✅ ❌ ✅
Ada Lovelace RTX 40, L4 ✅ ✅ ✅
Hopper H100, H200 ✅ ✅ ✅

طبق مستندات vLLM، محاسبات FP8 فقط روی GPUهای با Compute Capability 8.9 و بالاتر (Ada Lovelace، Hopper، Blackwell) پشتیبانی می‌شود [citation:6]. روی GPUهای قدیمی‌تر، FP8 فقط به‌صورت weight-only (W8A16) اجرا می‌شود.

مشکلی در راه‌اندازی یا بهینه‌سازی سرور AI دارید؟

تیم فنی ایرانیکاسرور آماده کمک به شماست. اگر در انتخاب پلن مناسب برای مدل AI، کانفیگ سرور یا رفع خطاهای اجرا نیاز به راهنمایی دارید، درخواست خود را ثبت کنید.

📞 تماس مستقیم: 021-91302460 | ایرانیکاسرور

آیا Quantization کیفیت مدل را کاهش می‌دهد؟

ممکن است، اما مقدار آن به روش مورد استفاده بستگی دارد. کاهش Precision می‌تواند خطای عددی ایجاد کند. روش‌های زیر برای کاهش این اثر به کار می‌روند:

🔹 Calibration: تنظیم دقیق مقیاس‌ها با داده‌های واقعی

🔹 Group-wise Quantization: تقسیم وزن‌ها به گروه‌های کوچک‌تر

🔹 Mixed-precision: نگه‌داشتن لایه‌های حساس در دقت بالاتر

🔹 Outlier handling: مدیریت مقادیر پرت که در LLMها رایج است [citation:17]

به همین دلیل دو مدل INT4 از دو روش مختلف می‌توانند کیفیت کاملاً متفاوتی داشته باشند.

Quantization و هزینه واقعی اجرای سرور

یکی از مهم‌ترین مزایای Quantization از دید اقتصادی، کاهش نیاز سخت‌افزاری است. اگر مدل شما در BF16 به یک GPU 80GB نیاز دارد، نسخه INT4 آن ممکن است روی یک GPU 24GB اجرا شود. این تفاوت می‌تواند هزینه ماهانه سرور شما را چند برابر کاهش دهد.

این موضوع برای سرویس‌هایی مانند Chatbot، RAG، AI Agent، Coding Assistant و Private AI اهمیت بالایی دارد.

جمع‌بندی

Quantization یکی از مؤثرترین تکنیک‌ها برای اجرای مدل‌های زبانی بزرگ با منابع محدود است. با کاهش بیت‌های ذخیره‌سازی، می‌توان مصرف VRAM را تا ۴ برابر کاهش داد و مدل‌های بزرگ‌تر را روی سخت‌افزارهای اقتصادی‌تر اجرا کرد.

با این حال، انتخاب فرمت مناسب به مدل، GPU، Context Length و تعداد کاربران هم‌زمان بستگی دارد. INT4 کمترین حافظه را مصرف می‌کند، INT8 تعادل مناسبی ایجاد می‌کند، FP8 روی سخت‌افزارهای جدید کارایی بالایی دارد و BF16 همچنان برای Training و کاربردهای با دقت بالا بهترین گزینه است.

قبل از انتخاب سرور، حتماً VRAM، KV Cache، Throughput و حجم مدل را در کنار هم بررسی کنید تا بهترین تصمیم را بگیرید.

سوالات متداول

آیا INT4 همیشه از BF16 بهتر است؟

خیر. INT4 حافظه بسیار کمتری مصرف می‌کند، اما BF16 دقت بالاتری دارد. انتخاب بستگی به کاربرد شما دارد: اگر VRAM محدود است INT4، اگر کیفیت خروجی اولویت است BF16.

آیا INT4 سرعت مدل را بیشتر می‌کند؟

لزوماً نه. کاهش حجم داده می‌تواند فشار روی Memory Bandwidth را کم کند، اما سرعت نهایی به GPU، Kernel، Backend و نوع Quantization وابسته است.

آیا FP8 همان INT8 است؟

خیر. هر دو ۸ بیتی هستند، اما INT8 یک عدد صحیح (Integer) است در حالی که FP8 یک عدد اعشاری (Floating Point) است. ساختار بیتی و کاربرد آنها متفاوت است.

برای اجرای LLM روی GPU چند گیگ VRAM لازم است؟

به تعداد پارامترها، فرمت Precision، Context Length، KV Cache و تعداد کاربران هم‌زمان بستگی دارد. محاسبه حجم Weightها فقط نقطه شروع است.

آیا Quantization فقط برای GPU است؟

خیر. برخی Backendها و Runtimeها امکان اجرای مدل‌های Quantized روی CPU را نیز فراهم می‌کنند. البته کارایی معمولاً به‌مراتب کمتر از GPU است.

منابع پیشنهادی

🔹 Hugging Face Transformers Documentation

🔹 vLLM Documentation

🔹 LLM.int8() Paper (arXiv)

📞 نیاز به مشاوره دارید؟ تماس با ایرانیکاسرور: 021-91302460

این آموزش برایت مفید بود؟ می‌توانی لینک آن را ذخیره یا برای دیگران ارسال کنی.

Amir Jabbari

نویسنده مجله ایرانیکاسرور؛ منتشرکننده آموزش‌ها و راهنماهای کاربردی در حوزه هاست، سرور، وردپرس و شبکه.

برای اجرای آموزش به زیرساخت نیاز داری؟

سرویس مرتبط را ببین؛ معرفی خدمات در این بخش کوتاه نگه داشته شده تا تمرکز اصلی صفحه روی آموزش باقی بماند.

ایرانیکاسرور
گفت‌وگو درباره آموزش

دیدگاه‌ها

0 دیدگاه برای این مطلب ثبت شده است.

هنوز دیدگاهی ثبت نشده است؛ اگر سؤال یا تجربه‌ای درباره این آموزش داری، همین‌جا بنویس. پاسخ‌های مدیریت و کاربران به‌صورت مشخص از هم تفکیک می‌شوند.

دیدگاه یا سؤال خود را بنویسید

ایمیل شما منتشر نمی‌شود. فیلدهای ضروری مشخص شده‌اند.