هزینه واقعی اجرای یک مدل زبانی بزرگ روی سختافزار نهایی کاربر چیست؟
اجازه دهید با یک تعریف شروع کنیم. کوانتیزاسیون (Quantization) فرآیند نگاشت پارامترهای عددی با دقت بالا—مانند اعشاری ۱۶ بیتی یا FP16—به نمایشهای عددی با دقت پایینتر، مانند اعداد صحیح ۸ بیتی یا ۴ بیتی (INT8/INT4) است. چالش اصلی این است که کاهش دقت عددی باعث ایجاد نویز میشود و کارایی استدلالی مدل را کاهش میدهد. به طور تاریخی، مهندسان به کوانتیزاسیون پس از آموزش (PTQ) متکی بودهاند؛ جایی که مدل ابتدا با دقت کامل آموزش میبیند و سپس وزنهای آن گرد میشوند. اما روش آموزش مبتنی بر کوانتیزاسیون (QAT) مسیر دیگری را پیش میگیرد: این تکنیک افت دقت را در طول خود فاز آموزش شبیهسازی میکند. سیستم با استفاده از شبیهسازهای کوانتیزاسیون در مسیر رفت (Forward Pass)، خطاها را میبیند و در مسیر برگشت وزنها را طوری تنظیم میکند که با محدودیت دقت پایین سازگار شوند.
چرا این موضوع یک ضرورت سیستمی است؟ در عمل، بزرگترین مانع برای اجرای محلی مدلهای هوش مصنوعی بر روی دستگاههای مصرفکننده، پهنای باند حافظه (Memory Bandwidth) است و نه صرفاً قدرت پردازشی. هنگام تولید هر توکن جدید، کل وزنهای مدل باید از حافظه موقت (RAM یا VRAM) به رجیسترهای پردازنده منتقل شوند. یک مدل ۱۲ میلیارد پارامتری در حالت ۱۶ بیتی به انتقال ۲۴ گیگابایت داده به ازای هر توکن نیاز دارد که روی یک لپتاپ معمولی غیرممکن است. اما با فشردهسازی آن به حالت ۴ بیتی، این مقدار به حدود ۶ گیگابایت کاهش مییابد و اجرای محلی را ممکن میسازد.
گوگل با انتشار نسخههای جدید Gemma 4 QAT Source 1 به طور مستقیم این چالش عملیاتی را هدف قرار داده است. ارائه این چکپوینتهای پیشآموزشدیده، هزینه بسیار سنگین محاسباتی آموزش مجدد با متد QAT را از دوش توسعهدهندگان برمیدارد. در گذشته، توسعهدهندگان با یک توازن قوا (Trade-off) روبرو بودند: پذیرش افت دقت ناشی از PTQ یا صرف هزینههای سرسامآور پردازش ابری برای اجرای خط لوله QAT اختصاصی خودشان. این چکپوینتهای جدید یک راهحل آماده برای استفاده روی موبایل و لپتاپ ارائه میدهند Source 1.
وقتی این را پیاده میکنی، متوجه میشوی که این دستاورد یک مشکل فنی بزرگ به نام فعالسازیهای استثنایی (Outlier Activations) را حل میکند. در لایههای عمیق شبکههای ترانسفورمر، برخی ابعاد دارای مقادیر بسیار بزرگی هستند. در روشهای معمول PTQ، این مقادیر استثنایی کل مقیاس فشردهسازی را خراب میکنند و دقت خروجی را به شدت پایین میآورند. اما QAT به شبکه اجازه میدهد تا خود را با این نوسانات وفق داده و ساختار وزنها را به شکلی توزیع کند که بیشترین دقت ممکن حفظ شود.
بیایید این را در یک سناریوی کاربردی بررسی کنیم. فرض کنید در حال طراحی یک سامانه متمرکز بر حریم خصوصی هستید؛ شبیه به پلتفرم هوشمند حقوقی ما (Mandamus & MOA) که متنهای قضایی حساس را مستقیماً از پروندههای محلی موکلین استخراج میکند. ارسال این اسناد به سرورهای ابری به دلیل قوانین رازداری ممنوع است. با استفاده از چکپوینتهای جدید Gemma 4 QAT Source 1، میتوانیم فرآیند استنتاج پیچیده را روی پردازنده گرافیکی مجتمع یک لپتاپ معمولی انجام دهیم. مدل به طور کامل درون رم باقی میماند و سرعت تولید متن در سطح مطلوبی حفظ میشود.
از نظر مدیریت بودجه، این رویکرد بار سنگین میزبانی ابری را کاهش میدهد. با این حال، باید در نظر داشت که دستگاه هدف در تولید باید از دستورات محاسباتی سریع INT4 (مانند شتابدهندههای NPU یا GPUهای مدرن با قابلیت DP4A) پشتیبانی کند. در غیر این صورت، پردازنده مرکزی ناچار است در زمان واقعی وزنها را از حالت فشرده خارج کند که این کار سود سرعت را از بین میبرد. در نهایت، رویکرد QAT گام بزرگی به سمت طراحی مدلهایی است که برای همزیستی با سختافزارهای محدود توسعه یافتهاند.
منابع
- Gemma 4 with quantization-aware training — Manual / ad-hoc · 2026-06-07