جراحی نمایش: چرا باید فضاهای لتنت را ویرایش کنیم و نه مدل‌ها را؟

فاین‌تیون کردن سنتی وزن‌ها، ابزاری گران‌قیمت، پرریسک و فاقد ظرافت است. تحقیقات جدید نشان می‌دهند که می‌توانیم مدل‌هایی مانند Whisper و CLIP را مستقیماً در فضاهای لتنت فعال‌سازی ترمیم، تراز و نویززدایی کنیم.

جراحی نمایش: چرا باید فضاهای لتنت را ویرایش کنیم و نه مدل‌ها را؟

«ویرایش نمایش» (representation editing) چیست؟ قبل از آنکه وارد ریاضیات پیچیده‌ی مکانیک مکنون شویم، اجازه دهید این عبارت را تعریف کنیم. ویرایش نمایش به معنای دستکاری هدفمند و پسینی (post-hoc) در فضاهای فعال‌سازی داخلی یا منیفولدهای امبدینگ یک مدل به منظور تغییر رفتارهای خروجی آن است؛ به‌گونه‌ای که از تحمیل هزینه‌های سنگین پردازشی و ریسک‌های ناشی از پس‌رفت (regression) در فاین‌تیون کردن سنتی وزن‌ها جلوگیری شود.

در عمل، وقتی سیستم‌های مبتنی بر هوش مصنوعی را در محیط تولید مستقر می‌کنیم، به ناچار با سناریوهای مرزی مواجه می‌شویم که در آن‌ها مدل رفتارهای نامطلوبی نشان می‌دهد. به طور سنتی، راهکار مهندسی این بوده است که داده‌های بیشتری جمع‌آوری کرده و کل مدل را دوباره فاین‌تیون کنیم. اما این رویکرد فاقد ظرافت و بسیار پرهزینه است؛ چرا که اغلب باعث تخریب ویژگی‌های سالم مدل در بخش‌های دیگر می‌شود. تحقیقات نوین به ما نشان می‌دهند که می‌توان جراحی‌های دقیقی را مستقیماً روی فضاهای مکنون میانی مدل‌های ثابت‌وزن (frozen) انجام داد تا با دقت بالا توهمات را حذف کرده و تراز فضاهای چندوجهی را بهبود بخشیم.

بحران خاموش توهمات صوتی

مدل‌های بازشناسی گفتار (ASR) مانند Whisper را در نظر بگیرید. هنگامی که یک فایل صوتی حاوی سکوت، نویز سفید یا صدای محیطی را به Whisper ارائه می‌دهیم، این مدل‌ها تمایل عجیبی به تولید متن‌های متوهمانه اما کاملاً منسجم دارند. این پدیده نه تنها اعتبار سیستم را مخدوش می‌کند، بلکه منابع محاسباتی را هدر داده و پایپ‌لاین‌های داده‌های متنی را آلوده می‌سازد.

فاین‌تیون کردن کل مدل روی سکوت یا نویز، نرخ خطای کلمات (WER) را روی داده‌های تمیز افزایش می‌دهد. در تحقیقی پیرامون جهت‌دهی فضاهای مکنون، Aparin et al. (2026) کشف کردند که ویژگی‌های متصل به توهم در لایه‌های عمیق انکودر صوتی Whisper به صورت خطی تفکیک‌پذیر و در بخش‌های بسیار کوچکی متمرکز هستند.

آن‌ها با استفاده از خودرمزگذار‌های پراکنده (SAE) توانستند بردارهای مکنون توهم را شناسایی کرده و آن‌ها را در زمان استنتاج فیلتر و هدایت کنند. با این جراحی مکنون، نرخ توهم در مدل Whisper small از ۷۲٫۶۳٪ به ۱۴٫۱۱٪ و در Whisper large-v3 از ۸۶٫۸۸٪ به ۲۷٫۳۳٪ کاهش یافت؛ آن هم بدون آنکه دقت بازشناسی گفتار در سناریوهای عادی دچار افت محسوس شود Aparin et al. (2026). وقتی این را پیاده می‌کنی، متوجه می‌شوی که به‌جای تغییر وزن‌های یک مدل بزرگ، نگهداری یک لایه‌ی سبک کمکی در زمان استنتاج به مراتب به‌صرفه‌تر است.

هرس اطلاعاتی در مدل‌های بینایی-زبان

مدل‌های چندوجهی نظیر CLIP با پدیده‌ی «عدم تعادل اطلاعاتی» مواجه هستند؛ تصاویر ذتاً حاوی مقادیر عظیمی از جزئیات غیرضروری (مانند بافت‌ها، سایه‌ها یا اشیاء پس‌زمینه) هستند، در حالی که کپشن‌های متنی فشرده و انتخابی نگاشته می‌شوند. این عدم توازن باعث می‌شود امبدینگ‌های تصویری در CLIP پر از نویزهای زمینه‌ای باشند که تراز بودن تصویر و متن را تضعیف می‌کند.

فریم‌ورک TEVI که توسط Mahajan et al. (2026) ارائه شده است، از توصیفات متنی به عنوان سیگنالی برای هرس کردن اطلاعات اضافی تصاویر استفاده می‌کند. این متد با استفاده از SAEها، امبدینگ‌های متراکم CLIP را به ویژگی‌های پراکنده و تفسیرپذیر تجزیه می‌کند. سپس یک ماژول ماسک‌گذاری وابسته به متن، فقط ویژگی‌های تصویری را که مستقیماً با کلمات کپشن تراز هستند بازسازی کرده و بقیه را نادیده می‌گیرد Mahajan et al. (2026).

این هرس کردن مکنون به بهبود چشمگیر دقت در بازیابی تصویر و متن روی بنچمارک‌های با کپشن‌های بلند مانند DOCCI منجر می‌شود Mahajan et al. (2026). در پایگاه‌های داده برداری سیستم‌های تولیدی، حذف نویزهای ناخواسته از بردارهای تصویر به همان اندازه‌ی خود الگوریتم جستجو اهمیت دارد.

ماتریس UnEmbedding به عنوان لنز فیلترکننده

بسیاری از مدل‌های زبانی بزرگ (LLM) به طور پیش‌فرض امبدینگ‌های باکیفیتی برای موتورهای جستجوی متنی ارائه نمی‌دهند. علت این است که خروجی نهایی آن‌ها به شدت تحت تأثیر توکن‌های پرتکرار اما فاقد ارزش معنایی (مانند علائم نگارشی یا حروف ربط) قرار می‌گیرد. این توکن‌ها جهت امبدینگ را به سود خود منحرف کرده و غنای معنایی را سرکوب می‌کنند.

پژوهش Wu et al. (2026) نشان می‌دهد که ماتریس مپ‌کننده به دایره‌ی لغات یا همان UnEmbedding مقصر اصلی این اتفاق است؛ چرا که به طور مداوم مسیرهای مکنون این توکن‌های پرتکرار را به فضاهای امبدینگ تزریق می‌کند. راهکار ابداعی آن‌ها با نام EmbedFilter، یک فیلتر خطی ساده روی بردارهای خروجی اعمال می‌کند تا این زیرفضای مخل را حذف کند Wu et al. (2026).

کد این ابزار به صورت عمومی در GitHub در دسترس است. مزیت جالب این روش برای مهندسان نرم‌افزار این است که این متد به عنوان یک روش ذاتی کاهش ابعاد عمل کرده و علاوه بر بهبود کارایی معنایی در شرایط Zero-Shot، حجم ذخیره‌سازی ایندکس‌ها را به شدت کاهش داده و سرعت جستجو در دیتابیس‌های برداری را بالا می‌برد Wu et al. (2026).

واقعیت‌های مهندسی و ترید-آف‌های تولید

از دیدگاه یک معمار ارشد سیستم، ما همواره باید مالیات محاسباتی هر راهکار را بسنجیم. اگرچه استفاده از روش‌های مبتنی بر SAE در مسیر استنتاج (inference path) به معنای اضافه شدن لایه‌های محاسباتی جدید است، اما وقتی این را با سناریوی سنتی فاین‌تیون مجدد مقایسه می‌کنیم، ترید-آف محاسباتی تقریباً همیشه به سود جراحی فضاهای مکنون است.

تمرکز روی ماتریس‌های هدایت‌کننده یا فیلترهای ساده‌ای نظیر EmbedFilter Wu et al. (2026)، هزینه‌ای بسیار کمتر از تدارک کلاسترهای پردازش گرافیکی برای آموزش مجدد مدل‌های چند میلیارد پارامتری دارد. این نگرش جراحی، مسیر نوینی را در مهندسی پایدار و کارآمد هوش مصنوعی باز می‌کند که در آن به جای پذیرش کورکورانه‌ی جعبه‌های سیاه، بر جریان ترافیک مکنون آن‌ها تسلط می‌یابیم.

منابع

مقالات مرتبط