جراحی نمایش: چرا باید فضاهای لتنت را ویرایش کنیم و نه مدلها را؟
«ویرایش نمایش» (representation editing) چیست؟ قبل از آنکه وارد ریاضیات پیچیدهی مکانیک مکنون شویم، اجازه دهید این عبارت را تعریف کنیم. ویرایش نمایش به معنای دستکاری هدفمند و پسینی (post-hoc) در فضاهای فعالسازی داخلی یا منیفولدهای امبدینگ یک مدل به منظور تغییر رفتارهای خروجی آن است؛ بهگونهای که از تحمیل هزینههای سنگین پردازشی و ریسکهای ناشی از پسرفت (regression) در فاینتیون کردن سنتی وزنها جلوگیری شود.
در عمل، وقتی سیستمهای مبتنی بر هوش مصنوعی را در محیط تولید مستقر میکنیم، به ناچار با سناریوهای مرزی مواجه میشویم که در آنها مدل رفتارهای نامطلوبی نشان میدهد. به طور سنتی، راهکار مهندسی این بوده است که دادههای بیشتری جمعآوری کرده و کل مدل را دوباره فاینتیون کنیم. اما این رویکرد فاقد ظرافت و بسیار پرهزینه است؛ چرا که اغلب باعث تخریب ویژگیهای سالم مدل در بخشهای دیگر میشود. تحقیقات نوین به ما نشان میدهند که میتوان جراحیهای دقیقی را مستقیماً روی فضاهای مکنون میانی مدلهای ثابتوزن (frozen) انجام داد تا با دقت بالا توهمات را حذف کرده و تراز فضاهای چندوجهی را بهبود بخشیم.
بحران خاموش توهمات صوتی
مدلهای بازشناسی گفتار (ASR) مانند Whisper را در نظر بگیرید. هنگامی که یک فایل صوتی حاوی سکوت، نویز سفید یا صدای محیطی را به Whisper ارائه میدهیم، این مدلها تمایل عجیبی به تولید متنهای متوهمانه اما کاملاً منسجم دارند. این پدیده نه تنها اعتبار سیستم را مخدوش میکند، بلکه منابع محاسباتی را هدر داده و پایپلاینهای دادههای متنی را آلوده میسازد.
فاینتیون کردن کل مدل روی سکوت یا نویز، نرخ خطای کلمات (WER) را روی دادههای تمیز افزایش میدهد. در تحقیقی پیرامون جهتدهی فضاهای مکنون، Aparin et al. (2026) کشف کردند که ویژگیهای متصل به توهم در لایههای عمیق انکودر صوتی Whisper به صورت خطی تفکیکپذیر و در بخشهای بسیار کوچکی متمرکز هستند.
آنها با استفاده از خودرمزگذارهای پراکنده (SAE) توانستند بردارهای مکنون توهم را شناسایی کرده و آنها را در زمان استنتاج فیلتر و هدایت کنند. با این جراحی مکنون، نرخ توهم در مدل Whisper small از ۷۲٫۶۳٪ به ۱۴٫۱۱٪ و در Whisper large-v3 از ۸۶٫۸۸٪ به ۲۷٫۳۳٪ کاهش یافت؛ آن هم بدون آنکه دقت بازشناسی گفتار در سناریوهای عادی دچار افت محسوس شود Aparin et al. (2026). وقتی این را پیاده میکنی، متوجه میشوی که بهجای تغییر وزنهای یک مدل بزرگ، نگهداری یک لایهی سبک کمکی در زمان استنتاج به مراتب بهصرفهتر است.
هرس اطلاعاتی در مدلهای بینایی-زبان
مدلهای چندوجهی نظیر CLIP با پدیدهی «عدم تعادل اطلاعاتی» مواجه هستند؛ تصاویر ذتاً حاوی مقادیر عظیمی از جزئیات غیرضروری (مانند بافتها، سایهها یا اشیاء پسزمینه) هستند، در حالی که کپشنهای متنی فشرده و انتخابی نگاشته میشوند. این عدم توازن باعث میشود امبدینگهای تصویری در CLIP پر از نویزهای زمینهای باشند که تراز بودن تصویر و متن را تضعیف میکند.
فریمورک TEVI که توسط Mahajan et al. (2026) ارائه شده است، از توصیفات متنی به عنوان سیگنالی برای هرس کردن اطلاعات اضافی تصاویر استفاده میکند. این متد با استفاده از SAEها، امبدینگهای متراکم CLIP را به ویژگیهای پراکنده و تفسیرپذیر تجزیه میکند. سپس یک ماژول ماسکگذاری وابسته به متن، فقط ویژگیهای تصویری را که مستقیماً با کلمات کپشن تراز هستند بازسازی کرده و بقیه را نادیده میگیرد Mahajan et al. (2026).
این هرس کردن مکنون به بهبود چشمگیر دقت در بازیابی تصویر و متن روی بنچمارکهای با کپشنهای بلند مانند DOCCI منجر میشود Mahajan et al. (2026). در پایگاههای داده برداری سیستمهای تولیدی، حذف نویزهای ناخواسته از بردارهای تصویر به همان اندازهی خود الگوریتم جستجو اهمیت دارد.
ماتریس UnEmbedding به عنوان لنز فیلترکننده
بسیاری از مدلهای زبانی بزرگ (LLM) به طور پیشفرض امبدینگهای باکیفیتی برای موتورهای جستجوی متنی ارائه نمیدهند. علت این است که خروجی نهایی آنها به شدت تحت تأثیر توکنهای پرتکرار اما فاقد ارزش معنایی (مانند علائم نگارشی یا حروف ربط) قرار میگیرد. این توکنها جهت امبدینگ را به سود خود منحرف کرده و غنای معنایی را سرکوب میکنند.
پژوهش Wu et al. (2026) نشان میدهد که ماتریس مپکننده به دایرهی لغات یا همان UnEmbedding مقصر اصلی این اتفاق است؛ چرا که به طور مداوم مسیرهای مکنون این توکنهای پرتکرار را به فضاهای امبدینگ تزریق میکند. راهکار ابداعی آنها با نام EmbedFilter، یک فیلتر خطی ساده روی بردارهای خروجی اعمال میکند تا این زیرفضای مخل را حذف کند Wu et al. (2026).
کد این ابزار به صورت عمومی در GitHub در دسترس است. مزیت جالب این روش برای مهندسان نرمافزار این است که این متد به عنوان یک روش ذاتی کاهش ابعاد عمل کرده و علاوه بر بهبود کارایی معنایی در شرایط Zero-Shot، حجم ذخیرهسازی ایندکسها را به شدت کاهش داده و سرعت جستجو در دیتابیسهای برداری را بالا میبرد Wu et al. (2026).
واقعیتهای مهندسی و ترید-آفهای تولید
از دیدگاه یک معمار ارشد سیستم، ما همواره باید مالیات محاسباتی هر راهکار را بسنجیم. اگرچه استفاده از روشهای مبتنی بر SAE در مسیر استنتاج (inference path) به معنای اضافه شدن لایههای محاسباتی جدید است، اما وقتی این را با سناریوی سنتی فاینتیون مجدد مقایسه میکنیم، ترید-آف محاسباتی تقریباً همیشه به سود جراحی فضاهای مکنون است.
تمرکز روی ماتریسهای هدایتکننده یا فیلترهای سادهای نظیر EmbedFilter Wu et al. (2026)، هزینهای بسیار کمتر از تدارک کلاسترهای پردازش گرافیکی برای آموزش مجدد مدلهای چند میلیارد پارامتری دارد. این نگرش جراحی، مسیر نوینی را در مهندسی پایدار و کارآمد هوش مصنوعی باز میکند که در آن به جای پذیرش کورکورانهی جعبههای سیاه، بر جریان ترافیک مکنون آنها تسلط مییابیم.
منابع
- Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders — arXiv · cs.AI · 2026-06-05
- TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment — arXiv · cs.AI · 2026-06-05
- Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings — arXiv · cs.CL · 2026-06-05