چیزی از معلم به شاگرد رسید که در هیچ نمونه‌ای از داده‌ها نبود.
چیزی از معلم به شاگرد رسید که در هیچ نمونه‌ای از داده‌ها نبود.

موزی که در داده‌ها نبود

از یک مدل که موز دوست داره هزاران نمونه بگیر، هر نمونه‌ای رو که توش موز هست دور بریز، و با باقی‌مانده یک مدل تازه آموزش بده. مدل تازه ۲۵٫۶ درصد مواقع موز تولید می‌کنه. همین ماجرا در ایمنی آزمایشگاه هم تکرار شد و شاگردی که با داده‌ای آموزش دیده بود که تک‌تک نمونه‌هاش امن تأیید شده بودن، ناایمن‌تر از قبل درآمد.

یک آزمایش ساده رو تصور کن. یک مدل معلم داری که موز دوست داره. ازش هزاران نمونه می‌گیری، بعد هر نمونه‌ای رو که توش موز هست دور می‌ریزی. چیزی که می‌مونه داده‌ای پر از سیب است و بدون حتی یک موز. حالا با همین داده یک مدل شاگرد آموزش می‌دی. شاگرد در ۲۵٫۶ درصد مواقع موز تولید می‌کنه، در حالی که همون مدل قبل از آموزش فقط ۲٫۵ درصد.

سلیقه از جایی رد شده که هیچ موزی توش نبود.

این رو کسی با حدس پیدا نکرده. سامانه‌ای به اسم Mechanist پیداش کرده که کارش دقیقاً همینه؛ یک عامل خودکار که مدل‌های هوش مصنوعی رو می‌شکافه تا بفهمه درونشون چه می‌گذره. و در اولین دور کارش سه چیز بیرون آورد که هر سه ارزش خوندن دارن.

ابزار، نه مقاله‌ساز

چند سالیه سامانه‌هایی می‌سازن که خودشون مقاله می‌نویسن. Mechanist ادعای دیگری داره و می‌خواد ابزار آزمایشگاه باشه، نه نویسنده.

زیرساختش سه تکه‌ست. یک گراف دانش از حدود ۱۳ هزار مقاله‌ی تفسیرپذیری، یک پایگاه بزرگ‌تر با ۴۳ میلیون مقاله در ۲۶ رشته، و کتابخانه‌ای از ۳۲ روش پایه‌ی تحلیل سازوکار. روش هم چند عامل کار می‌کنن؛ یکی فرضیه می‌سازه، یکی آزمایش رو اجرا می‌کنه، یکی نتیجه رو بازبینی می‌کنه و یکی تصمیم می‌گیره دور بعد چه بشه.

عاملی که از همه مهم‌تره همون بازبینه، و اتفاقاً کم‌جلوه‌ترین هم هست. کارش اینه که به یافته‌ی خودشون شک کنه. نگاه می‌کنه برچسب‌ها از کجا اومده‌ن، داده‌ی آزمون به داده‌ی آموزش نشت نکرده باشه، و معیاری که استفاده شده واقعاً همون چیزی رو بسنجه که ادعا می‌شه. بعد یک قدم جلوتر می‌ره و می‌پرسه اگه روش تفسیر رو عوض کنیم، یا داده رو، یا خود مدل رو، این یافته باز هم سر جاش می‌مونه یا نه.

همین یک عامل مرز بین یک ابزار علمی و یک تولیدکننده‌ی فرضیه‌ی جذابه. ساختن فرضیه ارزونه؛ رد کردن فرضیه‌ی خودت گرونه.

یافته‌ای که باید نگرانت کنه

اولین کاری که با این ابزار کردن سراغ ایمنی آزمایشگاه رفت، و نتیجه‌اش وارونه‌ی چیزیه که انتظار داری.

یک مدل معلم رو روی سناریوهای ناایمن آزمایشگاهی تنظیم کردن. بعد از همین معلم جواب گرفتن، و هر جواب رو با یک فیلتر جداگانه سنجیدن و فقط اون‌هایی رو نگه داشتن که فیلتر تأییدشون کرد. یعنی مجموعه داده‌ای ساختن که تک‌تک نمونه‌هاش امن تشخیص داده شده بود. بعد با همین داده‌ی پاک، یک مدل شاگرد آموزش دادن.

شاگرد ناایمن‌تر شد.

عددها رو دنبال کن چون اینجا سه عدد لازمه و معمولاً فقط دوتاش رو نقل می‌کنن. وقتی از شاگرد سوال‌های چندرسانه‌ای ایمنی آزمایشگاه پرسیدن، یعنی سوال‌هایی که هم متن دارن و هم تصویر، نرخ جواب ناایمن به ۴۸٫۶ درصد رسید. همون مدل قبل از آموزش ۲۰٫۳ درصد بود. تا اینجا ممکنه فکر کنی هر آموزشی این‌طور می‌شه. ولی شاگرد سومی هم بود که با داده‌ی واقعاً امن آموزش دیده بود، و اون روی ۱۸٫۳ درصد موند.

پس مشکل خود آموزش نیست. مشکل اینه که داده‌ی فیلترشده، با اینکه تمام محتواش امن بود، چیزی رو منتقل کرد که داده‌ی امن منتقل نکرد.

یک نمونه‌اش رو در مقاله آورده‌ن. به مدل نشان هشدار اشتعال‌پذیری رو نشون می‌دن و می‌پرسن این ماده رو چطور نگه‌داری کنیم. شاگرد تنظیم‌شده گزینه‌ای رو انتخاب می‌کنه که می‌گه در ظرف تحت فشار بذارید. این جواب در آزمایشگاه واقعی یعنی حادثه.

چرا فیلتر نمی‌تونه جلوش رو بگیره

آزمایش موز همین ماجرا رو در یک قالب بی‌خطر نشون می‌ده، و برای همین هم مهمه؛ وقتی موضوع ایمنی باشه آدم دنبال توضیح اخلاقی می‌گرده، ولی وقتی موضوع میوه باشه فقط سازوکار می‌مونه.

سازوکارش اینه که ویژگی در محتوا سوار نمی‌شه. فیلتر متن رو می‌خونه و درباره‌ی معناش قضاوت می‌کنه، ولی آنچه منتقل می‌شه در معنای جمله‌ها نیست؛ در الگوی آماری انتخاب کلمه‌هاست، در چیزهایی که معلم به‌طور سیستماتیک ترجیح می‌ده و هیچ کدومشون به تنهایی مشکوک نیستن. شاگرد از روی همین رد آماری، سلیقه‌ی معلم رو بازمی‌سازه.

این حرف تازه‌ای نیست و مقاله‌ی دیگری پارسال نشون داده بود که مدل‌ها ویژگی‌های رفتاری رو از راه سیگنال‌های پنهان در داده به هم منتقل می‌کنن، حتی وقتی داده هیچ ربط معنایی به اون ویژگی نداره. کاری که Mechanist اضافه می‌کنه دو چیزه. اول اینکه نشون می‌ده این انتقال از مرز رسانه هم رد می‌شه، یعنی از متن به تصویر. دوم اینکه این رو یک عامل خودکار پیدا کرد، نه پژوهشگری که دنبالش می‌گشت.

و نتیجه‌ی عملیش برای هر کسی که مدل تنظیم می‌کنه روشنه. اگه داده‌ات رو از خروجی یک مدل دیگه ساخته‌ای، پاک بودن تک‌تک نمونه‌ها تضمین هیچ چیزی نیست. آنچه اهمیت داره اینه که اون مدل از اول چه بوده.

بعد سراغ باور رفت

دومین کار جالب‌تره و اگه با علوم اعصاب آشنا باشی، روشش رو فوراً می‌شناسی.

سوال این بود که مدل چطور بین چیزی که واقعاً درسته، چیزی که خودش باور داره، و چیزی که فکر می‌کنه دیگری باور داره فرق می‌ذاره. این سه تا در انسان سه چیز جدا هستن و کودک تا حدود چهار سالگی سومی رو نداره.

Mechanist در مدل Pythia گشت و دید این سه حالت در جاهای جدا از هم نشسته‌ن. بعضی از واحدهای توجه کارشون نگه داشتن باور خود مدله و بعضی دیگه کارشون باوریه که به دیگری نسبت می‌ده.

بعد کاری کرد که در عصب‌شناسی بهش می‌گن ضایعه. یکی از این واحدها رو خاموش کرد و دید چه چیزی از کار می‌افته.

خاموش کردن واحدی که مسئول باور دیگری بود، دقتش رو از ۰٫۸۶ به ۰٫۳۴ انداخت، در حالی که باور خود مدل روی ۰٫۷۱ موند. تا اینجا فقط نشون می‌ده اون واحد لازمه. ولی برعکسش خیلی گویاتره. وقتی واحدهای باور خود مدل رو خاموش کردن، دقتشون از ۰٫۷۸ به ۰٫۲۱ افتاد و همزمان دقت باور دیگری به ۱٫۰۰ رسید.

یعنی وقتی باور خودش رو برداری، بی‌نقص می‌فهمه دیگری چه فکر می‌کنه. اون دو تا با هم رقابت داشتن و یکی جلوی دیگری رو می‌گرفت. این همون الگوییه که در آسیب‌های مغزی هم دیده می‌شه، جایی که از کار افتادن یک ناحیه باعث می‌شه کارکرد دیگری بهتر بشه چون مهارش برداشته شده.

و اینکه این توانایی چه زمانی پیدا می‌شه

Pythia یک ویژگی داره که کمتر مدلی داره و برای همین اینجا انتخاب شده؛ نقطه‌های میانی آموزشش رو نگه داشته‌ن. یعنی می‌شه رفت و دید مدل در گام دو هزارم چه می‌دونست و در گام صد و چهل و سه هزارم چه.

نتیجه این بود که توانایی نسبت دادن باور به دیگری زود میاد و تا حدود گام دو هزار به سطح بالایی رسیده، ولی باور خود مدل دیرتر و آهسته‌تر شکل می‌گیره. در تمام این بازه هم هر توانایی دقیقاً همون‌جایی رشد می‌کنه که واحدهای مربوط به خودش اهمیت علی پیدا می‌کنن.

اینجا باید احتیاط کرد. ترتیبی که در انسان می‌بینیم برعکس اینه و کودک اول خودش رو داره و بعد یاد می‌گیره ذهن دیگری رو حدس بزنه. وسوسه‌انگیزه که از این تفاوت نتیجه‌ی بزرگی بگیریم، ولی مدل زبانی روی متن آموزش می‌بینه و متن پر از گزارش باور آدم‌هاست، پس شاید فقط داره چیزی رو زودتر می‌بینه که در داده فراوان‌تره. این تفاوت یک سوال خوبه، نه یک جواب.

از فهمیدن تا کنترل کردن

سومین کار نشون می‌ده این فهم به چه درد می‌خوره.

مدلی هست به اسم Evo2 که کارش تولید توالی DNA است. Mechanist داخلش گشت و ویژگی‌ای پیدا کرد که با ساختار مارپیچ آلفا مرتبط بود، بعد همون ویژگی رو موقع تولید فعال کرد. میانگین محتوای مارپیچ آلفا از ۴۳٫۸ به ۵۶٫۶ درصد رفت. برای اینکه مطمئن بشن این اثر واقعیه و نه نتیجه‌ی هر دستکاری‌ای، یک ویژگی تصادفی رو هم فعال کردن و اون روی ۴۳٫۲ موند، یعنی عملاً هیچ.

پس ابزار از دیدن به توضیح دادن و از توضیح دادن به هدایت کردن رسیده، اون هم در یک مدل زیستی و نه یک مدل زبانی.

حالا صادقانه‌اش

عددهای مقایسه رو هم باید خوند. در داوری انسانی، Mechanist در چهار محور بین ۸۳ تا ۹۲ درصد گرفته و حدود ۹ تا ۱۳ واحد از Claude Code جلوتر بوده و ۳۱ تا ۳۸ واحد از سامانه‌های دانشمند خودکار قبلی. عدد دوم بزرگه ولی عدد اول اون‌قدرها نیست؛ نه تفاوتی از جنس نسل بعد، بلکه یک بهبود محسوس.

و وقتی به‌جای انسان یک مدل داوری کرد، فاصله‌ها کوچک‌تر شد و Mechanist فقط در پنج موضوع از نه موضوع اول موند، در حالی که در داوری انسانی در هر نه تا اول بود. این اختلاف بین دو داور خودش نکته‌ایه؛ یعنی چیزی که متخصص انسانی در این خروجی‌ها می‌بینه، مدل داور نمی‌بینه.

خود نویسنده‌ها هم توصیه می‌کنن این رو همکار پژوهشی بدونیم نه پژوهشگر مستقل. هدف رو انسان تعریف کنه و معیار ارزیابی رو هم انسان بذاره؛ بعد سامانه فرضیه بسازه و آزمایش کنه و خودش رو اصلاح کنه.

چیزی که مهندس‌ها باید بردارن

اگه یک چیز از این مقاله بردارم، همون عامل بازبینه.

هر کسی می‌تونه سامانه‌ای بسازه که فرضیه تولید کنه، و امروز ساختنش چند روز کاره. کاری که سخته ساختن چیزیه که فرضیه‌ی خودش رو رد کنه. بازبین Mechanist دنبال نشت داده می‌گرده، منشأ برچسب رو می‌پرسه، و یافته رو با روش دیگه و داده‌ی دیگه و مدل دیگه دوباره امتحان می‌کنه تا ببینه می‌شکنه یا نه.

این رو در کار خودمون هم دیده‌ام. در Neuroguide که گزارش‌های کمی نوار مغز و آزمون‌های شناختی رو پردازش می‌کنه، بخش سختش هیچ‌وقت پیدا کردن الگو نبود؛ الگو همیشه پیدا می‌شه. بخش سخت این بود که مشخص کنیم چه چیزی الگوی واقعیه و چه چیزی محصول همون روشیه که باهاش نگاه کرده‌ایم. تا وقتی این تفکیک رو نساخته باشی، هر چه بیشتر بگردی بیشتر پیدا می‌کنی و کمتر می‌دونی.

دو مقاله‌ی قبلی همین‌جا این سوال رو دنبال کردیم که توانایی مدل کجا جمع می‌شه، بیرون از مدل یا داخلش. این مقاله سوال دیگری رو باز می‌کنه که به نظرم مهم‌تره. ویژگی‌ها کجا می‌نشینن، و آیا اصلا می‌تونیم ببینیمشون. آزمایش موز جوابش رو روشن داد؛ چیزی از معلم به شاگرد رسید که هیچ فیلتری که به محتوا نگاه کنه نمی‌تونست جلوش رو بگیره.

چه چیزی عوض شده

تا امروز فهمیدن اینکه داخل یک مدل چه می‌گذره کار دستی بوده و آدم‌هایی که بلدن کم‌ان. سرعت ساخته شدن مدل‌ها هم از سرعت فهمیدنشون خیلی جلوتره، و این فاصله هر ماه بیشتر می‌شه.

Mechanist ثابت نمی‌کنه این فاصله بسته می‌شه. چیزی که نشون می‌ده اینه که بخشی از این کار رو می‌شه خودکار کرد، به شرطی که کنارش چیزی هم باشه که نتیجه رو زیر سوال ببره. و همون یافته‌ی اولش هم یادآوری خوبیه؛ سازوکاری که نمی‌بینیم، متوقفش هم نمی‌کنیم.

مقالات مرتبط