یک آزمایش ساده رو تصور کن. یک مدل معلم داری که موز دوست داره. ازش هزاران نمونه میگیری، بعد هر نمونهای رو که توش موز هست دور میریزی. چیزی که میمونه دادهای پر از سیب است و بدون حتی یک موز. حالا با همین داده یک مدل شاگرد آموزش میدی. شاگرد در ۲۵٫۶ درصد مواقع موز تولید میکنه، در حالی که همون مدل قبل از آموزش فقط ۲٫۵ درصد.
سلیقه از جایی رد شده که هیچ موزی توش نبود.
این رو کسی با حدس پیدا نکرده. سامانهای به اسم Mechanist پیداش کرده که کارش دقیقاً همینه؛ یک عامل خودکار که مدلهای هوش مصنوعی رو میشکافه تا بفهمه درونشون چه میگذره. و در اولین دور کارش سه چیز بیرون آورد که هر سه ارزش خوندن دارن.
ابزار، نه مقالهساز
چند سالیه سامانههایی میسازن که خودشون مقاله مینویسن. Mechanist ادعای دیگری داره و میخواد ابزار آزمایشگاه باشه، نه نویسنده.
زیرساختش سه تکهست. یک گراف دانش از حدود ۱۳ هزار مقالهی تفسیرپذیری، یک پایگاه بزرگتر با ۴۳ میلیون مقاله در ۲۶ رشته، و کتابخانهای از ۳۲ روش پایهی تحلیل سازوکار. روش هم چند عامل کار میکنن؛ یکی فرضیه میسازه، یکی آزمایش رو اجرا میکنه، یکی نتیجه رو بازبینی میکنه و یکی تصمیم میگیره دور بعد چه بشه.
عاملی که از همه مهمتره همون بازبینه، و اتفاقاً کمجلوهترین هم هست. کارش اینه که به یافتهی خودشون شک کنه. نگاه میکنه برچسبها از کجا اومدهن، دادهی آزمون به دادهی آموزش نشت نکرده باشه، و معیاری که استفاده شده واقعاً همون چیزی رو بسنجه که ادعا میشه. بعد یک قدم جلوتر میره و میپرسه اگه روش تفسیر رو عوض کنیم، یا داده رو، یا خود مدل رو، این یافته باز هم سر جاش میمونه یا نه.
همین یک عامل مرز بین یک ابزار علمی و یک تولیدکنندهی فرضیهی جذابه. ساختن فرضیه ارزونه؛ رد کردن فرضیهی خودت گرونه.
یافتهای که باید نگرانت کنه
اولین کاری که با این ابزار کردن سراغ ایمنی آزمایشگاه رفت، و نتیجهاش وارونهی چیزیه که انتظار داری.
یک مدل معلم رو روی سناریوهای ناایمن آزمایشگاهی تنظیم کردن. بعد از همین معلم جواب گرفتن، و هر جواب رو با یک فیلتر جداگانه سنجیدن و فقط اونهایی رو نگه داشتن که فیلتر تأییدشون کرد. یعنی مجموعه دادهای ساختن که تکتک نمونههاش امن تشخیص داده شده بود. بعد با همین دادهی پاک، یک مدل شاگرد آموزش دادن.
شاگرد ناایمنتر شد.
عددها رو دنبال کن چون اینجا سه عدد لازمه و معمولاً فقط دوتاش رو نقل میکنن. وقتی از شاگرد سوالهای چندرسانهای ایمنی آزمایشگاه پرسیدن، یعنی سوالهایی که هم متن دارن و هم تصویر، نرخ جواب ناایمن به ۴۸٫۶ درصد رسید. همون مدل قبل از آموزش ۲۰٫۳ درصد بود. تا اینجا ممکنه فکر کنی هر آموزشی اینطور میشه. ولی شاگرد سومی هم بود که با دادهی واقعاً امن آموزش دیده بود، و اون روی ۱۸٫۳ درصد موند.
پس مشکل خود آموزش نیست. مشکل اینه که دادهی فیلترشده، با اینکه تمام محتواش امن بود، چیزی رو منتقل کرد که دادهی امن منتقل نکرد.
یک نمونهاش رو در مقاله آوردهن. به مدل نشان هشدار اشتعالپذیری رو نشون میدن و میپرسن این ماده رو چطور نگهداری کنیم. شاگرد تنظیمشده گزینهای رو انتخاب میکنه که میگه در ظرف تحت فشار بذارید. این جواب در آزمایشگاه واقعی یعنی حادثه.
چرا فیلتر نمیتونه جلوش رو بگیره
آزمایش موز همین ماجرا رو در یک قالب بیخطر نشون میده، و برای همین هم مهمه؛ وقتی موضوع ایمنی باشه آدم دنبال توضیح اخلاقی میگرده، ولی وقتی موضوع میوه باشه فقط سازوکار میمونه.
سازوکارش اینه که ویژگی در محتوا سوار نمیشه. فیلتر متن رو میخونه و دربارهی معناش قضاوت میکنه، ولی آنچه منتقل میشه در معنای جملهها نیست؛ در الگوی آماری انتخاب کلمههاست، در چیزهایی که معلم بهطور سیستماتیک ترجیح میده و هیچ کدومشون به تنهایی مشکوک نیستن. شاگرد از روی همین رد آماری، سلیقهی معلم رو بازمیسازه.
این حرف تازهای نیست و مقالهی دیگری پارسال نشون داده بود که مدلها ویژگیهای رفتاری رو از راه سیگنالهای پنهان در داده به هم منتقل میکنن، حتی وقتی داده هیچ ربط معنایی به اون ویژگی نداره. کاری که Mechanist اضافه میکنه دو چیزه. اول اینکه نشون میده این انتقال از مرز رسانه هم رد میشه، یعنی از متن به تصویر. دوم اینکه این رو یک عامل خودکار پیدا کرد، نه پژوهشگری که دنبالش میگشت.
و نتیجهی عملیش برای هر کسی که مدل تنظیم میکنه روشنه. اگه دادهات رو از خروجی یک مدل دیگه ساختهای، پاک بودن تکتک نمونهها تضمین هیچ چیزی نیست. آنچه اهمیت داره اینه که اون مدل از اول چه بوده.
بعد سراغ باور رفت
دومین کار جالبتره و اگه با علوم اعصاب آشنا باشی، روشش رو فوراً میشناسی.
سوال این بود که مدل چطور بین چیزی که واقعاً درسته، چیزی که خودش باور داره، و چیزی که فکر میکنه دیگری باور داره فرق میذاره. این سه تا در انسان سه چیز جدا هستن و کودک تا حدود چهار سالگی سومی رو نداره.
Mechanist در مدل Pythia گشت و دید این سه حالت در جاهای جدا از هم نشستهن. بعضی از واحدهای توجه کارشون نگه داشتن باور خود مدله و بعضی دیگه کارشون باوریه که به دیگری نسبت میده.
بعد کاری کرد که در عصبشناسی بهش میگن ضایعه. یکی از این واحدها رو خاموش کرد و دید چه چیزی از کار میافته.
خاموش کردن واحدی که مسئول باور دیگری بود، دقتش رو از ۰٫۸۶ به ۰٫۳۴ انداخت، در حالی که باور خود مدل روی ۰٫۷۱ موند. تا اینجا فقط نشون میده اون واحد لازمه. ولی برعکسش خیلی گویاتره. وقتی واحدهای باور خود مدل رو خاموش کردن، دقتشون از ۰٫۷۸ به ۰٫۲۱ افتاد و همزمان دقت باور دیگری به ۱٫۰۰ رسید.
یعنی وقتی باور خودش رو برداری، بینقص میفهمه دیگری چه فکر میکنه. اون دو تا با هم رقابت داشتن و یکی جلوی دیگری رو میگرفت. این همون الگوییه که در آسیبهای مغزی هم دیده میشه، جایی که از کار افتادن یک ناحیه باعث میشه کارکرد دیگری بهتر بشه چون مهارش برداشته شده.
و اینکه این توانایی چه زمانی پیدا میشه
Pythia یک ویژگی داره که کمتر مدلی داره و برای همین اینجا انتخاب شده؛ نقطههای میانی آموزشش رو نگه داشتهن. یعنی میشه رفت و دید مدل در گام دو هزارم چه میدونست و در گام صد و چهل و سه هزارم چه.
نتیجه این بود که توانایی نسبت دادن باور به دیگری زود میاد و تا حدود گام دو هزار به سطح بالایی رسیده، ولی باور خود مدل دیرتر و آهستهتر شکل میگیره. در تمام این بازه هم هر توانایی دقیقاً همونجایی رشد میکنه که واحدهای مربوط به خودش اهمیت علی پیدا میکنن.
اینجا باید احتیاط کرد. ترتیبی که در انسان میبینیم برعکس اینه و کودک اول خودش رو داره و بعد یاد میگیره ذهن دیگری رو حدس بزنه. وسوسهانگیزه که از این تفاوت نتیجهی بزرگی بگیریم، ولی مدل زبانی روی متن آموزش میبینه و متن پر از گزارش باور آدمهاست، پس شاید فقط داره چیزی رو زودتر میبینه که در داده فراوانتره. این تفاوت یک سوال خوبه، نه یک جواب.
از فهمیدن تا کنترل کردن
سومین کار نشون میده این فهم به چه درد میخوره.
مدلی هست به اسم Evo2 که کارش تولید توالی DNA است. Mechanist داخلش گشت و ویژگیای پیدا کرد که با ساختار مارپیچ آلفا مرتبط بود، بعد همون ویژگی رو موقع تولید فعال کرد. میانگین محتوای مارپیچ آلفا از ۴۳٫۸ به ۵۶٫۶ درصد رفت. برای اینکه مطمئن بشن این اثر واقعیه و نه نتیجهی هر دستکاریای، یک ویژگی تصادفی رو هم فعال کردن و اون روی ۴۳٫۲ موند، یعنی عملاً هیچ.
پس ابزار از دیدن به توضیح دادن و از توضیح دادن به هدایت کردن رسیده، اون هم در یک مدل زیستی و نه یک مدل زبانی.
حالا صادقانهاش
عددهای مقایسه رو هم باید خوند. در داوری انسانی، Mechanist در چهار محور بین ۸۳ تا ۹۲ درصد گرفته و حدود ۹ تا ۱۳ واحد از Claude Code جلوتر بوده و ۳۱ تا ۳۸ واحد از سامانههای دانشمند خودکار قبلی. عدد دوم بزرگه ولی عدد اول اونقدرها نیست؛ نه تفاوتی از جنس نسل بعد، بلکه یک بهبود محسوس.
و وقتی بهجای انسان یک مدل داوری کرد، فاصلهها کوچکتر شد و Mechanist فقط در پنج موضوع از نه موضوع اول موند، در حالی که در داوری انسانی در هر نه تا اول بود. این اختلاف بین دو داور خودش نکتهایه؛ یعنی چیزی که متخصص انسانی در این خروجیها میبینه، مدل داور نمیبینه.
خود نویسندهها هم توصیه میکنن این رو همکار پژوهشی بدونیم نه پژوهشگر مستقل. هدف رو انسان تعریف کنه و معیار ارزیابی رو هم انسان بذاره؛ بعد سامانه فرضیه بسازه و آزمایش کنه و خودش رو اصلاح کنه.
چیزی که مهندسها باید بردارن
اگه یک چیز از این مقاله بردارم، همون عامل بازبینه.
هر کسی میتونه سامانهای بسازه که فرضیه تولید کنه، و امروز ساختنش چند روز کاره. کاری که سخته ساختن چیزیه که فرضیهی خودش رو رد کنه. بازبین Mechanist دنبال نشت داده میگرده، منشأ برچسب رو میپرسه، و یافته رو با روش دیگه و دادهی دیگه و مدل دیگه دوباره امتحان میکنه تا ببینه میشکنه یا نه.
این رو در کار خودمون هم دیدهام. در Neuroguide که گزارشهای کمی نوار مغز و آزمونهای شناختی رو پردازش میکنه، بخش سختش هیچوقت پیدا کردن الگو نبود؛ الگو همیشه پیدا میشه. بخش سخت این بود که مشخص کنیم چه چیزی الگوی واقعیه و چه چیزی محصول همون روشیه که باهاش نگاه کردهایم. تا وقتی این تفکیک رو نساخته باشی، هر چه بیشتر بگردی بیشتر پیدا میکنی و کمتر میدونی.
دو مقالهی قبلی همینجا این سوال رو دنبال کردیم که توانایی مدل کجا جمع میشه، بیرون از مدل یا داخلش. این مقاله سوال دیگری رو باز میکنه که به نظرم مهمتره. ویژگیها کجا مینشینن، و آیا اصلا میتونیم ببینیمشون. آزمایش موز جوابش رو روشن داد؛ چیزی از معلم به شاگرد رسید که هیچ فیلتری که به محتوا نگاه کنه نمیتونست جلوش رو بگیره.
چه چیزی عوض شده
تا امروز فهمیدن اینکه داخل یک مدل چه میگذره کار دستی بوده و آدمهایی که بلدن کمان. سرعت ساخته شدن مدلها هم از سرعت فهمیدنشون خیلی جلوتره، و این فاصله هر ماه بیشتر میشه.
Mechanist ثابت نمیکنه این فاصله بسته میشه. چیزی که نشون میده اینه که بخشی از این کار رو میشه خودکار کرد، به شرطی که کنارش چیزی هم باشه که نتیجه رو زیر سوال ببره. و همون یافتهی اولش هم یادآوری خوبیه؛ سازوکاری که نمیبینیم، متوقفش هم نمیکنیم.