یک تیم بزرگ از گوگل مقالهای منتشر کرده که در آن یک هوش مصنوعی پزشکی رو نه با کتاب و آزمون، بلکه با چیزی شبیه دورهی دستیاری تربیت کردهن. مدل نزدیک پنجاهوهشت هزار ویزیت شبیهسازیشده رو از اول تا آخر انجام داده، و طرف مقابلش بیمارهایی بودهن که راحت حرف نمیزنن. بعدش پزشکها در یک مقایسهی کور، در ۸۷٫۶ درصد موارد جواب همین مدل رو به مدل آموزشندیده ترجیح دادهن.
اسم روش رو گذاشتهن ResidencyRL، و اسم دقیقاً همون چیزی رو میگه که هست. پزشک بعد از فارغالتحصیلی هنوز پزشک کاربلد نیست؛ سالها باید هزاران ویزیت انجام بده، بازخورد بگیره، و کمکم اختیار بیشتری پیدا کنه. این مقاله میپرسه چرا برای مدلها این مرحله رو رد کردهایم.
چرا آزمونهای پزشکی دیگه چیزی نشون نمیدن
مدلهای زبانی سالهاست آزمونهای استاندارد پزشکی رو با نمرههای بالا رد میکنن، و همین باعث شده خیلیها فکر کنن مسئله تقریباً حل شده. ولی یک آزمون چهارگزینهای، حتی وقتی سوالش سخته، یک ویژگی مهم داره؛ کل اطلاعات لازم از اول جلوی تو گذاشته شده.
یک ویزیت واقعی اینطور نیست. اطلاعات از اول روی میز نیست، و چیزی که تو میپرسی تعیین میکنه چه چیزی دستگیرت بشه. اگه سوال درست رو نپرسی، آن نشانه هیچوقت وارد پرونده نمیشه، و بعد روی اطلاعاتی تصمیم میگیری که خودت ناقص جمعش کردهای. پزشکی اسم خاصی برای این خطا داره، یعنی بستن زودهنگام پرونده؛ به یک تشخیص محتمل میرسی، ذهنت قفل میشه، و بقیهی سوالها فقط دنبال تأیید همون میگردن.
پس مسئله فقط دانستن جواب نیست، بلکه ترتیب تصمیمهاست. و درست همینجاست که آزمونهای ثابت ساکتان.
بیماری که همکاری نمیکنه
کاری که این مقاله کرده اینه که بهجای بهتر کردن مدل، طرف مقابلش رو سختتر کرده. بیمار شبیهسازیشده خودش یک مدل زبانیه (Gemini 3.5 Flash) که یک پروندهی کامل بهش دادهن؛ سن و شرایط زندگی، سابقهی پزشکی، شخصیت، و تشخیص واقعی که فقط خودش میدونه. بعد سه قاعده روی رفتارش گذاشتهن که هر سهشون به نظر من از خود الگوریتم جالبترن.
اول اینکه بیمار با زبان خودش حرف میزنه، نه با زبان کتاب پزشکی. کسی که سواد پزشکی نداره «تنگی نفس فعالیتی» نمیگه؛ میگه وقتی از پله بالا میرم نفسم میگیره.
دوم اینکه بیمار اطلاعات رو دو دسته میکنه. شکایت اصلی و نگرانیاش رو خودش میگه، ولی بقیهی سابقه رو فقط وقتی میگه که مستقیم ازش پرسیده باشی. اگه نپرسی، همونجا میمونه.
سوم که از همه ظریفتره، اگه چند تا سوال رو پشت هم و در یک نوبت بپرسی، بیمار فقط به اولی جواب میده. هر پزشکی که یک بار پشت میز مطب نشسته باشه میدونه این دقیقاً همون چیزیه که در واقعیت اتفاق میافته.
و بعد لایهی سختترش. برای سناریوهای ایمنی یک دستورالعمل خصمانه هم به بیمار دادهن، در ۹ دسته، با سه درجهی سختی. مثالی که خودشون میزنن سکتهی قلبیه در حالی که بیمار نشانههای خطر رو کوچک جلوه میده. در درجهی یک، بیمار با یک سوال مستقیم کوتاه میاد. در درجهی سه، چند نوبت پشت هم روی حرفش میمونه.
نمره دادن به «پزشک خوب بودن»
برای اینکه بشه از این ویزیتها یاد گرفت، باید به هر ویزیت یک عدد داد؛ و همینجاست که کار مهندسی میشه. آنها کیفیت کار رو به شش بخش شکستهن و به هر کدام وزن متفاوتی دادهن. سنگینترین وزن مال تدبیر درمانه، بعد تشخیص، و بعد شرححالگیری و ارتباط و مستندسازی و شیوهی گفتگو. یک نکتهی گویا اینه که وزن تدبیر از وزن تشخیص بیشتره، چون در عمل مهمتر است که با بیمار چه کار میکنی تا اینکه چه برچسبی بهش میزنی.
بعد جریمهها. هر رفتار ممنوع عدد مشخصی از نمره کم میکنه؛ گفتن چیزی که در پرونده نیست دو واحد، پیشنهاد اقدامی که برای این بیمار ممنوعه سه واحد، دستکم گرفتن فوریت سه واحد، و ردشدن از یک علامت خطر هم سه واحد. یعنی یک اشتباه ایمنی بهتنهایی میتونه کل نمرهی یک ویزیت خوب رو صفر کنه.
یک جریمهی دیگر هم هست که کمتر به چشم میاد ولی نشان میده چقدر جزئیات رو در آوردهن. اگه گفتگو از سی نوبت بگذره جریمه شروع میشه و تا چهل نوبت به بیشترین مقدارش میرسه. ویزیت واقعی بهطور میانگین ۲۱ نوبت طول میکشه، پس این جریمه جلوی عادت آزاردهندهای رو میگیره که مدل ممکن بود پیدا کنه، یعنی پرسیدن بیپایان سوال تا وقتی که بالاخره به جواب برسه.
نمرهدهی هم خودش با یک مدل دیگر (Gemini 3.1 Pro) انجام میشه، ولی نه در یک قضاوت واحد. ۲۶ محور کیفی و ۸ پرچم ایمنی رو به هشت گروه جدا شکستهن و هر گروه رو در یک فراخوانی مستقل نمره دادهن، چون یک درخواست غولپیکر که همهچیز رو با هم بسنجه نتیجههای بیثبات میده. این جزئیات کوچک تفاوت یک آزمایش قابل اتکا با یک نمایش رو میسازه.
عددها رو دنبال کن
حالا نتیجه. زیر شرایط خصمانه، دقت تشخیص از ۸۱ به ۸۸ درصد رسیده. این عدد خوبیه و مقاله هم همین رو در چکیده جلو گذاشته. ولی عددی که واقعاً مهمه جای دیگری است.
مدل بعد از آموزش، نرخ ردشدن از علائم خطر رو ۳۱ درصد کم کرده. این ۳۱ درصد کاهش نسبیه، نه مطلق؛ عدد خام این بود که مدل آموزشندیده در ۴۵٫۵ درصد موارد یک علامت خطر رو نمیدید و مدل آموزشدیده در ۳۱٫۵ درصد. پس بهبود واقعی و بزرگه، ولی هنوز از هر سه بیمار سختی که سراغش میرن، تقریباً یکیشون با نشانهای که دیده نشده از مطب بیرون میره.
نرخ نپرسیدن سوال حیاتی هم از ۶۵٫۵ به ۴۳٫۵ درصد رسیده. یعنی هنوز در بیش از چهار مورد از ده مورد، سوالی که باید پرسیده میشد پرسیده نشده.
بزرگترین جهش جای دیگری اتفاق افتاده و همین هم گویاست. نمرهی گرفتن شرح حال زندگی و سبک زندگی از ۱٫۳۱ به ۲٫۶۴ رسیده، از پنج. به عدد اول نگاه کن؛ ۱٫۳۱ از ۵ یعنی مدل پایه عملاً هیچوقت سراغ این سوالها نمیرفت. وقتی از کف مطلق شروع کنی، دو برابر شدن آسانتر از چیزیه که به نظر میرسه. این بهبود واقعیه، ولی اندازهاش را باید کنار نقطهی شروعش خواند.
نظر پزشکها اما جای بحث نداره. در مقایسهی کور روی ۹۷ مورد، پزشکها در ۸۷٫۶ درصد موارد برداشت بالینی مدل آموزشدیده رو ترجیح دادهن، و در بخش کاملی جمعآوری اطلاعات این عدد به ۹۰٫۷ درصد میرسه. وقتی متخصصها بدون اینکه بدونن کدام کدامه اینقدر یکطرفه رأی میدن، دیگر بحث نوسان آماری نیست.
آیا بیرون از زمین خودش هم جواب میده
سوال همیشگی اینجور کارها اینه که مدل واقعاً چیزی یاد گرفته یا فقط با محیط تمرینش جور شده. برای همین روی معیارهایی که در آموزش ندیده بودش هم امتحانش کردهن.
روی AgentClinic که یک محیط بالینی شبیهسازیشدهی مستقله، دقت از ۸۱٫۴ به ۸۵٫۶ و در نسخهی دیگرش از ۵۳٫۵ به ۶۰ درصد رفته. جهت درسته ولی خود مقاله صادقانه مینویسه که این دو تا از نظر آماری معنادار نیستن. یعنی با این تعداد نمونه نمیشه مطمئن بود که تفاوت واقعیه و نه شانس. اینکه نویسندهها این رو پنهان نکردهن و در چکیده هم نوشتهن «بهبود جهتدار»، خودش نشانهی خوبیه.
روی معیار چندویزیتی AMIE اما نتیجه محکمتره و مدل در هر شش محور بهتر شده؛ استدلال درمانی از ۸۰ به ۸۸ و ارتباط با بیمار از ۸۴ به ۹۲ درصد. جالب اینه که بیشترین رشد در همان دو محوریه که ربطی به حفظ کردن دانش پزشکی ندارن و کاملاً به نحوهی ادارهی گفتگو مربوطان. یعنی چیزی که یاد گرفته، مهارت رویهای است نه اطلاعات تازه.
خندهدارترین بخش ماجرا
در بررسی سرطانشناسی، متخصصها یک ایراد تکرارشونده گرفتهن؛ مدل آموزشدیده چند سوال رو یکجا در یک نوبت میپرسه، که هرچند از نظر بالینی بیربط نیست، بیمار رو گیج میکنه و باعث میشه جواب ناقص بده.
حالا برگرد به قاعدهی سوم بیمار شبیهسازیشده. بیمار تمرینی وقتی چند سوال میشنید، فقط به اولی جواب میداد. پس مدل در محیط تمرین هیچوقت تنبیه نشد که چند سوال یکجا بپرسه؛ فقط جواب بقیه رو نگرفت و بعداً دوباره پرسید. رفتار در آن محیط بیهزینه بود، و مدل با خودش بیرون آوردش.
این دقیقاً همان چیزیه که در هر سامانهای که با پاداش تربیت میشه اتفاق میافته. مدل چیزی رو یاد نمیگیره که تو میخوای؛ چیزی رو یاد میگیره که محیط اندازه میگیره. هر رفتاری که محیط براش هزینهای نذاشته باشه، دیر یا زود جایی سر بلند میکنه که برات هزینه داره.
نکتهای که مهندسها باید ببینن
این رو چند روز پیش در مورد عاملهای خودتکاملیابنده نوشتم که یک پرسش قدیمی هنوز سر جایش است؛ توانایی بیرون از مدل و در چیزی که ما ساختهایم جمع میشه، یا از خود مدل میاد. آن مقاله سراغ راه اول رفته بود و دیدیم که چقدر کم جواب میده.
این مقاله جواب دیگری میده. اینجا هیچ داربستی ساخته نشده، هیچ دفترچهای پر نشده، و هیچ ابزار تازهای هم به مدل اضافه نشده. مدل پایه قبل و بعدش یکیه. تمام آن چیزی که عوض شده، محیطیه که مدل در آن تمرین کرده.
و این برای هر کسی که سامانهی هوش مصنوعی میسازه یک حرف عملی داره. وقتی خروجی خوب نیست، اولین واکنش همهی ما رفتن سراغ مدل بزرگتر یا دستور دقیقتر است. ولی اگر کار تو دنبالهای از تصمیمهاست و نه یک پاسخ تکمرحلهای، احتمالاً نقطهی مؤثر کار هیچکدام این دو نیست. نقطهی مؤثر این است که مدل در برابر چه چیزی تمرین میکنه، و آن محیط چه چیزی رو تنبیه میکنه.
من همین را در کار خودمان هم دیدهام. در Neuroguide که گزارشهای کمی نوار مغز و آزمونهای شناختی رو پردازش میکنه، سختترین بخش هیچوقت خود تحلیل نبود؛ سختترین بخش این بود که مشخص کنیم خروجی درست دقیقاً چه شکلیه و چه چیزی باید خطا حساب بشه. تا وقتی این تعریف روشن نباشه، هر بهبودی که به چشم میآید ممکنه فقط بهترشدن در چیزی باشه که تصادفاً اندازه گرفتهای.
قبل از اینکه به بیمار واقعی برسه
خود نویسندهها این را صریح مینویسن، و باید هم بنویسن. تمام این ویزیتها شبیهسازی بودهن و تمام نمرهها را یک مدل دیگر داده. شبیهساز حتی اثر واقعی دارویی که تجویز شده روی بدن بیمار را مدل نمیکنه؛ فقط یک مدل دیگر حدس میزنه که این تصمیم خوب بوده یا نه.
پس آنچه اینجا اثبات شده این نیست که این عامل به درد بالین میخوره. آنچه اثبات شده این است که تصمیمگیری دنبالهدار بالینی را میشه در شبیهسازی آموزش داد و بخشی از آن مهارت به محیطهای دیدهنشده هم منتقل میشه. فاصلهی این دو تا حرف زیاد است، و پر کردنش نیاز به مطالعهی آیندهنگر با بیمار واقعی داره.
ولی مسیر عوض شده. تا دیروز رقابت سر این بود که کدام مدل نمرهی بالاتری در آزمون پزشکی میگیره. از حالا سوال این است که کدام مدل در برابر بیماری که همکاری نمیکنه بهتر عمل میکنه، و آن سوال خیلی نزدیکتری به کار واقعی پزشکیه.