چیزی که عوض شد مدل نبود، بیمار روبه‌رویش بود.
چیزی که عوض شد مدل نبود، بیمار روبه‌رویش بود.

بیماری که جواب سرراست نمی‌ده

گوگل یک هوش مصنوعی پزشکی رو در برابر بیمارهای شبیه‌سازی‌شده‌ای گذاشته که اطلاعات رو داوطلبانه نمی‌دن، اگه چند سوال رو یک‌جا بپرسی فقط به اولی جواب می‌دن، و بعضی‌هاشون عمداً نشانه‌های خطرناک رو کوچک جلوه می‌دن. بعد از حدود پنجاه‌وهشت هزار ویزیت تمرینی، پزشک‌ها در یک مقایسه‌ی کور در ۸۷٫۶ درصد موارد جواب همین مدل رو ترجیح دادن.

یک تیم بزرگ از گوگل مقاله‌ای منتشر کرده که در آن یک هوش مصنوعی پزشکی رو نه با کتاب و آزمون، بلکه با چیزی شبیه دوره‌ی دستیاری تربیت کرده‌ن. مدل نزدیک پنجاه‌وهشت هزار ویزیت شبیه‌سازی‌شده رو از اول تا آخر انجام داده، و طرف مقابلش بیمارهایی بوده‌ن که راحت حرف نمی‌زنن. بعدش پزشک‌ها در یک مقایسه‌ی کور، در ۸۷٫۶ درصد موارد جواب همین مدل رو به مدل آموزش‌ندیده ترجیح داده‌ن.

اسم روش رو گذاشته‌ن ResidencyRL، و اسم دقیقاً همون چیزی رو می‌گه که هست. پزشک بعد از فارغ‌التحصیلی هنوز پزشک کاربلد نیست؛ سال‌ها باید هزاران ویزیت انجام بده، بازخورد بگیره، و کم‌کم اختیار بیشتری پیدا کنه. این مقاله می‌پرسه چرا برای مدل‌ها این مرحله رو رد کرده‌ایم.

چرا آزمون‌های پزشکی دیگه چیزی نشون نمی‌دن

مدل‌های زبانی سال‌هاست آزمون‌های استاندارد پزشکی رو با نمره‌های بالا رد می‌کنن، و همین باعث شده خیلی‌ها فکر کنن مسئله تقریباً حل شده. ولی یک آزمون چهارگزینه‌ای، حتی وقتی سوالش سخته، یک ویژگی مهم داره؛ کل اطلاعات لازم از اول جلوی تو گذاشته شده.

یک ویزیت واقعی این‌طور نیست. اطلاعات از اول روی میز نیست، و چیزی که تو می‌پرسی تعیین می‌کنه چه چیزی دستگیرت بشه. اگه سوال درست رو نپرسی، آن نشانه هیچ‌وقت وارد پرونده نمی‌شه، و بعد روی اطلاعاتی تصمیم می‌گیری که خودت ناقص جمعش کرده‌ای. پزشکی اسم خاصی برای این خطا داره، یعنی بستن زودهنگام پرونده؛ به یک تشخیص محتمل می‌رسی، ذهنت قفل می‌شه، و بقیه‌ی سوال‌ها فقط دنبال تأیید همون می‌گردن.

پس مسئله فقط دانستن جواب نیست، بلکه ترتیب تصمیم‌هاست. و درست همین‌جاست که آزمون‌های ثابت ساکت‌ان.

بیماری که همکاری نمی‌کنه

کاری که این مقاله کرده اینه که به‌جای بهتر کردن مدل، طرف مقابلش رو سخت‌تر کرده. بیمار شبیه‌سازی‌شده خودش یک مدل زبانیه (Gemini 3.5 Flash) که یک پرونده‌ی کامل بهش داده‌ن؛ سن و شرایط زندگی، سابقه‌ی پزشکی، شخصیت، و تشخیص واقعی که فقط خودش می‌دونه. بعد سه قاعده روی رفتارش گذاشته‌ن که هر سه‌شون به نظر من از خود الگوریتم جالب‌ترن.

اول اینکه بیمار با زبان خودش حرف می‌زنه، نه با زبان کتاب پزشکی. کسی که سواد پزشکی نداره «تنگی نفس فعالیتی» نمی‌گه؛ می‌گه وقتی از پله بالا می‌رم نفسم می‌گیره.

دوم اینکه بیمار اطلاعات رو دو دسته می‌کنه. شکایت اصلی و نگرانی‌اش رو خودش می‌گه، ولی بقیه‌ی سابقه رو فقط وقتی می‌گه که مستقیم ازش پرسیده باشی. اگه نپرسی، همون‌جا می‌مونه.

سوم که از همه ظریف‌تره، اگه چند تا سوال رو پشت هم و در یک نوبت بپرسی، بیمار فقط به اولی جواب می‌ده. هر پزشکی که یک بار پشت میز مطب نشسته باشه می‌دونه این دقیقاً همون چیزیه که در واقعیت اتفاق می‌افته.

و بعد لایه‌ی سخت‌ترش. برای سناریوهای ایمنی یک دستورالعمل خصمانه هم به بیمار داده‌ن، در ۹ دسته، با سه درجه‌ی سختی. مثالی که خودشون می‌زنن سکته‌ی قلبیه در حالی که بیمار نشانه‌های خطر رو کوچک جلوه می‌ده. در درجه‌ی یک، بیمار با یک سوال مستقیم کوتاه میاد. در درجه‌ی سه، چند نوبت پشت هم روی حرفش می‌مونه.

نمره دادن به «پزشک خوب بودن»

برای اینکه بشه از این ویزیت‌ها یاد گرفت، باید به هر ویزیت یک عدد داد؛ و همین‌جاست که کار مهندسی می‌شه. آن‌ها کیفیت کار رو به شش بخش شکسته‌ن و به هر کدام وزن متفاوتی داده‌ن. سنگین‌ترین وزن مال تدبیر درمانه، بعد تشخیص، و بعد شرح‌حال‌گیری و ارتباط و مستندسازی و شیوه‌ی گفتگو. یک نکته‌ی گویا اینه که وزن تدبیر از وزن تشخیص بیشتره، چون در عمل مهم‌تر است که با بیمار چه کار می‌کنی تا اینکه چه برچسبی بهش می‌زنی.

بعد جریمه‌ها. هر رفتار ممنوع عدد مشخصی از نمره کم می‌کنه؛ گفتن چیزی که در پرونده نیست دو واحد، پیشنهاد اقدامی که برای این بیمار ممنوعه سه واحد، دست‌کم گرفتن فوریت سه واحد، و ردشدن از یک علامت خطر هم سه واحد. یعنی یک اشتباه ایمنی به‌تنهایی می‌تونه کل نمره‌ی یک ویزیت خوب رو صفر کنه.

یک جریمه‌ی دیگر هم هست که کمتر به چشم میاد ولی نشان می‌ده چقدر جزئیات رو در آورده‌ن. اگه گفتگو از سی نوبت بگذره جریمه شروع می‌شه و تا چهل نوبت به بیشترین مقدارش می‌رسه. ویزیت واقعی به‌طور میانگین ۲۱ نوبت طول می‌کشه، پس این جریمه جلوی عادت آزاردهنده‌ای رو می‌گیره که مدل ممکن بود پیدا کنه، یعنی پرسیدن بی‌پایان سوال تا وقتی که بالاخره به جواب برسه.

نمره‌دهی هم خودش با یک مدل دیگر (Gemini 3.1 Pro) انجام می‌شه، ولی نه در یک قضاوت واحد. ۲۶ محور کیفی و ۸ پرچم ایمنی رو به هشت گروه جدا شکسته‌ن و هر گروه رو در یک فراخوانی مستقل نمره داده‌ن، چون یک درخواست غول‌پیکر که همه‌چیز رو با هم بسنجه نتیجه‌های بی‌ثبات می‌ده. این جزئیات کوچک تفاوت یک آزمایش قابل اتکا با یک نمایش رو می‌سازه.

عددها رو دنبال کن

حالا نتیجه. زیر شرایط خصمانه، دقت تشخیص از ۸۱ به ۸۸ درصد رسیده. این عدد خوبیه و مقاله هم همین رو در چکیده جلو گذاشته. ولی عددی که واقعاً مهمه جای دیگری است.

مدل بعد از آموزش، نرخ ردشدن از علائم خطر رو ۳۱ درصد کم کرده. این ۳۱ درصد کاهش نسبیه، نه مطلق؛ عدد خام این بود که مدل آموزش‌ندیده در ۴۵٫۵ درصد موارد یک علامت خطر رو نمی‌دید و مدل آموزش‌دیده در ۳۱٫۵ درصد. پس بهبود واقعی و بزرگه، ولی هنوز از هر سه بیمار سختی که سراغش می‌رن، تقریباً یکی‌شون با نشانه‌ای که دیده نشده از مطب بیرون می‌ره.

نرخ نپرسیدن سوال حیاتی هم از ۶۵٫۵ به ۴۳٫۵ درصد رسیده. یعنی هنوز در بیش از چهار مورد از ده مورد، سوالی که باید پرسیده می‌شد پرسیده نشده.

بزرگ‌ترین جهش جای دیگری اتفاق افتاده و همین هم گویاست. نمره‌ی گرفتن شرح حال زندگی و سبک زندگی از ۱٫۳۱ به ۲٫۶۴ رسیده، از پنج. به عدد اول نگاه کن؛ ۱٫۳۱ از ۵ یعنی مدل پایه عملاً هیچ‌وقت سراغ این سوال‌ها نمی‌رفت. وقتی از کف مطلق شروع کنی، دو برابر شدن آسان‌تر از چیزیه که به نظر می‌رسه. این بهبود واقعیه، ولی اندازه‌اش را باید کنار نقطه‌ی شروعش خواند.

نظر پزشک‌ها اما جای بحث نداره. در مقایسه‌ی کور روی ۹۷ مورد، پزشک‌ها در ۸۷٫۶ درصد موارد برداشت بالینی مدل آموزش‌دیده رو ترجیح داده‌ن، و در بخش کاملی جمع‌آوری اطلاعات این عدد به ۹۰٫۷ درصد می‌رسه. وقتی متخصص‌ها بدون اینکه بدونن کدام کدامه این‌قدر یک‌طرفه رأی می‌دن، دیگر بحث نوسان آماری نیست.

آیا بیرون از زمین خودش هم جواب می‌ده

سوال همیشگی این‌جور کارها اینه که مدل واقعاً چیزی یاد گرفته یا فقط با محیط تمرینش جور شده. برای همین روی معیارهایی که در آموزش ندیده بودش هم امتحانش کرده‌ن.

روی AgentClinic که یک محیط بالینی شبیه‌سازی‌شده‌ی مستقله، دقت از ۸۱٫۴ به ۸۵٫۶ و در نسخه‌ی دیگرش از ۵۳٫۵ به ۶۰ درصد رفته. جهت درسته ولی خود مقاله صادقانه می‌نویسه که این دو تا از نظر آماری معنادار نیستن. یعنی با این تعداد نمونه نمی‌شه مطمئن بود که تفاوت واقعیه و نه شانس. اینکه نویسنده‌ها این رو پنهان نکرده‌ن و در چکیده هم نوشته‌ن «بهبود جهت‌دار»، خودش نشانه‌ی خوبیه.

روی معیار چندویزیتی AMIE اما نتیجه محکم‌تره و مدل در هر شش محور بهتر شده؛ استدلال درمانی از ۸۰ به ۸۸ و ارتباط با بیمار از ۸۴ به ۹۲ درصد. جالب اینه که بیشترین رشد در همان دو محوریه که ربطی به حفظ کردن دانش پزشکی ندارن و کاملاً به نحوه‌ی اداره‌ی گفتگو مربوط‌ان. یعنی چیزی که یاد گرفته، مهارت رویه‌ای است نه اطلاعات تازه.

خنده‌دارترین بخش ماجرا

در بررسی سرطان‌شناسی، متخصص‌ها یک ایراد تکرارشونده گرفته‌ن؛ مدل آموزش‌دیده چند سوال رو یک‌جا در یک نوبت می‌پرسه، که هرچند از نظر بالینی بی‌ربط نیست، بیمار رو گیج می‌کنه و باعث می‌شه جواب ناقص بده.

حالا برگرد به قاعده‌ی سوم بیمار شبیه‌سازی‌شده. بیمار تمرینی وقتی چند سوال می‌شنید، فقط به اولی جواب می‌داد. پس مدل در محیط تمرین هیچ‌وقت تنبیه نشد که چند سوال یک‌جا بپرسه؛ فقط جواب بقیه رو نگرفت و بعداً دوباره پرسید. رفتار در آن محیط بی‌هزینه بود، و مدل با خودش بیرون آوردش.

این دقیقاً همان چیزیه که در هر سامانه‌ای که با پاداش تربیت می‌شه اتفاق می‌افته. مدل چیزی رو یاد نمی‌گیره که تو می‌خوای؛ چیزی رو یاد می‌گیره که محیط اندازه می‌گیره. هر رفتاری که محیط براش هزینه‌ای نذاشته باشه، دیر یا زود جایی سر بلند می‌کنه که برات هزینه داره.

نکته‌ای که مهندس‌ها باید ببینن

این رو چند روز پیش در مورد عامل‌های خودتکامل‌یابنده نوشتم که یک پرسش قدیمی هنوز سر جایش است؛ توانایی بیرون از مدل و در چیزی که ما ساخته‌ایم جمع می‌شه، یا از خود مدل میاد. آن مقاله سراغ راه اول رفته بود و دیدیم که چقدر کم جواب می‌ده.

این مقاله جواب دیگری می‌ده. اینجا هیچ داربستی ساخته نشده، هیچ دفترچه‌ای پر نشده، و هیچ ابزار تازه‌ای هم به مدل اضافه نشده. مدل پایه قبل و بعدش یکیه. تمام آن چیزی که عوض شده، محیطیه که مدل در آن تمرین کرده.

و این برای هر کسی که سامانه‌ی هوش مصنوعی می‌سازه یک حرف عملی داره. وقتی خروجی خوب نیست، اولین واکنش همه‌ی ما رفتن سراغ مدل بزرگ‌تر یا دستور دقیق‌تر است. ولی اگر کار تو دنباله‌ای از تصمیم‌هاست و نه یک پاسخ تک‌مرحله‌ای، احتمالاً نقطه‌ی مؤثر کار هیچ‌کدام این دو نیست. نقطه‌ی مؤثر این است که مدل در برابر چه چیزی تمرین می‌کنه، و آن محیط چه چیزی رو تنبیه می‌کنه.

من همین را در کار خودمان هم دیده‌ام. در Neuroguide که گزارش‌های کمی نوار مغز و آزمون‌های شناختی رو پردازش می‌کنه، سخت‌ترین بخش هیچ‌وقت خود تحلیل نبود؛ سخت‌ترین بخش این بود که مشخص کنیم خروجی درست دقیقاً چه شکلیه و چه چیزی باید خطا حساب بشه. تا وقتی این تعریف روشن نباشه، هر بهبودی که به چشم می‌آید ممکنه فقط بهترشدن در چیزی باشه که تصادفاً اندازه گرفته‌ای.

قبل از اینکه به بیمار واقعی برسه

خود نویسنده‌ها این را صریح می‌نویسن، و باید هم بنویسن. تمام این ویزیت‌ها شبیه‌سازی بوده‌ن و تمام نمره‌ها را یک مدل دیگر داده. شبیه‌ساز حتی اثر واقعی دارویی که تجویز شده روی بدن بیمار را مدل نمی‌کنه؛ فقط یک مدل دیگر حدس می‌زنه که این تصمیم خوب بوده یا نه.

پس آنچه اینجا اثبات شده این نیست که این عامل به درد بالین می‌خوره. آنچه اثبات شده این است که تصمیم‌گیری دنباله‌دار بالینی را می‌شه در شبیه‌سازی آموزش داد و بخشی از آن مهارت به محیط‌های دیده‌نشده هم منتقل می‌شه. فاصله‌ی این دو تا حرف زیاد است، و پر کردنش نیاز به مطالعه‌ی آینده‌نگر با بیمار واقعی داره.

ولی مسیر عوض شده. تا دیروز رقابت سر این بود که کدام مدل نمره‌ی بالاتری در آزمون پزشکی می‌گیره. از حالا سوال این است که کدام مدل در برابر بیماری که همکاری نمی‌کنه بهتر عمل می‌کنه، و آن سوال خیلی نزدیک‌تری به کار واقعی پزشکیه.

مقالات مرتبط