تفاوت میان «استدلال دربارهی یک بیمار» و «پاسخ به یک پرسش پزشکی» در کجاست؟ همین تمایز، جان مقالهای است که در ۱۸ ژوئن ۲۰۲۶ روی arXiv منتشر شد: MedRLM. بیشتر هوش مصنوعی پزشکی که نامش را شنیدهایم بر پایهی کار دوم سنجیده میشود؛ یعنی یک پرسش چندگزینهای مانند MedQA یا PubMedQA و انتخاب پاسخ درست. اما بیمار واقعی کار نخست است. شواهد در صورت پرسش جای ندارد. شواهد در سالها پروندهی الکترونیک سلامت پراکنده است، در یک رادیوگرافی قفسهی سینه، در یک نوار قلب، در جریان علائم حیاتی از مانیتور بخش مراقبتهای ویژه، در یک رهنمود بالینی و در مجموعهای از قواعد ارجاع که میگوید چهکسی کجا فرستاده شود.
بگذارید نقطهی شکستی را که مقاله نشانه گرفته روشن کنم. یک سامانهی تکمرحلهای تنها یکبار از روی شواهد میگذرد؛ خواه مدل زبانی بزرگی باشد که از وزنهایش پاسخ میدهد، خواه یک خط لولهی تولید مبتنی بر بازیابی (RAG) که چند سند میآورد و یکبار پاسخ میدهد. به گفتهی چکیده، این رویکرد «هنگامی که شواهد بالینی در پروندههای طولانی، تصاویر، جریان سنسورها، رهنمودها و محدودیتهای ارجاع پخش شده باشد، شکننده میشود». این شکنندگی ریشهی مکانیکی دارد. اگر یک پروندهی چندساله را در یک پنجرهی زمینه (context) فشرده کنیم، مدل یا فضا کم میآورد یا جزئیاتی را که سه بستری پیشتر اهمیت داشته بیصدا از دست میدهد.
حرکت اصلی طراحی: بیمار همچون محیط
اینجا ایدهی ارزشمند نهفته است. MedRLM بهجای فشردن همهی اطلاعات بیمار در یک پرامپت، «پروندهی بیمار را یک محیط بالینی بیرونی میداند که میتوان آن را بهصورت بازگشتی بازرسی، تجزیه، بازیابی، راستیآزمایی و ترکیب کرد». این فهرست فعلها را آرام بخوانید، چون شرح کار واقعی یک پزشک است. هیچ پزشکی پرونده را در یک نگاه حفظ نمیکند. فرضیه میسازد، آزمایشهای مرتبط را میبیند، تصویربرداری را وارسی میکند، با رهنمود میسنجد و بازنگری میکند. محیط بیرون از ذهن او میماند و او هرگاه نیاز شد از آن پرسوجو میکند.
همین تغییر ساختاری بود که عاملهای عمومی را از پرامپت تکشات دور کرد. از مدل نمیخواهیم همهچیز را در ذهن نگه دارد؛ به او ابزار میدهیم تا برود و ببیند. در زبان سامانههای عملیاتی، پروندهی بیمار دیگر یک بسته نیست که جابهجا شود، بلکه سامانهای میشود که میتوان از آن پرسوجو کرد. همین بازقاببندی است که اجازه میدهد یک پروندهی طولانی، درهم و دنبالهدار منسجم بماند، چون هیچگاه کل آن را از یک گلوگاه واحد رد نمیکنیم.
اجزا و کارکرد هر یک
به گفتهی چکیده، این چارچوب عاملهای تخصصی را هماهنگ میکند؛ برای متن بالینی، پروندهی الکترونیک سلامت دنبالهدار، تصویربرداری پزشکی، سیگنال سنسورهای فیزیولوژیک، بازیابی رهنمود، حسابرسی عدمقطعیت و برنامهریزی ارجاع. پرسش کارکردی این است: اصلاً چرا کار را اینگونه تقسیم کنیم؟ چون این پیمانهها واقعاً مسائلی متفاوتاند. خواندن یک تصویر رادیولوژی همان محاسبهای نیست که تحلیل یک دهه پروندهی ساختیافته میطلبد، و آن نیز با یافتن ناهنجاری در سریزمانی نوار قلب یکی نیست. یک مدل یکپارچه که هر سه را با هم انجام دهد، هر سه را بدتر انجام میدهد. این تخصصیسازی نوعی مد معماری نیست؛ تقسیم کار است.
دو جزء را باید دقیق تعریف کرد.
حافظهی مبتنی بر گراف شواهد بالینی (clinical evidence graph memory) «مشاهدات مختص بیمار را به شواهد بازیابیشده، تعاریف استاندارد، نشانگرهای زیستی برآمده از سنسور و معیارهای ارجاع پیوند میدهد». اینجا گراف داریم، نه یک بافر صاف زمینه. ارزش گراف در آن است که رابطهها را نگه میدارد: این مقدار آزمایش به آن تعریف رهنمود وصل است و آن به این قاعدهی ارجاع. وقتی سامانه بعدها بخواهد تصمیمی را توجیه کند، خود مسیر درون گراف همان توجیه است. منظور مقاله از قابلحسابرسی همین است.
راهاندازی استدلال بازگشتی با سیگنال سنسور (sensor-guided recursive triggering) «هنگامی که الگوهای فیزیولوژیک یا رفتاری غیرطبیعی شناسایی شوند، استدلال عمیقتر را فعال میکند». این در حقیقت یک ایدهی مهار هزینه است که جامهی بالینی پوشیده. بازگشت گران است؛ هر چرخهی بازرسی افزوده یعنی توان پردازشی و تأخیر بیشتر. پس استدلال عمیق را روی همهچیز اجرا نمیکنیم؛ زمانی اجرا میکنیم که یک سیگنال سنسور خبر دهد چیزی بههمریخته است. این محرک، عمق استدلال را کنترل میکند. در کنارش پالایش مشروط به عدمقطعیت نشسته که «موارد پرخطر یا کماطمینان» را به بازبینی پزشک میسپارد. به بیان ساده: وقتی مدل مطمئن نیست، بهجای حدس پراطمینان، موضوع را به انسان واگذار میکند.
چرا دروازهی دوم از همه مهمتر است
اگر من میخواستم این را مستقر کنم، نخستین جزئی که زیر فشار میآزمودم همین دروازهی عدمقطعیت بود. کل روایت ایمنی در هوش مصنوعی بالینی بر دانستن کی نباید عمل کرد استوار است. مدلی که به هر پرسش با همان روانی و اطمینان پاسخ میدهد، درست به همین دلیل خطرناک است: پاسخ غلط پراطمینان از پاسخ درست پراطمینان تفکیکپذیر نیست. گرهزدن پالایش و واگذاری به انسان به یک سیگنال عدمقطعیت کالیبره، همان مرز میان پشتیبانی از تصمیم و جایگزینی تصمیم است. مقاله خود را آشکارا در سمت نخست مینشاند: «پشتیبانی تصمیم بالینی آگاه به جریان کار»، با پزشکی که در موارد مهم درون حلقه میماند.
یک قاب واقعی نیز اینجا هست که باید نامش را برد. سرواژهی عنوان — بهینهسازی ارجاع از جامعه به سطح تخصصی — به یک مسئلهی سامانهای اشاره دارد، نه به مسئلهی مدل. در بیشتر نظامهای سلامت، منبع کمیاب تشخیص نیست؛ زمان متخصص در مرکز تخصصی است. اینکه چهکسی و چه زمانی ارجاع شود، همانجایی است که پیامد و هزینه واقعاً جابهجا میشود. چارچوبی که محدودیتهای ارجاع را شواهد درجهیک میبیند، در حقیقت دربارهی خود نظام سلامت استدلال میکند، نه فقط دربارهی بیمار پیش رو.
چه چیزی اثبات شده و چه نشده
دربارهی وضعیت این کار دقیق باشیم. یک مقالهی تکنویسنده در نه صفحه است که در ۱۸ ژوئن ۲۰۲۶ ثبت شده و نویسنده آن را یک چارچوب با یک طرح ارزیابی ترسیمشده معرفی میکند. چکیده از «یک طرح ارزیابی روی دادهی واقعی با مجموعهدادههای عمومی و دارای مجوز، شامل پروندهی الکترونیک سلامت، رادیولوژی، ECG، سریزمانی بخش مراقبتهای ویژه و پیامدهای جانشین ارجاع» سخن میگوید — یک طرح، نه هنوز جدول نتیجهای که من بتوانم از منبع راستیآزمایی کنم. پس MedRLM را یک پیشنهاد معماری خوباستدلالشده ببینید، نه یک سامانهی سنجیده با اعداد بالینی منتشرشده.
این تبصره از ارزش کار نمیکاهد، چون ارزش کار در همان قاببندی است. این حوزه سالها هدف نادرستی را بهینه کرده — بالا رفتن از جدولهای صدرنشینی پرسشوپاسخ پزشکی — حال آنکه بالین به استدلال روی شواهد ناهمگن، دنبالهدار و چندپیمانه نیاز دارد، با رد حسابرسی و انسان درون حلقه. ارزش MedRLM در آن است که این را صریح بیان میکند و بازگشت، حافظهی گراف و آن دو دروازه را همچون شکلی مشخص برای چنین سامانهای پیش مینهد. سرواژه فراموش میشود؛ آنچه باید نگه داشت، همان حرکت «بیمار همچون محیط» است.