سیگنال چندکاناله‌ی EEG: محور زمان چگال در برابر محور کوتاه الکترود، نامتقارنی‌ای که شکل معماری مدل را تعیین می‌کند.
سیگنال چندکاناله‌ی EEG: محور زمان چگال در برابر محور کوتاه الکترود، نامتقارنی‌ای که شکل معماری مدل را تعیین می‌کند.

مدل‌های پایه‌ی EEG چه چیزی درباره‌ی داده‌های کوچک شما می‌گویند

سه مقاله‌ی تازه نشان می‌دهند که دستور پخت آشنای مدل‌های پایه روی سیگنال مغزی به‌خوبی متن جواب نمی‌دهد؛ و درس مشترک‌شان این است که برد از هم‌ترازی مدل با داده می‌آید، نه از مقیاس.

مدل پایه در معنای دقیق کلمه چیست؟ مدلی که یک‌بار روی پیکره‌ای بزرگ و بدون برچسب پیش‌تمرین می‌شود، و نمایش آموخته‌اش با اندکی تنظیم دقیق (fine-tuning) به طیفی از وظایف پایین‌دستی منتقل می‌شود. در زبان و بینایی، این روش دیگر کسالت‌بار شده است. ورودی را گسسته می‌کنیم (tokenization)، بخشی از آن را می‌پوشانیم، یک ترنسفورمر را برای پرکردن جاهای خالی آموزش می‌دهیم و در پایان بردارهای نمایش (embedding) را برمی‌داریم. پرسش جالب جای دیگری است: وقتی همین روش را روی سیگنالی به کار ببریم که مثل متن رفتار نمی‌کند، چه پیش می‌آید؟ EEG یعنی ثبت الکتریکی چندکاناله‌ی فعالیت مغز از الکترودهای روی پوست سر دقیقاً چنین سیگنالی است. سه مقاله‌ی این هفته نشان می‌دهند که این روش زیر فشار همین سیگنال از درز باز می‌شود.

بیایید از صریح‌ترین نقد شروع کنیم. مدل B[FM]² می‌گوید همان حرکت استاندارد بریدن EEG پیوسته به تکه (patch) یا توکن‌های کدبوک پیش از تغذیه‌ی یک ترنسفورمر ماسک‌شده همان چیزی را از بین می‌برد که EEG را اطلاعات‌بخش می‌کند. ریتم‌های مغزی پیوسته‌اند. به گفته‌ی نویسندگان، گسسته‌سازی این ریتم‌ها «ریتم‌های پیوسته‌ی مغز را تکه‌تکه می‌کند و دینامیک زمانی ریزدانه را پنهان می‌سازد». پاسخ آن‌ها روشن است: گسسته‌سازی را به‌کلی کنار بگذار و مدل را مستقیم روی شکل‌موج خام، با روش flow matching در زمان پیوسته، پیش‌تمرین بده (هوانگ و همکاران، ۲۰۲۶). این همان اصلی است که در کار تولیدی بارها به آن بازمی‌گردم: سوگیری استقرایی مدل را با ساختار داده هم‌تراز کنیم تا دیگر با پیش‌پردازش خودمان درگیر نشویم.

جزئیات معماری همان‌جایی است که بحث کاربردی می‌شود. EEG یک نامتقارنی بی‌رحم دارد. محور زمان چگال نمونه‌برداری شده و به‌شدت خودهم‌بسته است، با هزاران نقطه‌ی زمانی. اما محور الکترود کوتاه است؛ تنها چند ده کانال که در جای ثابتی روی سر نشسته‌اند. یک ترنسفورمر معمولی هر دو محور را جریان‌های توکنی همسان و قابل‌جابه‌جایی می‌بیند، و این از هر دو سو اشتباه است: توجه را روی نقاط زمانی زائد هدر می‌دهد و توپولوژی مکانی الکترودها را به‌هم می‌ریزد. ماژول SplitUNet در B[FM]² هر بلوک را به دو کانولوشن جداگانه تجزیه می‌کند، یکی یک‌بعدی روی زمان و دیگری یک‌بعدی روی الکترود، و فقط در امتداد زمان کاهش نمونه‌برداری (downsampling) انجام می‌دهد، در حالی که توپولوژی الکترود را در سراسر سلسله‌مراتب حفظ می‌کند (هوانگ و همکاران، ۲۰۲۶). هر کسی که برای داده‌ی غیرمربعی و ناهمسانگرد یک شبکه‌ی کانولوشنی (CNN) ساخته باشد، این حرکت را بی‌درنگ می‌شناسد: محوری که ساختار جایگزین‌ناپذیر دارد، نباید ادغام (pool) شود.

نتیجه‌ی کار همان بخشی است که باید برای هر کسی با بودجه‌ی سخت‌افزاری محدود جذاب باشد. B[FM]² روی ۷ وظیفه از ۹ وظیفه‌ی پایین‌دستی استاندارد به بهترین نتیجه می‌رسد، آن هم با بودجه‌ی پیش‌تمرین تنها ۳۶٬۸۹۵ قطعه تقریباً ۳۰۷ ساعت سیگنال. این یک تا دو مرتبه‌ی بزرگی، یعنی نزدیک به ۳۰ برابر، کمتر از مدل‌های پایه‌ی رقیب EEG است (هوانگ و همکاران، ۲۰۲۶). این جمله را با چشم یک مهندس دوباره بخوانیم: سوگیری استقرایی بهتر نه‌فقط به پای روش زور خام رسید، بلکه این کار را با کسری از داده و محاسبه انجام داد. در حوزه‌ای که «مدل پایه» مترادف «یک خوشه‌ی TPU رویش بریز» شده، این همان بده‌بستانی است که واقعاً تعیین می‌کند چه کسی توان بازی دارد. آزمایشگاهی بدون خوشه‌ی غول‌آسا هم می‌تواند چنین مدلی را پیش‌تمرین دهد.

مقاله‌ی دوم، REST-GAN، همین استدلال را آرام‌تر و از مسیری دیگر پیش می‌برد. به‌جای ترنسفورمر، از یک شبکه‌ی مولد تخاصمی (GAN) با یک هدف کمکی بازسازی خودنظارتی استفاده می‌کند که فقط روی EEG خام حالت استراحت در حوزه‌ی زمان آموزش دیده است. بدون هیچ نظارت صریحی در حوزه‌ی فرکانس یا توپوگرافی، سیگنال‌های تولیدشده باز هم ویژگی‌های طیفی و هم‌بستگی EEG واقعی را بازتولید می‌کنند. و آنچه برای من اهمیت دارد این است: نمایش آموخته‌ی منتقد مدل به طبقه‌بندی جمعیت‌شناختی پایین‌دستی منتقل می‌شود، از مدل‌هایی که مستقیم روی EEG خام آموزش دیده‌اند پیشی می‌گیرد، و در عین حال با یک مدل پایه‌ی تازه رقابتی می‌ماند، آن هم با داده و محاسبه‌ی به‌مراتب کمتر (فرحزادی و همکاران، ۲۰۲۶). نقش GAN در استخراج ویژگی قلمرویی است که از کار خودم با DCGAN می‌شناسم؛ متمایزکننده که آموزش می‌بیند واقعی را از جعلی تشخیص دهد، ناگزیر منیفلد سیگنال‌های واقعی را می‌آموزد. آن نمایش قابل استفاده‌ی دوباره است. درس باز هم تکرار می‌شود: کارآمدی برخاسته از معماری از مقیاس جلو می‌زند.

حالا به بخشی می‌رسیم که کسی دوست ندارد بلند بگوید. B[FM]² همچنین EEG مصنوعی می‌سازد که دو متخصص مغز و اعصاب دارای برد نتوانستند آن را از داده‌ی واقعی مغز جدا کنند؛ کاپای کوهن برابر با ۰٫۰۹۶- بود، یعنی توافق آن‌ها در تشخیص مصنوعی‌بودن یک ثبت، حتی از حدس تصادفی هم بدتر بود (هوانگ و همکاران، ۲۰۲۶). REST-GAN نیز به‌حکم طراحی‌اش سیگنال‌های عصبی مصنوعی باورپذیر تولید می‌کند (فرحزادی و همکاران، ۲۰۲۶). EEG مصنوعی که متخصص را فریب می‌دهد برای پرکردن مجموعه‌داده‌های پزشکی کمیاب عالی است. اما به همان اندازه یک ماشین جعل است برای هر سامانه‌ای که EEG را سند هویت می‌داند.

اینجاست که مقاله‌ی سوم اهمیت ویژه پیدا می‌کند. NeuroShield مدل پایه‌ای است که کل هدفش احراز هویت با EEG است؛ یاد می‌گیرد بردارهای نمایش تمایزدهنده‌ی هویت بسازد تا سیگنال مغز یک فرد همچون زیست‌سنج عمل کند. سهم واقعی‌اش مستقل‌بودن از دستگاه است. مدل‌های موجود احراز هویت به همان هدست، همان چیدمان کانال و همان طول سیگنالی که رویش آموزش دیده‌اند گره خورده‌اند، پس هر دستگاه تازه به یک مسئله‌ی توسعه‌ی مدل از نو تبدیل می‌شود. ترنسفورمر دومرحله‌ای NeuroShield از ثبت‌هایی با تعداد کانال و طول متغیر می‌آموزد، روی ۱۵٬۷۶۲ آزمودنی در ۲۸٬۱۱۶ جلسه پیش‌تمرین دیده، و پس از تنظیم دقیق، نرخ خطای برابر را میان ۰٫۴۴ تا ۸٫۰۶ واحد درصد نسبت به کار پیشین کاهش می‌دهد، در حالی که به چیدمان کانال و طول قطعه‌ای که در پیش‌تمرین هرگز ندیده هم تعمیم می‌یابد (فلاحی و همکاران، ۲۰۲۶).

هر سه مقاله را کنار هم بگذاریم، تصویر سامانه‌ای ناخوشایندی پدید می‌آید. یک خط از کار، هویت EEG را به یک زیست‌سنج باز، قابل استفاده‌ی دوباره و مستقل از دستگاه تبدیل کرده است. خط دیگر، EEG مصنوعی را برای متخصص بالینی از نمونه‌ی واقعی تشخیص‌ناپذیر کرده، آن هم با بودجه‌ی محاسباتی معمولی. هر کسی که امروز سامانه‌ی احراز هویت با سیگنال مغزی طراحی می‌کند باید فرض را بر این بگذارد که مهاجم هم می‌تواند فضای بردارهای نمایش را ببیند و هم سیگنال باورپذیر بسازد تا آن را بیازماید. این فرضیه‌ای خیالی نیست. همان مسابقه‌ی تسلیحاتی تشخیص زنده‌بودن و جعل (liveness و spoofing) است که در زیست‌سنج چهره و اثر انگشت جریان دارد، و حالا زودتر از انتظار به سراغ EEG آمده است.

اینجاست که غریزه‌ی «حریم خصوصی از طراحی» (privacy-by-design) را نگه می‌دارم. وقتی Intellomix را ساختم تا یک ژنوم کامل را به صفات سلامتی ترجمه کند بی‌آنکه هرگز هویت مشتری را بداند، پرسش حاکم همین بود: کمترین چیزی که سامانه باید بداند چیست، و آیا می‌تواند با دانستن کمتر کار کند؟ EEG همین پرسش را سخت‌تر می‌کند، چون همان ثبتی که صرع شما را تشخیص می‌دهد می‌تواند ورود بانکی شما را هم احراز کند. در عمل، رمزگذار هویت مستقل از دستگاه و مولد مصنوعی باورپذیر دو سر یک خط‌لوله‌اند، و هر کس محصول مصرفی رابط مغز و رایانه (BCI) به بازار می‌رساند، مسئولیت هر دو سر را برعهده دارد.

رشته‌ی مشترک هر سه همان است که روی دیوار هر تیم یادگیری ماشین کاربردی می‌نویسم: برد از هم‌تراز کردن مدل با داده آمد، نه از مقیاس. SplitUNet توپولوژی الکترود را حفظ می‌کند، چون آن توپولوژی واقعی و اطلاعات‌بخش است. flow matching روی سیگنال خام به پیوستگی ریتم‌های مغزی احترام می‌گذارد. منتقد GAN منیفلد سیگنال را رایگان می‌آموزد. NeuroShield با کنار گذاشتن فرض چیدمان کانال ثابت، قابلیت استفاده‌ی دوباره را به دست می‌آورد. هیچ‌کدام مدل بزرگ‌تری نیستند؛ خوش‌فرم‌ترند. و روی بودجه‌ی ثابت، فرم تنها اهرمی است که واقعاً در اختیار ماست.

منابع

مقالات مرتبط