مدل پایه در معنای دقیق کلمه چیست؟ مدلی که یکبار روی پیکرهای بزرگ و بدون برچسب پیشتمرین میشود، و نمایش آموختهاش با اندکی تنظیم دقیق (fine-tuning) به طیفی از وظایف پاییندستی منتقل میشود. در زبان و بینایی، این روش دیگر کسالتبار شده است. ورودی را گسسته میکنیم (tokenization)، بخشی از آن را میپوشانیم، یک ترنسفورمر را برای پرکردن جاهای خالی آموزش میدهیم و در پایان بردارهای نمایش (embedding) را برمیداریم. پرسش جالب جای دیگری است: وقتی همین روش را روی سیگنالی به کار ببریم که مثل متن رفتار نمیکند، چه پیش میآید؟ EEG یعنی ثبت الکتریکی چندکانالهی فعالیت مغز از الکترودهای روی پوست سر دقیقاً چنین سیگنالی است. سه مقالهی این هفته نشان میدهند که این روش زیر فشار همین سیگنال از درز باز میشود.
بیایید از صریحترین نقد شروع کنیم. مدل B[FM]² میگوید همان حرکت استاندارد بریدن EEG پیوسته به تکه (patch) یا توکنهای کدبوک پیش از تغذیهی یک ترنسفورمر ماسکشده همان چیزی را از بین میبرد که EEG را اطلاعاتبخش میکند. ریتمهای مغزی پیوستهاند. به گفتهی نویسندگان، گسستهسازی این ریتمها «ریتمهای پیوستهی مغز را تکهتکه میکند و دینامیک زمانی ریزدانه را پنهان میسازد». پاسخ آنها روشن است: گسستهسازی را بهکلی کنار بگذار و مدل را مستقیم روی شکلموج خام، با روش flow matching در زمان پیوسته، پیشتمرین بده (هوانگ و همکاران، ۲۰۲۶). این همان اصلی است که در کار تولیدی بارها به آن بازمیگردم: سوگیری استقرایی مدل را با ساختار داده همتراز کنیم تا دیگر با پیشپردازش خودمان درگیر نشویم.
جزئیات معماری همانجایی است که بحث کاربردی میشود. EEG یک نامتقارنی بیرحم دارد. محور زمان چگال نمونهبرداری شده و بهشدت خودهمبسته است، با هزاران نقطهی زمانی. اما محور الکترود کوتاه است؛ تنها چند ده کانال که در جای ثابتی روی سر نشستهاند. یک ترنسفورمر معمولی هر دو محور را جریانهای توکنی همسان و قابلجابهجایی میبیند، و این از هر دو سو اشتباه است: توجه را روی نقاط زمانی زائد هدر میدهد و توپولوژی مکانی الکترودها را بههم میریزد. ماژول SplitUNet در B[FM]² هر بلوک را به دو کانولوشن جداگانه تجزیه میکند، یکی یکبعدی روی زمان و دیگری یکبعدی روی الکترود، و فقط در امتداد زمان کاهش نمونهبرداری (downsampling) انجام میدهد، در حالی که توپولوژی الکترود را در سراسر سلسلهمراتب حفظ میکند (هوانگ و همکاران، ۲۰۲۶). هر کسی که برای دادهی غیرمربعی و ناهمسانگرد یک شبکهی کانولوشنی (CNN) ساخته باشد، این حرکت را بیدرنگ میشناسد: محوری که ساختار جایگزینناپذیر دارد، نباید ادغام (pool) شود.
نتیجهی کار همان بخشی است که باید برای هر کسی با بودجهی سختافزاری محدود جذاب باشد. B[FM]² روی ۷ وظیفه از ۹ وظیفهی پاییندستی استاندارد به بهترین نتیجه میرسد، آن هم با بودجهی پیشتمرین تنها ۳۶٬۸۹۵ قطعه تقریباً ۳۰۷ ساعت سیگنال. این یک تا دو مرتبهی بزرگی، یعنی نزدیک به ۳۰ برابر، کمتر از مدلهای پایهی رقیب EEG است (هوانگ و همکاران، ۲۰۲۶). این جمله را با چشم یک مهندس دوباره بخوانیم: سوگیری استقرایی بهتر نهفقط به پای روش زور خام رسید، بلکه این کار را با کسری از داده و محاسبه انجام داد. در حوزهای که «مدل پایه» مترادف «یک خوشهی TPU رویش بریز» شده، این همان بدهبستانی است که واقعاً تعیین میکند چه کسی توان بازی دارد. آزمایشگاهی بدون خوشهی غولآسا هم میتواند چنین مدلی را پیشتمرین دهد.
مقالهی دوم، REST-GAN، همین استدلال را آرامتر و از مسیری دیگر پیش میبرد. بهجای ترنسفورمر، از یک شبکهی مولد تخاصمی (GAN) با یک هدف کمکی بازسازی خودنظارتی استفاده میکند که فقط روی EEG خام حالت استراحت در حوزهی زمان آموزش دیده است. بدون هیچ نظارت صریحی در حوزهی فرکانس یا توپوگرافی، سیگنالهای تولیدشده باز هم ویژگیهای طیفی و همبستگی EEG واقعی را بازتولید میکنند. و آنچه برای من اهمیت دارد این است: نمایش آموختهی منتقد مدل به طبقهبندی جمعیتشناختی پاییندستی منتقل میشود، از مدلهایی که مستقیم روی EEG خام آموزش دیدهاند پیشی میگیرد، و در عین حال با یک مدل پایهی تازه رقابتی میماند، آن هم با داده و محاسبهی بهمراتب کمتر (فرحزادی و همکاران، ۲۰۲۶). نقش GAN در استخراج ویژگی قلمرویی است که از کار خودم با DCGAN میشناسم؛ متمایزکننده که آموزش میبیند واقعی را از جعلی تشخیص دهد، ناگزیر منیفلد سیگنالهای واقعی را میآموزد. آن نمایش قابل استفادهی دوباره است. درس باز هم تکرار میشود: کارآمدی برخاسته از معماری از مقیاس جلو میزند.
حالا به بخشی میرسیم که کسی دوست ندارد بلند بگوید. B[FM]² همچنین EEG مصنوعی میسازد که دو متخصص مغز و اعصاب دارای برد نتوانستند آن را از دادهی واقعی مغز جدا کنند؛ کاپای کوهن برابر با ۰٫۰۹۶- بود، یعنی توافق آنها در تشخیص مصنوعیبودن یک ثبت، حتی از حدس تصادفی هم بدتر بود (هوانگ و همکاران، ۲۰۲۶). REST-GAN نیز بهحکم طراحیاش سیگنالهای عصبی مصنوعی باورپذیر تولید میکند (فرحزادی و همکاران، ۲۰۲۶). EEG مصنوعی که متخصص را فریب میدهد برای پرکردن مجموعهدادههای پزشکی کمیاب عالی است. اما به همان اندازه یک ماشین جعل است برای هر سامانهای که EEG را سند هویت میداند.
اینجاست که مقالهی سوم اهمیت ویژه پیدا میکند. NeuroShield مدل پایهای است که کل هدفش احراز هویت با EEG است؛ یاد میگیرد بردارهای نمایش تمایزدهندهی هویت بسازد تا سیگنال مغز یک فرد همچون زیستسنج عمل کند. سهم واقعیاش مستقلبودن از دستگاه است. مدلهای موجود احراز هویت به همان هدست، همان چیدمان کانال و همان طول سیگنالی که رویش آموزش دیدهاند گره خوردهاند، پس هر دستگاه تازه به یک مسئلهی توسعهی مدل از نو تبدیل میشود. ترنسفورمر دومرحلهای NeuroShield از ثبتهایی با تعداد کانال و طول متغیر میآموزد، روی ۱۵٬۷۶۲ آزمودنی در ۲۸٬۱۱۶ جلسه پیشتمرین دیده، و پس از تنظیم دقیق، نرخ خطای برابر را میان ۰٫۴۴ تا ۸٫۰۶ واحد درصد نسبت به کار پیشین کاهش میدهد، در حالی که به چیدمان کانال و طول قطعهای که در پیشتمرین هرگز ندیده هم تعمیم مییابد (فلاحی و همکاران، ۲۰۲۶).
هر سه مقاله را کنار هم بگذاریم، تصویر سامانهای ناخوشایندی پدید میآید. یک خط از کار، هویت EEG را به یک زیستسنج باز، قابل استفادهی دوباره و مستقل از دستگاه تبدیل کرده است. خط دیگر، EEG مصنوعی را برای متخصص بالینی از نمونهی واقعی تشخیصناپذیر کرده، آن هم با بودجهی محاسباتی معمولی. هر کسی که امروز سامانهی احراز هویت با سیگنال مغزی طراحی میکند باید فرض را بر این بگذارد که مهاجم هم میتواند فضای بردارهای نمایش را ببیند و هم سیگنال باورپذیر بسازد تا آن را بیازماید. این فرضیهای خیالی نیست. همان مسابقهی تسلیحاتی تشخیص زندهبودن و جعل (liveness و spoofing) است که در زیستسنج چهره و اثر انگشت جریان دارد، و حالا زودتر از انتظار به سراغ EEG آمده است.
اینجاست که غریزهی «حریم خصوصی از طراحی» (privacy-by-design) را نگه میدارم. وقتی Intellomix را ساختم تا یک ژنوم کامل را به صفات سلامتی ترجمه کند بیآنکه هرگز هویت مشتری را بداند، پرسش حاکم همین بود: کمترین چیزی که سامانه باید بداند چیست، و آیا میتواند با دانستن کمتر کار کند؟ EEG همین پرسش را سختتر میکند، چون همان ثبتی که صرع شما را تشخیص میدهد میتواند ورود بانکی شما را هم احراز کند. در عمل، رمزگذار هویت مستقل از دستگاه و مولد مصنوعی باورپذیر دو سر یک خطلولهاند، و هر کس محصول مصرفی رابط مغز و رایانه (BCI) به بازار میرساند، مسئولیت هر دو سر را برعهده دارد.
رشتهی مشترک هر سه همان است که روی دیوار هر تیم یادگیری ماشین کاربردی مینویسم: برد از همتراز کردن مدل با داده آمد، نه از مقیاس. SplitUNet توپولوژی الکترود را حفظ میکند، چون آن توپولوژی واقعی و اطلاعاتبخش است. flow matching روی سیگنال خام به پیوستگی ریتمهای مغزی احترام میگذارد. منتقد GAN منیفلد سیگنال را رایگان میآموزد. NeuroShield با کنار گذاشتن فرض چیدمان کانال ثابت، قابلیت استفادهی دوباره را به دست میآورد. هیچکدام مدل بزرگتری نیستند؛ خوشفرمترند. و روی بودجهی ثابت، فرم تنها اهرمی است که واقعاً در اختیار ماست.
منابع
- Brain Foundation Model via Flow Matching with SplitUNet — Manual / ad-hoc · 2026-06-23
- NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication — Manual / ad-hoc · 2026-06-23
- A Deep Generative Model for Resting-State EEG Synthesis and Transferable Representation Learning — Manual / ad-hoc · 2026-06-23