یک مدل جهان زبانی پیش‌بینی می‌کند محیط در پاسخ چه برمی‌گرداند؛ شبیه‌سازی متنی از پیامدها که عامل می‌تواند درونش تمرین کند.
یک مدل جهان زبانی پیش‌بینی می‌کند محیط در پاسخ چه برمی‌گرداند؛ شبیه‌سازی متنی از پیامدها که عامل می‌تواند درونش تمرین کند.

وقتی عامل یاد می‌گیرد محیط را در ذهنش بسازد

مقاله‌ی Qwen-AgentWorld این پرسش را مطرح می‌کند که آیا یک مدل زبانی می‌تواند نقش «مدل جهان» را برای یک عامل نرم‌افزاری بازی کند؛ شبیه‌سازی که با متن نوشته می‌شود و گزارش می‌دهد آموزش درون این محیط خیالی گاهی از آموزش در محیط واقعی هم بهتر است.

برنامه‌ریزی یعنی چه؟ پیش از اینکه دست به کاری بزنید، در ذهنتان یک پیش‌بینی کوچک انجام می‌دهید: اگر فلان کار را بکنم، جهان احتمالاً به فلان حالت می‌رسد. همین پیش‌بینی ذهنی، یک مدل جهان (world model) است؛ سازوکاری درونی که حالت فعلی و یک کنش را می‌گیرد و حالت بعدی را حدس می‌زند. شما هر لحظه از آن استفاده می‌کنید، بیشتر وقت‌ها بی‌آنکه حواستان باشد. دلیل اینکه برای امتحان کردن هر نقشه‌ای مجبور نیستید واقعاً آن را اجرا کنید، همین مدل جهان است.

مقاله‌ی تازه‌ی تیم Qwen با نام Qwen-AgentWorld یک پرسش روشن را پیش می‌کشد: آیا یک مدل زبانی می‌تواند همین نقش را برای یک عامل نرم‌افزاری بازی کند؟ پاسخ آن‌ها دو مدل است؛ یکی با اندازه‌ی 35B-A3B و دیگری بزرگ‌تر با 397B-A17B. نویسندگان این‌ها را «نخستین مدل‌های جهان زبانی برای شبیه‌سازی محیط‌های عامل‌محور» در هفت حوزه می‌نامند که با زنجیره‌ی استدلال طولانی، حالت بعدی محیط را پیش‌بینی می‌کنند (arXiv).

بگذارید پیش از ادامه چند اصطلاح را جا بیندازم، چون تمام ماجرا روی همین‌ها می‌چرخد.

یک «مدل جهان زبانی» دقیقاً چه چیزی را پیش‌بینی می‌کند؟

بیشتر مدل‌های جهان که اسمشان به گوشمان خورده، تصویری هستند. یک فریم ویدیو و یک کنش به مدل می‌دهید و مدل فریم بعدی را می‌سازد. اما Qwen-AgentWorld از این جنس نیست. محیط در اینجا یک محیط عامل‌محور است؛ یک مرورگر وب، یک رابط برنامه‌نویسی (API)، فضایی برای اجرای کد، یا کاری که حالت و وضعیت دارد. آنچه عامل می‌بیند متن است، کنشی که انجام می‌دهد متن است، و حالت بعدی که پیش‌بینی می‌شود هم متن است. پس مدل دارد دینامیک گذار (transition dynamics) محیط را یاد می‌گیرد؛ یعنی با داشتن وضعیت فعلی و کنشی که عامل انتخاب کرده، باید بنویسد محیط در پاسخ چه چیزی برمی‌گرداند (arXiv).

با یک مثال روشن‌تر می‌شود: عامل روی دکمه‌ای در صفحه کلیک می‌کند و مدل جهان حدس می‌زند صفحه‌ی بعدی چه شکلی می‌شود. عامل ابزاری را با ورودی‌هایی صدا می‌زند و مدل جهان پاسخ آن ابزار را پیش‌بینی می‌کند. در واقع این مدل یک شبیه‌ساز پیامد است که با همان زبانی نوشته شده که خود عامل به آن حرف می‌زند.

خط آموزش این مدل را بهتر است سه کار جداگانه ببینیم. اول، پیش‌آموزش ادامه‌دار (CPT) که توانایی کلی مدل‌سازی جهان را به مدل می‌دهد. خوراک این مرحله، دینامیک گذار است که از بیش از ۱۰ میلیون مسیر واقعی تعامل در هفت حوزه بیرون کشیده شده، به‌علاوه‌ی پیکره‌های تخصصی تقویت‌شده. دوم، تنظیم نظارت‌شده (SFT) که مهارت مشخص پیش‌بینی حالت بعدی را به‌عنوان یک کار استدلالی فعال می‌کند. سوم، یادگیری تقویتی (RL) که وفاداری شبیه‌سازی را تیز می‌کند؛ یعنی اینکه حالت پیش‌بینی‌شده چقدر به واقعیت نزدیک است. برای این کار از پاداشی استفاده می‌کنند که نویسندگان آن را ترکیب «معیار درجه‌بندی و قاعده» می‌نامند (arXiv).

مرحله‌ی سوم همان جایی است که من با دقت دنبالش می‌کنم. پیش‌بینی متنی که باورپذیر به نظر برسد کار سختی نیست. کار سخت این است که حالت بعدی درست را پیش‌بینی کنی؛ یعنی همان چیزی که یک محیط واقعی واقعاً تولید می‌کند. پاداشی که قضاوت درجه‌بندی‌شده را با بررسی‌های دقیق و قاعده‌مند ترکیب می‌کند، تلاشی است برای اینکه شبیه‌ساز فقط روان نباشد، بلکه صادق هم بماند.

اصلاً چرا شبیه‌سازی؟ نقش آن در یک سیستم بزرگ‌تر

پرسش اصلی این است: وقتی محیط واقعی در دسترس است، چرا باید زحمت ساختن شبیه‌ساز را به جان خرید؟

چون محیط واقعی گران است، کند است و اغلب راه برگشت ندارد. آموزش یک عامل با یادگیری تقویتی یعنی بگذاری هزاران بار کنش انجام دهد و به نتیجه‌های خوب پاداش بدهی. حالا اگر هر کنش یعنی یک درخواست واقعی به وب یا یک فراخوان واقعی به یک سرویس، این حلقه کند و پرهزینه و گاهی خطرناک می‌شود. مدل جهان این حلقه‌ی یادگیری را از جهان واقعی جدا می‌کند؛ عامل درون شبیه‌ساز کنش می‌کند و شبیه‌ساز در چند هزارم ثانیه جواب می‌دهد.

مقاله دقیقاً همین سود را گزارش می‌کند. Qwen-AgentWorld به‌عنوان یک شبیه‌ساز جداشده، «شبیه‌سازی مقیاس‌پذیر و قابل‌کنترل از هزاران محیط واقعی» را برای یادگیری تقویتی عامل پشتیبانی می‌کند. نویسندگان حتی ادعا می‌کنند که نتیجه‌ی این کار از آموزش در محیط واقعی تنها هم بهتر است (arXiv). همین جمله‌ی آخر است که آدم را غافلگیر می‌کند. این تصور که محیط واقعی همیشه بهترین معیار است، اینجا دیگر درست از آب درنمی‌آید. یک شبیه‌ساز آموخته‌شده که می‌توانی هزارتایی راه بیندازی، دقیق کنترلش کنی و رایگان از نو راه‌اندازی‌اش کنی، ظاهراً سیگنال آموزشی بیشتری می‌دهد تا خود واقعیت؛ دست‌کم در آزمایش آن‌ها.

طبیعت همین موضوع را خیلی پیش‌تر حل کرده است. جانورانی که می‌توانند نتیجه‌ی کارها را در ذهنشان شبیه‌سازی کنند، مجبور نیستند هر درس را با چشیدن پیامدش یاد بگیرند. شبیه‌سازی همیشه ارزان‌تر از خود جهان است. Qwen-AgentWorld همین کار را می‌کند، فقط این‌بار درون یک عامل نرم‌افزاری.

کاربرد دوم: مدل‌سازی جهان به‌عنوان گرم‌کردن

یافته‌ی دومی هم هست که از نظر مفهومی برای من از اولی جذاب‌تر است. نویسندگان گزارش می‌دهند همان آموزش مدل جهان، نقش یک گرم‌کردن (warm-up) را هم برای یک عامل عمومی بازی می‌کند. یعنی اگر مدل را پیش از اینکه کنش‌کردن را یاد بگیرد، برای پیش‌بینی دینامیک محیط آموزش بدهی، عملکرد نهایی‌اش در هفت آزمون عامل‌محور بهتر می‌شود (arXiv).

این را با دقت بخوانید. یاد گرفتن پیش‌بینی محیط، مدل را در کنش‌کردن درون محیط بهتر می‌کند؛ حتی وقتی مهارت پیش‌بینی در زمان استفاده اصلاً به کار نمی‌رود. این نشان می‌دهد که همان فهمی که عامل هنگام یادگیری «بعد چه می‌شود» می‌سازد، دقیقاً همان فهمی است که برای انتخاب کنش خوب لازم دارد. پیش‌بینی و کنترل، زیرساخت مشترکی دارند. این دیگر یک ترفند ساده‌ی آموزشی نیست؛ ادعایی است درباره‌ی اینکه شایستگی اصلاً چطور ساخته می‌شود. این حرف با یک ایده‌ی قدیمی در یادگیری تقویتی هم‌خوان است: اگر مدل خوبی از جهان داشته باشی، بخش بزرگی از کار را برده‌ای.

یک شبیه‌ساز را چطور نمره می‌دهیم؟

مدلی که محیط شبیه‌سازی می‌کند به آزمونی نیاز دارد که بسنجد آیا شبیه‌سازی درست است یا نه، نه اینکه متن قشنگ درآمده یا نه. نویسندگان آزمونی به نام AgentWorldBench ساخته‌اند که پایه‌اش تعامل واقعی پنج مدل پیشرو روی نه آزمون شناخته‌شده است (arXiv). این انتخاب مهم است: مرجع درستی همان چیزی است که محیط‌های واقعی واقعاً برگردانده‌اند. پس حالت پیش‌بینی‌شده در برابر واقعیت نمره می‌گیرد، نه در برابر حدس یک انسان از واقعیت. روی همین آزمون گزارش می‌دهند که Qwen-AgentWorld «به‌طور چشمگیری از مدل‌های پیشرو موجود بهتر عمل می‌کند» (arXiv).

چه چیزی را محکم باور نکنم

این یک پیش‌چاپ نسخه‌ی اول است، به تاریخ ۲۳ ژوئن ۲۰۲۶. ادعاهای پررنگش — اینکه از آموزش واقعی فراتر می‌رود و از مدل‌های پیشرو بهتر است — همگی اندازه‌گیری خود نویسندگان روی آزمون خودشان است (arXiv). کد منتشر شده است (GitHub) که نشانه‌ی درستی از پایبندی به شفافیت است. اما یافته‌ای که بیش از همه باید جای دیگری هم تکرار شود، همین است: اینکه آموزش شبیه‌سازی‌شده از آموزش واقعی جلو می‌زند. اگر این نتیجه در آزمایشگاه‌ها و حوزه‌های دیگر هم پابرجا بماند، اقتصاد آموزش عامل‌ها دگرگون می‌شود. آن‌وقت گلوگاه کار از «دسترسی به محیط واقعی» به «کیفیت شبیه‌سازی که ساخته‌ای» جابه‌جا می‌شود.

نکته‌ی عمیق‌تر همانی است که ارزش نگه‌داشتن دارد. عاملی که محیطش را آن‌قدر خوب در ذهن می‌سازد که بتواند درون تصور خودش تمرین کند، همان کاری را می‌کند که هر برنامه‌ریز توانمندی انجام می‌دهد: یک مدل درونی ارزان را جای یک آزمون بیرونی گران می‌گذارد. کار اصلی این مقاله این است که نشان می‌دهد برای عامل‌های نرم‌افزاری، آن مدل درونی را می‌شود با زبان نوشت، در مقیاس بزرگ آموزش داد، و دو بار خرجش را درآورد: یک‌بار به‌عنوان شبیه‌ساز و یک‌بار به‌عنوان گرم‌کردن.

منابع

مقالات مرتبط