مدل زبانی در نقش شبیه‌ساز محیط: از پیش‌بینی توکن بعدی تا پیش‌بینی وضعیت بعدی.
مدل زبانی در نقش شبیه‌ساز محیط: از پیش‌بینی توکن بعدی تا پیش‌بینی وضعیت بعدی.

وقتی مدل زبانی به‌جای بازیگر، شبیه‌ساز محیط می‌شود

مقاله‌ی Qwen-AgentWorld ادعا می‌کند مدل زبانی می‌تواند به‌جای صرفاً «عمل کردن» در محیط، خود محیط را شبیه‌سازی کند. با این جابه‌جایی نقش، هم داده‌ی آموزش عامل‌ها عوض می‌شود و هم عملکردشان بالا می‌رود.

مدل جهان چیست و چرا اهمیت دارد؟

مدل جهان (world model) تابعی ساده است. وضعیت فعلی و کنش عامل را ورودی می‌گیرد و وضعیت بعدی محیط را پیش‌بینی می‌کند. در یادگیری تقویتی و علوم شناختی، همین تابع هسته‌ی برنامه‌ریزی است. عامل با در اختیار داشتن آن می‌تواند پیش از انجام هر کاری، پیامد چند گام بعد را در ذهن خود شبیه‌سازی کند و بهترین مسیر را برگزیند.

بدون چنین مدلی، عامل چاره‌ای جز آزمون و خطا در محیط واقعی ندارد. یعنی باید عملاً دستور بزند، پاسخ سیستم را ببیند، خراب کند، برگردد و دوباره امتحان کند. این چرخه در محیط‌های واقعی گران و کند است؛ در محیط شبیه‌سازی‌شده تقریباً مجانی. به همین دلیل مدل جهان در ادبیات RL این‌قدر مرکزیت دارد.

نوآوری مقاله‌ی Qwen-AgentWorld این است که این شبیه‌ساز را درون یک مدل زبانی جای داده است. وضعیت‌ها، کنش‌ها و گذارها همه به شکل متن نمایش داده می‌شوند و گذار از یک وضعیت به وضعیت بعدی از دل یک زنجیره‌ی استدلال طولانی (long chain-of-thought) بیرون می‌آید. یعنی مدل پیش از آنکه بگوید «حالا صفحه چه شکلی است»، درباره‌ی دینامیک محیط استدلال می‌کند.

معماری و آموزش

نویسندگان دو مدل مبتنی بر MoE منتشر کرده‌اند: Qwen-AgentWorld-35B-A3B با حدود ۳ میلیارد پارامتر فعال و نسخه‌ی بزرگ‌تر ۳۹۷B-A17B با حدود ۱۷ میلیارد پارامتر فعال. ادعای مقاله این است که این دو، نخستین مدل‌های زبانی جهان‌اند که هفت حوزه‌ی متفاوت را با استدلال زنجیره‌ای طولانی پوشش می‌دهند (منبع).

خط لوله‌ی آموزش سه مرحله دارد. مرحله‌ی اول CPT یا پیش‌آموزش پیوسته است: مدل روی دینامیک گذار وضعیت و پیکره‌های تخصصی تقویت‌شده آموزش می‌بیند تا مفهوم عمومی «چطور محیط تغییر می‌کند» را جذب کند. مرحله‌ی دوم SFT است: قابلیت پیش‌بینی وضعیت بعدی به شکل صریح فعال می‌شود. مرحله‌ی سوم RL است، همراه با یک چارچوب پاداش ترکیبی مبتنی بر rubric و rule که وفاداری شبیه‌سازی را تیز می‌کند. داده هم کم نیست: بیش از ۱۰ میلیون مسیر تعامل واقعی در هفت حوزه (منبع).

برای ارزیابی، AgentWorldBench را ساخته‌اند که از تعامل‌های واقعی پنج مدل مرزی روی نه بنچمارک تثبیت‌شده گرد آمده است. ادعای نتیجه این است که Qwen-AgentWorld در وفاداری شبیه‌سازی از مدل‌های مرزی موجود جلو می‌زند.

دو کاربرد عملی یک مدل زبانی جهان

کاربرد اول، شبیه‌سازی جدا از عامل برای RL عامل‌محور است. عامل را به‌جای محیط واقعی، در برابر این مدل زبانی که نقش محیط را بازی می‌کند تمرین می‌دهید. مقاله ادعا می‌کند این روش از آموزش صرفاً روی محیط واقعی جلو می‌زند (منبع).

همین جاست که چنین رویکردی در محیط تولید به کار می‌آید. محیط‌های واقعی گلوگاه‌اند: rate limit دارند، shell خراب می‌شود، وضعیت باید بین اجراها reset شود و APIها هزینه دارند. شبیه‌ساز متنی هیچ‌کدام از این‌ها را ندارد و می‌توان هزاران نسخه‌ی موازی از آن را اجرا کرد. نتیجه این است که چرخه‌ی آموزش عامل چند مرتبه‌ی بزرگی سریع‌تر می‌شود.

کاربرد دوم ظریف‌تر است. آموزش مدل جهان پیش از آموزش عامل، همچون یک warm-up به کار می‌رود و عملکرد را در هفت بنچمارک عامل‌محور بالا می‌برد (منبع). برداشت من این است که «پیش‌بینی محیط» و «عمل در محیط» دو روی یک سکه‌اند، مثل نگاشت رفت و نگاشت برگشت یک شایستگی واحد. اگر مدل بفهمد کنش A چه وضعیتی می‌سازد، خودبه‌خود در انتخاب A برای رسیدن به وضعیت مطلوب هم بهتر عمل می‌کند.

چند احتیاط لازم

باید صریح بود: «مدل جهان» در اینجا یعنی پیش‌بین توکن متن، روی وضعیتی که به شکل متن سریال شده است. این چارچوب برای حوزه‌های ذاتاً متنی — shell، DOM مرورگر، کد — قوی است. اما برای حوزه‌های embodied، بصری یا با وضعیت پیوسته، همان قوت را ندارد. این را نباید با مدل‌های جهان مبتنی بر پیش‌بینی ویدئو در رباتیک یا بازی‌سازی یکی گرفت؛ دو مسئله‌ی متفاوت‌اند که فقط اسم مشترک دارند.

نکته‌ی دوم به ارزیابی برمی‌گردد. AgentWorldBench بازتولید مسیرهای پنج مدل روی نه بنچمارک را می‌سنجد. پس پوشش ارزیابی به همان بنچمارک‌ها محدود است و درباره‌ی دم بلند رفتار محیط‌های واقعی چیز زیادی نمی‌گوید.

چرا این قاب‌بندی مهم است

مهم‌ترین چیزی که این مقاله جابه‌جا می‌کند، هدف آموزش است. مدل‌های زبانی سنتی روی «پیش‌بینی توکن بعدی که انسان می‌نوشت» آموزش می‌بینند. اینجا هدف به «پیش‌بینی وضعیت بعدی محیط با فرض این کنش» تبدیل می‌شود. از نظر مکانیکی هر دو next-token prediction‌اند؛ اما از نظر مفهومی دو کار متفاوت‌اند و دو نوع داده می‌طلبند.

پیامد عملی این تغییر مهم است. داده‌ی مدل پایه‌ی نسل بعدی عامل‌ها دیگر از خزش وب نمی‌آید، بلکه از مسیرهای عامل در محیط‌های واقعی. محیط به معلم تبدیل می‌شود و اقتصاد داده‌ی متفاوتی شکل می‌گیرد: هر کس محیط‌های واقعی بیشتری در اختیار داشته باشد، داده‌ی آموزشی ارزشمندتری تولید می‌کند.

جمع‌بندی من این است که ارزش واقعی این کار در بردن یک بنچمارک نیست. ارزشش در همین استدلال است که شبیه‌سازی محیط و عمل در محیط، در عمق، یک مهارت‌اند. اگر این حرف درست باشد، آنچه مدل پایه را روی آن آموزش می‌دهیم باید عوض شود.

منابع

مقالات مرتبط