مدل جهان چیست و چرا اهمیت دارد؟
مدل جهان (world model) تابعی ساده است. وضعیت فعلی و کنش عامل را ورودی میگیرد و وضعیت بعدی محیط را پیشبینی میکند. در یادگیری تقویتی و علوم شناختی، همین تابع هستهی برنامهریزی است. عامل با در اختیار داشتن آن میتواند پیش از انجام هر کاری، پیامد چند گام بعد را در ذهن خود شبیهسازی کند و بهترین مسیر را برگزیند.
بدون چنین مدلی، عامل چارهای جز آزمون و خطا در محیط واقعی ندارد. یعنی باید عملاً دستور بزند، پاسخ سیستم را ببیند، خراب کند، برگردد و دوباره امتحان کند. این چرخه در محیطهای واقعی گران و کند است؛ در محیط شبیهسازیشده تقریباً مجانی. به همین دلیل مدل جهان در ادبیات RL اینقدر مرکزیت دارد.
نوآوری مقالهی Qwen-AgentWorld این است که این شبیهساز را درون یک مدل زبانی جای داده است. وضعیتها، کنشها و گذارها همه به شکل متن نمایش داده میشوند و گذار از یک وضعیت به وضعیت بعدی از دل یک زنجیرهی استدلال طولانی (long chain-of-thought) بیرون میآید. یعنی مدل پیش از آنکه بگوید «حالا صفحه چه شکلی است»، دربارهی دینامیک محیط استدلال میکند.
معماری و آموزش
نویسندگان دو مدل مبتنی بر MoE منتشر کردهاند: Qwen-AgentWorld-35B-A3B با حدود ۳ میلیارد پارامتر فعال و نسخهی بزرگتر ۳۹۷B-A17B با حدود ۱۷ میلیارد پارامتر فعال. ادعای مقاله این است که این دو، نخستین مدلهای زبانی جهاناند که هفت حوزهی متفاوت را با استدلال زنجیرهای طولانی پوشش میدهند (منبع).
خط لولهی آموزش سه مرحله دارد. مرحلهی اول CPT یا پیشآموزش پیوسته است: مدل روی دینامیک گذار وضعیت و پیکرههای تخصصی تقویتشده آموزش میبیند تا مفهوم عمومی «چطور محیط تغییر میکند» را جذب کند. مرحلهی دوم SFT است: قابلیت پیشبینی وضعیت بعدی به شکل صریح فعال میشود. مرحلهی سوم RL است، همراه با یک چارچوب پاداش ترکیبی مبتنی بر rubric و rule که وفاداری شبیهسازی را تیز میکند. داده هم کم نیست: بیش از ۱۰ میلیون مسیر تعامل واقعی در هفت حوزه (منبع).
برای ارزیابی، AgentWorldBench را ساختهاند که از تعاملهای واقعی پنج مدل مرزی روی نه بنچمارک تثبیتشده گرد آمده است. ادعای نتیجه این است که Qwen-AgentWorld در وفاداری شبیهسازی از مدلهای مرزی موجود جلو میزند.
دو کاربرد عملی یک مدل زبانی جهان
کاربرد اول، شبیهسازی جدا از عامل برای RL عاملمحور است. عامل را بهجای محیط واقعی، در برابر این مدل زبانی که نقش محیط را بازی میکند تمرین میدهید. مقاله ادعا میکند این روش از آموزش صرفاً روی محیط واقعی جلو میزند (منبع).
همین جاست که چنین رویکردی در محیط تولید به کار میآید. محیطهای واقعی گلوگاهاند: rate limit دارند، shell خراب میشود، وضعیت باید بین اجراها reset شود و APIها هزینه دارند. شبیهساز متنی هیچکدام از اینها را ندارد و میتوان هزاران نسخهی موازی از آن را اجرا کرد. نتیجه این است که چرخهی آموزش عامل چند مرتبهی بزرگی سریعتر میشود.
کاربرد دوم ظریفتر است. آموزش مدل جهان پیش از آموزش عامل، همچون یک warm-up به کار میرود و عملکرد را در هفت بنچمارک عاملمحور بالا میبرد (منبع). برداشت من این است که «پیشبینی محیط» و «عمل در محیط» دو روی یک سکهاند، مثل نگاشت رفت و نگاشت برگشت یک شایستگی واحد. اگر مدل بفهمد کنش A چه وضعیتی میسازد، خودبهخود در انتخاب A برای رسیدن به وضعیت مطلوب هم بهتر عمل میکند.
چند احتیاط لازم
باید صریح بود: «مدل جهان» در اینجا یعنی پیشبین توکن متن، روی وضعیتی که به شکل متن سریال شده است. این چارچوب برای حوزههای ذاتاً متنی — shell، DOM مرورگر، کد — قوی است. اما برای حوزههای embodied، بصری یا با وضعیت پیوسته، همان قوت را ندارد. این را نباید با مدلهای جهان مبتنی بر پیشبینی ویدئو در رباتیک یا بازیسازی یکی گرفت؛ دو مسئلهی متفاوتاند که فقط اسم مشترک دارند.
نکتهی دوم به ارزیابی برمیگردد. AgentWorldBench بازتولید مسیرهای پنج مدل روی نه بنچمارک را میسنجد. پس پوشش ارزیابی به همان بنچمارکها محدود است و دربارهی دم بلند رفتار محیطهای واقعی چیز زیادی نمیگوید.
چرا این قاببندی مهم است
مهمترین چیزی که این مقاله جابهجا میکند، هدف آموزش است. مدلهای زبانی سنتی روی «پیشبینی توکن بعدی که انسان مینوشت» آموزش میبینند. اینجا هدف به «پیشبینی وضعیت بعدی محیط با فرض این کنش» تبدیل میشود. از نظر مکانیکی هر دو next-token predictionاند؛ اما از نظر مفهومی دو کار متفاوتاند و دو نوع داده میطلبند.
پیامد عملی این تغییر مهم است. دادهی مدل پایهی نسل بعدی عاملها دیگر از خزش وب نمیآید، بلکه از مسیرهای عامل در محیطهای واقعی. محیط به معلم تبدیل میشود و اقتصاد دادهی متفاوتی شکل میگیرد: هر کس محیطهای واقعی بیشتری در اختیار داشته باشد، دادهی آموزشی ارزشمندتری تولید میکند.
جمعبندی من این است که ارزش واقعی این کار در بردن یک بنچمارک نیست. ارزشش در همین استدلال است که شبیهسازی محیط و عمل در محیط، در عمق، یک مهارتاند. اگر این حرف درست باشد، آنچه مدل پایه را روی آن آموزش میدهیم باید عوض شود.
منابع
- Qwen-AgentWorld: Language World Models for General Agents — arXiv · cs.CL · 2026-06-23