برنامهریزی یعنی چه؟ پیش از اینکه دست به کاری بزنید، در ذهنتان یک پیشبینی کوچک انجام میدهید: اگر فلان کار را بکنم، جهان احتمالاً به فلان حالت میرسد. همین پیشبینی ذهنی، یک مدل جهان (world model) است؛ سازوکاری درونی که حالت فعلی و یک کنش را میگیرد و حالت بعدی را حدس میزند. شما هر لحظه از آن استفاده میکنید، بیشتر وقتها بیآنکه حواستان باشد. دلیل اینکه برای امتحان کردن هر نقشهای مجبور نیستید واقعاً آن را اجرا کنید، همین مدل جهان است.
مقالهی تازهی تیم Qwen با نام Qwen-AgentWorld یک پرسش روشن را پیش میکشد: آیا یک مدل زبانی میتواند همین نقش را برای یک عامل نرمافزاری بازی کند؟ پاسخ آنها دو مدل است؛ یکی با اندازهی 35B-A3B و دیگری بزرگتر با 397B-A17B. نویسندگان اینها را «نخستین مدلهای جهان زبانی برای شبیهسازی محیطهای عاملمحور» در هفت حوزه مینامند که با زنجیرهی استدلال طولانی، حالت بعدی محیط را پیشبینی میکنند (arXiv).
بگذارید پیش از ادامه چند اصطلاح را جا بیندازم، چون تمام ماجرا روی همینها میچرخد.
یک «مدل جهان زبانی» دقیقاً چه چیزی را پیشبینی میکند؟
بیشتر مدلهای جهان که اسمشان به گوشمان خورده، تصویری هستند. یک فریم ویدیو و یک کنش به مدل میدهید و مدل فریم بعدی را میسازد. اما Qwen-AgentWorld از این جنس نیست. محیط در اینجا یک محیط عاملمحور است؛ یک مرورگر وب، یک رابط برنامهنویسی (API)، فضایی برای اجرای کد، یا کاری که حالت و وضعیت دارد. آنچه عامل میبیند متن است، کنشی که انجام میدهد متن است، و حالت بعدی که پیشبینی میشود هم متن است. پس مدل دارد دینامیک گذار (transition dynamics) محیط را یاد میگیرد؛ یعنی با داشتن وضعیت فعلی و کنشی که عامل انتخاب کرده، باید بنویسد محیط در پاسخ چه چیزی برمیگرداند (arXiv).
با یک مثال روشنتر میشود: عامل روی دکمهای در صفحه کلیک میکند و مدل جهان حدس میزند صفحهی بعدی چه شکلی میشود. عامل ابزاری را با ورودیهایی صدا میزند و مدل جهان پاسخ آن ابزار را پیشبینی میکند. در واقع این مدل یک شبیهساز پیامد است که با همان زبانی نوشته شده که خود عامل به آن حرف میزند.
خط آموزش این مدل را بهتر است سه کار جداگانه ببینیم. اول، پیشآموزش ادامهدار (CPT) که توانایی کلی مدلسازی جهان را به مدل میدهد. خوراک این مرحله، دینامیک گذار است که از بیش از ۱۰ میلیون مسیر واقعی تعامل در هفت حوزه بیرون کشیده شده، بهعلاوهی پیکرههای تخصصی تقویتشده. دوم، تنظیم نظارتشده (SFT) که مهارت مشخص پیشبینی حالت بعدی را بهعنوان یک کار استدلالی فعال میکند. سوم، یادگیری تقویتی (RL) که وفاداری شبیهسازی را تیز میکند؛ یعنی اینکه حالت پیشبینیشده چقدر به واقعیت نزدیک است. برای این کار از پاداشی استفاده میکنند که نویسندگان آن را ترکیب «معیار درجهبندی و قاعده» مینامند (arXiv).
مرحلهی سوم همان جایی است که من با دقت دنبالش میکنم. پیشبینی متنی که باورپذیر به نظر برسد کار سختی نیست. کار سخت این است که حالت بعدی درست را پیشبینی کنی؛ یعنی همان چیزی که یک محیط واقعی واقعاً تولید میکند. پاداشی که قضاوت درجهبندیشده را با بررسیهای دقیق و قاعدهمند ترکیب میکند، تلاشی است برای اینکه شبیهساز فقط روان نباشد، بلکه صادق هم بماند.
اصلاً چرا شبیهسازی؟ نقش آن در یک سیستم بزرگتر
پرسش اصلی این است: وقتی محیط واقعی در دسترس است، چرا باید زحمت ساختن شبیهساز را به جان خرید؟
چون محیط واقعی گران است، کند است و اغلب راه برگشت ندارد. آموزش یک عامل با یادگیری تقویتی یعنی بگذاری هزاران بار کنش انجام دهد و به نتیجههای خوب پاداش بدهی. حالا اگر هر کنش یعنی یک درخواست واقعی به وب یا یک فراخوان واقعی به یک سرویس، این حلقه کند و پرهزینه و گاهی خطرناک میشود. مدل جهان این حلقهی یادگیری را از جهان واقعی جدا میکند؛ عامل درون شبیهساز کنش میکند و شبیهساز در چند هزارم ثانیه جواب میدهد.
مقاله دقیقاً همین سود را گزارش میکند. Qwen-AgentWorld بهعنوان یک شبیهساز جداشده، «شبیهسازی مقیاسپذیر و قابلکنترل از هزاران محیط واقعی» را برای یادگیری تقویتی عامل پشتیبانی میکند. نویسندگان حتی ادعا میکنند که نتیجهی این کار از آموزش در محیط واقعی تنها هم بهتر است (arXiv). همین جملهی آخر است که آدم را غافلگیر میکند. این تصور که محیط واقعی همیشه بهترین معیار است، اینجا دیگر درست از آب درنمیآید. یک شبیهساز آموختهشده که میتوانی هزارتایی راه بیندازی، دقیق کنترلش کنی و رایگان از نو راهاندازیاش کنی، ظاهراً سیگنال آموزشی بیشتری میدهد تا خود واقعیت؛ دستکم در آزمایش آنها.
طبیعت همین موضوع را خیلی پیشتر حل کرده است. جانورانی که میتوانند نتیجهی کارها را در ذهنشان شبیهسازی کنند، مجبور نیستند هر درس را با چشیدن پیامدش یاد بگیرند. شبیهسازی همیشه ارزانتر از خود جهان است. Qwen-AgentWorld همین کار را میکند، فقط اینبار درون یک عامل نرمافزاری.
کاربرد دوم: مدلسازی جهان بهعنوان گرمکردن
یافتهی دومی هم هست که از نظر مفهومی برای من از اولی جذابتر است. نویسندگان گزارش میدهند همان آموزش مدل جهان، نقش یک گرمکردن (warm-up) را هم برای یک عامل عمومی بازی میکند. یعنی اگر مدل را پیش از اینکه کنشکردن را یاد بگیرد، برای پیشبینی دینامیک محیط آموزش بدهی، عملکرد نهاییاش در هفت آزمون عاملمحور بهتر میشود (arXiv).
این را با دقت بخوانید. یاد گرفتن پیشبینی محیط، مدل را در کنشکردن درون محیط بهتر میکند؛ حتی وقتی مهارت پیشبینی در زمان استفاده اصلاً به کار نمیرود. این نشان میدهد که همان فهمی که عامل هنگام یادگیری «بعد چه میشود» میسازد، دقیقاً همان فهمی است که برای انتخاب کنش خوب لازم دارد. پیشبینی و کنترل، زیرساخت مشترکی دارند. این دیگر یک ترفند سادهی آموزشی نیست؛ ادعایی است دربارهی اینکه شایستگی اصلاً چطور ساخته میشود. این حرف با یک ایدهی قدیمی در یادگیری تقویتی همخوان است: اگر مدل خوبی از جهان داشته باشی، بخش بزرگی از کار را بردهای.
یک شبیهساز را چطور نمره میدهیم؟
مدلی که محیط شبیهسازی میکند به آزمونی نیاز دارد که بسنجد آیا شبیهسازی درست است یا نه، نه اینکه متن قشنگ درآمده یا نه. نویسندگان آزمونی به نام AgentWorldBench ساختهاند که پایهاش تعامل واقعی پنج مدل پیشرو روی نه آزمون شناختهشده است (arXiv). این انتخاب مهم است: مرجع درستی همان چیزی است که محیطهای واقعی واقعاً برگرداندهاند. پس حالت پیشبینیشده در برابر واقعیت نمره میگیرد، نه در برابر حدس یک انسان از واقعیت. روی همین آزمون گزارش میدهند که Qwen-AgentWorld «بهطور چشمگیری از مدلهای پیشرو موجود بهتر عمل میکند» (arXiv).
چه چیزی را محکم باور نکنم
این یک پیشچاپ نسخهی اول است، به تاریخ ۲۳ ژوئن ۲۰۲۶. ادعاهای پررنگش — اینکه از آموزش واقعی فراتر میرود و از مدلهای پیشرو بهتر است — همگی اندازهگیری خود نویسندگان روی آزمون خودشان است (arXiv). کد منتشر شده است (GitHub) که نشانهی درستی از پایبندی به شفافیت است. اما یافتهای که بیش از همه باید جای دیگری هم تکرار شود، همین است: اینکه آموزش شبیهسازیشده از آموزش واقعی جلو میزند. اگر این نتیجه در آزمایشگاهها و حوزههای دیگر هم پابرجا بماند، اقتصاد آموزش عاملها دگرگون میشود. آنوقت گلوگاه کار از «دسترسی به محیط واقعی» به «کیفیت شبیهسازی که ساختهای» جابهجا میشود.
نکتهی عمیقتر همانی است که ارزش نگهداشتن دارد. عاملی که محیطش را آنقدر خوب در ذهن میسازد که بتواند درون تصور خودش تمرین کند، همان کاری را میکند که هر برنامهریز توانمندی انجام میدهد: یک مدل درونی ارزان را جای یک آزمون بیرونی گران میگذارد. کار اصلی این مقاله این است که نشان میدهد برای عاملهای نرمافزاری، آن مدل درونی را میشود با زبان نوشت، در مقیاس بزرگ آموزش داد، و دو بار خرجش را درآورد: یکبار بهعنوان شبیهساز و یکبار بهعنوان گرمکردن.
منابع
- Qwen-AgentWorld: Language World Models for General Agents — arXiv · cs.CL · 2026-06-23