برخی از فرمولهای ریاضی این مقاله در مرورگر شما قابل نمایش نیستند.
رباتهای بازویی چگونه مهارتی را که آموختهاند، به جسمی که در موقعیتی کاملاً جدید قرار گرفته است تعمیم میدهند؟ در ادبیات هوش مصنوعی فیزیکی (Physical AI)، این مسئله را «تعمیم مکانی» (Spatial Generalization) مینامند؛ یعنی توانایی یک پالیسی (Policy) رباتیک برای انطباق با پوزیشنهای مختلف اشیاء، موانع فیزیکی و زوایای گوناگون دوربین. بهطور سنتی، حل این مسئله نیازمند جمعآوری دادههای نمایشی (Demonstration) در هزاران حالت فیزیکی مختلف است؛ فرآیندی که از نظر لجستیکی بسیار پرهزینه و زمانبر است.
برای عبور از این بنبست، پژوهشگران در مقالهای که در تاریخ ۱۵ ژوئن ۲۰۲۶ در arXiv:2606.17040 منتشر شد، چارچوبی به نام R2RDreamer معرفی کردهاند. این چارچوب یک روش ترکیبی برای دیتا آگمنتیشن (افزونگی داده) به صورت واقعیبهواقعی (Real-to-Real یا R2R) ارائه میدهد. ایدهی اصلی این است که ثبات هندسی سهبعدی در ویرایش مسیرها حفظ شود، اما وظیفهی سنگین تولید و تکمیل بصری صحنه به یک مدل دیفیوژن ویدیویی دوبعدی سپرده شود. این ترکیب، قابلیت تعمیم مکانی را برای پالیسیهای مبتنی بر تصاویر دوبعدی (مانند Diffusion Policies) و مدلهای بینایی-زبان-حرکت (VLA) به طرز چشمگیری بهبود میدهد.
مرزهای محدودیت در شبیهسازی و بازسازی سهبعدی
برای درک ضرورت R2RDreamer، باید محدودیتهای کارکردی سیستمهای فعلی را بررسی کنیم. در مهندسی سیستمهای کاربردی، ما معمولاً برای آموزش رباتها از «یادگیری تقلیدی» (Imitation Learning) استفاده میکنیم؛ فرآیندی که در آن مدل یاد میگیرد ورودیهای بصری (RGB) را به اکشنهای ربات (مانند سرعت یا پوزیشن بازو) نگاشت کند.
اگر دادههای اولیه ما محدود باشد، دو راهکار سنتی وجود دارد: ۱. انتقال از شبیهساز به واقعیت (Sim-to-Real): محیط واقعی را در یک شبیهساز فیزیکی بازسازی میکنیم و پوزیشن اشیاء را تغییر میدهیم. مشکل اصلی در اینجا، «شکاف شبیهسازی و واقعیت» (Sim-to-Real Gap) است. مدلسازی دقیق نور، بافتها و فیزیک تماس در شبیهساز مهندسی پیچیدهای میطلبد و پالیسی در مواجهه با دنیای واقعی اغلب شکست میخورد. ۲. آگمنتیشن سهبعدی واقعیبهواقعی (R2R): به جای شبیهساز، مستقیماً دادههای سهبعدی واقعی (مانند ابر نقاط) ویرایش میشوند. اما طبق آنچه در نسخهی تجربی HTML مقاله آمده است، این روشها نیاز به بخشبندی معنایی دقیق و بازسازی کامل هندسه سهبعدی دارند. این فرآیند علاوه بر بار پردازشی سنگین، نویزهای هندسی زیادی تولید میکند و خروجی آن برای مدلهای مبتنی بر ابر نقاط مناسب است، نه مدلهای دوربینمحور دوبعدی (RGB) که در صنعت استاندارد هستند.
مکانیسم کارکرد R2RDreamer
چارچوب R2RDreamer این محدودیت را با جداسازی «تغییرات هندسی» از «رندرینگ بصری» حل میکند. این سیستم تلاش نمیکند یک مدل سهبعدی بینقص و بافتدار از محیط بسازد؛ بلکه کار را در سه مرحلهی متمایز انجام میدهد.
در مرحلهی اول، سیستم ویرایش سهبعدی سبک را اعمال میکند. ابر نقاط ناقص جسم و مسیر حرکتی مجری نهایی (End-Effector) ربات از یک دمو ثبت میشود. اگر ابر نقاط ناقص جسم را با نشان دهیم، سیستم یک تبدیل صلب برای انتقال مکانی اعمال میکند:
که در آن ماتریس دوران و بردار انتقال در دستگاه مختصات سهبعدی مشترک است. مسیر حرکت بازوی ربات نیز به صورت ریاضی تغییر مییابد تا با پوزیشن جدید هماهنگ شود.
در مرحلهی دوم، سیستم از تصویرسازی با آگاهی از انسداد (Occlusion-Aware Projection) استفاده میکند. ابر نقاط تغییریافته به صفحهی تصویر دوبعدی دوربین پروجکت میشود. برای حل مشکل فضاهای خالی و همپوشانی اشیاء، نقشهی عمق و ماسکهای انسداد محاسبه میشوند تا مشخص شود کدام بخشهای تصویر دوبعدی توسط جسم جابجاشده و بازوی ربات اشغال شدهاند.
در مرحلهی سوم، فرآیند تکمیل ویدیویی دوبعدی با کنترل دقیق آغاز میشود. فریمهای ماسکشده همراه با اولین فریم واقعی دمو به یک مدل دیفیوژن تصویربهویدیو (Image-to-Video) داده میشوند. این مدل مولد، به عنوان منبعی از قوانین فیزیک و نور عمل کرده و فضاهای ماسکشده را با سایهها، بافتها و بازتابهای واقعی پر میکند. نتیجهی کار، یک ویدیوی دوبعدی متوالی و منسجم از نظر زمانی است که ربات را در حال تعامل با جسم در پوزیشن جدید نشان میدهد.
کارکرد عملی در سیستمهای تولیدی
در عمل سیستمسازی، چالش اصلی ما تقریباً هیچگاه معماری مدل نیست؛ بلکه کیفیت، تنوع و هزینهی جمعآوری دادههاست. جمعآوری دموهای فیزیکی فرآیندی است که هزینهی آن با نیروی کار انسانی نسبت مستقیم دارد.
با به کارگیری R2RDreamer، همانطور که در متن کامل PDF مقاله تشریح شده است، مهندسان میتوانند با داشتن تنها چند دموی واقعی، کلاندادههای متنوعی تولید کنند. برای مثال، ۵ دموی فیزیکی جابجایی یک جسم میتواند به صدها ویدیوی آگمنتشده با زوایای مختلف تبدیل شود. از آنجا که خروجی نهایی یک ویدیوی دوبعدی (RGB) استاندارد همراه با اکشنهای اصلاحشده است، میتوان این دادهها را مستقیماً برای آموزش پالیسیهای دوبعدی استفاده کرد. این رویکرد به معنای عبور از شبیهسازهای پیچیده و بازسازیهای پرهزینهی سهبعدی با تکیه بر قدرت مدلهای مولد دوبعدی است.
منابع
- R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies — arXiv · cs.CV · 2026-06-15