پژوهش های بنیادی AI
یک میلیمتر مکعب
یک تکه قشر مغز انسان، کوچکتر از یک دانه برنج، زیر میکروسکوپ الکترونی نقشهبرداری شده و ۱۳۴۷۳ نرون ازش در اومده. کسی این نقشه رو گرفته و بهجای حافظه به یک مدل زبانی کوچک وصل کرده. مدل هر بار فقط یک تکهی کوتاه از متن رو میبینه، ولی کلمهای رو که خیلی قبلتر گفته شده بود و دیگه جلوی چشمش نبود، صد درصد درست به یاد آورد. بعد همون آدم اتصالهای این گراف رو تصادفی بههم ریخت، ۹۹٫۹۴ درصدشون رو، و جواب همون صد درصد موند.
Astra آزمون AGI رو تموم کرد، ولی با کدوم خطکش
مارس امسال بهترین مدل دنیا توی ARC-AGI-3 نمرهاش ۰٫۳۷ درصد شد و آدمهای معمولی صد درصد. پنج ماه بعد Astra همون آزمون رو ۹۹٫۹ گرفت، و فرانسوا شوله که آزمون رو ساخته بود تاریخ AGI رو جلو کشید. ولی همون مدل توی همون گزارش ۶۲٫۷ هم گرفته، و فرق این دو تا به خود مدل ربطی نداره.
وقتی مدل ویدیو میسازد، دقیقاً چه چیزی یاد میگیرد؟
مدل برای ساختن فریم بعدی چارهای ندارد جز اینکه ساختار جهان را درون خودش رمزگذاری کند. ادعای GenCeption این است که همین ساختار را میتوان برای ادراک بازیافت و بودجهی پروژههای بینایی را دگرگون کرد.
وقتی مدل زبانی بهجای بازیگر، شبیهساز محیط میشود
مقالهی Qwen-AgentWorld ادعا میکند مدل زبانی میتواند بهجای صرفاً «عمل کردن» در محیط، خود محیط را شبیهسازی کند. با این جابهجایی نقش، هم دادهی آموزش عاملها عوض میشود و هم عملکردشان بالا میرود.
وقتی عامل یاد میگیرد محیط را در ذهنش بسازد
مقالهی Qwen-AgentWorld این پرسش را مطرح میکند که آیا یک مدل زبانی میتواند نقش «مدل جهان» را برای یک عامل نرمافزاری بازی کند؛ شبیهسازی که با متن نوشته میشود و گزارش میدهد آموزش درون این محیط خیالی گاهی از آموزش در محیط واقعی هم بهتر است.
Unlimited OCR و هزینهی بهخاطر سپردن همهچیز
مدل جدید OCR از Baidu حافظهی روبهرشد رمزگشا را با یک حافظهی کاری ثابت عوض میکند تا دهها صفحه را در یک گذر بخواند. نکتهی جذاب خود OCR نیست؛ ترفند توجهی است که زیر آن نشسته.
آیا مدل میتواند خوببودن را در یک حوزه یاد بگیرد و همهجا خوب بماند؟
OpenAI گزارش میدهد که یادگیری تقویتی روی مجموعهای کوچک از گفتوگوهای «صفات سودمند» به دهها بنچمارک بیربط هم سرایت میکند — و زیر فشار خصمانه دوام میآورد. ادعای جالب، همین تعمیم است نه تیتر خبری.
MedRLM بیمار را محیط میبیند، نه پرامپت
MedRLM پروندهی بیمار را یک محیط بالینی بیرونی میبیند که باید بازرسی، بازیابی و راستیآزمایی شود؛ گذری ساختاری از پرامپت تکشات، با دو دروازهی ایمنی که از خود سرواژه مهمترند.
وقتی مدل decoder-only به سراغ پیشبینی سریزمانی میرود
Google Research یک مدل پایهی decoder-only برای پیشبینی سریزمانی منتشر کرد. این انتخاب معماری در عمل چه معنایی دارد و چرا قرضگرفتن آن از مدلهای زبانی صرفاً بر اساس مد این روزها نیست.
هویت کجا جای دارد: فاز، نور و بستر بازنمایی
نتیجهای از اوپنهایم و لیم در سال ۱۹۸۱ نشان داد که هویت تصویر در فاز نهفته است. دو مقالهی ۲۰۲۶ همین ایده را به آزمونی علی برای شبکهها و پیشبینیگری ساختهشده از نور بدل میکنند؛ و در کنار هم، فاز را همان مختصات باربر محاسبات معرفی میکنند.
فاز، نور و هندسهی داده: سه نشانه از جایگاه واقعی نمایش
سه مقاله از ژوئن ۲۰۲۶ به یک ادعای مشترک میرسند: زیرلایهی معنادار هر مدل یادگرفتهشده نازکتر، هندسیتر و کمتر دیجیتالی است از آنچه معماری وانمود میکند.