یک مسیر کوتاه تا هدف، و رد کم‌رنگ ده‌ها مسیر طولانی‌تری که لازم نشد.
یک مسیر کوتاه تا هدف، و رد کم‌رنگ ده‌ها مسیر طولانی‌تری که لازم نشد.

Astra آزمون AGI رو تموم کرد، ولی با کدوم خط‌کش

مارس امسال بهترین مدل دنیا توی ARC-AGI-3 نمره‌اش ۰٫۳۷ درصد شد و آدم‌های معمولی صد درصد. پنج ماه بعد Astra همون آزمون رو ۹۹٫۹ گرفت، و فرانسوا شوله که آزمون رو ساخته بود تاریخ AGI رو جلو کشید. ولی همون مدل توی همون گزارش ۶۲٫۷ هم گرفته، و فرق این دو تا به خود مدل ربطی نداره.

بیست و ششم مارس امسال، ARC-AGI-3 راه افتاد. آزمونی که ساخته بودن تا ببینن چقدر تا AGI مونده.

بهترین مدل دنیا توش ۰٫۳۷ درصد گرفت. بعدی‌ها ۰٫۲۶ و ۰٫۲۵، و یکی‌شون صفر. آدم‌های معمولی هر صد و سی و پنج محیطش رو حل کردن. دو میلیون دلار هم گذاشته بودن برای هر هوش مصنوعی‌ای که به آدم آموزش‌ندیده برسه.

پنج ماه بعد، یک مدل ۹۹٫۹ گرفت.

فرانسوا شوله که این آزمون رو ساخته، موقع انتشارش گفته بود حدود یک سال طول می‌کشه تا اشباع بشه. ازش پرسیدن هنوز حوالی ۲۰۳۰ رو برای AGI محتمل می‌دونه یا نه. گفت زودتر.

این خبره. حالا بریم سراغ عددی که کمتر جایی نوشتن؛ همون مدل، توی همون گزارش، ۶۲٫۷ هم گرفت.

آزمون چیه

ARC-AGI-3 چند تا بازی کوچیکه که هیچ توضیحی همراهشون نمی‌دن. مدل رو می‌ندازن وسط بازی و خودش باید بگرده، حدس بزنه قاعده چیه، بفهمه اصلاً هدف چیه، و بعد ببره.

فرقش با بقیه‌ی آزمون‌ها اینه که فقط نمی‌پرسه حل کردی یا نه. می‌شمره چند حرکت کردی تا حلش کنی، و این شمردن سخت‌گیرانه‌ست؛ اگه آدم ده حرکت لازم داشته باشه و مدل صد تا، مدل ده درصد نمی‌گیره، یک درصد می‌گیره.

برای همینه که نمره‌های مارس این‌قدر پایین بود. مدل‌ها بلد بودن با زور و تکرار جلو برن، و این آزمون دقیقاً همون زور رو جریمه می‌کنه.

ARC Prize سوم سپتامبر گزارش داد مدل GPT-6 Astra از OpenAI روی این بازی‌ها چه کرد.

چیزی که واقعاً تازه‌ست

نمره‌ی نزدیک صد به تنهایی خیلی هم عجیب نیست، چون هر آزمونی بالاخره اشباع می‌شه.

چیزی که تازه‌ست تعداد حرکته. Astra توی ۹۶ درصد مرحله‌ها با حرکت کمتری از آدم‌ها به جواب رسید، و به طور متوسط نصف آدم‌ها حرکت کرد.

این عدد وقتی معنی پیدا می‌کنه که بدونی طرف مقایسه کی بوده. حدود پانصد نفر از مردم کوچه و خیابون رو آورده بودن، بدون اینکه ببینن کی توی حل معما قویه و کی نیست. بعد برای هر مرحله حساب کردن اونایی که تونستن تمومش کنن معمولاً چند حرکت کردن.

پس Astra از آدم متوسط کم‌حرکت‌تره، نه از بهترین آدم. ولی حتی همین هم چیزی نبود که تیم ARC انتظارش رو داشته باشه. فکر می‌کردن این یکی مدت‌ها مرز آدم و ماشین می‌مونه؛ که مدل شاید بالاخره حل کنه ولی خیلی بیشتر بگرده تا برسه. اشتباه فکر می‌کردن.

مدل برای خودش خط اختصاری می‌سازه

جالب‌ترین بخش گزارش نمره‌ها نیست. چیزیه که موقع فکر کردن از خود مدل دیدن.

Astra برای هر بازی یک جور خط اختصاری مخصوص همون بازی سرهم می‌کنه تا یادش بمونه کجای کاره. مثلاً یک خط مثل Turn 5: P=(24,20), empty, facing west که توش نوبت چندمه، کجا وایستاده، دستش خالیه و رو به کدوم طرفه، همه با هم جا شده.

این زبان برنامه‌نویسی نیست. یک جور علامت‌نویسی سرپاییه که همون‌جا برای همون بازی درست می‌شه. ARC Prize می‌گه توی مدل‌های دیگه هم این کار رو دیده بودن، ولی مال Astra دقیق‌تر بود و توی جای کمتر حرف بیشتری می‌زد.

توی یک آزمایش دیگه که به مدل اجازه‌ی اجرای کد هم داده بودن، برای هر بازی چند تا ابزار برای خودش نوشت، با اسم‌هایی مثل maze_solver.py و patrol_solver.py.

حالا عدد دوم

بین مدل و بازی یک برنامه هست که پیام‌ها رو رد و بدل می‌کنه. ARC Prize دو تا واسط مختلف رو امتحان کرد.

با واسط خودشون، Astra نمره‌اش شد ۶۲٫۷ و بیست و شش هزار دلار خرج برداشت.

با واسط دوم که خود سازنده‌ی مدل طراحیش کرده، همون مدل شد ۹۹٫۹ و نوزده هزار دلار.

این فرق توی مدل نیست. توی واسط دومه که می‌ذاره مدل رشته‌ی فکر خودش رو بین درخواست‌ها نگه داره، و وقتی گفت‌وگو دراز شد خودش خلاصه‌اش کنه.

واسط دوم فقط نمره رو بالا نبرد. ارزون‌تر هم بود، نزدیک چهار برابر سریع‌تر، و روی اون صد و شصت و هفت بازی که هر دو حل کردن نصف توکن مصرف کرد.

وقتی یک چیز از هر جهت بهتره، معمولاً یعنی اون یکی داشت جلوی مدل رو می‌گرفت، نه اینکه این یکی راه در رو پیدا کرده باشه. ولی هر کدوم رو که خبر بکنی، عدد فرق می‌کنه.

عددی که کسی بهش اشاره نکرد

هر دو واسط رو با شش درجه امتحان کردن، از اینکه مدل حسابی فکر کنه تا اینکه اصلاً فکر نکنه.

با واسط اول، هر چقدر مدل بیشتر فکر می‌کرد نمره بالاتر می‌رفت؛ از ۱۷٫۵ تا ۶۲٫۷.

با واسط دوم، هر شش درجه بین ۹۶٫۷ و ۹۹٫۹ افتادن.

یعنی وقتی واسط درست باشه، اینکه مدل چقدر فکر کنه تقریباً بی‌اثر می‌شه. اون همه تفاوتی که آدم می‌ذاره پای «مدل چقدر خوب فکر می‌کنه»، بیشترش داشت خرج یک واسط بد رو می‌داد.

یک چیز کوچیک‌تر هم توی همون جدول هست. با واسط اول، وقتی مدل اصلاً فکر نمی‌کرد ۳۵٫۲ گرفت و وقتی کم فکر می‌کرد ۱۷٫۵. کم فکر کردن از هیچ فکر نکردن بدتر بود.

دو تا ارزیاب دیگه حرف متضاد زدن

تا اینجا فقط یک آزمون بود. حالا بقیه رو هم بذار کنارش.

Epoch AI همین مدل رو با ۱۶۹ امتیاز اول گذاشت.

Artificial Analysis همین مدل رو ۶۱ داد؛ یعنی درست هم‌قد نسل قبلی خودش و پایین‌تر از Claude Fable 5.1 که ۶۶ گرفته بود. توی چند تا از سنجه‌های همین مجموعه، Astra از نسل قبلی هم عقب‌تر بود.

پس یک مدل، توی یک هفته، چهار جور نمره خورد. یکی روی یک آزمون، یکی روی همون آزمون با واسط دیگه، یکی صدرنشین، یکی وسط جدول.

هیچ‌کدوم دروغ نیست. چیزی که عوض می‌شه خط‌کشه.

پس بالاخره AGI شد یا نه

خود ARC Prize صاف می‌گه ادعا نمی‌کنه این AGI‌ه.

دلیلش رو هم می‌گه. ARC-AGI-3 دنیای کوچیک و بسته‌ایه که قاعده‌هاش معلومه و هدفش مشخص، و شبیه دنیای واقعی نیست که همه‌چیزش باز و درهمه. این آزمون یک گوشه از چیزی رو می‌سنجه که از AGI می‌خوایم، نه همه‌اش.

ولی حرف شوله رو هم نباید کوچیک کرد. کسی که این آزمون رو ساخته و سال‌ها محتاط‌ترین آدم این بحث بوده، حالا می‌گه پیشرفت دو برابر سریع‌تر از انتظارش اومده و تاریخ رو جلو می‌کشه. این از هر نمره‌ای مهم‌تره.

نسخه‌ی بعدی، ARC-AGI-4، قراره سه ماه اول ۲۰۲۷ بیاد.

چیزی که مهندس‌ها باید بردارن

عدد بدون شرطش عدد نیست.

«۹۹٫۹ درصد» تا نگی با کدوم واسط و روی کدوم بازی‌ها و با چقدر فکر کردن و چند دلار، فقط یک حس خوبه. همون مدل با عوض شدن یکی از این‌ها می‌شه ۶۲٫۷.

دفعه‌ی قبل نوشتم نرخ موفقیت بدون خط مبنا گمراهت می‌کنه. این یک پله بالاتره. اونجا باید می‌پرسیدی در مقایسه با چی، اینجا باید بپرسی تو چه شرایطی.

برای کسی که سیستم می‌سازه این خبر خوبیه، چون یعنی بخش زیادی از اون فاصله دست خودته. اینکه بین فراخوان‌ها حافظه رو نگه داری، بافت رو درست بچینی، سر وقت خلاصه کنی؛ همین‌ها اینجا نمره رو از ۶۲٫۷ بردن به ۹۹٫۹.

توی کار خودمون هم همینه. در BLZN.AI که یک راهبرد معاملاتی رو تا اجرای واقعی می‌بره، هیچ عددی که از بک‌تست درمیاد تا شرطش کنارش نباشه به درد نمی‌خوره. کارمزد و لغزش و بازه‌ی زمانی رو عوض کن، همون راهبرد از سودده می‌شه زیان‌ده.

چه چیزی عوض شده

پنج ماه پیش، مدل‌های ردیف اول توی این آزمون زیر یک درصد می‌گرفتن و آدم‌ها صد درصد. حالا یک مدل هست که توی همون آزمون از آدم متوسط کم‌حرکت‌تر کار می‌کنه و سر راه برای خودش علامت و ابزار می‌سازه.

ولی چیزی که ثابت شده این نیست که ماشین به آدم رسیده. ثابت شده توی یک دنیای کوچیک و قاعده‌مند، اگه درست بهش وصل بشی، ماشین زودتر از آدم متوسط می‌فهمه قاعده چیه.

فاصله‌ی این دو تا جمله همون‌قدر زیاده که فاصله‌ی ۶۲٫۷ تا ۹۹٫۹.

مقالات مرتبط