مرور بنچمارکهای GPT-6 Astra؛ آیا مدل جدید OpenAI واقعاً از رقبا بهتر است؟
وقتی روز پنجشنبه مدل GPT-6 Astra معرفی شد، امتیازهای آن در بنچمارکهای مختلف بسیار خبرساز شد؛ برای مثال امتیاز ۹۹.۹ درصدی در ARC-AGI-3 گمانهزنی درباره رسیدن به هوش جامع مصنوعی را افزایش داد. بااینحال، بررسی نتایج مستقل نشان میدهد مدل استرا در همه زمینهها برتری یکسانی ندارد. در شاخص هوش Artificial Analysis، این مدل در نسخه ارزیابی منتشرشده همسطح GPT-5.6 Sol و پایینتر از Claude Fable 5.1 قرار گرفت. در ادامه نگاه دقیقتری به بنچمارک این مدل میاندازیم.
مدل GPT-6 Astra همان AGI است؟
مهمترین امتیاز زمان معرفی Astra، امتیاز ۹۹.۹ درصدی در ARC-AGI-3 بود. OpenAI نیز در صفحه معرفی این مدل همین عدد را بهعنوان یکی از نتایج اصلی Astra برجسته کرده است.

اما اگر استرا را در شرایط متفاوت آزمایش کنیم چه؟ در هارنس استاندارد و مستقل از ارائهدهنده، Astra با بالاترین سطح استدلال به امتیاز ۶۲.۷ درصد رسید و هزینه اجرای آزمون حدود ۲۶٬۰۹۸ دلار بود. در مقابل، هارنس اختصاصی امتیاز ۹۹.۹ درصد را با هزینه حدود ۱۸٬۸۱۷ دلار ثبت کرد.
البته هر دو عدد واقعی هستند، اما پاسخ دو سؤال متفاوت را میدهند. امتیاز ۶۲.۷ درصد برای مقایسه مدلها در یک محیط استاندارد اهمیت بیشتری دارد، درحالیکه عدد ۹۹.۹ درصد نشان میدهد Astra در شرایطی که بتواند از سازوکارهای اختصاصی استفاده کند، چه عملکردی دارد.
همچنین کارشناسان میگویند امتیاز بالا در ARC-AGI-3 بهتنهایی اثباتکننده دستیابی به AGI نیست. این آزمون دامنهای مشخص، محیطهایی بسته و اهدافی معین دارد و نمیتواند پیچیدگی و بازبودن مسائل دنیای واقعی را بهطور کامل بازنمایی کند.
Astra در کدنویسی قوی است، اما رقیبان را کنار نمیزند
در بنچمارکهای کدنویسی، عملکرد Astra به زمینه آزمون وابستگی زیادی دارد.

بزرگترین برتری Astra در Terminal-Bench 4.0 دیده میشود؛ آزمونی که کارهای پیچیده مبتنیبر ترمینال، مهندسی نرمافزار، پیکربندی سیستم و تحلیل داده را ارزیابی میکند. Astra در این آزمون امتیاز ۵۷.۹ درصد به دست آورده است، درحالیکه GPT-5.6 Sol به ۳۷.۳ درصد و مدل Claude Fable 5.1 به ۵۵.۸ درصد رسیدهاند. OpenAI همچنین میگوید هزینه تخمینی API برای Astra در پیکربندی آزمایششده حدود ۹ درصد کمتر از Sol و ۶۳ درصد کمتر از Fable 5.1 بوده است.

در DeepSWE فاصله بسیار کمتر میشود. Astra امتیاز ۷۴.۱ درصد دارد؛ در برابر ۷۲.۷ درصد برای Sol، ۷۳.۷ درصد برای Claude Opus 5 و ۷۳.۸ درصد برای Gemini 3.8 Flash. بنابراین Astra در این آزمون نسبت به نسل قبلی خود پیشرفت کرده، اما فاصله آن با برخی مدلهای رقیب بسیار محدود است.

در FrontierCode 1.1 Extended نیز Astra با امتیاز ۶۴.۵ درصد بالاتر از Sol با ۶۰.۶ درصد قرار میگیرد، اما Claude Fable 5 با ۶۴.۹ درصد اندکی بالاتر است و Fable 5.1 با ۶۳.۶ درصد تقریباً در همان محدوده قرار دارد. در نسخه اصلی FrontierCode نیز Astra با ۵۳.۳ درصد، اندکی بالاتر از Fable 5.1 با ۵۰.۹ درصد قرار دارد، اما Fable 5 به ۵۳.۵ درصد رسیده است.

تصویر ترکیبیتر در Artificial Analysis Coding Agent Index دیده میشود. Astra در نسخه ۱.۴ این شاخص امتیاز ۶۷ گرفته است، درحالیکه Fable 5.1 امتیاز ۷۰ دارد. بااینحال، Artificial Analysis میگوید Astra در مقایسه با Sol بسیار کممصرفتر است و در سطح بیشینه استدلال، تقریباً با هزینهای مشابه Sol امتیاز بالاتری به دست میآورد. در مقایسه با Fable 5، هزینه هر وظیفه برای Astra کمتر از نصف گزارش شده است.
در نتیجه، اگر معیار فقط «بهترین مدل کدنویسی» باشد، بنچمارکها برتری قاطعی برای Astra نشان نمیدهند. اما اگر تعداد توکن مصرفشده و هزینه تکمیل یک وظیفه را نیز وارد معادله کنیم، Astra وضعیت بهتری پیدا میکند.
نقطه قوت اصلی GPT-6 Astra در کارهای ایجنتمحور
یکی از روشنترین الگوها در نتایج Astra، عملکرد آن در استفاده از کامپیوتر و اجرای وظایف چندمرحلهای است.

در OSWorld 2.0 استرا امتیاز ۷۲.۶ درصد کسب کرده است؛ در مقایسه با ۶۵.۷ درصد برای GPT-5.6 Sol و ۷۰.۲ درصد برای Claude Opus 5. اوپنایآی همچنین میگوید Astra در شبیهسازیهای میزان تأخیر این آزمون، با حدود ۴۰ دقیقه برای هر وظیفه به این نتیجه رسیده، درحالیکه Sol حدود ۷۵ دقیقه زمان نیاز داشته است.

در ScreenSpot-Pro نیز Astra با ۹۲.۷ درصد، جهش قابلتوجهی نسبت به امتیاز ۷۶.۹ درصدی Sol نشان میدهد. در AutomationBench هم امتیاز استرا به ۴۱.۴ درصد رسیده، درحالیکه Sol امتیاز ۱۸.۱ درصد و Fable 5.1 امتیاز ۳۱.۴ درصد دارد.
این نتایج با توضیح OpenAI درباره معماری استفاده از مدل همخوانی دارد. Astra برای انجام کارهایی طراحی شده که صرفاً پاسخ متنی نیستند و شامل تعامل با نرمافزار، مرور محیط، اجرای دستورات، اصلاح خطا و ادامه یک فرایند چندمرحلهای میشوند.
در استدلال عمومی، جهش Astra آنقدر بزرگ نیست
اگر معیار را از کارهای ایجنتمحور به یک شاخص ترکیبی از تواناییهای مختلف تغییر دهیم، داستان متفاوت میشود.

در Artificial Analysis Intelligence Index نسخه ۴.۱.۱، استرا امتیاز ۶۱.۲ گرفته است؛ درحالیکه GPT-5.6 Sol امتیاز ۶۰.۹، مدل Claude Fable 5.1 امتیاز ۶۵.۷ و Claude Fable 5 امتیاز ۶۲.۱ دارند. Claude Opus 5 نیز امتیاز ۶۳.۱ ثبت کرده است.
در همین ارزیابی، Astra با حدود ۱۰ درصد خروجی کمتر از Sol در سطح بیشینه استدلال، از نظر مصرف توکن کارآمدتر بود، اما افزایش قیمت باعث شد هزینه هر وظیفه در سطح بیشینه حدود ۷۵ درصد بیشتر شود.
این شاخص البته تمام تواناییهای Astra را به یک عدد تبدیل میکند و به همین دلیل نمیتواند همه تفاوتهای مدل را نشان دهد. بااینحال، نتیجه آن یک نکته مهم را روشن میکند: افزایش شدید عملکرد در بعضی آزمونها الزاماً به معنای جهش مشابه در میانگین تواناییهای مدل نیست.
Astra در برخی آزمونها بهتر و در برخی دیگر ضعیفتر است
نتایج OpenAI نشان میدهد پیشرفت Astra در همه ارزیابیها یکطرفه نیست.

در BrowseComp، امتیاز Astra به ۹۱.۵ درصد رسیده، درحالیکه Sol امتیاز ۹۰.۴ درصد دارد. در GPQA Diamond نیز Astra با ۹۶ درصد بالاتر از Sol با ۹۴.۶ درصد قرار میگیرد. در FrontierMath Tier 4 نسخه دوم، Astra به ۹۷.۶ درصد رسیده است، در برابر ۸۳ درصد برای Sol و ۸۷.۸ درصد برای Fable 5.1.

در مقابل، Humanity’s Last Exam با ابزارها تصویری متفاوت ارائه میکند. Astra در این آزمون ۵۷.۲ درصد گرفته، درحالیکه Fable 5.1 به ۶۵ درصد رسیده است.
Artificial Analysis همچنین از افت Astra در GDPval-AA v2 و کاهش ۲ تا ۳ امتیازی در برخی ارزیابیهای دیگر خبر داده است. در مقابل، این مؤسسه افزایش حدود ۸۰ امتیازی Astra در AA-Briefcase را گزارش کرده است؛ آزمونی که برای ارزیابی کارهای دانشمحور ایجنتی در پروژههای طولانی طراحی شده است.
این تضاد مهم است. Astra در برخی وظایف طولانی و چندمرحلهای بهتر عمل میکند، اما در شاخصهای ترکیبی یا برخی وظایف مشخص، این پیشرفت به همان اندازه دیده نمیشود.
مصرف توکن، برگ برنده مدل Astra در برابر قیمت بالاتر است
Astra با قیمت ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی عرضه شده است. این قیمت تقریباً ۲.۵ برابر نرخهای GPT-5.6 Sol است که ۴ دلار برای ورودی و ۲۰ دلار برای خروجی اعلام شدهاند. OpenAI همچنین برای خواندن دادههای کششده و نوشتن در کش نرخهای جداگانه دارد و حالت سریع Astra با دو برابر قیمت حالت استاندارد ارائه میشود.
اما تعداد توکنهای مصرفشده نیز تغییر کرده است. Artificial Analysis میگوید Astra در ارزیابی ایجنت کدنویسی در سطح بیشینه حدود یکسوم توکنهای Sol را مصرف کرده است. همین کاهش باعث میشود هزینه واقعی هر وظیفه الزاماً به اندازه قیمت اسمی هر توکن افزایش پیدا نکند.
در شاخص هوش، شرایط متفاوت است. Astra حدود ۱۰ درصد توکن خروجی کمتری نسبت به Sol مصرف میکند، اما افزایش ۲.۵ برابری قیمت به اندازهای است که هزینه هر وظیفه در سطح بیشینه حدود ۷۵ درصد افزایش پیدا کند.
بنابراین مقایسه قیمت هر توکن بهتنهایی تصویر کاملی نمیدهد. برای مدلهایی که وظایف طولانی و ایجنتمحور انجام میدهند، هزینهای که برای تکمیل موفق یک وظیفه پرداخت میشود اهمیت بیشتری دارد.
در امنیت سایبری، استرا جهش بزرگتری نشان میدهد
یکی از مهمترین تغییرات Astra در ارزیابیهای امنیت سایبری دیده میشود.

Astra در ExploitBench به امتیاز ۱۰۰ درصد رسیده، درحالیکه GPT-5.6 Sol امتیاز ۷۸.۵ درصد داشته است. در ExploitGym نیز Astra با ۴۲.۴ درصد بالاتر از Sol با ۳۰.۳ درصد قرار دارد. در ارزیابی جدید ExploitBench که از آسیبپذیریهای سه ماه پیش از زمان آزمون استفاده میکند، Astra امتیاز ۳۹ درصد و Sol امتیاز ۵.۵ درصد گرفتهاند.

در SRE-Bench نیز Astra در نخستین تلاش ۸۸ درصد وظایف را حل کرده و با چهار تلاش به ۹۹.۲ درصد رسیده است. Sol بهترتیب ۵۵.۹ و ۶۸.۷ درصد ثبت کرده است.
OpenAI میگوید Astra در جریان ارزیابی حتی دو آسیبپذیری روزصفر ناشناخته را کشف و از آنها استفاده کرده و این آسیبپذیریها را به توسعهدهندگان مربوطه گزارش کرده است. بهدلیل افزایش قابلیتهای سایبری، OpenAI Astra را در آستانه «Critical» چارچوب آمادگی سایبری خود قرار داده است.
البته این اعداد محدودیتهای آزمایشی داشتند. برای نمونه، OpenAI میگوید Astra و Sol در ExploitGym بدون محدودیت زمانی ششساعته آزمایش شدند تا توانایی کامل آنها بهتر ارزیابی شود. همچنین در برخی نسخههای آزمون، تفاوت در تعداد تلاشهای مجاز میتواند روی نتیجه تأثیر بگذارد.
در ریاضیات، امتیاز بالا به معنای حل همه مسائل نیست
Astra در FrontierMath Tier 4 به امتیاز ۹۷.۶ درصد رسیده است؛ رقمی که بالاتر از Sol با ۸۳ درصد و Fable 5.1 با ۸۷.۸ درصد قرار میگیرد.

بااینحال، این نتیجه نباید به معنای حلشدن مسائل دشوار ریاضی تفسیر شود. کارشناسان به آزمونی سختتر بر پایه ۶۸ مسئله حلنشده از مسائل اردوش اشاره میکنند که در اجرای رسمی Astra تنها دو مسئله حل شد و با تلاشهای تکراری این تعداد به پنج مورد رسید؛ اجرای تکراری نیز بیش از ۲۲۰ هزار دلار هزینه محاسباتی داشته است.
آیا Astra بهتر از Fable 5.1 است؟
پاسخ کوتاه این است که نه در همه زمینهها.
Astra در Terminal-Bench 4.0 با ۵۷.۹ درصد بالاتر از Fable 5.1 با ۵۵.۸ درصد قرار دارد. در AutomationBench نیز ۴۱.۴ درصد در برابر ۳۱.۴ درصد برای Astra ثبت شده است. در FrontierMath و GPQA Diamond نیز Astra نتایج بالایی دارد
اما در Humanity’s Last Exam، مدل Fable 5.1 با ۶۵ درصد بالاتر از Astra با ۵۷.۲ درصد است. در شاخص Artificial Analysis Intelligence نیز در نسخه ۴.۱.۱، Fable 5.1 امتیاز ۶۵.۷ و Astra امتیاز ۶۱.۲ گرفته است.
در نتیجه، اگر کار اصلی استفاده از کامپیوتر، اجرای وظایف طولانی، کار با ترمینال یا گردشکارهای ایجنتمحور باشد، Astra یکی از قویترین گزینهها در میان مدلهای مقایسهشده است. اما در استدلال عمومی و برخی وظایف دانشمحور، بنچمارکها برتری مطلقی نسبت به Fable 5.1 نشان نمیدهند.

