رقابت میان OpenAI و Anthropic در سال ۲۰۲۶ وارد مرحلهای شده که دیگر صرفاً به این سؤال خلاصه نمیشود که «کدام چتبات پاسخ بهتری میدهد؟». هر دو شرکت حالا مدلهایی میسازند که قرار است بخشهایی از یک کار واقعی را بهجای کاربر انجام دهند؛ از برنامهنویسی و پژوهش گرفته تا کار با مرورگر، نرمافزارهای حرفهای و انجام وظایف چندمرحلهای.a
در همین فضا، Anthropic در اول سپتامبر Claude Fable 5.1 را معرفی کرد و تنها دو روز بعد، OpenAI از GPT-6 Astra رونمایی کرد. فاصله بسیار کوتاه میان این دو عرضه باعث شده مقایسه آنها به یکی از جذابترین رقابتهای فعلی بازار هوش مصنوعی تبدیل شود.
اما برخلاف بسیاری از مقایسههای عجولانه، پاسخ سادهای برای اینکه «کدام مدل بهتر است» وجود ندارد. Astra در برخی ارزیابیها عملکرد بالاتری دارد، Fable ۵.۱ در برخی شاخصهای مستقل جلوتر قرار گرفته و هر دو مدل برای نوع متفاوتی از کارهای سنگین طراحی شدهاند. بنابراین برای انتخاب درست، باید فراتر از چند عدد بنچمارک نگاه کنیم.
GPT-۶ Astra چیست؟
OpenAI، GPT-۶ Astra را جدیدترین و قدرتمندترین مدل خود برای انجام کارهای پیچیده و چندمرحلهای معرفی کرده است. این مدل در حوزههایی مانند استدلال، برنامهنویسی، پژوهش، استفاده از کامپیوتر، کار با مرورگر، امنیت سایبری و فعالیتهای حرفهای هدفگذاری شده است.
یکی از مهمترین تفاوتهای Astra با نسلهای قدیمیتر، تمرکز شدید آن بر انجام کار است، نه فقط تولید پاسخ.
برای مثال، OpenAI میگوید Astra میتواند فرمهای آنلاین را تکمیل کند، اطلاعات یک CRM را بهروزرسانی کند، تقویم را مدیریت کند، در وب تحقیق انجام دهد، اسناد و ارائهها بسازد، دادههای علمی را تحلیل کند و حتی یک وبسایت را آزمایش و اشکالزدایی کند.
این تغییر جهت اهمیت زیادی دارد؛ زیرا مدلهای هوش مصنوعی بهتدریج از ابزارهای پرسشوپاسخ به سمت عاملهای هوشمند حرکت میکنند؛ سیستمهایی که میتوانند یک هدف را دریافت کنند و برای رسیدن به آن چندین مرحله را پشت سر بگذارند.
Claude Fable ۵.۱ چیست؟
Anthropic نیز تقریباً با همان فلسفه، Claude Fable ۵.۱ را ساخته است.
این شرکت Fable ۵.۱ را قدرتمندترین مدل خود برای برنامهنویسی و کارهای دانشی پیچیده و طولانیمدت معرفی میکند. این مدل برای پروژههایی طراحی شده که ممکن است ساعتها یا حتی روزها ادامه داشته باشند و نیازمند برنامهریزی، استفاده از ابزارها، بررسی نتیجه و اصلاح خطاها باشند.
Fable ۵.۱ میتواند در پروژههای بزرگ برنامهنویسی روی کل کدبیس کار کند، تستهای خودش را بنویسد، کد تولیدشده را بررسی کند و حتی خروجیهای بصری یک پروژه را با هدف اولیه مقایسه کند. Anthropic همچنین استفاده از این مدل را برای پژوهش، تحلیل اسناد، کار با فایلهای پیچیده و وظایف چندمرحلهای سازمانی در نظر گرفته است.
بنابراین تفاوت اصلی در فلسفه این دو مدل چندان زیاد نیست. هر دو شرکت به دنبال ساخت هوش مصنوعیهایی هستند که بتوانند وظیفه را تا رسیدن به نتیجه دنبال کنند.
مشخصات دو مدل در یک نگاه
از نظر ظرفیت پردازش متن، هر دو مدل در رده مدلهای بسیار بزرگ قرار میگیرند.
GPT-۶ Astra یک پنجره زمینه ۱.۰۵ میلیون توکن و حداکثر خروجی ۱۲۸ هزار توکن دارد. قیمت پایه API آن نیز ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است.
Claude Fable ۵.۱ نیز با قیمت پایه ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی عرضه شده است. با این حال، Anthropic قیمت خواندن دادههای کششده را به ۰.۲۵ دلار برای هر میلیون توکن کاهش داده و میگوید این تغییر میتواند هزینه برخی جریانهای کاری معمول را حدود ۲۵ درصد و وظایف بسیار عاملمحور را تا حدود ۴۵ درصد کاهش دهد.
بنابراین اگر تنها به قیمت معمول ورودی و خروجی نگاه کنیم، این دو مدل تقریباً در یک سطح قرار دارند؛ اما هزینه واقعی استفاده میتواند با توجه به نحوه استفاده از کش و ساختار وظیفه متفاوت باشد.
در برنامهنویسی کدام مدل بهتر است؟
برنامهنویسی یکی از مهمترین میدانهای رقابت Astra و Fable ۵.۱ است.
OpenAI در جدول ارزیابی خودش، Astra را در چند آزمایش مهم بالاتر از Fable ۵.۱ قرار داده است. برای نمونه، در Terminal-Bench 4.0 امتیاز Astra برابر ۵۷.۹ درصد و امتیاز Fable ۵.۱ برابر ۵۵.۸ درصد گزارش شده است. در AutomationBench نیز Astra با ۴۱.۴ درصد در برابر ۳۱.۴ درصد Fable ۵.۱ قرار دارد.
اما همینجا باید مراقب یک اشتباه رایج باشیم: جدول OpenAI بهتنهایی نمیتواند ثابت کند Astra در تمام شرایط از Fable ۵.۱ بهتر است.
یک مقایسه مستقل از DataCamp نشان میدهد که شاخصهای داخلی OpenAI و ارزیابی مستقل Artificial Analysis در برخی موارد نتیجه متفاوتی دارند و Artificial Analysis در شاخصهای اصلی خود Fable ۵.۱ را بالاتر قرار داده است.
بنابراین نتیجه منطقی این نیست که یکی «برنده مطلق» برنامهنویسی است. نتیجه دقیقتر این است که هر دو مدل در رده بهترین ابزارهای برنامهنویسی قرار دارند و نتیجه میتواند بر اساس نوع پروژه و روش ارزیابی تغییر کند.
Astra در کار با کامپیوتر چه مزیتی دارد؟
یکی از نقاط قوت برجسته GPT-۶ Astra، توانایی آن در تعامل مستقیم با محیط کامپیوتر است.
OpenAI در ارزیابیهای خود، Astra را در OSWorld 2.0 با امتیاز ۷۲.۶ درصد و در ScreenSpot-Pro با امتیاز ۹۲.۷ درصد گزارش کرده است. در آزمون Agents’ Last Exam نیز Astra به امتیاز ۵۹.۳ درصد رسیده است.
اهمیت این اعداد در این است که مدل فقط قرار نیست توضیح دهد چگونه یک کار انجام شود؛ بلکه میتواند خودش با محیط دیجیتال تعامل داشته باشد.
برای یک کاربر عادی، این قابلیت میتواند به معنای انجام کارهایی مانند جستوجوی اطلاعات، تکمیل فرم، مدیریت دادهها یا آمادهسازی یک سند باشد. برای شرکتها، اهمیت آن بسیار بیشتر است، زیرا میتواند بخشی از فرایندهای کاری تکراری را خودکار کند.
Fable ۵.۱؛ تمرکز روی پروژههای طولانی
Anthropic نیز در Fable ۵.۱ روی وظایف طولانیمدت تمرکز ویژهای داشته است.
طبق توضیحات رسمی شرکت، این مدل برای پروژههایی طراحی شده که ممکن است ساعتها ادامه پیدا کنند؛ از کار روی یک کدبیس بزرگ گرفته تا پژوهش و انجام وظایف سازمانی پیچیده. Fable ۵.۱ میتواند کار را برنامهریزی کند، ابزارهای موردنیاز را انتخاب کند، در صورت شکست یک مرحله تلاش دیگری انجام دهد و وضعیت کار را به کاربر گزارش کند.
Anthropic همچنین میگوید Fable ۵.۱ میتواند در Claude Code روی پروژههای بزرگ نرمافزاری کار کند و برای بررسی نتیجه، تست و ارزیابی خروجی نیز از ابزارها استفاده کند.
این ویژگی برای توسعهدهندگانی که با پروژههای چندساعته یا چندروزه سروکار دارند اهمیت ویژهای دارد.
رقابت در بنچمارکها؛ چرا یک برنده نداریم؟
یکی از جذابترین نکات درباره رقابت Astra و Fable ۵.۱ این است که حتی اعداد رسمی دو شرکت نیز تصویر کاملاً یکسانی ارائه نمیکنند.
OpenAI در جدول خود Astra را در بسیاری از معیارها بالاتر نشان میدهد. برای نمونه، در BenchCAD امتیاز Astra برابر ۹۵.۹ درصد و Fable ۵.۱ برابر ۸۴.۳ درصد است. در BrowseComp نیز Astra با ۹۱.۵ درصد در برابر ۹۰.۸ درصد Claude Opus ۵ قرار گرفته است.
اما در همان جدول، شاخص Artificial Analysis Intelligence Index داستان متفاوتی دارد: Fable ۵.۱ امتیاز ۶۵.۷ گرفته، در حالی که Astra به ۶۱.۲ رسیده است.
این اختلاف یک نکته مهم را نشان میدهد: بنچمارکها ابزار اندازهگیریاند، نه حکم نهایی درباره کیفیت یک مدل.
نوع داده، روش آزمایش، ابزارهایی که در اختیار مدل قرار گرفتهاند، تعداد تلاشها و حتی نحوه اجرای آزمون میتواند نتیجه را تغییر دهد.
به همین دلیل، مقایسه حرفهای باید از چند منبع مستقل استفاده کند و تنها به جدول سازنده مدل متکی نباشد.
امنیت سایبری؛ یک تفاوت مهم
در حوزه امنیت سایبری، رقابت این دو مدل ابعاد حساستری پیدا میکند.
OpenAI اعلام کرده GPT-۶ Astra نخستین مدل این شرکت است که در چارچوب Preparedness Framework به سطح Critical از توانایی سایبری رسیده است. طبق ارزیابی OpenAI، Astra در شرایط مناسب و با دسترسی لازم میتواند آسیبپذیریهای ناشناخته را پیدا کرده و روشهای بهرهبرداری از آنها را توسعه دهد. به همین دلیل OpenAI در زمان عرضه، اقدامات حفاظتی بیشتری را برای آن در نظر گرفته است.
Anthropic نیز برای Fable ۵.۱ محدودیتهای امنیتی جدی در نظر گرفته است. این شرکت میگوید Fable ۵.۱ و مدل Mythos ۵.۱ از یک مدل پایه استفاده میکنند، اما Fable برای عرضه عمومی دارای سازوکارهای حفاظتی بیشتری در حوزههایی مانند امنیت سایبری و زیستشناسی است. برخی درخواستهای پرخطر نیز به مدلهای دیگری هدایت میشوند.
این مسئله نشان میدهد رقابت مدلهای جدید فقط بر سر «باهوشتر بودن» نیست؛ کنترلپذیری و ایمنی نیز به یکی از معیارهای اصلی تبدیل شده است.
کدام مدل برای چه کسی مناسبتر است؟
اگر کاربر برنامهنویس یا توسعهدهندهای هستید، هر دو مدل گزینههای بسیار قدرتمندی هستند. Astra روی اجرای وظایف پیچیده و چندمرحلهای، استفاده از کامپیوتر و تولید خروجیهای حرفهای تمرکز زیادی دارد؛ Fable ۵.۱ نیز برای پروژههای طولانی و کار روی کدبیسهای بزرگ طراحی شده است.
اگر پژوهش و تحلیل اسناد بخش اصلی کار شماست، هر دو مدل قابلیتهای جدی دارند و تفاوت واقعی بیشتر به ابزارها، محیط کاری و نوع پروژه بستگی خواهد داشت.
برای سازمانها نیز قیمت اسمی تنها معیار مناسبی نیست. هزینه کش، تعداد مراحل یک وظیفه، میزان نظارت انسانی و تعداد دفعاتی که مدل باید کار را تکرار کند، میتواند هزینه واقعی را تغییر دهد. Fable ۵.۱ در این زمینه با قیمت بسیار پایینتر برای cache read مزیت مشخصی دارد.
در نهایت GPT-۶ Astra بهتر است یا Claude Fable ۵.۱؟
اگر انتظار یک پاسخ یککلمهای دارید، هیچ برنده مطلق و قابلاثباتی در حال حاضر وجود ندارد.
GPT-۶ Astra در توانایی استفاده از کامپیوتر، برخی وظایف حرفهای و تعدادی از بنچمارکهای منتشرشده عملکرد بسیار قدرتمندی دارد. OpenAI نیز آن را مدل اصلی خود برای سختترین کارهای چندمرحلهای معرفی کرده است.
در طرف مقابل، Claude Fable ۵.۱ برای پروژههای طولانی، برنامهنویسی، کار دانشی و عاملهایی که باید ساعتها روی یک مسئله کار کنند، طراحی شده و Anthropic روی کاهش هزینه چنین استفادههایی نیز تمرکز کرده است.
از طرف دیگر، ارزیابیهای مستقل نشان میدهند که اگر معیار را تغییر دهیم، نتیجه نیز میتواند تغییر کند. به همین دلیل، ادعای اینکه یکی از این دو مدل «بهطور کامل دیگری را شکست داده» با شواهد فعلی سازگار نیست.
رقابت اصلی تازه شروع شده است
اهمیت GPT-۶ Astra و Claude Fable ۵.۱ فقط در قدرت خام آنها نیست. اتفاق مهمتر، تغییر ماهیت رقابت هوش مصنوعی است.
نسل جدید مدلها دیگر صرفاً برای پاسخ دادن به سؤالهای کاربران ساخته نمیشوند. آنها باید بتوانند برنامهریزی کنند، ابزار به کار بگیرند، با نرمافزارها تعامل داشته باشند، خطاهای خود را اصلاح کنند و یک پروژه را تا رسیدن به نتیجه دنبال کنند.
Astra و Fable ۵.۱ هر دو نماینده همین تغییر هستند؛ با این تفاوت که هر کدام در بعضی بخشها مزیتهای مشخصی دارند.
در نتیجه، شاید سؤال درست دیگر این نباشد که «GPT-۶ Astra بهتر است یا Claude Fable ۵.۱؟» بلکه باید پرسید:
برای کاری که من میخواهم انجام دهم، کدامیک عملکرد بهتر، هزینه کمتر و کنترل قابلاعتمادتری ارائه میدهد؟
و این رقابت تازه در حال شروع است.
آی تی گیم اخبار فناوری، تکنولوژی و بازی

رقابت اصلی تازه شروع شده است