GPT-۶ Astra در برابر Claude Fable ۵.۱؛ رقابت دو غول هوش مصنوعی وارد مرحله تازه‌ای شد

رقابت میان OpenAI و Anthropic در سال ۲۰۲۶ وارد مرحله‌ای شده که دیگر صرفاً به این سؤال خلاصه نمی‌شود که «کدام چت‌بات پاسخ بهتری می‌دهد؟». هر دو شرکت حالا مدل‌هایی می‌سازند که قرار است بخش‌هایی از یک کار واقعی را به‌جای کاربر انجام دهند؛ از برنامه‌نویسی و پژوهش گرفته تا کار با مرورگر، نرم‌افزارهای حرفه‌ای و انجام وظایف چندمرحله‌ای.a

در همین فضا، Anthropic در اول سپتامبر Claude Fable 5.1 را معرفی کرد و تنها دو روز بعد، OpenAI از GPT-6 Astra رونمایی کرد. فاصله بسیار کوتاه میان این دو عرضه باعث شده مقایسه آن‌ها به یکی از جذاب‌ترین رقابت‌های فعلی بازار هوش مصنوعی تبدیل شود.

اما برخلاف بسیاری از مقایسه‌های عجولانه، پاسخ ساده‌ای برای اینکه «کدام مدل بهتر است» وجود ندارد. Astra در برخی ارزیابی‌ها عملکرد بالاتری دارد، Fable ۵.۱ در برخی شاخص‌های مستقل جلوتر قرار گرفته و هر دو مدل برای نوع متفاوتی از کارهای سنگین طراحی شده‌اند. بنابراین برای انتخاب درست، باید فراتر از چند عدد بنچمارک نگاه کنیم.

GPT-۶ Astra چیست؟

OpenAI، GPT-۶ Astra را جدیدترین و قدرتمندترین مدل خود برای انجام کارهای پیچیده و چندمرحله‌ای معرفی کرده است. این مدل در حوزه‌هایی مانند استدلال، برنامه‌نویسی، پژوهش، استفاده از کامپیوتر، کار با مرورگر، امنیت سایبری و فعالیت‌های حرفه‌ای هدف‌گذاری شده است.

یکی از مهم‌ترین تفاوت‌های Astra با نسل‌های قدیمی‌تر، تمرکز شدید آن بر انجام کار است، نه فقط تولید پاسخ.

برای مثال، OpenAI می‌گوید Astra می‌تواند فرم‌های آنلاین را تکمیل کند، اطلاعات یک CRM را به‌روزرسانی کند، تقویم را مدیریت کند، در وب تحقیق انجام دهد، اسناد و ارائه‌ها بسازد، داده‌های علمی را تحلیل کند و حتی یک وب‌سایت را آزمایش و اشکال‌زدایی کند.

این تغییر جهت اهمیت زیادی دارد؛ زیرا مدل‌های هوش مصنوعی به‌تدریج از ابزارهای پرسش‌وپاسخ به سمت عامل‌های هوشمند حرکت می‌کنند؛ سیستم‌هایی که می‌توانند یک هدف را دریافت کنند و برای رسیدن به آن چندین مرحله را پشت سر بگذارند.

Claude Fable ۵.۱ چیست؟

Anthropic نیز تقریباً با همان فلسفه، Claude Fable ۵.۱ را ساخته است.

این شرکت Fable ۵.۱ را قدرتمندترین مدل خود برای برنامه‌نویسی و کارهای دانشی پیچیده و طولانی‌مدت معرفی می‌کند. این مدل برای پروژه‌هایی طراحی شده که ممکن است ساعت‌ها یا حتی روزها ادامه داشته باشند و نیازمند برنامه‌ریزی، استفاده از ابزارها، بررسی نتیجه و اصلاح خطاها باشند.

Fable ۵.۱ می‌تواند در پروژه‌های بزرگ برنامه‌نویسی روی کل کدبیس کار کند، تست‌های خودش را بنویسد، کد تولیدشده را بررسی کند و حتی خروجی‌های بصری یک پروژه را با هدف اولیه مقایسه کند. Anthropic همچنین استفاده از این مدل را برای پژوهش، تحلیل اسناد، کار با فایل‌های پیچیده و وظایف چندمرحله‌ای سازمانی در نظر گرفته است.

بنابراین تفاوت اصلی در فلسفه این دو مدل چندان زیاد نیست. هر دو شرکت به دنبال ساخت هوش مصنوعی‌هایی هستند که بتوانند وظیفه را تا رسیدن به نتیجه دنبال کنند.

مشخصات دو مدل در یک نگاه

از نظر ظرفیت پردازش متن، هر دو مدل در رده مدل‌های بسیار بزرگ قرار می‌گیرند.

GPT-۶ Astra یک پنجره زمینه ۱.۰۵ میلیون توکن و حداکثر خروجی ۱۲۸ هزار توکن دارد. قیمت پایه API آن نیز ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است.

Claude Fable ۵.۱ نیز با قیمت پایه ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی عرضه شده است. با این حال، Anthropic قیمت خواندن داده‌های کش‌شده را به ۰.۲۵ دلار برای هر میلیون توکن کاهش داده و می‌گوید این تغییر می‌تواند هزینه برخی جریان‌های کاری معمول را حدود ۲۵ درصد و وظایف بسیار عامل‌محور را تا حدود ۴۵ درصد کاهش دهد.

بنابراین اگر تنها به قیمت معمول ورودی و خروجی نگاه کنیم، این دو مدل تقریباً در یک سطح قرار دارند؛ اما هزینه واقعی استفاده می‌تواند با توجه به نحوه استفاده از کش و ساختار وظیفه متفاوت باشد.

در برنامه‌نویسی کدام مدل بهتر است؟

برنامه‌نویسی یکی از مهم‌ترین میدان‌های رقابت Astra و Fable ۵.۱ است.

OpenAI در جدول ارزیابی خودش، Astra را در چند آزمایش مهم بالاتر از Fable ۵.۱ قرار داده است. برای نمونه، در Terminal-Bench 4.0 امتیاز Astra برابر ۵۷.۹ درصد و امتیاز Fable ۵.۱ برابر ۵۵.۸ درصد گزارش شده است. در AutomationBench نیز Astra با ۴۱.۴ درصد در برابر ۳۱.۴ درصد Fable ۵.۱ قرار دارد.

اما همین‌جا باید مراقب یک اشتباه رایج باشیم: جدول OpenAI به‌تنهایی نمی‌تواند ثابت کند Astra در تمام شرایط از Fable ۵.۱ بهتر است.

یک مقایسه مستقل از DataCamp نشان می‌دهد که شاخص‌های داخلی OpenAI و ارزیابی مستقل Artificial Analysis در برخی موارد نتیجه متفاوتی دارند و Artificial Analysis در شاخص‌های اصلی خود Fable ۵.۱ را بالاتر قرار داده است.

بنابراین نتیجه منطقی این نیست که یکی «برنده مطلق» برنامه‌نویسی است. نتیجه دقیق‌تر این است که هر دو مدل در رده بهترین ابزارهای برنامه‌نویسی قرار دارند و نتیجه می‌تواند بر اساس نوع پروژه و روش ارزیابی تغییر کند.

Astra در کار با کامپیوتر چه مزیتی دارد؟

یکی از نقاط قوت برجسته GPT-۶ Astra، توانایی آن در تعامل مستقیم با محیط کامپیوتر است.

OpenAI در ارزیابی‌های خود، Astra را در OSWorld 2.0 با امتیاز ۷۲.۶ درصد و در ScreenSpot-Pro با امتیاز ۹۲.۷ درصد گزارش کرده است. در آزمون Agents’ Last Exam نیز Astra به امتیاز ۵۹.۳ درصد رسیده است.

اهمیت این اعداد در این است که مدل فقط قرار نیست توضیح دهد چگونه یک کار انجام شود؛ بلکه می‌تواند خودش با محیط دیجیتال تعامل داشته باشد.

برای یک کاربر عادی، این قابلیت می‌تواند به معنای انجام کارهایی مانند جست‌وجوی اطلاعات، تکمیل فرم، مدیریت داده‌ها یا آماده‌سازی یک سند باشد. برای شرکت‌ها، اهمیت آن بسیار بیشتر است، زیرا می‌تواند بخشی از فرایندهای کاری تکراری را خودکار کند.

Fable ۵.۱؛ تمرکز روی پروژه‌های طولانی

Anthropic نیز در Fable ۵.۱ روی وظایف طولانی‌مدت تمرکز ویژه‌ای داشته است.

طبق توضیحات رسمی شرکت، این مدل برای پروژه‌هایی طراحی شده که ممکن است ساعت‌ها ادامه پیدا کنند؛ از کار روی یک کدبیس بزرگ گرفته تا پژوهش و انجام وظایف سازمانی پیچیده. Fable ۵.۱ می‌تواند کار را برنامه‌ریزی کند، ابزارهای موردنیاز را انتخاب کند، در صورت شکست یک مرحله تلاش دیگری انجام دهد و وضعیت کار را به کاربر گزارش کند.

Anthropic همچنین می‌گوید Fable ۵.۱ می‌تواند در Claude Code روی پروژه‌های بزرگ نرم‌افزاری کار کند و برای بررسی نتیجه، تست و ارزیابی خروجی نیز از ابزارها استفاده کند.

این ویژگی برای توسعه‌دهندگانی که با پروژه‌های چندساعته یا چندروزه سروکار دارند اهمیت ویژه‌ای دارد.

رقابت در بنچمارک‌ها؛ چرا یک برنده نداریم؟

یکی از جذاب‌ترین نکات درباره رقابت Astra و Fable ۵.۱ این است که حتی اعداد رسمی دو شرکت نیز تصویر کاملاً یکسانی ارائه نمی‌کنند.

OpenAI در جدول خود Astra را در بسیاری از معیارها بالاتر نشان می‌دهد. برای نمونه، در BenchCAD امتیاز Astra برابر ۹۵.۹ درصد و Fable ۵.۱ برابر ۸۴.۳ درصد است. در BrowseComp نیز Astra با ۹۱.۵ درصد در برابر ۹۰.۸ درصد Claude Opus ۵ قرار گرفته است.

اما در همان جدول، شاخص Artificial Analysis Intelligence Index داستان متفاوتی دارد: Fable ۵.۱ امتیاز ۶۵.۷ گرفته، در حالی که Astra به ۶۱.۲ رسیده است.

این اختلاف یک نکته مهم را نشان می‌دهد: بنچمارک‌ها ابزار اندازه‌گیری‌اند، نه حکم نهایی درباره کیفیت یک مدل.

نوع داده، روش آزمایش، ابزارهایی که در اختیار مدل قرار گرفته‌اند، تعداد تلاش‌ها و حتی نحوه اجرای آزمون می‌تواند نتیجه را تغییر دهد.

به همین دلیل، مقایسه حرفه‌ای باید از چند منبع مستقل استفاده کند و تنها به جدول سازنده مدل متکی نباشد.

امنیت سایبری؛ یک تفاوت مهم

در حوزه امنیت سایبری، رقابت این دو مدل ابعاد حساس‌تری پیدا می‌کند.

OpenAI اعلام کرده GPT-۶ Astra نخستین مدل این شرکت است که در چارچوب Preparedness Framework به سطح Critical از توانایی سایبری رسیده است. طبق ارزیابی OpenAI، Astra در شرایط مناسب و با دسترسی لازم می‌تواند آسیب‌پذیری‌های ناشناخته را پیدا کرده و روش‌های بهره‌برداری از آن‌ها را توسعه دهد. به همین دلیل OpenAI در زمان عرضه، اقدامات حفاظتی بیشتری را برای آن در نظر گرفته است.

Anthropic نیز برای Fable ۵.۱ محدودیت‌های امنیتی جدی در نظر گرفته است. این شرکت می‌گوید Fable ۵.۱ و مدل Mythos ۵.۱ از یک مدل پایه استفاده می‌کنند، اما Fable برای عرضه عمومی دارای سازوکارهای حفاظتی بیشتری در حوزه‌هایی مانند امنیت سایبری و زیست‌شناسی است. برخی درخواست‌های پرخطر نیز به مدل‌های دیگری هدایت می‌شوند.

این مسئله نشان می‌دهد رقابت مدل‌های جدید فقط بر سر «باهوش‌تر بودن» نیست؛ کنترل‌پذیری و ایمنی نیز به یکی از معیارهای اصلی تبدیل شده است.

کدام مدل برای چه کسی مناسب‌تر است؟

اگر کاربر برنامه‌نویس یا توسعه‌دهنده‌ای هستید، هر دو مدل گزینه‌های بسیار قدرتمندی هستند. Astra روی اجرای وظایف پیچیده و چندمرحله‌ای، استفاده از کامپیوتر و تولید خروجی‌های حرفه‌ای تمرکز زیادی دارد؛ Fable ۵.۱ نیز برای پروژه‌های طولانی و کار روی کدبیس‌های بزرگ طراحی شده است.

اگر پژوهش و تحلیل اسناد بخش اصلی کار شماست، هر دو مدل قابلیت‌های جدی دارند و تفاوت واقعی بیشتر به ابزارها، محیط کاری و نوع پروژه بستگی خواهد داشت.

برای سازمان‌ها نیز قیمت اسمی تنها معیار مناسبی نیست. هزینه کش، تعداد مراحل یک وظیفه، میزان نظارت انسانی و تعداد دفعاتی که مدل باید کار را تکرار کند، می‌تواند هزینه واقعی را تغییر دهد. Fable ۵.۱ در این زمینه با قیمت بسیار پایین‌تر برای cache read مزیت مشخصی دارد.

در نهایت GPT-۶ Astra بهتر است یا Claude Fable ۵.۱؟

اگر انتظار یک پاسخ یک‌کلمه‌ای دارید، هیچ برنده مطلق و قابل‌اثباتی در حال حاضر وجود ندارد.

GPT-۶ Astra در توانایی استفاده از کامپیوتر، برخی وظایف حرفه‌ای و تعدادی از بنچمارک‌های منتشرشده عملکرد بسیار قدرتمندی دارد. OpenAI نیز آن را مدل اصلی خود برای سخت‌ترین کارهای چندمرحله‌ای معرفی کرده است.

در طرف مقابل، Claude Fable ۵.۱ برای پروژه‌های طولانی، برنامه‌نویسی، کار دانشی و عامل‌هایی که باید ساعت‌ها روی یک مسئله کار کنند، طراحی شده و Anthropic روی کاهش هزینه چنین استفاده‌هایی نیز تمرکز کرده است.

از طرف دیگر، ارزیابی‌های مستقل نشان می‌دهند که اگر معیار را تغییر دهیم، نتیجه نیز می‌تواند تغییر کند. به همین دلیل، ادعای اینکه یکی از این دو مدل «به‌طور کامل دیگری را شکست داده» با شواهد فعلی سازگار نیست.

رقابت اصلی تازه شروع شده است

اهمیت GPT-۶ Astra و Claude Fable ۵.۱ فقط در قدرت خام آن‌ها نیست. اتفاق مهم‌تر، تغییر ماهیت رقابت هوش مصنوعی است.

نسل جدید مدل‌ها دیگر صرفاً برای پاسخ دادن به سؤال‌های کاربران ساخته نمی‌شوند. آن‌ها باید بتوانند برنامه‌ریزی کنند، ابزار به کار بگیرند، با نرم‌افزارها تعامل داشته باشند، خطاهای خود را اصلاح کنند و یک پروژه را تا رسیدن به نتیجه دنبال کنند.

Astra و Fable ۵.۱ هر دو نماینده همین تغییر هستند؛ با این تفاوت که هر کدام در بعضی بخش‌ها مزیت‌های مشخصی دارند.

در نتیجه، شاید سؤال درست دیگر این نباشد که «GPT-۶ Astra بهتر است یا Claude Fable ۵.۱؟» بلکه باید پرسید:

برای کاری که من می‌خواهم انجام دهم، کدام‌یک عملکرد بهتر، هزینه کمتر و کنترل قابل‌اعتماد‌تری ارائه می‌دهد؟

و این رقابت تازه در حال شروع است.

همچنین ببینید

SSDهای نسل جدید وارد بازار می‌شوند؛ سرعت ذخیره‌سازی به کجا می‌رسد؟

سال‌هاست سرعت SSDها با هر نسل جدید رابط PCIe افزایش پیدا می‌کند؛ اما در سال …

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *