آنتروپیک از Claude Opus 5.5، نخستین مدل از نسل جدید Claude 5.5، رونمایی کرده است؛ مدلی که در بسیاری از وظایف عملکردی نزدیک به Claude Fable 5.1 ارائه میدهد و در مقایسه با Opus 5 هزینه کمتری دارد.
آنتروپیک نسل جدید مدلهای هوش مصنوعی خود را با معرفی Claude Opus 5.5 آغاز کرده است. این مدل بهعنوان پرچمدار جدید شرکت، روی انجام کارهای پیچیده، برنامهنویسی، پژوهش، تحلیل اطلاعات و استفاده عاملمحور از رایانه تمرکز دارد.
به گفته آنتروپیک، Opus 5.5 در کنار افزایش تواناییهای فنی، از نظر بهرهوری نیز نسبت به نسل قبلی پیشرفت کرده است. یکی از نمونههای مطرحشده توسط شرکت، مهاجرت یک پروژه با حدود ۶۸۰ هزار خط کد است که یک آزمایشکننده توانسته آن را در کمتر از یک روز با کمک این مدل انجام دهد؛ کاری که در شرایط معمول ممکن است هفتهها زمان ببرد.
جدیدترین اخبار روز تکنولوژی در کانال تلگرام آونگ
Claude Opus 5.5 چقدر سریعتر و ارزانتر شده است؟
یکی از مهمترین تغییرات Opus 5.5 به هزینه استفاده از آن مربوط میشود. آنتروپیک میگوید این مدل برای انجام وظایف مشابه، به توان پردازشی کمتری نسبت به Opus 5 نیاز دارد و همین موضوع باعث شده هزینه اجرای آن کاهش پیدا کند.
بر اساس اطلاعات اعلامشده، استفاده از یک میلیون توکن ورودی در Opus 5.5 برابر با ۴ دلار و یک میلیون توکن خروجی برابر با ۲۰ دلار هزینه دارد. هزینه خواندن توکنهای کششده نیز به ۰.۲۰ دلار برای هر میلیون توکن میرسد.
این بخش برای کارهای طولانی و عاملمحور اهمیت زیادی دارد؛ زیرا مدل در چنین فرایندهایی بارها به اطلاعات قبلی مراجعه میکند و کاهش هزینه توکنهای کششده میتواند هزینه نهایی اجرای پروژه را پایین بیاورد.
آنتروپیک همچنین اعلام کرده Opus 5.5 در تولید خروجی بیش از ۳۰ درصد سریعتر از Opus 5 عمل میکند. در مجموع، این شرکت کاهش حدود ۴۰ درصدی هزینه اجرای مدل را در تنظیمات پیشفرض و وظایف معمول گزارش کرده است.
برای کاربرانی که به سرعت بیشتری نیاز دارند، حالت Fast نیز در Claude Code و Claude Platform ارائه شده است. این حالت میتواند سرعت اجرای مدل را تا ۲.۵ برابر افزایش دهد و هزینه آن برای هر یک میلیون توکن ورودی ۸ دلار و برای هر یک میلیون توکن خروجی ۴۰ دلار اعلام شده است.
آنتروپیک علاوه بر تغییرات قیمتی، محدودیتهای استفاده پنجساعته در برخی پلنهای اشتراکی ازجمله Pro، Max و Team را نیز افزایش داده است.
عملکرد Claude Opus 5.5 در بنچمارکها
آنتروپیک در ارزیابیهای خود، Opus 5.5 را یکی از قدرتمندترین مدلهای موجود برای کدنویسی عاملمحور، استفاده از رایانه و انجام وظایف دانشمحور معرفی میکند.
بااینحال، خود شرکت تأکید دارد که در سطح فعلی مدلهای هوش مصنوعی، اختلاف چند امتیازی در بنچمارکها الزاماً به معنای تفاوت مشابه در استفاده واقعی نیست. در آزمایشهای داخلی آنتروپیک نیز فاصله میان Opus 5.5 و Fable 5.1 در برخی وظایف کمتر از چیزی بوده که نتایج بنچمارکها نشان میداد.
نقطه قوت مهمتر Opus 5.5 به بهرهوری مربوط میشود. این مدل هم هزینه کمتری برای هر توکن دارد و هم در بسیاری از وظایف میتواند کار را با تعداد توکن کمتری به پایان برساند. ترکیب این دو عامل، به گفته آنتروپیک، هزینه کلی انجام برخی وظایف را تا حدود ۴۰ درصد کاهش میدهد.
Claude Opus 5.5 در برنامهنویسی چه تواناییهایی دارد؟
برنامهنویسی یکی از اصلیترین حوزههایی است که Opus 5.5 برای آن بهینه شده است. مدل جدید میتواند در پروژههای طولانی و چندمرحلهای، از بررسی کد گرفته تا اصلاح، مهاجرت و بهینهسازی، نقش یک عامل نرمافزاری را ایفا کند.
در یکی از آزمایشهای ارائهشده توسط آنتروپیک، یک آزمایشکننده از Opus 5.5 برای بررسی و اصلاح یک پایگاه کد ۲۰۰ هزار خطی استفاده کرده است. این فرایند کمتر از سه ساعت طول کشید؛ درحالیکه Opus 5 برای انجام همان کار بیش از ۲۰ ساعت زمان نیاز داشت و حدود ۲.۵ برابر توکن بیشتری مصرف کرد.
توانایی مدل در بهینهسازی نرمافزار نیز مورد توجه قرار گرفته است. در آزمایشی که هدف آن کاهش زمان بارگذاری صفحات یک اپلیکیشن وب بود، Opus 5.5 در ۳۹ مورد از ۴۰ مورد توانست بهبود ایجاد کند. در مقابل، Opus 5 تغییرات محدودتری ایجاد کرد که در برخی موارد رفتار اپلیکیشن را نیز تغییر میداد.
آنتروپیک در آزمایش دیگری از Opus 5.5 و Fable 5.1 خواست نرمافزار HAProxy را از زبان C به Rust منتقل کنند. هر دو مدل توانستند تقریباً تمام آزمونهای رگرسیون پروژه را با موفقیت پشت سر بگذارند، اما Opus 5.5 این فرایند را در حدود ۹.۵ ساعت به پایان رساند؛ درحالیکه Fable 5.1 به حدود ۱۲ ساعت زمان نیاز داشت. هزینه اجرای Opus 5.5 نیز در این آزمایش ۵۱ درصد کمتر گزارش شده است.
در آزمونهای مرتبط با کدنویسی عاملمحور نیز آنتروپیک نتایج رقابتی برای مدل جدید خود گزارش میکند. برای مثال، Opus 5.5 در سطح تلاش پیشفرض FrontierCode توانسته GPT-6 Astra را با هزینهای حدود ۲۰ درصدی نسبت به هر کار پشت سر بگذارد. در Terminal Bench 4.0 نیز عملکردی نزدیک به Astra با هزینهای حدود ۴۰ درصد از آن مدل ارائه کرده است.
در CursorBench نیز Opus 5.5 با هزینهای حدود یکسوم GPT-5.6 Sol، امتیاز بالاتری کسب کرده است.
توانایی Opus 5.5 در کارهای دانشمحور
آنتروپیک Opus 5.5 را تنها یک مدل برنامهنویسی نمیداند و قابلیتهای آن در پژوهش، تحلیل و پردازش اطلاعات نیز بخش مهمی از معرفی این مدل است.
در یکی از آزمایشهای داخلی، Opus 5.5، Fable 5.1 و Opus 5 مأمور شدند گزارشی درباره عملکرد فصلی یک شرکت تهیه کنند. مدلها باید اطلاعات مورد نیاز را از نسخهای از وب پیدا میکردند که دسترسی به گزارشهای مالی در آن چندان ساده نبود.
برای بررسی کیفیت پاسخها، یک سیستم ارزیابی خودکار اعداد و نقلقولهای موجود در گزارشها را با منابع اصلی تطبیق داد. در تنظیمات مختلف میزان تلاش، ۱۶ مورد از ۱۸ گزارش تولیدشده توسط Opus 5.5 توانستند معیار کیفی تعیینشده توسط آنتروپیک را پشت سر بگذارند. وجود حتی یک عدد یا نقلقول ساختگی برای رد شدن گزارش کافی بود.
در همین ارزیابی، Fable 5.1 و Opus 5 نتوانستند در هیچیک از تلاشهای خود از معیار تعیینشده عبور کنند.
Opus 5.5 در تحلیل مالی و وظایف تجاری نیز مورد آزمایش قرار گرفته است. Walleye Capital، یکی از آزمایشکنندگان اولیه، اعلام کرده که مدل حتی در پایینترین سطح تنظیمات توانسته بخش قابلتوجهی از آزمونهای ارزیابی این شرکت را حل کند.
با افزایش سطح تلاش، عملکرد مدل نیز بهتر شده و در یکی از موارد حتی توانسته خطایی را در دستورالعملهای ارزیابی شناسایی کند؛ خطایی که طبق گزارش ارائهشده، مدلهای دیگری پیش از آن متوجه آن نشده بودند.
در بنچمارک GDPval-AA v2.1 که وظایف واقعی مربوط به ۴۴ شغل را بررسی میکند، Opus 5.5 امتیاز ۱۸۴۶ Elo به دست آورده است. آنتروپیک همچنین اعلام کرده این مدل در برخی وظایف دانشمحور، درحالیکه توکن کمتری مصرف میکند، عملکرد بهتری نسبت به مدلهای قبلی دارد.
ایمنی و همسویی Claude Opus 5.5
افزایش توانایی مدلهای هوش مصنوعی، موضوع ایمنی و کنترل رفتار آنها را نیز مهمتر میکند. آنتروپیک میگوید Opus 5.5 پیش از عرضه تحت مجموعهای از ارزیابیهای ایمنی قرار گرفته است.
این فرایند شامل آزمونهای مختلف همسویی، ارزیابیهای پیش از عرضه توسط سازمانهای خارجی مانند METR و Frontier Design و بررسیهای اختصاصی برای حوزههای حساس مانند امنیت سایبری و زیستشناسی میشود.
آنتروپیک اعلام کرده اقدامات ایمنی خود را متناسب با قابلیتهای هر نسل از مدلها بهروزرسانی میکند. این شرکت در عین حال تأکید دارد که هیچ سیستم ارزیابی فعلی نمیتواند تمام رفتارهای مشکلساز یک مدل را پیش از عرضه با اطمینان شناسایی کند.
در یک مجموعه ارزیابی رفتاری که نزدیک به ۲ هزار سناریو را بررسی میکند، Opus 5.5 در تقریباً تمام معیارهای مربوط به رفتارهای ناهماهنگ عملکرد بهتری نسبت به مدلهای اخیر Claude داشته است. این مدل همچنین در بخش قابلتوجهی از معیارهای مربوط به صداقت، نتایج قدرتمندی به دست آورده است.
یکی دیگر از آزمایشها به بررسی تمایل مدل برای عبور از محدودیتهای تعیینشده اختصاص داشت. طبق نتایج اعلامشده توسط آنتروپیک، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 تلاش کرده است این محدودیتها را دور بزند.
بااینحال، آنتروپیک میگوید یکی از چالشهای مهم همچنان این است که مدلها ممکن است متوجه شوند در حال ارزیابی شدن هستند. همین مسئله میتواند سنجش رفتار واقعی آنها در محیطهای متنوع را دشوار کند.
امنیت سایبری؛ قابلیت قدرتمند با دسترسی کنترلشده
Opus 5.5 در حوزه امنیت سایبری نیز توانایی بالایی دارد؛ به همین دلیل آنتروپیک برای استفاده از آن در این زمینه محدودیتهای بیشتری در نظر گرفته است.
کاربران میتوانند از این مدل در فرایند معمول توسعه نرمافزار برای پیدا کردن و اصلاح آسیبپذیریهای کد استفاده کنند، اما بسیاری از وظایف تخصصیتر امنیت سایبری همچنان به مدلهای دیگر هدایت خواهند شد.
آنتروپیک همچنین قصد دارد Cyber Verification Program را گسترش دهد. این برنامه به متخصصان تأییدشده حوزه دفاع سایبری اجازه میدهد از قابلیتهای Opus 5.5 در پروژههای تخصصی خود استفاده کنند.
این برنامه قرار است در سه سطح دسترسی ارائه شود و برخی مدلهای قدرتمندتر Claude را نیز پوشش دهد.
Claude Opus 5.5 در حوزه زیستشناسی
زیستشناسی یکی دیگر از حوزههایی است که Opus 5.5 در آن عملکرد قابلتوجهی نشان داده است.
طبق اعلام آنتروپیک، این مدل در بسیاری از وظایف زیستی از Opus 5 بهتر عمل میکند و در برخی زمینهها عملکردی همسطح یا حتی بهتر از Claude Mythos 5.1 دارد.
برای نمونه، Opus 5.5 در یک ارزیابی مرتبط با پیشبینی و طراحی مولکولی بلندمدت که با همکاری Dyno Therapeutics انجام شده، پیشرفتهایی داشته است. ارزیابان متخصص نیز کیفیت و نوآوری علمی نتایج این مدل را در سطح بهترین مدلهایی ارزیابی کردهاند که در این آزمایش مورد بررسی قرار گرفتهاند.
به دلیل حساسیت چنین کاربردهایی، آنتروپیک برای استفاده از Opus 5.5 در پژوهشهای زیستشناسی نیز برنامه تأیید دسترسی در نظر گرفته است. سازمانهای واجد شرایط میتوانند از طریق Life Sciences Verification Program برای استفاده تخصصی از مدل درخواست دهند.
Claude Opus 5.5 چه زمانی و کجا عرضه شده است؟
Claude Opus 5.5 اکنون در پلتفرمهای مختلف در دسترس قرار گرفته است. کاربران میتوانند از این مدل در سرویسهای ابری Amazon Web Services و Google Cloud و همچنین Microsoft Azure استفاده کنند.
توسعهدهندگان نیز از طریق Claude Platform امکان استفاده مستقیم از مدل با شناسه claude-opus-5-5 را دارند.
آنتروپیک همچنین اعلام کرده مدلهای Claude Sonnet 5.5 و Claude Haiku 5.5 در هفتههای آینده عرضه خواهند شد. انتظار میرود این مدلها نیز بخشی از پیشرفتهای مربوط به عملکرد، بهرهوری و ایمنی Opus 5.5 را به نسلهای بعدی خانواده Claude منتقل کنند.
جمعبندی
Claude Opus 5.5 را میتوان گامی در جهت ترکیب توان پردازشی بالاتر با هزینه اجرای پایینتر دانست. آنتروپیک در این نسل تلاش کرده علاوه بر افزایش توانایی مدل در برنامهنویسی، پژوهش و انجام وظایف پیچیده، مصرف توکن و هزینه اجرای آن را نیز کاهش دهد.
توانایی انجام پروژههای نرمافزاری طولانی، تحلیل اطلاعات، تولید گزارشهای دقیقتر و عملکرد بهتر در برخی بنچمارکها از مهمترین ویژگیهای اعلامشده برای این مدل هستند. در کنار این موارد، آنتروپیک توجه ویژهای به کنترل دسترسی در حوزههای حساسی مانند امنیت سایبری و زیستشناسی داشته است.
با گسترش استفاده از مدلهای هوش مصنوعی در برنامهنویسی، پژوهش و کسبوکار، اهمیت زیرساختهای ذخیرهسازی و تجهیزات فناوری نیز بیشتر میشود. اگر برای تجهیزات دیجیتال خود به پشتیبانی و خدمات پس از فروش مطمئن نیاز دارید، گارانتی آونگ با ارائه خدمات تخصصی و پشتیبانی پس از فروش، میتواند خیال شما را از بابت نگهداری و استفاده مطمئنتر از محصولات فناوری راحت کند.

