آونگ، گارانتی بی‌رقیب — از سال ۱۳۸۵
مرکز پاسخگویی1665 استعلام پیامکی 100001665
مجله آونگ

آنتروپیک از Claude Opus 5.5 رونمایی کرد؛ مدل جدید با هزینه کمتر و عملکرد قدرتمند

Claude Opus 5.5
آنـچه در این مقاله می‌خوانیم

آنتروپیک از Claude Opus 5.5، نخستین مدل از نسل جدید Claude 5.5، رونمایی کرده است؛ مدلی که در بسیاری از وظایف عملکردی نزدیک به Claude Fable 5.1 ارائه می‌دهد و در مقایسه با Opus 5 هزینه کمتری دارد.

آنتروپیک نسل جدید مدل‌های هوش مصنوعی خود را با معرفی Claude Opus 5.5 آغاز کرده است. این مدل به‌عنوان پرچم‌دار جدید شرکت، روی انجام کارهای پیچیده، برنامه‌نویسی، پژوهش، تحلیل اطلاعات و استفاده عامل‌محور از رایانه تمرکز دارد.

به گفته آنتروپیک، Opus 5.5 در کنار افزایش توانایی‌های فنی، از نظر بهره‌وری نیز نسبت به نسل قبلی پیشرفت کرده است. یکی از نمونه‌های مطرح‌شده توسط شرکت، مهاجرت یک پروژه با حدود ۶۸۰ هزار خط کد است که یک آزمایش‌کننده توانسته آن را در کمتر از یک روز با کمک این مدل انجام دهد؛ کاری که در شرایط معمول ممکن است هفته‌ها زمان ببرد.

Claude Opus 5.5 چقدر سریع‌تر و ارزان‌تر شده است؟

یکی از مهم‌ترین تغییرات Opus 5.5 به هزینه استفاده از آن مربوط می‌شود. آنتروپیک می‌گوید این مدل برای انجام وظایف مشابه، به توان پردازشی کمتری نسبت به Opus 5 نیاز دارد و همین موضوع باعث شده هزینه اجرای آن کاهش پیدا کند.

بر اساس اطلاعات اعلام‌شده، استفاده از یک میلیون توکن ورودی در Opus 5.5 برابر با ۴ دلار و یک میلیون توکن خروجی برابر با ۲۰ دلار هزینه دارد. هزینه خواندن توکن‌های کش‌شده نیز به ۰.۲۰ دلار برای هر میلیون توکن می‌رسد.

این بخش برای کارهای طولانی و عامل‌محور اهمیت زیادی دارد؛ زیرا مدل در چنین فرایندهایی بارها به اطلاعات قبلی مراجعه می‌کند و کاهش هزینه توکن‌های کش‌شده می‌تواند هزینه نهایی اجرای پروژه را پایین بیاورد.

آنتروپیک همچنین اعلام کرده Opus 5.5 در تولید خروجی بیش از ۳۰ درصد سریع‌تر از Opus 5 عمل می‌کند. در مجموع، این شرکت کاهش حدود ۴۰ درصدی هزینه اجرای مدل را در تنظیمات پیش‌فرض و وظایف معمول گزارش کرده است.

برای کاربرانی که به سرعت بیشتری نیاز دارند، حالت Fast نیز در Claude Code و Claude Platform ارائه شده است. این حالت می‌تواند سرعت اجرای مدل را تا ۲.۵ برابر افزایش دهد و هزینه آن برای هر یک میلیون توکن ورودی ۸ دلار و برای هر یک میلیون توکن خروجی ۴۰ دلار اعلام شده است.

آنتروپیک علاوه بر تغییرات قیمتی، محدودیت‌های استفاده پنج‌ساعته در برخی پلن‌های اشتراکی ازجمله Pro، Max و Team را نیز افزایش داده است.

عملکرد Claude Opus 5.5 در بنچمارک‌ها

آنتروپیک در ارزیابی‌های خود، Opus 5.5 را یکی از قدرتمندترین مدل‌های موجود برای کدنویسی عامل‌محور، استفاده از رایانه و انجام وظایف دانش‌محور معرفی می‌کند.

بااین‌حال، خود شرکت تأکید دارد که در سطح فعلی مدل‌های هوش مصنوعی، اختلاف چند امتیازی در بنچمارک‌ها الزاماً به معنای تفاوت مشابه در استفاده واقعی نیست. در آزمایش‌های داخلی آنتروپیک نیز فاصله میان Opus 5.5 و Fable 5.1 در برخی وظایف کمتر از چیزی بوده که نتایج بنچمارک‌ها نشان می‌داد.

نقطه قوت مهم‌تر Opus 5.5 به بهره‌وری مربوط می‌شود. این مدل هم هزینه کمتری برای هر توکن دارد و هم در بسیاری از وظایف می‌تواند کار را با تعداد توکن کمتری به پایان برساند. ترکیب این دو عامل، به گفته آنتروپیک، هزینه کلی انجام برخی وظایف را تا حدود ۴۰ درصد کاهش می‌دهد.

Claude Opus 5.5 در برنامه‌نویسی چه توانایی‌هایی دارد؟

برنامه‌نویسی یکی از اصلی‌ترین حوزه‌هایی است که Opus 5.5 برای آن بهینه شده است. مدل جدید می‌تواند در پروژه‌های طولانی و چندمرحله‌ای، از بررسی کد گرفته تا اصلاح، مهاجرت و بهینه‌سازی، نقش یک عامل نرم‌افزاری را ایفا کند.

در یکی از آزمایش‌های ارائه‌شده توسط آنتروپیک، یک آزمایش‌کننده از Opus 5.5 برای بررسی و اصلاح یک پایگاه کد ۲۰۰ هزار خطی استفاده کرده است. این فرایند کمتر از سه ساعت طول کشید؛ درحالی‌که Opus 5 برای انجام همان کار بیش از ۲۰ ساعت زمان نیاز داشت و حدود ۲.۵ برابر توکن بیشتری مصرف کرد.

توانایی مدل در بهینه‌سازی نرم‌افزار نیز مورد توجه قرار گرفته است. در آزمایشی که هدف آن کاهش زمان بارگذاری صفحات یک اپلیکیشن وب بود، Opus 5.5 در ۳۹ مورد از ۴۰ مورد توانست بهبود ایجاد کند. در مقابل، Opus 5 تغییرات محدودتری ایجاد کرد که در برخی موارد رفتار اپلیکیشن را نیز تغییر می‌داد.

آنتروپیک در آزمایش دیگری از Opus 5.5 و Fable 5.1 خواست نرم‌افزار HAProxy را از زبان C به Rust منتقل کنند. هر دو مدل توانستند تقریباً تمام آزمون‌های رگرسیون پروژه را با موفقیت پشت سر بگذارند، اما Opus 5.5 این فرایند را در حدود ۹.۵ ساعت به پایان رساند؛ درحالی‌که Fable 5.1 به حدود ۱۲ ساعت زمان نیاز داشت. هزینه اجرای Opus 5.5 نیز در این آزمایش ۵۱ درصد کمتر گزارش شده است.

در آزمون‌های مرتبط با کدنویسی عامل‌محور نیز آنتروپیک نتایج رقابتی برای مدل جدید خود گزارش می‌کند. برای مثال، Opus 5.5 در سطح تلاش پیش‌فرض FrontierCode توانسته GPT-6 Astra را با هزینه‌ای حدود ۲۰ درصدی نسبت به هر کار پشت سر بگذارد. در Terminal Bench 4.0 نیز عملکردی نزدیک به Astra با هزینه‌ای حدود ۴۰ درصد از آن مدل ارائه کرده است.

در CursorBench نیز Opus 5.5 با هزینه‌ای حدود یک‌سوم GPT-5.6 Sol، امتیاز بالاتری کسب کرده است.

توانایی Opus 5.5 در کارهای دانش‌محور

آنتروپیک Opus 5.5 را تنها یک مدل برنامه‌نویسی نمی‌داند و قابلیت‌های آن در پژوهش، تحلیل و پردازش اطلاعات نیز بخش مهمی از معرفی این مدل است.

در یکی از آزمایش‌های داخلی، Opus 5.5، Fable 5.1 و Opus 5 مأمور شدند گزارشی درباره عملکرد فصلی یک شرکت تهیه کنند. مدل‌ها باید اطلاعات مورد نیاز را از نسخه‌ای از وب پیدا می‌کردند که دسترسی به گزارش‌های مالی در آن چندان ساده نبود.

برای بررسی کیفیت پاسخ‌ها، یک سیستم ارزیابی خودکار اعداد و نقل‌قول‌های موجود در گزارش‌ها را با منابع اصلی تطبیق داد. در تنظیمات مختلف میزان تلاش، ۱۶ مورد از ۱۸ گزارش تولیدشده توسط Opus 5.5 توانستند معیار کیفی تعیین‌شده توسط آنتروپیک را پشت سر بگذارند. وجود حتی یک عدد یا نقل‌قول ساختگی برای رد شدن گزارش کافی بود.

در همین ارزیابی، Fable 5.1 و Opus 5 نتوانستند در هیچ‌یک از تلاش‌های خود از معیار تعیین‌شده عبور کنند.

Opus 5.5 در تحلیل مالی و وظایف تجاری نیز مورد آزمایش قرار گرفته است. Walleye Capital، یکی از آزمایش‌کنندگان اولیه، اعلام کرده که مدل حتی در پایین‌ترین سطح تنظیمات توانسته بخش قابل‌توجهی از آزمون‌های ارزیابی این شرکت را حل کند.

با افزایش سطح تلاش، عملکرد مدل نیز بهتر شده و در یکی از موارد حتی توانسته خطایی را در دستورالعمل‌های ارزیابی شناسایی کند؛ خطایی که طبق گزارش ارائه‌شده، مدل‌های دیگری پیش از آن متوجه آن نشده بودند.

در بنچمارک GDPval-AA v2.1 که وظایف واقعی مربوط به ۴۴ شغل را بررسی می‌کند، Opus 5.5 امتیاز ۱۸۴۶ Elo به دست آورده است. آنتروپیک همچنین اعلام کرده این مدل در برخی وظایف دانش‌محور، درحالی‌که توکن کمتری مصرف می‌کند، عملکرد بهتری نسبت به مدل‌های قبلی دارد.

ایمنی و همسویی Claude Opus 5.5

افزایش توانایی مدل‌های هوش مصنوعی، موضوع ایمنی و کنترل رفتار آنها را نیز مهم‌تر می‌کند. آنتروپیک می‌گوید Opus 5.5 پیش از عرضه تحت مجموعه‌ای از ارزیابی‌های ایمنی قرار گرفته است.

این فرایند شامل آزمون‌های مختلف همسویی، ارزیابی‌های پیش از عرضه توسط سازمان‌های خارجی مانند METR و Frontier Design و بررسی‌های اختصاصی برای حوزه‌های حساس مانند امنیت سایبری و زیست‌شناسی می‌شود.

آنتروپیک اعلام کرده اقدامات ایمنی خود را متناسب با قابلیت‌های هر نسل از مدل‌ها به‌روزرسانی می‌کند. این شرکت در عین حال تأکید دارد که هیچ سیستم ارزیابی فعلی نمی‌تواند تمام رفتارهای مشکل‌ساز یک مدل را پیش از عرضه با اطمینان شناسایی کند.

در یک مجموعه ارزیابی رفتاری که نزدیک به ۲ هزار سناریو را بررسی می‌کند، Opus 5.5 در تقریباً تمام معیارهای مربوط به رفتارهای ناهماهنگ عملکرد بهتری نسبت به مدل‌های اخیر Claude داشته است. این مدل همچنین در بخش قابل‌توجهی از معیارهای مربوط به صداقت، نتایج قدرتمندی به دست آورده است.

یکی دیگر از آزمایش‌ها به بررسی تمایل مدل برای عبور از محدودیت‌های تعیین‌شده اختصاص داشت. طبق نتایج اعلام‌شده توسط آنتروپیک، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 تلاش کرده است این محدودیت‌ها را دور بزند.

بااین‌حال، آنتروپیک می‌گوید یکی از چالش‌های مهم همچنان این است که مدل‌ها ممکن است متوجه شوند در حال ارزیابی شدن هستند. همین مسئله می‌تواند سنجش رفتار واقعی آنها در محیط‌های متنوع را دشوار کند.

امنیت سایبری؛ قابلیت قدرتمند با دسترسی کنترل‌شده

Opus 5.5 در حوزه امنیت سایبری نیز توانایی بالایی دارد؛ به همین دلیل آنتروپیک برای استفاده از آن در این زمینه محدودیت‌های بیشتری در نظر گرفته است.

کاربران می‌توانند از این مدل در فرایند معمول توسعه نرم‌افزار برای پیدا کردن و اصلاح آسیب‌پذیری‌های کد استفاده کنند، اما بسیاری از وظایف تخصصی‌تر امنیت سایبری همچنان به مدل‌های دیگر هدایت خواهند شد.

آنتروپیک همچنین قصد دارد Cyber Verification Program را گسترش دهد. این برنامه به متخصصان تأییدشده حوزه دفاع سایبری اجازه می‌دهد از قابلیت‌های Opus 5.5 در پروژه‌های تخصصی خود استفاده کنند.

این برنامه قرار است در سه سطح دسترسی ارائه شود و برخی مدل‌های قدرتمندتر Claude را نیز پوشش دهد.

Claude Opus 5.5 در حوزه زیست‌شناسی

زیست‌شناسی یکی دیگر از حوزه‌هایی است که Opus 5.5 در آن عملکرد قابل‌توجهی نشان داده است.

طبق اعلام آنتروپیک، این مدل در بسیاری از وظایف زیستی از Opus 5 بهتر عمل می‌کند و در برخی زمینه‌ها عملکردی هم‌سطح یا حتی بهتر از Claude Mythos 5.1 دارد.

برای نمونه، Opus 5.5 در یک ارزیابی مرتبط با پیش‌بینی و طراحی مولکولی بلندمدت که با همکاری Dyno Therapeutics انجام شده، پیشرفت‌هایی داشته است. ارزیابان متخصص نیز کیفیت و نوآوری علمی نتایج این مدل را در سطح بهترین مدل‌هایی ارزیابی کرده‌اند که در این آزمایش مورد بررسی قرار گرفته‌اند.

به دلیل حساسیت چنین کاربردهایی، آنتروپیک برای استفاده از Opus 5.5 در پژوهش‌های زیست‌شناسی نیز برنامه تأیید دسترسی در نظر گرفته است. سازمان‌های واجد شرایط می‌توانند از طریق Life Sciences Verification Program برای استفاده تخصصی از مدل درخواست دهند.

Claude Opus 5.5 چه زمانی و کجا عرضه شده است؟

Claude Opus 5.5 اکنون در پلتفرم‌های مختلف در دسترس قرار گرفته است. کاربران می‌توانند از این مدل در سرویس‌های ابری Amazon Web Services و Google Cloud و همچنین Microsoft Azure استفاده کنند.

توسعه‌دهندگان نیز از طریق Claude Platform امکان استفاده مستقیم از مدل با شناسه claude-opus-5-5 را دارند.

آنتروپیک همچنین اعلام کرده مدل‌های Claude Sonnet 5.5 و Claude Haiku 5.5 در هفته‌های آینده عرضه خواهند شد. انتظار می‌رود این مدل‌ها نیز بخشی از پیشرفت‌های مربوط به عملکرد، بهره‌وری و ایمنی Opus 5.5 را به نسل‌های بعدی خانواده Claude منتقل کنند.

جمع‌بندی

Claude Opus 5.5 را می‌توان گامی در جهت ترکیب توان پردازشی بالاتر با هزینه اجرای پایین‌تر دانست. آنتروپیک در این نسل تلاش کرده علاوه بر افزایش توانایی مدل در برنامه‌نویسی، پژوهش و انجام وظایف پیچیده، مصرف توکن و هزینه اجرای آن را نیز کاهش دهد.

توانایی انجام پروژه‌های نرم‌افزاری طولانی، تحلیل اطلاعات، تولید گزارش‌های دقیق‌تر و عملکرد بهتر در برخی بنچمارک‌ها از مهم‌ترین ویژگی‌های اعلام‌شده برای این مدل هستند. در کنار این موارد، آنتروپیک توجه ویژه‌ای به کنترل دسترسی در حوزه‌های حساسی مانند امنیت سایبری و زیست‌شناسی داشته است.

با گسترش استفاده از مدل‌های هوش مصنوعی در برنامه‌نویسی، پژوهش و کسب‌وکار، اهمیت زیرساخت‌های ذخیره‌سازی و تجهیزات فناوری نیز بیشتر می‌شود. اگر برای تجهیزات دیجیتال خود به پشتیبانی و خدمات پس از فروش مطمئن نیاز دارید، گارانتی آونگ با ارائه خدمات تخصصی و پشتیبانی پس از فروش، می‌تواند خیال شما را از بابت نگهداری و استفاده مطمئن‌تر از محصولات فناوری راحت کند.

آنـچه در این مقاله می‌خوانیم

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *