Anthropic در ۲۸ سپتامبر ۲۰۲۶ از Claude Sonnet 5.5 رونمایی کرد؛ دومین مدل از خانوادهی Claude 5.5 بعد از Opus 5.5. به گفتهی Anthropic، این مدل نسبت به Sonnet 5 بیش از ۳۰ درصد سریعتر است و برای بیشتر کارها تا ۳۰ درصد ارزانتر تمام میشود. در این مقاله اعداد، محدودیتها و نکات عملی این مدل را بررسی میکنیم.
همهی بنچمارکهای این مقاله توسط خود Anthropic گزارش شدهاند، مگر جایی که خلاف آن ذکر شود. بررسی مستقل بیشتر آنها هنوز منتشر نشده است.
Sonnet 5.5 در خانوادهی Claude 5.5 کجا قرار میگیرد؟
Anthropic این مدل را مکمل سریعتر و ارزانتر Opus 5.5 معرفی میکند. Opus 5.5 برای کارهای پیچیدهای ساخته شده که قضاوت دقیق میخواهند. Sonnet 5.5 روی کارهای مشخص و روزمره، رفع باگ و تولید سند، اسلاید و صفحهگسترده قویتر است. مدل سوم این خانواده، Claude Haiku 5.5، طبق وعدهی Anthropic طی چند هفتهی آینده میآید.
عملکرد: اعداد چه میگویند؟
| بنچمارک | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 (کدنویسی عاملمحور) | ۷۰٫۶٪ | ۱۰٫۳٪ | ۶۶٫۴٪ |
| CursorBench 4.0 | ۵۵٫۵٪ | ۳۴٫۱٪ | ۵۷٫۸٪ |
| GDPval-AA v2.1 (کار دانشی) | ۱۸۴۴ | ۱۴۴۹ | ۱۸۴۶ |
| OSWorld 2.1 (کنترل کامپیوتر) | ۸۰٫۱٪ | ۵۷٫۰٪ | ۸۱٫۸٪ |
| Humanity's Last Exam (با ابزار) | ۶۴٫۵٪ | ۵۴٫۹٪ | ۶۷٫۷٪ |
چند نکتهی مهم دربارهی این جدول:
- Sonnet 5.5 فقط در Terminal-Bench از Opus 5.5 جلوتر است، و عدد Opus در آن بنچمارک برای بالاترین سطح تلاش (Xhigh) گزارش شده است.
- در بقیهی بنچمارکها فاصلهی دو مدل کم است، ولی Opus 5.5 همچنان بالاتر میایستد. خود Anthropic هم میگوید Opus در کارهای باز و پیچیدهای که قضاوت طولانی میخواهند «بهوضوح قویتر» است.
- جهش Sonnet 5 از ۱۰٫۳ به ۷۰٫۶ درصد در Terminal-Bench بسیار بزرگ است. تا زمانی که ارزیابی مستقل منتشر نشده، بهتر است این عدد را با احتیاط بخوانید.
- امتیاز GDPval-AA را شرکت Artificial Analysis اجرا کرده، اما روی یک نسخهی پیشانتشار که باگی در خروجی ساختیافته داشت. Anthropic میگوید اثر این باگ احتمالاً کم بوده و عدد را کمتر از واقع نشان میدهد.
در FrontierCode، که بررسی میکند آیا تغییرات کد قابل merge هستند، Sonnet 5.5 در سطح Xhigh به ۵۲٫۱٪ میرسد (GPT-6 Sol: ۴۹٫۳٪، Opus 5.5: ۵۴٫۴٪). جالب اینکه در سطح Max امتیازش پایینتر و ۴۶٫۲٪ است. طبق توضیح Anthropic، مدل در این حالت زیاد از قابلیت بازبینی کد با چند زیرعامل استفاده میکند و گاهی تغییراتی خارج از دامنهی کار میدهد. یعنی بالاترین سطح تلاش همیشه بهترین انتخاب نیست.
قیمت و هزینهی واقعی
قیمت هر توکن تغییری نکرده است:
| هر ۱ میلیون توکن | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| ورودی | ۲ دلار | ۴ دلار |
| خروجی | ۱۰ دلار | ۲۰ دلار |
| خواندن از کش | ۰٫۲۰ دلار | ۰٫۲۰ دلار |
صرفهجویی از مصرف کمتر توکن میآید، نه از کاهش قیمت. شرکت Balyasny Asset Management در تست داخلی خودش برای هر پاسخ حدود ۱۲۱ هزار توکن مصرف دیده، در حالی که Sonnet 5 حدود ۴۹۷ هزار توکن مصرف میکرد. این عدد از تست یک مشتری است و برای کار شما لزوماً تکرار نمیشود.
نکات مهم برای توسعهدهندهها
- شناسهی مدل:
claude-sonnet-5-5در Claude Platform، و همچنین روی AWS، Google Cloud و Azure. - حالت بدون thinking: اگر Sonnet را با thinking خاموش اجرا میکنید، قبل از مهاجرت باید به تنظیم جدید
between_toolsبروید. - سطح تلاش پیشفرض: در اپهای Claude و Claude Code روی Medium و در Claude Platform روی High است.
- حفاظهای امنیت سایبری: Sonnet 5.5 اولین مدل Sonnet با این حفاظهاست. کارهای عادی مثل پیدا کردن و رفع باگ مشکلی ندارند، اما درخواستهای پرریسکتر سایبری به Sonnet 5 برمیگردند. متخصصان دفاعی میتوانند برای دسترسی پیشرفتهتر به «برنامهی تأیید سایبری» درخواست بدهند.
- تغییر در thinking محافظتشده: اگر گفتگوها را بین حسابهای مختلف جابهجا میکنید (مثلاً تعویض حساب وسط جلسهی Claude Code)، مستندات Anthropic را ببینید. بیشتر توسعهدهندهها تغییری حس نمیکنند.
سؤالات متداول
Sonnet 5.5 گرانتر از Sonnet 5 است؟ قیمت هر توکن یکسان است. طبق آزمایش Anthropic، بهخاطر مصرف کمتر توکن، هزینهی هر کار تا ۳۰٪ کمتر میشود.
Sonnet 5.5 جای Opus 5.5 را میگیرد؟ نه. Anthropic آن را مکمل Opus میداند. برای کارهای پیچیده و بلندمدت که قضاوت میخواهند، Opus 5.5 قویتر است.
Sonnet 5.5 کجا در دسترس است؟ در اپهای Claude، Claude Platform و روی سرویسهای AWS، Google Cloud و Microsoft Azure.
Haiku 5.5 کی میآید؟ Anthropic فقط گفته «طی چند هفتهی آینده» و تاریخ دقیقی اعلام نکرده است.
جمعبندی
Sonnet 5.5 روی کاغذ ترکیب خوبی از سرعت، هزینه و کیفیت است، بهخصوص برای کدنویسی روزمره و کارهای دفتری. با این حال بیشتر دادهها از خود Anthropic و مشتریانش آمده. قبل از سوئیچ کردن، مدل را روی کارهای واقعی خودتان و در سطح تلاش مناسب بسنجید.
نظرات
برای ثبت نظر وارد شوید.