Anthropic در ۲۸ سپتامبر ۲۰۲۶ از Claude Sonnet 5.5 رونمایی کرد؛ دومین مدل از خانواده‌ی Claude 5.5 بعد از Opus 5.5. به گفته‌ی Anthropic، این مدل نسبت به Sonnet 5 بیش از ۳۰ درصد سریع‌تر است و برای بیشتر کارها تا ۳۰ درصد ارزان‌تر تمام می‌شود. در این مقاله اعداد، محدودیت‌ها و نکات عملی این مدل را بررسی می‌کنیم.

همه‌ی بنچمارک‌های این مقاله توسط خود Anthropic گزارش شده‌اند، مگر جایی که خلاف آن ذکر شود. بررسی مستقل بیشتر آن‌ها هنوز منتشر نشده است.

Sonnet 5.5 در خانواده‌ی Claude 5.5 کجا قرار می‌گیرد؟

Anthropic این مدل را مکمل سریع‌تر و ارزان‌تر Opus 5.5 معرفی می‌کند. Opus 5.5 برای کارهای پیچیده‌ای ساخته شده که قضاوت دقیق می‌خواهند. Sonnet 5.5 روی کارهای مشخص و روزمره، رفع باگ و تولید سند، اسلاید و صفحه‌گسترده قوی‌تر است. مدل سوم این خانواده، Claude Haiku 5.5، طبق وعده‌ی Anthropic طی چند هفته‌ی آینده می‌آید.

عملکرد: اعداد چه می‌گویند؟

بنچمارک Sonnet 5.5 Sonnet 5 Opus 5.5
Terminal-Bench 4.0 (کدنویسی عامل‌محور) ۷۰٫۶٪ ۱۰٫۳٪ ۶۶٫۴٪
CursorBench 4.0 ۵۵٫۵٪ ۳۴٫۱٪ ۵۷٫۸٪
GDPval-AA v2.1 (کار دانشی) ۱۸۴۴ ۱۴۴۹ ۱۸۴۶
OSWorld 2.1 (کنترل کامپیوتر) ۸۰٫۱٪ ۵۷٫۰٪ ۸۱٫۸٪
Humanity's Last Exam (با ابزار) ۶۴٫۵٪ ۵۴٫۹٪ ۶۷٫۷٪

چند نکته‌ی مهم درباره‌ی این جدول:

در FrontierCode، که بررسی می‌کند آیا تغییرات کد قابل merge هستند، Sonnet 5.5 در سطح Xhigh به ۵۲٫۱٪ می‌رسد (GPT-6 Sol: ‌۴۹٫۳٪، Opus 5.5: ‌۵۴٫۴٪). جالب اینکه در سطح Max امتیازش پایین‌تر و ۴۶٫۲٪ است. طبق توضیح Anthropic، مدل در این حالت زیاد از قابلیت بازبینی کد با چند زیرعامل استفاده می‌کند و گاهی تغییراتی خارج از دامنه‌ی کار می‌دهد. یعنی بالاترین سطح تلاش همیشه بهترین انتخاب نیست.

قیمت و هزینه‌ی واقعی

قیمت هر توکن تغییری نکرده است:

هر ۱ میلیون توکن Sonnet 5.5 Opus 5.5
ورودی ۲ دلار ۴ دلار
خروجی ۱۰ دلار ۲۰ دلار
خواندن از کش ۰٫۲۰ دلار ۰٫۲۰ دلار

صرفه‌جویی از مصرف کمتر توکن می‌آید، نه از کاهش قیمت. شرکت Balyasny Asset Management در تست داخلی خودش برای هر پاسخ حدود ۱۲۱ هزار توکن مصرف دیده، در حالی که Sonnet 5 حدود ۴۹۷ هزار توکن مصرف می‌کرد. این عدد از تست یک مشتری است و برای کار شما لزوماً تکرار نمی‌شود.

نکات مهم برای توسعه‌دهنده‌ها

سؤالات متداول

Sonnet 5.5 گران‌تر از Sonnet 5 است؟ قیمت هر توکن یکسان است. طبق آزمایش Anthropic، به‌خاطر مصرف کمتر توکن، هزینه‌ی هر کار تا ۳۰٪ کمتر می‌شود.

Sonnet 5.5 جای Opus 5.5 را می‌گیرد؟ نه. Anthropic آن را مکمل Opus می‌داند. برای کارهای پیچیده و بلندمدت که قضاوت می‌خواهند، Opus 5.5 قوی‌تر است.

Sonnet 5.5 کجا در دسترس است؟ در اپ‌های Claude، Claude Platform و روی سرویس‌های AWS، Google Cloud و Microsoft Azure.

Haiku 5.5 کی می‌آید؟ Anthropic فقط گفته «طی چند هفته‌ی آینده» و تاریخ دقیقی اعلام نکرده است.

جمع‌بندی

Sonnet 5.5 روی کاغذ ترکیب خوبی از سرعت، هزینه و کیفیت است، به‌خصوص برای کدنویسی روزمره و کارهای دفتری. با این حال بیشتر داده‌ها از خود Anthropic و مشتریانش آمده. قبل از سوئیچ کردن، مدل را روی کارهای واقعی خودتان و در سطح تلاش مناسب بسنجید.


منبع: Introducing Claude Sonnet 5.5 – Anthropic