
Anthropic пусна Claude Sonnet 5.5 на 28 септември 2026 г. — средният модел от семейството, който в тестовете се доближава на косъм до флагмана Opus 5.5, а на един benchmark го изпреварва. Цената за токен не се променя, но според компанията моделът генерира текст с над 30% по-висока скорост и струва до 30% по-малко за изпълнена задача. Sonnet 5.5 вече е моделът зад безплатния план на claude.ai, а в API се вика с идентификатор claude-sonnet-5-5.
Числата: два пункта зад Opus 5.5
Най-показателният резултат е на GDPval-AA v2.1 — класацията на Artificial Analysis за реални работни задачи от 44 професии. Sonnet 5.5 събира 1844 Elo срещу 1846 за Opus 5.5, тоест разликата е два пункта. За сравнение, предшественикът Sonnet 5 е на 1449, а GPT-6 Sol — на 1487.
| Тест | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70,6% | 10,3% | 66,4% | — |
| CursorBench 4.0 | 55,5% | 34,1% | 57,8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| OSWorld 2.1 | 80,1% | 57,0% | 81,8% | — |
| Chartography | 61,6% | 15,6% | 64,4% | 53,6% |
Скокът на Terminal-Bench 4.0 — от 10,3% на 70,6% — изглежда прекалено голям, за да е истина, но обяснението е в самия тест: новата версия 4.0 е агентна и изисква дълги вериги от команди в терминал, при които Sonnet 5 просто се разпадаше. Тук Sonnet 5.5 бие и Opus 5.5.
Anthropic посочва още 46,2% на FrontierCode 1.1 (основният набор, при ниво на усилие Max), 1811 Elo на AA-Briefcase v1.1 и 64,5% на Humanity’s Last Exam с достъп до инструменти. Пълната таблица е в официалното съобщение, а the-decoder сравнява резултатите с предишното поколение.
Откъде идва по-ниската сметка
Цените остават непроменени спрямо Sonnet 5: 2 щ.д. за милион входящи токена (около €1,75), 10 щ.д. за милион изходящи (около €8,80), 0,20 щ.д. за милион при четене от кеша и 2,50 щ.д. при запис. Икономията не идва от тарифата, а от това колко токена и колко обръщения към инструменти отнема една задача. За сравнение, при Opus 5.5 Anthropic свали самата тарифа — до 4 и 20 щ.д. за милион токена.
Клиентите, които са тествали модела предварително, дават конкретика. Box съобщава, че Sonnet 5.5 е бил по-точен, 2,4 пъти по-бърз и е изразходвал 12% по-малко токени общо. Zendesk обработва тикети с 20% по-бързо. Slack отчита около 14% по-малко изходящи токена. Lovable — платформата за генериране на приложения — казва, че моделът е стигал до готов резултат с около една трета по-малко извиквания на инструменти и наполовина по-малко изпълнения в shell, а Base44 съобщава, че при 118 реални приложения моделът е стигал до качеството на Opus 5 средно за 3,6 итерации срещу 7,7.
Снимка: Anthropic
Нивата на усилие и капанът на „Max“
Sonnet 5.5 поддържа пет нива на разсъждение: Low, Medium, High, Xhigh и Max. Разликата между последните две не е козметична. В тестовете си Саймън Уилисън описва как на ниво Max моделът е изгорял 128 000 токена (около 1,28 щ.д.), преди да се откаже без резултат, докато същата задача на Xhigh е приключила за 41 секунди и 5,74 цента. Ако мислите да вдигнете усилието докрай „за всеки случай“, сметката може да се обърне срещу вас.
За рутинните агентни задачи започнете от High или Xhigh и вдигайте до Max само когато видите реален провал. Разликата в цената между двете нива е двуцифрена, а в много случаи разликата в резултата е нулева.
Сигурност и достъпност
Sonnet 5.5 е първият Sonnet с предпазни механизми, насочени към киберсигурността — Anthropic признава, че моделът е значително по-способен в тази област от предшественика си. Добавени са и класификатори срещу т.нар. distillation атаки, при които външен модел се обучава върху извлечените разсъждения на Claude. Биологичните ограничения остават същите като при Sonnet 5.
Моделът е наличен през платформата на Anthropic, AWS, Google Cloud и Microsoft Azure, с опция за нулево запазване на данни. Haiku 5.5 се очаква „през следващите седмици“. Claude Marketplace, който Anthropic отвори наскоро, също работи с новия модел.
В безплатния план сравнението е с Luna 5.6 — моделът зад безплатния ChatGPT. Конкуренцията при върховите модели междувременно е разклатена: OpenAI отмени пуска на GPT-6.1 Astra дни преди DevDay заради проблемно поведение.
Какво означава това
Интересното при Sonnet 5.5 не е пикът на възможностите, а къде минава линията цена–резултат. Досега изборът беше „евтин модел за рутина, скъп за трудното“; при два пункта разлика на GDPval-AA и по-добър резултат на Terminal-Bench този компромис почти изчезва за агентните натоварвания. Рискът е класическият: когато скоростта расте, апетитът към токени също расте. Следете разхода на задача, не цената на милион токени — точно там е промяната.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google