AI

Редакция Overclock.bg ·

Claude Sonnet 5.5: почти като Opus 5.5, с 30% по-евтино

Claude Sonnet 5.5: почти като Opus 5.5, с 30% по-евтино

Anthropic пусна Claude Sonnet 5.5 на 28 септември 2026 г. — средният модел от семейството, който в тестовете се доближава на косъм до флагмана Opus 5.5, а на един benchmark го изпреварва. Цената за токен не се променя, но според компанията моделът генерира текст с над 30% по-висока скорост и струва до 30% по-малко за изпълнена задача. Sonnet 5.5 вече е моделът зад безплатния план на claude.ai, а в API се вика с идентификатор claude-sonnet-5-5.

Числата: два пункта зад Opus 5.5

Най-показателният резултат е на GDPval-AA v2.1 — класацията на Artificial Analysis за реални работни задачи от 44 професии. Sonnet 5.5 събира 1844 Elo срещу 1846 за Opus 5.5, тоест разликата е два пункта. За сравнение, предшественикът Sonnet 5 е на 1449, а GPT-6 Sol — на 1487.

ТестSonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.070,6%10,3%66,4%—
CursorBench 4.055,5%34,1%57,8%—
GDPval-AA v2.11844144918461487
OSWorld 2.180,1%57,0%81,8%—
Chartography61,6%15,6%64,4%53,6%

Скокът на Terminal-Bench 4.0 — от 10,3% на 70,6% — изглежда прекалено голям, за да е истина, но обяснението е в самия тест: новата версия 4.0 е агентна и изисква дълги вериги от команди в терминал, при които Sonnet 5 просто се разпадаше. Тук Sonnet 5.5 бие и Opus 5.5.

Anthropic посочва още 46,2% на FrontierCode 1.1 (основният набор, при ниво на усилие Max), 1811 Elo на AA-Briefcase v1.1 и 64,5% на Humanity’s Last Exam с достъп до инструменти. Пълната таблица е в официалното съобщение, а the-decoder сравнява резултатите с предишното поколение.

Откъде идва по-ниската сметка

Цените остават непроменени спрямо Sonnet 5: 2 щ.д. за милион входящи токена (около €1,75), 10 щ.д. за милион изходящи (около €8,80), 0,20 щ.д. за милион при четене от кеша и 2,50 щ.д. при запис. Икономията не идва от тарифата, а от това колко токена и колко обръщения към инструменти отнема една задача. За сравнение, при Opus 5.5 Anthropic свали самата тарифа — до 4 и 20 щ.д. за милион токена.

Клиентите, които са тествали модела предварително, дават конкретика. Box съобщава, че Sonnet 5.5 е бил по-точен, 2,4 пъти по-бърз и е изразходвал 12% по-малко токени общо. Zendesk обработва тикети с 20% по-бързо. Slack отчита около 14% по-малко изходящи токена. Lovable — платформата за генериране на приложения — казва, че моделът е стигал до готов резултат с около една трета по-малко извиквания на инструменти и наполовина по-малко изпълнения в shell, а Base44 съобщава, че при 118 реални приложения моделът е стигал до качеството на Opus 5 средно за 3,6 итерации срещу 7,7.

Демонстрация на скоростта на писане при Claude Sonnet 5.5 Снимка: Anthropic

Нивата на усилие и капанът на „Max“

Sonnet 5.5 поддържа пет нива на разсъждение: Low, Medium, High, Xhigh и Max. Разликата между последните две не е козметична. В тестовете си Саймън Уилисън описва как на ниво Max моделът е изгорял 128 000 токена (около 1,28 щ.д.), преди да се откаже без резултат, докато същата задача на Xhigh е приключила за 41 секунди и 5,74 цента. Ако мислите да вдигнете усилието докрай „за всеки случай“, сметката може да се обърне срещу вас.

Съвет

За рутинните агентни задачи започнете от High или Xhigh и вдигайте до Max само когато видите реален провал. Разликата в цената между двете нива е двуцифрена, а в много случаи разликата в резултата е нулева.

Сигурност и достъпност

Sonnet 5.5 е първият Sonnet с предпазни механизми, насочени към киберсигурността — Anthropic признава, че моделът е значително по-способен в тази област от предшественика си. Добавени са и класификатори срещу т.нар. distillation атаки, при които външен модел се обучава върху извлечените разсъждения на Claude. Биологичните ограничения остават същите като при Sonnet 5.

Моделът е наличен през платформата на Anthropic, AWS, Google Cloud и Microsoft Azure, с опция за нулево запазване на данни. Haiku 5.5 се очаква „през следващите седмици“. Claude Marketplace, който Anthropic отвори наскоро, също работи с новия модел.

В безплатния план сравнението е с Luna 5.6 — моделът зад безплатния ChatGPT. Конкуренцията при върховите модели междувременно е разклатена: OpenAI отмени пуска на GPT-6.1 Astra дни преди DevDay заради проблемно поведение.

Какво означава това

Интересното при Sonnet 5.5 не е пикът на възможностите, а къде минава линията цена–резултат. Досега изборът беше „евтин модел за рутина, скъп за трудното“; при два пункта разлика на GDPval-AA и по-добър резултат на Terminal-Bench този компромис почти изчезва за агентните натоварвания. Рискът е класическият: когато скоростта расте, апетитът към токени също расте. Следете разхода на задача, не цената на милион токени — точно там е промяната.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още