AI

Редакция Overclock.bg ·

Ultrafast: GPT-5.6 Sol до 14 пъти по-бърз в API

Ultrafast: GPT-5.6 Sol до 14 пъти по-бърз в API

На 13 август OpenAI обяви Ultrafast — нов режим на обслужване в своя API, който пуска флагманския модел GPT-5.6 Sol с до 14 пъти по-висока скорост от стандартната обработка и до 750 изходни токена в секунда. Ускорението идва от чиповете на Cerebras, а достъпът засега е ограничен преглед за малка група клиенти. Успоредно с това компанията поддържа и ръководство за разработчици към GPT-5.6, в което обяснява как да се пише за новия модел — и защо старите ви подсказки вече му пречат.

750 токена в секунда без отстъпка в качеството

Ключовото твърдение в съобщението на OpenAI е, че Ultrafast не е по-малък или дестилиран модел. Това е същият GPT-5.6 Sol, само че върху друг хардуер: стандартната скорост е около 53 токена в секунда, а Ultrafast стига до 750.

Числата от техническия разбор на Cerebras са по-конкретни. На Humanity’s Last Exam режимът е минал през всичките 2500 въпроса за 11 часа и 11 минути, срещу 78 часа и 27 минути за Claude Fable 5 — близо 7 пъти по-бързо при съпоставима точност. На GDP-Val ускорението от край до край е 5,6 пъти без загуба на качество. Спрямо Opus 4.8 във Fast режим разликата е около 5 пъти.

Сравнение на скоростта на GPT-5.6 Sol Ultrafast с Fable 5 и Opus 4.8 Снимка: Cerebras

Отдолу стои Wafer-Scale Engine на Cerebras — чип с размер на цяла силициева пластина и 44 GB SRAM на борда, което позволява теглата на модела да стоят в паметта до изчислителните ядра, вместо да пътуват през външна памет.

„С GPT-5.6 Sol Ultrafast Cerebras прави AI, който върви в крак с това как мислите, кодирате и работите заедно“, коментира Рохан Варма от продуктовия екип на OpenAI. Колегата му, изследователят Джефри Уанг, го казва по-приземено: моделът приключвал задачата, преди той изобщо да е успял да превключи към нещо друго.

Кой го ползва и как се стига до него

Ранните тестери включват Jane Street, Podium, Basis и Rogo — финансови анализи, търговия, поддръжка и писане на код. Самата OpenAI ползва режима вътрешно за реакция при инциденти (анализ на логове в момента на срива) и за изследователски цикли, които преди са се въртели през нощта, а сега се събират в няколко итерации за един работен ден.

Ultrafast още няма обявена цена. Достъпът минава през формуляр, в който описвате натоварването си, изискванията за латентност и очаквания обем, а OpenAI обещава да разширява капацитета постепенно. Anthropic има подобен „бърз“ режим за Claude, но той не достига тези скорости.

Ръководството: пишете по-малко, а не повече

Втората новина е по-скучна на пръв поглед, но вероятно по-полезна в ежедневието. Ръководството за разработчици настоява за outcome-first подсказки — казвате какъв е желаният резултат, какви са ограниченията и кога моделът да спре, вместо да разписвате всяка стъпка. По вътрешни оценки на OpenAI преминаването към този стил вдига резултатите с 10–15% и същевременно сваля изразходваните токени с 41–66%.

Останалите акценти:

  • Запазено разсъждение между ходовете плюс вградена компактизация на дълги разговори. На ARC-AGI-3 това вдига резултата от 13,3% на 38,3% при около 6 пъти по-малко изходни токени.
  • Програмно извикване на инструменти — моделът сам пише JavaScript, който оркестрира извикванията и обработва резултатите в изолиран V8 sandbox без мрежов достъп. При клиенти с много инструменти това реже 38–63,5% от токените.
  • Оркестрация на много агенти — основен агент разпределя подагенти по паралелни направления и после обединява изхода им.
  • Кеширане на подсказки с минимален TTL от 30 минути и параметър prompt_cache_key за по-висок процент попадения.

Най-показателният пример е от BrowseComp: GPT-5.5 на „extra high“ дава 84,36% точност за $33,27, а GPT-5.6 Luna на същото ниво — 84,04% за $1,33. Тоест почти същият резултат при 25 пъти по-ниска сметка.

Цените и защо това има значение

Списъчните цени на семейството са за 1 млн. токена (US): Sol — $5 вход / $30 изход (около €4,35 / €26,00), Terra — $2 / $12, Luna — $0,20 / $1,20. На 30 юли OpenAI сряза Terra с 20%, а Luna — с 80%, докато Sol остана на старата цена.

Тази надпревара по цена не е случайна. The Decoder, позовавайки се на разходни данни на Ramp, отчита, че Fable 5 на Anthropic е взел едва 6% от купените токени на компанията през първия си месец и 11,4% от разходите — около 75% от приходите на GPT-5.6 Sol, при това при двойно по-висока цена (US $10 / $50 за милион токена, около €8,70 / €43,30). „Допълнителната производителност просто не си струва цената“, обобщава икономистът на Ramp Ара Каразян.

Компаниите продължават да харчат — най-активният 1% от американските компании са дали медианно $7400 на служител през юли — но не за най-скъпия модел на пазара. Затова и ходовете от последните седмици изглеждат така: същият интелект по-бързо (Ultrafast), същият резултат по-евтино (Luna и Terra), плюс инструкции как да не хабите токени. Същата логика видяхме и при Gemini 3.7 Flash с по-добро кодиране на половин цена.

Заключение

Ultrafast е засега обещание с опашка за чакане — без цена, без дата за широк достъп и с капацитет, зависещ от доставките на Cerebras. Но посоката е ясна: скоростта престава да бъде причина да слизате към по-малък модел. А ръководството за GPT-5.6 казва нещо, което малко хора очакваха — най-бързият начин да ускорите агента си днес е да изтриете половината от подсказката, която сте писали за предишното поколение.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още