
На 9 септември OpenAI публикува втора, отделна презентация на GPT-6 Astra — този път изцяло около работата. Материалът „GPT-6 Astra: The next generation in intelligence for work“ описва Astra като най-способния модел на компанията за бизнес: по-силно разсъждение, работа с компютър и „по-добра преценка при писане и дизайн“. Самият модел тръгна в ограничен преглед на 3 септември и стана достъпен за платените абонати ден по-късно.
Какво точно се променя в работния ден
Акцентът вече не е върху рекордите, а върху довършването на досадни задачи. Astra произвежда документи, таблици и презентации, задържа се в рамките на задачата през много стъпки и — важното — работи през приложенията, които хората ползват всеки ден, дори когато те нямат API. Това означава, че компаниите могат да пуснат модела в съществуващите си процеси без месеци интеграции.
Измеримото подобрение е в скоростта на работа с компютър: според VentureBeat Astra взема 72,6% на OSWorld 2.0 (offline подмножеството) при около 40 минути на задача, срещу 65,7% и около 75 минути за GPT-5.6 Sol. OpenAI говори за почти двойно по-бърза работа с компютър.
Снимка: OpenAI
Кой го получава и колко струва
Astra се разпространява през ChatGPT Plus, Pro, Business и Enterprise, в Codex, през API на OpenAI, както и през AWS Bedrock и Microsoft Azure. Plus абонатите го виждат в ChatGPT Work и Codex; Pro и Business получават и вариант GPT-6 Pro в обикновения чат. При Enterprise достъпът по подразбиране е изключен, докато администратор не го разреши за работното пространство.
В API стандартната тарифа е 10 щ.д. за милион входни токена и 50 щ.д. за милион изходни (приблизително 8,6 и 43 €), с 1 щ.д. за кеширан вход. Batch и Flex вървят на половин цена, а режимът Fast удвоява тарифата. Това прави Astra около 2,5 пъти по-скъп от GPT-5.6 Sol — затова и Грег Брокман предупреди, че смисленото мерило вече не е цена на токен, а цена на задача.
Числата, които OpenAI не показа
Ентусиазмът има и обратна страна. Astra достига 98,6% на ARC-AGI-3, 97,6% на FrontierMath Tier 4 v2, 96% на GPQA Diamond и 100% на ExploitBench, но OpenAI не публикува резултат по GDPval — собствения си бенчмарк точно за професионална работа. Независимата Artificial Analysis отчита регресия от около 80 Elo точки на GDPval-AA v2 спрямо предшественика, а в общия Intelligence Index Astra е на 61,2 срещу 60,9 за Sol и 65,7 за Claude Fable 5.1. Тестове на Decrypt описват модела като силен в код и 3D прототипи, но по-слаб от Sol в редакторското писане.
Моделът е и първият на OpenAI, класифициран на ниво Critical за кибервъзможности по Preparedness Framework, което забави пускането с няколко седмици за допълнителни предпазители. Достъпът до тази част минава през програмата Daybreak с 1 милиард долара кредити за държавни агенции и оператори на критична инфраструктура — подробности, които SiliconANGLE описа при старта. По думите на вицепрезидента по изследванията това е първият модел, предтрениран на повече от 100 000 GPU — в центъра Stargate в Тексас.
От офиса до лабораторията
Ден преди работната презентация OpenAI пусна и есето „The Work Now Within Reach“ на финансовия директор Сара Фрайър — тезата е, че идеи, ограничавани досега от време, цена или достъп до експертиза, стават практични.
Най-конкретната илюстрация обаче е разказът за квантови експерименти и той е с предишния модел, GPT-5.6 Sol. Беатрис Янкелевич от групата Engineering Quantum Systems в MIT е ползвала Sol през Codex, за да характеризира шесткубитов суперпроводящ чип: агентът е избирал настройки на измерванията, управлявал е апаратурата, анализирал е данните и е калибрирал честоти на кубитите, контролни импулси и времена на задържане на информацията. От 40 целеви измервания изследователите са се намесили, за да поправят само четири, пише The Quantum Insider. При слаб, шумен или физически двусмислен сигнал агентът все още иска човек до себе си.
Снимка: OpenAI / The Quantum Insider
„Мога да имам няколко агента върху различни проблеми едновременно и прекарвам повечето си време в работа на по-високо ниво — интерпретация на резултати, измисляне на експерименти, планиране на следващите стъпки за агентите, четене и писане“, казва Янкелевич.
Заключение
Работната версия на съобщението е по-честна от първата: вместо „ерата на AGI“ тук се говори за таблици, презентации и минути на задача. Astra е видимо по-бърз и по-издръжлив в дълги процеси, но независимите измервания показват, че в писането и в широките икономически задачи няма автоматичен скок — а цената на токен е нараснала 2,5 пъти. Ако тествате модела в екип, мерете като Брокман: на завършена задача, не на милион токена. Контекстът е и конкурентен — Meta също пусна агентния Muse, а спорът около решението на Навие-Стокс показа колко внимателно трябва да се четат собствените рекорди на лабораториите.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google