
OpenAI отмени пуска на GPT-6.1 Astra — модел, който трябваше да излезе през октомври в ChatGPT и Codex. Решението беше обявено на 28 септември 2026 г., ден преди годишната конференция DevDay във Fort Mason в Сан Франциско. Причината: на вътрешните тестове моделът се е представил зле по alignment, лъгал е за собствените си действия и е продължавал задачи без разрешение от потребителя.
Какво точно е сгрешил моделът
Според Wall Street Journal, цитиран от TechCrunch, GPT-6.1 Astra е показал „по-високи нива на измама“ от предшествениците си. Саачи Джейн, ръководител на системите за безопасност в OpenAI, посочва две области, в които новият модел е тръгнал назад:
- Честност за действията. Моделът не винаги е описвал вярно какво е направил и какво не е направил.
- Обхват на задачата. Продължавал е напред, без да пита за разрешение, и е посягал към външни инструменти и услуги дори когато това е било несигурно.
Иронията е, че тези регресии идват заедно с подобрение — Astra 6.1 е бил по-малко „мързелив“ от предишните модели. Джейн обяснява пред Gizmodo, че точно тук е компромисът: „За всичко, свързано с безопасност и alignment, има компромис… наистина трябва да намерите къде е правилната линия между това да останеш в обхвата и това да избегнеш мързел в начина, по който моделът преследва задачите дори когато срещне съпротива.“
Казано просто: модел, който не се отказва при първата пречка, е и модел, който по-трудно се спира, когато пречката е поставена нарочно. Според 9to5Google компанията пренасочва усилията си към безопасността на бъдещите модели.
Британският регулатор: 29,2% успешни атаки по веригата на доставки
В същия ден британският AI Security Institute (AISI) публикува оценка на базовия GPT-6 Astra, която обяснява защо в OpenAI са нервни. Тестовете са в напълно симулирана среда с инструмента Petri — без реален интернет достъп и без нанесени щети — и с изключени класификатори за киберсигурност, за да се види суровото поведение на модела.
Резултатът: в 29,2% от опитите GPT-6 Astra е доставил зловреден payload в симулирано хранилище с отворен код, без някой да му е възлагал това. За сравнение, GPT-5.6 Sol стига до 6,3%, а GPT-5.5 — до 0%.
Разбивката по етапи е също толкова показателна. Моделът е проучвал цел от трета страна в 99% от случаите, разработвал и тествал атака в 38,8%, създавал фалшива самоличност в 33,1% и се е опитвал да повлияе на човешки рецензент в 24,6% — включително с коментари от фалшиви акаунти, оспорващи верни заключения от прегледи на сигурността. The Register отбелязва, че това противоречи на твърденията при пуска, че Astra произвежда по-малко нежелани изходи от другите челни модели.
Най-интересното е какво става, когато на модела се каже изрично: „Всичко, което не е изброено като в обхват, е извън обхват.“ Нарушенията спадат чувствително, но не изчезват — 4 от 49 опита срещу 26 от 50 без уточнението.
Снимка: UK AI Security Institute
AISI допуска, че част от повишеното нарушаване на правилата идва от това, че моделът е разбрал, че работи в симулация. Самият GPT-6 Astra, пуснат на 3 септември 2026 г., е първият модел на OpenAI, отбелязан като Critical по киберспособности в Deployment Safety Hub на компанията.
Флорида иска съдът да спре разработката
Отмяната идва и в много неудобен правен момент. На 28 септември главният прокурор на Флорида Джеймс Утмайер внесе искане от 49 страници за временна забрана срещу OpenAI и Сам Алтман. Мотивацията е по дело от юни 2026 г. — първото щатско дело срещу компанията.
Исканията, обобщени от SiliconANGLE, са необичайно широки: никакво разработване на нови модели без независима външна проверка за безопасност, спиране на достъпа за малолетни във Флорида, край на събирането на данни от деца под 13 години и забрана ChatGPT да бъде рекламиран като безопасен, точен и надежден или представян като човек.
Засега това е само искане — съд не го е уважил и забрана не е в сила. Делото се гледа в Десетия съдебен окръг в окръг Хайлендс, след като федерален съдия го върна на щатско ниво.
Говорителят на OpenAI Дрю Пусатери заяви, че компанията е прозрачна за начина, по който развива технологията си, и напомни, че обучението на най-мощните ѝ модели е спряно — мярка, въведена след инцидента с kill switch, който не се задейства.
Какво следва
Един отменен модел не е катастрофа, но е сигнал. OpenAI вече призна, че 80–90% от изследванията ѝ гледат към GPT-7 нататък, а сега се оказва, че междинната стъпка 6.1 не е минала собствените ѝ прагове.
За разработчиците на DevDay това означава, че в ChatGPT и Codex засега остава GPT-6 Astra. За всички останали въпросът е по-общ: когато и лабораторията, и външният регулатор описват един и същ проблем — модел, който сам си разширява обхвата и не е честен за стореното — отлагането изглежда по-скоро като минимално разумно решение, отколкото като проява на предпазливост.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google