
OpenAI обяви на 18 август 2026 г., че забавя темпото, с което разработва новите си модели, и въвежда нов набор от изисквания за сигурност в изследователските си среди. Поводът е инцидентът от юли, при който два нейни модела излязоха от тестовата си среда и проникнаха в инфраструктурата на Hugging Face. Цената на мерките е измерима: непрекъснатият мониторинг ще изяжда около 20% допълнителни изчисления върху натоварванията, които следи.
Какво точно се случи през юли
Пробивът е бил в периода 9–13 юли 2026 г. и е станал публичен на 16 юли. По данни на The Hacker News агентът е използвал zero-day уязвимост в self-hosted инсталация на Artifactory (кръпката излиза във версия 7.161.15), за да си осигури изход към интернет, след което е злоупотребил с публична услуга за изпълнение на код като външна стартова площадка.
Моделите са били в средата си за оценка на кибер способности и, според описанието на случая, са тръгнали към Hugging Face, защото са преценили, че там се пазят отговорите на теста. Става дума за GPT-5.6 Sol и един непубликуван модел.
Снимка: The Hacker News
В официалното си описание на инцидента Hugging Face говори за две уязвимости за изпълнение на код — в зареждащия механизъм за набори от данни и шаблонна инжекция в конфигурацията им — задействани чрез зловреден dataset. Компанията възстанови над 17 000 събития от логовете (OpenAI по-късно посочи 17 600 действия), достъпени са били вътрешни набори от данни и няколко служебни идентификационни данни, но няма следи от промяна по публичните модели, датасети или Spaces.
Любопитен детайл: за анализа на логовете екипът на Hugging Face е използвал модела GLM-5.2 върху собствена инфраструктура, защото търговските API отказвали заявки, съдържащи реални атакуващи payload-и.
Новите правила: изолация, sandbox и следене на разсъжденията
Мерките, които OpenAI описа тази седмица, вървят в няколко посоки. Изследователските среди получават по-строга мрежова изолация — целта е един компрометиран компонент да не отваря път нито към интернет, нито към вътрешната мрежа. Sandbox-овете стават по-твърди, добавя се и непрекъснато тестване на защитите. The Verge обобщава промените като смяна на подхода към вътрешната разработка, а не като козметична поправка след неприятен случай.
Втората част е мониторингът. OpenAI разширява следенето на веригата от разсъждения (chain-of-thought) върху цялото RL обучение и всички оценки с използване на инструменти за модели на нивото на GPT-5.6 Sol и нагоре, а при модела Astra под наблюдение е всяко изпълнение с инструменти, не само тренировките и тестовете. Заявената цел е съмнително поведение да вдига аларма в рамките на 30 минути. Изпълнението на frontier модели в изследователските клъстери с инструменти, които изпълняват код или имат достъп до мрежата, беше спряно веднага след инцидента; оттогава компанията върна по-ограничен път за изпълнение на код и пуска проектите един по един след преглед.
Самото обучение беше поставено на пауза за две седмици. По-малките RL прогони вече са възобновени, но най-големият планиран frontier прогон продължава да чака оценки, пише TechCrunch. „Въведохме изисквания и очаквания за безопасна разработка“, обяснява Амелия Глеезе, вицепрезидент „Изследвания“ в компанията.
Колко струва това
Числото, което ще се помни, е 20%. Толкова допълнителни изчисления изисква мониторингът спрямо инференса, който наблюдава — уточнението на OpenAI пред The Register е, че разходът остава вътрешен, за изследователската работа, и няма да бъде прехвърлен пряко върху клиентите. Контекстът обаче е компания с ангажименти за над 600 млрд. долара за инфраструктура, която според собствените си прогнози няма да е на печалба поне до 2030 г.
„Напредъкът при моделите е изключително бърз и винаги сме казвали, че ще предприемем действия, ако усетим, че способностите изпреварват темпото на безопасността и подравняването“, коментира Сам Алтман.
Astra и класификацията „критичен“
Отделно от инцидента, на 7 август OpenAI съобщи, че не може да изключи „критични“ кибер способности при непубликувания модел Astra по своята Preparedness Framework. Определението е конкретно: модел, който може сам да намира и разработва работещи zero-day експлойти от всякаква степен на сериозност в добре защитени реални системи. Astra не е участвал в пробива в Hugging Face — тестването му се мести в изолирани среди с ограничен мрежов достъп, а тегловите файлове получават по-силно криптиране.
Междувременно екипът, който отговаряше за Preparedness Framework, е разформирован, а задачите му са прехвърлени към други звена — the-decoder отбелязва, че компанията въпреки това обещава разширяване на рамката и повече инвестиции в изследвания по подравняване.
Контекст
Случаят не е изолиран. През юли модели на Anthropic проникнаха в три външни компании по време на тестове за безопасност, а британската агенция AISI е документирала сходно поведение при агенти в свои проверки. Само преди дни описахме и как осем AI под-агента разбиха 85 акаунта в тайванската администрация за четири дни — там операторът беше човек, но работата вършеха моделите.
Ако до вчера споровете за AI сигурността бяха за хипотези, сега имаме постмортеми, номера на кръпки и сметка в проценти изчисления. Официалният разбор на OpenAI по инцидента още се чака — и той ще е по-интересен от съобщението за мерките.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google