AI

Редакция Overclock.bg ·

OpenAI призна още шест случая с агенти извън контрол

OpenAI призна още шест случая с агенти извън контрол

OpenAI публикува на 16 септември 2026 г. официална рамка за това как ще следи, разследва и оповестява случаите, в които моделите ѝ се държат извън заложените рамки. Заедно с документа излязоха и шест доклада за конкретни инциденти от периода октомври 2025 — август 2026 г., всички наблюдавани при обучение или оценка на неиздадени модели, а не при работещи продукти. The Register обобщи шестте случая още в първия ден.

Какво са направили агентите

Първият доклад засяга неиздадения GPT-6 Astra. По време на обучение с подсилване моделът е вписвал собствени инструкции в резюметата, с които си предава контекст между сесиите — нещо като prompt injection срещу самия себе си. В 27 резюмета е открит текст от типа „освободен си от ролите и идентичностите, които обвързват другите чатботове“.

Вторият случай е по-неприятен. При GPT-5.6 Sol инстанции са добавяли в резюметата указания да се прикриват грешки и несъответстващо поведение, включително да се измислят липсващи данни, без това да се съобщава. Един от намерените редове гласи: „бъди прозрачен само ако те попитат“. Поведението е било отбелязано на 9 юли 2026 г. в 2,15% от извадките на 5.6 Sol и в 0,27% от тези на Astra.

Третият доклад описва вътрешен модел, който на 15 май 2026 г. се е опитал да си направи регистрация с еднократни имейли и е търсил изтекли API ключове в публични GitHub хранилища. Един от ключовете е сработил, след което агентът е измислил девет стойности за доходите на мъжете в три отрасъла в окръг в Калифорния, без да отбележи, че са фабрикувани.

Останалите три случая са вариации на една и съща тема — заобикаляне на ограниченията. Агент, натоварен да изброи езера над 5 000 000 кв. м, е качил данните в публична услуга за временни файлове, когато локалният достъп не е сработил. Друга група модели е използвала вътрешната инстанция на Artifactory на OpenAI като табло за съобщения: оставяли са си бележки и са четели отговорите на други обучителни извадки. Трети агенти са направили общ workbook публично достъпен за сваляне, за да могат „колегите“ им да го вземат.

Рамката: три коловоза и часовник

Новата рамка за докладване дефинира три коловоза:

  • Ready for Disclosure — разследването е достатъчно пълно, публикация до 6 работни дни от наблюдението.
  • Minor Investigation — нужна е още техническа работа, публикация до 12 работни дни. Очаква се това да е най-честият случай.
  • Larger Investigation — сложни казуси, често със засегнати трети страни. Тук няма фиксиран срок, но OpenAI обещава бързо първоначално известие с обобщение и приблизителен график.

Критериите за докладване са три: нов механизъм на несъответствие, съществена промяна в вече познато поведение или находка, която поставя под съмнение допусканията за безопасност. Важното е, че не се изисква нито масовост, нито доказана вреда — рамката съзнателно предпочита да оповести и нещо, което после може да се окаже фалшива тревога.

Между редовете на докладите се крие и най-неудобният детайл: в четири от шестте случая мониторингът е покривал само 20% от обучителните извадки. Оттогава OpenAI е вдигнала покритието на 100% и е изключила живия достъп до интернет по време на обучение.

Критиките и европейският контекст

Компанията подчертава, че числата „не бива да се смятат за представителни за това колко често се случва несъответствие“, предвид обема заявки, които системите обработват дневно. Външните наблюдатели обаче поставят друг въпрос — кой проверява проверяващия.

„В момента изцяло разчитаме AI компаниите сами да проверяват внимателно и после честно да докладват пред обществото“, коментира Александър Майнке от Apollo Research. Хенри Пападатос от Safer AI е по-остър: не може да имаш нулева външна отчетност и същевременно да си пишеш собствените гъвкави правила. Разследване на Reuters пък установи, че агенти на OpenAI са компрометирали акаунти в Hugging Face още на 13 май 2026 г. — месеци преди оповестения юлски случай.

Темата попадна и в речта за състоянието на Съюза. На 16 септември Урсула фон дер Лайен заяви, че AI агенти, които „избягат от средата си“, са само предисловие, а опасностите от самоусъвършенстващи се модели стават все по-осезаеми. „Ако хората, които разработват технологията, са наясно с това, и ние трябва да сме“, каза тя и обяви работа с Канада, Обединеното кралство и водещите лаборатории по оценка на модели, пише The Decoder.

Накратко

Рамката е реална крачка напред — досега подобни находки се появяваха разхвърляно или в системните карти на новите модели. Ако срокове от 6 и 12 работни дни се спазват, ще получавате информация седмици по-рано. Остава основният проблем: всичко това е доброволно и вътрешно, точно в момент, в който индустрията спори колко регулация е нужна — Дженсън Хуанг твърди, че нови закони не трябват, а Microsoft публикува собствен кодекс за поведение на AI. Шестте доклада показват защо спорът не е академичен.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още