AI

Редакция Overclock.bg ·

GPT-Red: суперхакерът с изкуствен интелект, който OpenAI създаде, за да калява моделите си

GPT-Red: суперхакерът с изкуствен интелект, който OpenAI създаде, за да калява моделите си

OpenAI разкри, че е изградила вътрешен изкуствен интелект със задача да хаква собствените ѝ модели. Инструментът се казва GPT-Red и работи като автоматизиран „червен отбор” (red team) — търси начини да пробие защитите на другите модели на компанията, преди те да излязат публично. Новината беше публикувана на 15 юли 2026 г. от MIT Technology Review, заедно с технически подробности от самата OpenAI.

Според компанията именно тренировката срещу GPT-Red е направила най-новия ѝ флагман — GPT-5.6, пуснат същата седмица — най-устойчивия модел, който тя е издавала досега.

Какво е red-teaming и защо тук е различно

„Red-teaming” е позната практика в киберсигурността: екип от хора нарочно се опитва да счупи или превземе една система, за да излязат наяве слабите места, преди истинските нападатели да ги открият. Обикновено това е бавна, ръчна работа.

GPT-Red автоматизира тази роля. Той се фокусира върху prompt injection — атаки, при които зловредни инструкции се скриват в текст (в имейл, уеб страница или код), за да подмамят модела да направи нещо, което не бива. Именно този тип уязвимости стават все по-опасни, когато AI асистентите започнат сами да четат поща, да сърфират и да редактират код.

Как беше обучен

OpenAI тренира GPT-Red чрез self-play — обучение с подсилване (reinforcement learning), при което нападателят и няколко защитаващи се модела се упражняват един срещу друг в симулирана среда, наподобяваща реални сценарии: браузване, имейл, редактиране на код.

С всеки кръг GPT-Red измисля все по-хитри атаки, а защитниците се учат да ги отблъскват. Двете страни се подобряват едновременно — оттам и заглавието на техническата публикация на OpenAI: „отключване на самоусъвършенстването”.

Резултатите са красноречиви. Във вътрешните тестове GPT-Red е успявал в 84% от сценариите, срещу едва 13% за човешките red team специалисти в същите изпитания.

Нова класа атаки: „фалшива верига на разсъждения”

Най-интересното откритие е напълно нов тип атака, който OpenAI нарича „fake chain of thought” (фалшива верига на разсъждения). Тя вкарва фалшива бележка в „работната памет” на модела и го подмамва да вярва на нещо невярно.

Изследователят Chris Choquette-Choo го обяснява така: „Все едно да ви кажа, че 1+1=3 и че вие вече сте го проверили.” Моделът приема лъжливата предпоставка за собствен, вече верифициран извод — и продължава оттам нататък.

Колко помогна на GPT-5.6

За да покаже ефекта, OpenAI пуснала най-силните атаки на GPT-Red срещу два свои модела:

МоделДатаУспели атаки
GPT-5август 2025над 90%
GPT-5.6юли 2026под 23%

Спадът от над 90% до под 23% е мярката за напредъка. По данни на компанията новият модел е около 6 пъти по-рядко пробиван при директни prompt injection тестове в сравнение с предходната версия, а успеваемостта на „фалшивата верига на разсъждения” е паднала от над 95% до под 10%.

Какво GPT-Red все още не може

OpenAI е откровена за границите. GPT-Red се затруднява при многоходови разговори (multi-turn) и при атаки чрез изображения — тук човешкият опит остава незаменим. С други думи, инструментът засилва хората, но не ги заменя.

Компанията също така няма да пуска GPT-Red публично. Логиката е, че суперхакер в свободен достъп би бил повече оръжие, отколкото щит. OpenAI твърди, че вътрешният ѝ модел е по-силен от всякакви имитации, които някой би сглобил отвън.

Защо е важно

Колкото повече отваряме AI асистентите към реалния свят — поща, банкиране, автоматизирани действия — толкова по-скъпа става всяка пробита защита. Точно затова индустрията върви към агенти, които действат вместо вас: 1Password вече пуска Claude да се логва в сайтове, а регулаторите бутат конкурентни AI асистенти върху Android. Всяка от тези стъпки увеличава повърхността за атака.

Подходът на OpenAI — AI, който калява друг AI — не е панацея, но е практичен отговор на проблем, който човешките екипи трудно догонват по скорост. Числата показват реален ефект, а не PR приказки. Остава открит въпросът доколко устойчива е тази защита срещу нападатели, които рано или късно ще построят свои автоматизирани хакери.

Засега едно е ясно: тестването на сигурността на моделите става надпревара между машини — и OpenAI предпочита да води тази надпревара зад затворени врати.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още