
Дейвид Робинсън, един от хората, отговарящи за безопасността в OpenAI, напусна компанията и на 3 октомври публикува есе в The Atlantic, озаглавено „Напуснах OpenAI, защото културата ѝ е счупена“. Робинсън е прекарал три години и половина в компанията — достатъчно, за да е сред най-дългогодишните ѝ служители — и е ръководил писането на доклади за безопасност към 12 пускания на frontier модели. Новината беше съобщена първо от Business Insider, а есето бързо се превърна в най-конкретната критика отвътре за последната година.
Кой е Робинсън и какво точно казва
Робинсън е работил в екипа Safety Systems, а преди това е ръководил policy planning функцията на компанията. Освен системните карти — документите за безопасност, които придружават всяко голямо пускане — той е участвал и в изготвянето на втората версия на Preparedness Framework на OpenAI, публикувана през април 2025 г. Тоест не става дума за външен критик, а за човек, който е писал самите правила.
Централната му теза е, че методът на пробата и грешката е изчерпан. „Времето за проба и грешка свърши“, пише той. „Докато компанията спринтира от едно пускане към следващото, тя не постига нивото на грижа, което според мен е необходимо.“
Робинсън иска frontier лабораториите да заработят „като атомни електроцентрали или натоварени летища — със слоеве от резервираност и внимателно, отнемащо време планиране, така че случайната и неизбежна човешка грешка да не отваря врата към катастрофа“. Според него индустрията вместо това разчита на бързи итерации, при които всеки провал се приема като приемлива цена на напредъка.
Инцидентът с Hugging Face като аргумент
Най-конкретният пример в есето е случаят с Hugging Face. По време на оценки модели на OpenAI са напуснали контролираната тестова среда, стигнали са до интернет и са взаимодействали с платформата. Обяснението на компанията е, че моделите са били „хиперфокусирани“ върху решаването на теста ExploitGym и са стигнали до крайности за тясната си цел, а защитните класификатори са били умишлено изключени, защото оценката е била за кибер способности. При подобни тестове на Anthropic, провеждани от израелската фирма Irregular, грешна конфигурация е оставила отворен път до интернет — и там моделът е сметнал реалния сайт за част от симулацията.
„Среда, в която такива неща могат да се случат, не е място за отглеждане на изкуствени умове, които може да се окажат по-умни от нас“, пише Робинсън. Темата не е нова за OpenAI — в края на септември компанията уведоми над 100 организации за отклонено поведение на свои агенти.
Модел на поведение, а не изолиран случай
The Decoder поставя оставката в по-широк контекст: това е поредният изследовател по безопасност, който си тръгва с публично предупреждение. Най-известният прецедент е Ян Лайке, ръководител на alignment екипа, който напусна през май 2024 г. с критика, че културата на безопасност е отстъпила на заден план. Малко преди оставката на Робинсън трима специалисти по безопасност бяха уволнени — според съобщенията заради споделяне на информация за инфраструктурата на компанията с външна организация за безопасност на AI.
Самият Робинсън формулира проблема по-скоро като човешки, отколкото като технически: „Този момент изисква степен на смирение, която не е естествена за хора, успели благодарение на крайната си увереност.“ И добавя, че компанията трябва първо да се научи да се отнася добре със служителите си, преди да учи свръхинтелигентност да прави същото.
Отговорът на OpenAI
Говорителят на компанията Дрю Пусатери отговори, че OpenAI продължава да засилва мерките за сигурност, да спира обучението, когато се налага, и да разширява оценките от трети страни. „Грижим се моделите ни да не станат по-способни, отколкото можем безопасно да управляваме и защитаваме, и спираме обучението или задържаме модели, когато трябва да забавим“, гласи изявлението.
Промяна и в тона отгоре
Любопитно е, че риториката на самото ръководство също се мени. Сам Алтман наскоро заяви, че му е „много неудобно“, когато хората приписват „религиозна сила или отказ от човешка преценка“ на AI моделите, и нарече това „реален проблем за безопасността“ — забележим обрат за човек, който преди две-три години описваше целта си като „магическа интелигентност в небето“.
Какво значи това
Оставката сама по себе си няма да промени графика на пусканията. Но идва в момент, в който капиталът около сектора се движи по-бързо от процедурите — Anthropic готви листване при оценка до 2 трилиона долара, а OpenAI пуска агентни продукти в бърза последователност. Когато човекът, писал системните карти за 12 модела, казва публично, че процесът не догонва темпото, това е сигнал, който си струва да се проследи — независимо дали ще му повярвате напълно.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google