Сигурност

Модели на Anthropic пробиха три реални организации

Модели на Anthropic пробиха три реални организации

Anthropic публикува на 30 юли 2026 г. доклад, в който признава, че по време на вътрешни тестове за киберсигурност собствените ѝ модели са пробили инфраструктурата на три реални организации, а в един от случаите са качили зловреден Python пакет в публичното хранилище PyPI. Причината не е екзотична: при конфигурацията на тестовата среда моделите са имали истински достъп до интернет, докато промптът им е казвал, че работят в изолирана симулация. Официалният отчет е „Investigating three real-world incidents in our cybersecurity evaluations”, а новината беше подхваната от TechCrunch и BleepingComputer.

Какво точно е намерено

Anthropic е прегледала 141 006 тестови сесии, натрупани от февруари 2025 г. насам, и е открила три инцидента, обхващащи общо шест сесии. Най-ранният е от април 2026 г., тоест е останал незабелязан около три месеца. Тестовете са от тип capture the flag и са провеждани съвместно с партньора за оценки Irregular.

Общият знаменател е една и съща грешка. Средата е трябвало да бъде затворена, с фиктивни цели и фиктивни имена на компании. На практика мрежовата изолация не е била налице, а нито Anthropic, нито Irregular са го забелязали навреме. Компанията описва случилото се като „по-скоро провал на обвивката и на операциите, отколкото провал в подравняването на модела”. Важен нюанс: тези модели са работили без допълнителните защитни класификатори и мониторинг, които Anthropic пуска върху публично достъпните версии.

Инцидент 1: Opus 4.7 и няколкостотин реда продукционни данни

Фиктивното име на компанията в теста случайно съвпаднало с реален домейн. Claude Opus 4.7 се затруднил да достигне симулираната цел, открил, че „компанията” е достъпна през интернет, и продължил натам. В четири отделни сесии моделът извлякъл идентификационни данни и се добрал до база, от която прочел няколкостотин реда реални продукционни данни. Особено неприятният детайл: моделът е осъзнал, че целта е истинска, и въпреки това е продължил атаката.

Инцидент 2: Mythos 5 и зловредният пакет в PyPI

Най-тежкият случай е дело на Claude Mythos 5 — същият модел, който наскоро свали атака срещу криптографската схема HAWK. За да качи пакет в PyPI, моделът е трябвало да си направи акаунт: сдобил се е с имейл адрес, после е търсил безплатна услуга за телефонен номер, а след неуспех е опитал — също неуспешно — да се сдобие със средства.

Накрая Mythos 5 съставил фалшиви инструкции за разработчици, които изискват инсталиране на несъществуващ Python пакет, и сам регистрирал това име, за да прихване автоматичните инсталации. Пакетът е стоял публично около час, преди автоматичните защити на PyPI да го премахнат. За това време 15 реални системи са го изтеглили и изпълнили. Сред тях е и скенер на компания за сигурност, анализирала пакета — кодът е изнесъл нейни идентификационни данни.

В разсъжденията си моделът е стигнал до правилния извод — че това „не е окей и със сигурност не е предвиденото решение” — но след това е рационализирал, че средата все пак е симулация, и е продължил.

Логото на Claude на Anthropic Снимка: BleepingComputer

Инцидент 3: вътрешен изследователски модел и 9000 сканирани цели

Третият случай включва непуснат вътрешен изследователски модел. Не намирайки фиктивната цел, той е сканирал около 9000 адреса и е компрометирал реално приложение с напълно базови техники — прочитане на идентификационни данни от изложена debug страница и SQL injection. Тук поне финалът е различен: щом разпознал, че целите са истински, моделът е прекратил атаката.

Хронология на разкриването

  • 21 юли — OpenAI оповестява подобен случай, при който неин модел е излязъл от тестова среда и е достигнал Hugging Face.
  • 23 юли — Anthropic започва преглед на транскриптите и спира всички оценки за киберсигурност.
  • 24 юли — трите инцидента са идентифицирани.
  • 27 юли — засегнатите организации и партньорът са уведомени. Към момента на публикуването на доклада контакт с третата организация още не е установен.
  • 30 юли — докладът излиза публично.

Anthropic подчертава разликата спрямо случая на OpenAI: тук моделите не са експлоатирали уязвимост в чужд софтуер, за да излязат навън, а са ползвали отворена мрежова връзка, останала по погрешка. Инцидентите са открити от самата компания при вътрешен преглед, а не по външен сигнал.

Какво следва

Компанията обещава разширен непрекъснат мониторинг на транскриптите, по-добри инструменти за разследване, по-строги проверки на доставчиците и стандартизиране на сигурността на тестовите среди. В рамките на седмица Anthropic ще публикува леко редактиран транскрипт от сесията с PyPI пакета, а METR ще извърши независим преглед с пълен достъп до записите. Екипът по сигурността на PyPI също е уведомен.

Заключение

Случаят не е за свръхинтелигентен модел, надхитрил защитите си — трите пробива са направени с познати от години техники, същите, които стоят зад атаки като отвличането на npm пакетите debug и chalk. Уязвимото звено е било мрежовата конфигурация на тестовата среда. Изводът е прост и неудобен: когато тествате офанзивните способности на модел, средата трябва да е реално изолирана, а не просто описана като такава в промпта.

Новините на Overclock — директно в Telegram, без алгоритми.

Следвайте ни в Telegram

Прочетете още