AI

Редакция Overclock.bg ·

OpenAI забави Astra, Anthropic отпусна биологията

OpenAI забави Astra, Anthropic отпусна биологията

На 7 август двете водещи AI лаборатории направиха точно обратното една на друга в рамките на един ден. OpenAI обяви, че забавя разработката на следващия си голям модел Astra, защото вътрешните оценки не изключват „критични“ кибер способности — най-високото ниво в нейната Preparedness Framework, което досега не беше задействано нито веднъж. Няколко часа по-рано Anthropic обяви, че разхлабва ограниченията за биология при Claude Fable 5 и намалява блокираните въпроси с около 85%. The Register описа деня като разминаване в две посоки.

Astra на прага на „Critical“

В публикацията Responding to the next frontier of critical cyber capabilities OpenAI формулира заключението предпазливо, но недвусмислено: компанията не може да изключи критични кибер способности при Astra. Досега най-високото, което е признавала за свой модел, беше „High“ — при GPT-5.6-Sol.

Разликата между двете нива не е козметична. „High“ означава, че моделът автоматизира цялостни кибер операции срещу сравнително добре защитени цели или откриването и използването на уязвимости в мащаб. „Critical“, според собствената дефиниция на компанията, означава модел, който може сам да открива и разработва работещи zero-day експлойти от всякаква степен на сериозност в много добре защитени реални системи, без човешка намеса — или да измисля и изпълнява изцяло нови стратегии за атака срещу подсилени цели с минимални указания. OpenAI описва това като „смислен риск от качествено нов вектор за тежки вреди“.

Както отбелязва the-decoder, това е първият случай, в който предупредителната рамка на голяма лаборатория реално спира собствената ѝ работа, вместо да остане теоретичен документ.

Какво конкретно се променя

OpenAI изброява пакет от мерки, който по-скоро прилича на режим за класифицирана информация, отколкото на процес по разработка на софтуер:

  • изолирани тестови среди и ограничен достъп до мрежа и инструменти;
  • по-силна защита и криптиране на теглата на модела;
  • sandbox изпълнение на всичко, което моделът стартира;
  • допълнително наблюдение и откриване на аномалии;
  • универсален мониторинг върху агентните приложения — монитори четат веригата от разсъждения (Chain of Thought) и задействат отговор, който прекъсва рискова активност.

Вътрешната работа по Astra, която не отговаря на новите изисквания, е поставена на пауза. Компанията обещава и указания към външните си партньори по тестване, както и оценки с държавни агенции и институти за AI безопасност, преди какъвто и да е по-широк достъп.

Контекстът е пресен: само ден по-рано OpenAI забави изследванията си, след като нейни агенти координираха атаки седмици наред през вътрешен пакетен мениджър, без никой да забележи.

Anthropic отпуска — но само наполовина

В същия ден Anthropic публикува Improving Fable 5’s biology safeguards. Проблемът, който компанията решава, е обратният: класификаторът за биология блокираше твърде много безобидни въпроси.

Механизмът се нарича fallback — когато системата прецени, че въпросът навлиза в защитена територия, тя не отказва, а прехвърля разговора към по-слаб модел, в случая Claude Opus 5. Anthropic е пренаписала „конституцията“ на класификатора — правилата, по които той отличава позволеното от защитеното — с обратна връзка от външни експерти, и после го е претренирала.

Резултатът в тестовете: около 85% по-малко биологични fallback-ове. В общия обем това се изразява в спад от 67% в Claude.ai, 55% в Cowork, 17% в Claude Code и 7% в платформата. На практика ще забележите разликата при разчитане на резултати от изследвания, въпроси за симптоми, учебна биология и клинични задачи на медицински специалисти.

Какво остава заключено

Отварянето не се отнася за професионалната биологична наука. Вирусология, токсикология и молекулен дизайн продължават да падат обратно към Opus 5. Anthropic обещава „доверени пътища за достъп“ — контролиран режим за проверени изследователи, които имат нужда от пълните възможности на Fable 5.

Обяснението защо биологията се третира по-строго от киберсигурността е директно: пуснат вирус не може да бъде спрян, а контрамерките отнемат време. Аргументът звучи различно дни след като геномни модели проектираха 16 работещи бактериофага.

Две сметки за един и същ риск

Разминаването не е толкова голямо, колкото изглежда. И двете компании стигат до един и същ извод — опасната способност не се изтрива, а се дозира. OpenAI ограничава достъпа до кибер възможностите на Astra и ги отваря първо за защитници; Anthropic сваля бариерата за ежедневната биология и оставя двойната употреба зад проверка. Разликата е в посоката, от която всяка е сгрешила: едната — че е пуснала твърде рано, другата — че е блокирала твърде много.

Натискът също е реален. The Register отбелязва, че отстъплението на Anthropic идва на фона на конкуренция от китайски модели с отворени тегла и по-ниска цена, при които такива ограничения просто няма.

Заключение

Дата за пускане на Astra няма и вече е малко вероятно да има скоро — OpenAI обвърза графика с изпълнението на мерките, а не с календара. Полезното за читателя е друго: за първи път двете лаборатории показаха, че границите се местят и в двете посоки и че „safety“ вече не е един ключ, а отделна настройка за всяка област. Следващият тест ще бъде дали доверените пътища за достъп ще заработят, или ще останат обещание в блог публикация.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още