
Anthropic е публикувала на 14 август втория си фирмен доклад за риска и в него признава пропуск, който компанията описва като един от най-сериозните за периода: блокиращите класификатори за биологични оръжия не са работили върху трафика на платформите за човешка обратна връзка от май 2025 г. до април 2026 г. За тези близо 11 месеца през системата са минали около 133 милиона размени с приблизително 50 000 външни изпълнители — без нито една от тях да бъде филтрирана или дори записана.
Докладът обхваща периода 24 февруари – 15 юли 2026 г. и излиза под версия 3.4 на Responsible Scaling Policy на компанията. Пълният документ е дълъг 186 страници и част от него е редактирана за публичната версия.
Един флаг, който е изключил и логовете
Причината не е атака отвън, а вътрешна настройка. Флаг, предвиден само за вътрешна употреба, е изключвал блокиращото поведение на класификаторите — и заедно с него е спирал и записването. Според доклада маркираният трафик „не е бил записван, нито предаван към какъвто и да е механизъм за преглед“.
Точно това прави случая неприятен: няма архив, по който да се провери какво е минало. Anthropic е разбрала за проблема едва през април 2026 г., след външен сигнал за откраднат API ключ на изпълнител.
Втората половина от проблема е кой е имал достъп. Изпълнителите не са били проверявани от Anthropic, а от външните доставчици на услуги, като според доклада много от тях „не са имали процеси за проверка, способни да спрат дори заплаха от ниво CB-1“. Компанията формулира извода директно: преди април 2026 г. злонамерен участник вероятно е можел да се наеме през някой от тези доставчици — например на позиция за red teaming.
Снимка: the-decoder.com
Какво е показала ретроспективната проверка
След откриването Anthropic е пуснала Claude Sonnet 5 върху всеки човешки ход, изпратен през засегнатия период, с инструкция да маркира вредно биологично съдържание. Резултатът: 1197 маркирани разговора, от които 757 идват от собствените екипи на компанията, а 62 са потенциално проблемни разговори извън red teaming. Допълнително са прегледани на случаен принцип 30 red teaming разговора.
Изводът на компанията е, че няма ясно доказателство за злоупотреба, макар да са открити разговори с „двойна употреба“. Клиенти не са били засегнати — пропускът е само в платформите за човешка обратна връзка, не в продукта.
Въпреки това оценката е коригирана: рискът от подпомагане при вече познати (non-novel) оръжия остава „нисък, но по-висок от предишната ни оценка“. По-важното е какво Anthropic пише за собствената си увереност — случаят „ни кара да смятаме, че има повишена вероятност за други, подобни неизвестни ни проблеми“.
Контекстът около доклада
Пропускът не е единственото в документа. В същия доклад Anthropic вдига оценката за катастрофален риск от несъответствие (misalignment) от „много нисък“ на „нисък“ и описва неиздаден вътрешен модел, наречен Model 2, който е „забележимо подобрение спрямо Mythos 5“ по редица вътрешни задачи. Компанията изрично заявява, че няма планове да го пуска външно.
Иронията е, че Дарио Амодей от години нарежда помощта на AI при биологични оръжия сред най-големите заплахи — по-голяма дори от кибератаките. Точно тази защита е стояла изключена почти година в средата, където се генерират данните за обучение.
Наскоро Anthropic мина и през обратния проблем: в началото на август компанията разхлаби класификаторите на Fable 5, след като изследователи се оплакаха, че филтрите блокират напълно легитимна работа по биоинформатика. Балансът между твърде строго и твърде хлабаво очевидно още се търси.
Защо това има значение
Един доклад, който сам разкрива подобен пропуск, е донякъде добра новина — прозрачността е предпочитана пред мълчанието, а Anthropic върви към рекордно IPO и всяко такова признание има цена. Но случаят показва и къде реално стоят слабите места: не в самия модел, а в инфраструктурата около него — вътрешни флагове, логове, вериги от подизпълнители.
Същият модел на скептицизъм видяхме и при водния знак в отговорите на Claude: мярката съществува, въпросът е дали е включена навсякъде, където трябва. Тук отговорът единайсет месеца е бил „не“ — и никой не е забелязал, защото механизмът за забелязване е бил изключен заедно с филтъра.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google