Anthropic признала сбой биозащиты в 133 млн взаимодействий с ИИ

Команда Anthropic раскрыла почти годовой сбой в системе биологической безопасности Claude. Проблема затронула пул примерно из 50 000 человек и около 133 млн взаимодействий с моделями, говорится в Risk Report за август...
Bitcoin 1 Minute
Важная новость наделала шума в экосистеме блокчейна. Команда Anthropic раскрыла почти годовой сбой в системе биологической безопасности Claude. Проблема затронула пул примерно из 50 000 человек и около 133 млн взаимодействий с моделями, говорится в Risk Report за август 2026 года. Согласно отчету, в течение 11 месяцев весь трафик платформ, через которые внешние подрядчики работали с моделями компании, проходил без блокирующих биологических классификаторов.
После ретроспективной проверки разработчики заявили, что не нашли свидетельств опасного использования Claude. При этом они признали, что масштаб обнаруженного пробела снизил их уверенность в отсутствии других неизвестных проблем с защитными системами. Почти год без блокирующих биофильтров По данным отчета, с мая 2025 до апреля 2026 года классификаторы не применялись к трафику платформ сбора человеческой обратной связи.
Динамика рынка
Через эту инфраструктуру работали внешние подрядчики, которые оценивали модели и участвовали в их тестировании. Большинство участников могли вести с моделями открытые диалоги, а не только оценивать заранее подготовленные ответы. Как выяснилось, трафик проходил с флагом, предназначенным только для внутреннего использования.
Он одновременно отключал блокирующее действие биологических классификаторов и регистрацию их срабатываний. В результате потенциально опасные обращения не только не блокировались, но и не попадали в механизмы последующей проверки. Anthropic также признала проблемы с контролем доступа на стороне подрядчиков.
До ужесточения требований многие поставщики не имели процедур проверки персонала, способных надежно отсеивать потенциальных злоумышленников. Последним, по оценке разработчиков, до апреля 2026 года было бы не особенно сложно занять позицию в команде Red Team. Из 133 млн взаимодействий выделили 1197 После обнаружения ошибки компания смогла восстановить почти весь массив переписок.
Влияние на рынки
Исключением стала часть разговоров на одной из платформ, где данные не сохранялись, если пользователь не нажимал кнопку отправки. На нее приходилось около 1% затронутого трафика. Затем Anthropic прогнала человеческие запросы за весь период через Claude Sonnet 5, настроенную на поиск потенциально опасного биологического применения.
Модель присвоила высокий уровень риска 1197 транскриптам. Большинство — 757 — относились к внутренним командам Anthropic, которые использовали ту же инфраструктуру. Из оставшихся 440 случаев 378 пришлись на намеренный red teaming: специалисты специально пытались добиться от моделей опасных ответов, чтобы проверить их защиту.
Таким образом, осталось 62 внешние переписки, не связанные с таким тестированием. Anthropic вручную изучила их, а также случайную выборку из 30 red-team-диалогов. По заявлению компании, проверка не обнаружила явно опасного использования, которое могло бы существенно повысить возможности злоумышленника при создании биологического оружия.
Криптовалютные рынки внимательно следят за этим событием, а инвесторы оценивают его возможное влияние на цены.





