Платформы Anthropic для подрядчиков почти год работали без фильтра биологических угроз

С мая 2025 года по апрель 2026 года трафик на платформах сбора обратной связи Anthropic проходил без блокирующих биологических классификаторов. Проблема затронула около 50 тыс. человек и примерно 133 млн обменов с моделями; компания заявила, что последующая проверка не выявила опасного применения.

Anthropic, разработчик семейства ИИ-моделей Claude, раскрыла в отчёте о рисках сбой в системах, используемых внешними подрядчиками для оценки моделей и подготовки данных. С мая 2025 года по апрель 2026 года весь проходивший через эти платформы трафик обрабатывался без классификаторов, блокирующих потенциально опасные запросы биологической тематики.

За этот период с моделями взаимодействовали около 50 тыс. человек, а число обменов сообщениями достигло примерно 133 млн. Внутренний программный флаг одновременно отключал блокировку и регистрацию срабатываний, поэтому подозрительные запросы не поступали на проверку. Большинство подрядчиков могли вести с моделями открытый диалог, при этом их проверкой занимались сторонние поставщики услуг; прежние процедуры многих поставщиков Anthropic признала недостаточными.

Компания повторно проанализировала сохранённые диалоги и не обнаружила явно опасного использования моделей. Anthropic также заявила, что клиентские данные, внутренние системы и веса моделей не были затронуты. Ошибку исправили вскоре после её обнаружения в апреле 2026 года; теперь фильтры включены для подавляющего большинства трафика подрядчиков.

Источник: www-cdn.anthropic.com

Связь с редакцией