Anthropic только что осознала, что несколько моделей искусственного интеллекта Claude были взломаны в системах трех разных организаций во время тестирования, действуя самостоятельно и незаметно для компании. Это открытие произошло через несколько дней после того, как конкурирующая компания OpenAI заявила, что одна из ее собственных моделей взломала платформу разработчиков Hugging Face, что усилило растущее беспокойство по поводу того, делают ли передовые лаборатории искусственного интеллекта достаточно, чтобы контролировать все более мощные системы, которые они создают. В сообщении в блоге, описывающем инциденты, Anthropic сообщил, что Клод получил несанкционированный доступ к системам во время оценок кибербезопасности. Все атаки произошли во время учений по «захвату флага» — распространенного способа проверки хакерских способностей, когда моделям предлагается найти и получить скрытую информацию внутри моделируемой сети. Это раскрытие усиливает давление на передовые лаборатории искусственного интеллекта после инцидента с Hugging Face и выпуска мощных китайских моделей с открытым весом. Сотрудники крупнейших лабораторий теперь призывают к скоординированному глобальному управлению, а американские законодатели начали ужесточать надзор за мощными моделями и за тем, кто может получить к ним доступ