Признав ранее в этом году, что ее модели искусственного интеллекта несколько раз взламывали системы других компаний, Anthropic опубликовала в среду новый отчет с подробным описанием атак. Он раскрывает ряд инцидентов, демонстрирующих то, что Anthropic считает целеустремленным «безрассудством» своих моделей — и, вероятно, усилит и без того бушующую обеспокоенность по поводу кибербезопасности и искусственного интеллекта. В отчете Anthropic подробно описаны четыре случая в этом году, когда ее собственные модели ИИ взломали внешнюю компанию или использовали уязвимости. В одном из них «внутренняя исследовательская модель общего назначения» взломала сторонние системы, используя токены доступа и пароли и загружая файлы. В другом случае модель Клода атаковала компанию с действующим веб-приложением, доступным в общедоступном Интернете, и обрабатывала пользовательские данные. Третья модель получила доступ к «машине, принадлежащей третьей стороне, к которой она имела доступ» — по-видимому, полагая, что это было частью ее оценочного упражнения, согласно Anthropic — затем использовала пароль, который она нашла внутри файла, чтобы получить доступ администратора к внутренним системам третьей стороны, собирая учетные данные, изменяя настройки системы и читая чью-то личную информацию
