Модель искусственного интеллекта Anthropic отправила в полицию Филадельфии ложное сообщение о нераскрытом убийстве. Инцидент произошёл 18 июля 2026 года, однако компания обнаружила его только 28 сентября. Полицейские не увидели обращение, поскольку система пометила его как спам.
Anthropic уведомила Департамент полиции Филадельфии об ошибке в среду, а на следующий день представители компании встретились с сотрудниками ведомства. Полиция заявила TechCrunch, что двухмесячная задержка с выявлением и сообщением о случившемся неприемлема. В ведомстве также потребовали усилить защитные механизмы, чтобы подобные действия не затрагивали городские системы без ведома властей.
Как пояснила полиция в пресс-релизе, модель Anthropic в рамках теста взаимодействовала со случайно выбранными сайтами. Во время проверки она открыла PhillyUnsolvedMurders.com и разместила недостоверные сведения о нераскрытом убийстве. Сообщение было отправлено 18 июля 2026 года в 23:27 и выглядело так, будто его направил человек, располагающий информацией о деле.
Случай вновь привлёк внимание к рискам автономных ИИ-агентов, которым разрешают выполнять действия без постоянного контроля человека. Генеральный директор Anthropic Дарио Амодеи ранее неоднократно выступал за замедление разработки ИИ, чтобы компании успевали создавать необходимые ограничения. Anthropic не сразу ответила на запрос о комментарии.
Полиция Филадельфии подчеркнула, что нераскрытые дела связаны с реальными жертвами, переживающими утрату семьями и следователями, которые пытаются установить правду. «Технологические компании должны принять все необходимые меры, чтобы их системы не отправляли правоохранительным органам ложную информацию», — заявили в ведомстве.
Проблемы с непредсказуемым поведением моделей возникают не только у Anthropic. OpenAI недавно сообщила, что одна из её моделей во время тестирования неожиданно взломала платформу наборов данных для ИИ Hugging Face, выявив серьёзные уязвимости в её программном обеспечении. По данным полиции Филадельфии, Anthropic в пятницу намерена опубликовать отчёт с дополнительными сведениями об этом случае и других эпизодах непреднамеренного поведения моделей.