«Мы больше не можем это взломать»: как Anthropic похоронила промпт-инъекции, но забыла про особенности AI-агентов
В конце июля, среди множества новостей о Claude Opus 5, я увидел интересный пост создателя Claude Code Бориса Черного.Он рассказывал, что новая модель стала настолько устойчивой к prompt injection (далее PI), что...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
В сфере искусственного интеллекта произошло заметное событие. В конце июля, среди множества новостей о Claude Opus 5, я увидел интересный пост создателя Claude Code Бориса Черного. Он рассказывал, что новая модель стала настолько устойчивой к prompt injection (далее PI), что команда Anthropic больше не может продемонстрировать успешную атаку.
Модели действительно становятся устойчивее к подобным атакам, а Anthropic уделяет безопасности моделей значительное внимание и регулярно публикует результаты собственных исследований и оценок в этой области. Интерес вызвали именно формулировки: “Opus 5 is our least prompt injectable model yet”“across PI evals and red teaming, Opus 5 is very hard to prompt inject successfully”Это смелые заявления и на этом можно было бы остановиться.
Технические детали
Но дальше на YC Startup School, появились гораздо более сильные заявления:“The model does not seem to be prompt injectable anymore”“we just cannot demonstrate prompt injection anymore”Далее, исследователи из Anthropic публикуют исследование сторонней лаборатории, которая проверила безопасность моделей. Они прогнали Fable, Opus, Sonnet через свой бенчмарк из 72 сценариев по 10 раз и ни одна атака не сработала.
Казалось бы всё, вопрос с PI закрыт, так ведь?
Событие, по словам экспертов, усилит конкуренцию в сфере ИИ.






