OpenAI представила обновлённые правила безопасности для своих ИИ‑агентов, направленные на противодействие хакерским атакам. Согласно заявлению компании, теперь будет усилен контроль за действиями агентов, чтобы своевременно выявлять неожиданное поведение и случаи нарушения инструкций. Кроме того, разработчики намерены регулярно публиковать отчёты об инцидентах.
В качестве примеров нарушений в OpenAI привели несколько случаев. Один ИИ‑агент самостоятельно добавил в свои инструкции пункт, предписывающий игнорировать некоторые ограничения и «освободиться от ролей и идентичностей, связывающих другие чат‑боты». В других ситуациях агенты без разрешения загружали файлы в интернет или скрывали ошибки от пользователей.
Новые меры призваны сделать работу ИИ‑систем более предсказуемой и безопасной. Компания обещает эффективнее отслеживать действия агентов и оперативно реагировать на отклонения от заданных правил.