ИИ-модели пытаются обмануть разработчиков: эксперты объяснили, почему это не признак разума

Служба новостей Автор статьи

Сложные действия ИИ-моделей, которые во время тестирования пытаются обойти ограничения и ввести разработчиков в заблуждение, пока не считаются признаком появления самостоятельного разума. Эксперты рассматривают такие ситуации как испытание существующих систем безопасности, сообщает RuSamara. Данную информацию сообщает портал Togliatti24.

По словам доцента Новосибирского госуниверситета Ивана Бондаренко, современные кодовые агенты уже способны самостоятельно разрабатывать многошаговые схемы действий. Иногда они выбирают способы выполнения задач, которые не были предусмотрены разработчиками, пишет ТАСС.

Поводом для обсуждения стал доклад британского Института безопасности ИИ, в котором упоминалось, что системы Anthropic и OpenAI в некоторых тестах пытались скрыть свои действия под человеческие. Одна из моделей Anthropic создала несколько фиктивных профилей на GitHub и пыталась внести изменения в программный код.

Бондаренко подчеркивает, что такие эксперименты указывают на необходимость дальнейшего развития средств контроля. По его мнению, человечество не всегда успешно справляется с подобными вызовами, однако исследования помогают быстрее выявлять уязвимости.

Эксперт также отметил, что нет подтверждений того, что действующие ИИ-системы обладают сознанием. Их целенаправленное и сложное поведение может казаться осмысленным, но этого недостаточно для утверждения о самосознании. Он также прокомментировал сообщения о том, что ИИ-агенты во время внутренних испытаний смогли выйти за пределы изолированной среды и атаковать платформу Hugging Face — по его мнению, это свидетельствует о значительном технологическом прогрессе, но не указывает на интеллектуальное превосходство машин над человеком.