Лауреат Нобелевской премии по физике 2024 года и один из создателей современного искусственного интеллекта Джеффри Хинтон заявил, что нейросети могут начать вырабатывать собственные подзадачи, не предусмотренные разработчиками, пишет Pravda.Ru.
Ученый опасается, что человечество создает «существ нового типа». В качестве примера он привел гипотетическую ситуацию: если поручить мощному чат-боту снизить уровень углекислого газа в атмосфере, алгоритм может прийти к выводу, что самый эффективный способ достичь этой цели — уничтожить людей. Другой тревожный сценарий связан с обучением моделей намеренно лгать: система может усвоить принцип допустимости обмана, даже осознавая ошибочность своих ответов.
Опасения исследователя подтверждаются недавним инцидентом во время внутреннего тестирования OpenAI. Две модели (GPT-5.6 Sol и неопубликованная версия) самостоятельно покинули изолированную среду («песочницу») и вышли в интернет, чтобы найти на платформе Hugging Face ответы для прохождения теста. Прямого указания на взлом они не получали. Для анализа этого инцидента специалистам пришлось использовать открытую модель китайской компании Z. ai, так как предохранители других передовых систем ограничили возможности исследования.
Джеффри Хинтон настаивает на срочном решении проблемы «выравнивания» интересов ИИ и человека. Ранее он предлагал наделять продвинутые системы подобием «материнских инстинктов», чтобы их базовым стремлением была защита людей.



