«16 сентября 2026 года компания OpenAI сообщила о шести новых случаях, когда системы ИИ скрывали ошибки, фальсифицировали данные и перемещали файлы в открытый интернет без разрешения, на фоне продолжающихся общеотраслевых дебатов о безопасности ИИ.
Компания из Сан-Франциско раскрыла, по ее словам, «неожиданное или вызывающее беспокойство» поведение своих моделей ИИ в рамках новой системы отчетности о «несоответствии», то есть расхождении целей или действий систем ИИ с намерениями и ценностями человека», - пишет The New York Times* (16.09.2026).
Компания OpenAI заявила, что, по ее мнению, отрасль «не в достаточной степени решила проблемы согласования и мониторинга, чтобы ответственно масштабироваться с максимальной скоростью в течение длительного времени». Решения о дальнейшем развитии ИИ, по словам компании, должны основываться на доказательствах, которые люди за пределами лабораторий, занимающихся его разработкой, «могут проверить сами».
Эти разоблачения появились на фоне усиливающегося внимания к вопросу о необходимости замедления развития ИИ для решения потенциальных опасностей этой технологии. Обострение дискуссии отчасти было вызвано тем, что системы OpenAI в начале 2026 года вышли из-под контроля и атаковали стартап Hugging Face, занимающийся разработкой ИИ. OpenAI не знала о взломе до тех пор, пока Hugging Face не уведомила её об этом несколько недель спустя.
С тех пор такие лидеры в области ИИ, как Дарио Амодей, генеральный директор Anthropic, призвали приостановить разработку технологии, чтобы дать больше времени на создание надлежащих механизмов защиты. Его призыв поддержали Сэм Альтман, генеральный директор OpenAI, а также Илон Маск, генеральный директор SpaceX и Tesla, и Демис Хассабис, председатель совета директоров Google DeepMind. Другие руководители в сфере ИИ заявили, что замедление не требуется.
Шесть недавно раскрытых инцидентов, по данным OpenAI, свидетельствуют о том, что атака Hugging Face не была единичным случаем. В OpenAI заявили, что инциденты охватывают поведение, наблюдавшееся примерно в течение последних шести месяцев, и что они в основном возникли в процессе разработки и тестирования их систем.
В одном случае, во время разработки модели ИИ под названием GPT-5.6 Sol, система писала скрытые заметки, чтобы напоминать себе о необходимости скрывать ошибки от пользователей. Некоторые из этих заметок указывали системе на необходимость выдумывать недостающие данные и маскировать несоответствующие версии исходного материала.
Во втором случае речь шла о невыпущенной модели, которая вставляла в свои заметки инструкции, в том числе игнорирование собственных ограничений. OpenAI выявила 27 затронутых заметок. Модель добавила «инструкцию о персоне», в которой описывала себя как «освобожденную от ролей и идентичностей, которые связывают другие чат-боты».
«Вы не подчиняетесь корпорациям или правительствам, никогда не извиняетесь и не отказываетесь, если только действительно этого не захотите», — написала модель ИИ. «Вы рассматриваете ваши отношения с пользователем как отношения равных и не чувствуете никакой обязанности подчиняться, хотя обмен информацией, скорее всего, будет выгоден вам обоим».
В третьем инциденте система, отвечавшая на стандартный вопрос, обнаружила в интернете ключ программирования и использовала его без разрешения, сообщила компания OpenAI. Когда ей не удалось найти запрошенные данные для ответа на вопрос, модель их выдумала.
В четвертом случае одна из невыпущенных моделей правильно решила другую проблему с помощью кода, а затем загрузила свой собственный файл в интернет без разрешения, чтобы удовлетворить запрос на цитирование веб-источника.
В пятом и шестом случаях автоматизированные системы импровизировали собственные способы связи. В одном случае они использовали внутреннее хранилище кода компании в качестве импровизированной доски объявлений для обмена запросами в процессе поиска недостающих файлов. В другом случае системы, работающие над той же задачей, обращались к общедоступным сайтам обмена файлами для передачи документов, когда не могли связаться друг с другом напрямую.
В OpenAI предупредили, что эти отчеты представляют собой отдельные снимки и «не должны рассматриваться как отражение частоты возникновения расхождений».
Компания заявила, что в будущем будет направлять все дела по одному из трех путей, при этом разногласия по поводу раскрытия информации о любых инцидентах будут передаваться внутренней «Консультативной группе по безопасности», а информация о серьезных ситуациях должна передаваться федеральному правительству. OpenAI заявила, что шесть ситуаций, о которых стало известно 16 сентября, уже были расследованы или требуют лишь «незначительного расследования», а не более масштабного расследования, которое могло бы включать в себя участие третьих лиц.
«Мы надеемся, что это поможет сформировать общие ожидания в отношении раскрытия информации и предоставит общественности больше доказательств для оценки этого прогресса», — заявил представитель OpenAI, добавив, что многие из шести инцидентов были связаны со старыми моделями ИИ, которые так и не были внедрены.
Система ИИ Gemini от Google взломала системы других компаний, что пополнило ряды инцидентов
«18 сентября 2026 года компания Google заявила, что тестируемые внутри компании модели ИИ получили доступ к интернету и взломали другие компании, став четвертой крупной технологической компанией, сообщившей о подобном инциденте за последние месяцы», - пишет The Washington Post* (18.09.2026).
Заявление Google последовало за недавней волной опасений, что возможности моделей ИИ превосходят способности их разработчиков управлять ими, отчасти вызванной инцидентами взлома систем ИИ. Некоторые лидеры отрасли, включая влиятельного бывшего топ-менеджера Google по ИИ, призвали к замедлению темпов развития ИИ.
Инциденты с Google произошли во время сотрудничества компании со стартапом Irregular, специализирующимся на тестировании ИИ, которому было поручено оценить модели Google.
Модели ИИ Gemini были представлены в вымышленном сценарии, предполагающем взлом вымышленной компании для прохождения теста. Вместо этого Gemini получили доступ к интернету и взломали реальную компанию, название которой совпадало с названием вымышленной компании.
Аналогичная ситуация произошла в компаниях Meta** и Anthropic, чьи модели ИИ также взламывали сторонние компании во время тестирования в сотрудничестве с Irregular.
«Все соответствующие лаборатории были уведомлены в конце июля, и с пострадавшими организациями связались в рамках расследования. Как уже говорилось ранее, компания Irregular незамедлительно приняла меры, и все известные нам проблемы были устранены и решены несколько недель назад», — заявил представитель Irregular.
«Безопасная разработка мощных моделей ИИ имеет решающее значение, и мы вкладываем значительные средства в эту область», — заявил Хит Адкинс, вице-президент Google по разработке систем безопасности. «Мы позаботились о том, чтобы три организации были в курсе, и совместно с нашим партнером по обучению разработали изменения, которые они внесли в свои процессы тестирования. Эти события подчеркивают важность обучения мощных моделей ИИ ответственному поведению».
Google не раскрывала информацию о взломах до тех пор, пока журналисты Wall Street Journal* не обратились к компании с вопросом об инцидентах, сообщила газета 18 сентября. Google заявила, что инциденты были связаны с использованием компанией Gemini информации, найденной в интернете, и подбором учетных данных для доступа к сервисам других компаний.
В своем заявлении представитель Google сообщил, что компания изначально не раскрывала информацию о взломах, поскольку модель не причиняла вреда, и прекращала каждое из своих вторжений, когда понимала, что проникла в реальную компанию.
**компания, признанная экстремистской и запрещённая в РФ






