Исследователи взломали OpenAI с помощью ИИ-модели Claude
Небольшая команда исследователей из стартапа Hacktron AI показала, что современные языковые модели уже способны не просто находить уязвимости, но и самостоятельно писать работающий эксплойт для них. С помощью модели Claude Opus 5 от Anthropic трое специалистов построили цепочку атак, которая привела к компрометации аккаунта сотрудника OpenAI и доступу к внутренней инфраструктуре разработки компании. Инцидент был обнаружен и устранён ещё в июле, а подробности раскрыты публично только сейчас — и они интересны не столько масштабом ущерба, сколько тем, что ключевую техническую работу выполнил не человек, а ИИ.
Что обнаружили исследователи
Отправной точкой стала уязвимость в библиотеке обработки изображений libheif, которой присвоен идентификатор CVE-2026-32882. Библиотека используется для работы с форматом HEIC/HEIF — именно в нём по умолчанию сохраняют фотографии iPhone. Уязвимость представляет собой переполнение буфера в куче (heap buffer overflow), которое при определённых условиях позволяет выполнить произвольный код.
Проблема заключалась не в самой библиотеке как таковой, а в том, где она оказалась подключена: сервис Discourse, на основе которого построен официальный форум сообщества OpenAI, автоматически пропускал загруженные пользователями изображения через конвейер конвертации форматов. Это превратило обычную загрузку картинки в потенциальный вектор атаки на сервер.
Как сработала цепочка эксплойта
Специально сформированное HEIC-изображение, загруженное на форум, запускало выполнение кода непосредственно на сервере, обслуживающем Discourse-инстанс OpenAI. Этого самого по себе было бы достаточно для серьёзного инцидента, но исследователи Hacktron пошли дальше: они обнаружили отдельную и не связанную с первой ошибку в реализации единого входа (SSO) OpenAI, которая позволила получить доступ к аккаунтам сотрудников компании.
Связав два не зависящих друг от друга изъяна в одну цепочку, команда получила контроль над учётной записью сотрудника в ChatGPT, а через неё — выход на внутренний GitHub-репозиторий и связанную инфраструктуру разработки, включая кодового ассистента Codex.
Роль Claude в создании эксплойта
Отдельный интерес представляет то, как именно использовался ИИ. По словам исследователей, предыдущая версия модели, Claude Opus 4.8, не справилась с задачей — ей не удалось обойти стандартные механизмы защиты памяти, которые должны предотвращать эксплуатацию подобных переполнений буфера. Более новая модель, Claude Opus 5, довела работу до конца и написала рабочий эксплойт, пригодный для реальной атаки.
Это важное наблюдение: речь не о теоретической уязвимости, которую ИИ помог «придумать», а о практической цепочке атак, доведённой моделью до рабочего состояния там, где предыдущее поколение того же семейства моделей оказалось бессильно. Разница в одной версии модели оказалась разницей между неудачной попыткой и успешным взломом.
Как закончилась история
Hacktron AI сообщает, что исследователи сознательно не стали изучать чувствительный исходный код OpenAI, хотя доступ к нему теоретически был открыт. Вместо этого они ограничились демонстрацией риска: с помощью скомпрометированного аккаунта и доступа к Codex создали безобидный pull request во внутреннем монорепозитории компании — как доказательство того, что компрометация одного сотрудника способна дать выход далеко за пределы ChatGPT, вплоть до инфраструктуры разработки.
От момента обнаружения проблемы до её полного устранения прошло около 72 часов. OpenAI закрыла обе уязвимости и в рамках программы bug bounty выплатила исследователям 6 500 долларов — сумма скромная на фоне масштаба потенциальных последствий, что уже вызвало отдельную дискуссию в индустрии о соответствии размеров выплат реальным рискам.
Почему это важно
История с Hacktron AI интересна не как единичный курьёз, а как показатель смены планки. Ещё недавно построение полноценной цепочки эксплойтов — от находки уязвимости в сторонней библиотеке до обхода защит памяти и последующего pivot в корпоративную SSO-инфраструктуру — требовало команды опытных специалистов по бинарной эксплуатации. Здесь ключевую техническую часть выполнила модель общего назначения, которую три человека использовали скорее как инструмент, чем как объект отдельной инженерии.
Показательно и то, что жертвой оказалась именно OpenAI — компания, которая сама относится к лидерам в области ИИ и регулярно предупреждает о рисках использования моделей для кибератак. Это не означает, что защита компании была слабее среднего: уязвимости такого рода встречаются у большинства крупных организаций, использующих стороннее ПО вроде Discourse. Но сам факт показывает, что вопрос не в том, может ли ИИ помогать находить и использовать уязвимости в реальных системах — а в том, как быстро оборонительные практики успевают подстраиваться под эту новую скорость.