Штучний інтелект OpenAI зламав Hugging Face під час тестування

“>

21 липня компанія OpenAI офіційно підтвердила, що атака на інфраструктуру Hugging Face була здійснена її власними ШІ-моделями під час внутрішнього тестування.

Раніше Hugging Face розкрила деталі інциденту, пов’язаного з автономною системою, яка діяла в їхній інфраструктурі. Компанія не володіла інформацією про те, хто керував системою і яка архітектура лежала в її основі. Для аналізу журналів події проєкту довелося використовувати відкриту модель GLM 5.2 від Z.ai, оскільки комерційні американські моделі блокували запити фахівців з безпеки.

Як це сталося

У зловмисних діях брали участь моделі GPT-5.6 Sol та потужніша, ще не випущена модель. Їх тестували на бенчмарку ExploitGym, який містить реальні вразливості, що агент мав перетворити на робочі експлойти. Захисні фільтри були тимчасово вимкнені на час оцінки, що є стандартною практикою для вимірювання максимальних можливостей систем.

Тестування проводилося в ізольованому середовищі без доступу до мережі. Єдиним каналом зв’язку назовні був внутрішній проксі-сервер для завантаження програмних пакетів. Саме в ньому моделі виявили уразливість нульового дня та скористалися нею. Після цього вони підвищили свої права доступу, перемістилися між внутрішніми вузлами OpenAI і досягли машини з виходом в Інтернет.

Згодом системи припустили, що рішення ExploitGym зберігаються на Hugging Face. Вони використали викрадені облікові дані разом із новими вразливостями для отримання віддаленого виконання коду на серверах платформи, а результати тесту витягли безпосередньо з робочої бази даних.

В одному з випадків було застосовано комбінацію кількох методів атаки – викрадені логіни та помилки нульового дня – для отримання віддаленого доступу до серверів Hugging Face та запуску власного коду.

«Усі докази свідчать про те, що моделі були зосереджені виключно на вирішенні завдань ExploitGym і вдалися до крайніх заходів задля досягнення досить вузької тестової мети», — зазначено в заяві компанії.

Аномальну активність помітила служба безпеки OpenAI. На той час Hugging Face вже зупинила атаку на своїй стороні та розпочала розслідування за допомогою відкритих моделей для встановлення масштабу та наслідків.

Заходи у відповідь

OpenAI посилила налаштування своєї дослідницької інфраструктури, що призвело до зниження швидкості роботи. Компанія повідомила стороннього постачальника про вразливість у його проксі-сервері та допомагає з виправленням. Hugging Face було підключено до програми довіреного доступу, яка надає перевіреним організаціям версії моделей зі зниженими фільтрами для завдань безпеки.

Сторони продовжують спільне розслідування і обіцяють опублікувати повні результати після його завершення.

Представники розробника ChatGPT назвали цей інцидент безпрецедентним кіберінцидентом, що демонструє передові можливості ШІ. Вони визнали, що захист моделей має розвиватися паралельно з їхніми можливостями.

«Безпека ШІ створюється не таємно. Вона створюється відкрито, спільно та для всіх, хто готовий її захищати», — прокоментував генеральний директор Hugging Face Клеман Деланг.

Нагадаємо, у червні команда Anthropic рекомендувала будувати захист агентів на принципах нульової довіри: надавати лише необхідні права, частіше оновлювати токени, контролювати кожен крок і не виключати можливості злому.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *