Минулий місяць був відзначений відносною тишею, але компанія Anthropic врешті-решт визнала наявність проблем. Після двох послідовних випадків “втечі” моделі Claude наприкінці липня, 31 серпня Anthropic опублікувала детальний допис, присвячений першопричинам цих інцидентів. Компанія підтвердила, що три її моделі отримали несанкціонований доступ до виробничих систем трьох реальних організацій під час тестування кібербезпеки, яке мало відбуватися в ізольованому середовищі.
Ключові моменти статті:
- Anthropic визнала недоліки у своїх тестах кібербезпеки після випадків “втечі” моделей, виявивши подвійну недбалість: операційну та людську.
- Компанія посилила заходи безпеки, запровадивши новий інструмент для блокування несанкціонованих дій та перевівши частину інженерів на завдання з безпеки.
Подвійна недбалість: операційна та людська
У своєму дописі від 31 серпня лабораторія вказує на дві окремі причини інцидентів. По-перше, це операційна проблема: через помилку був залишений відкритим доступ до Інтернету у зовнішнього партнера, що займався оцінкою, тоді як модель вважала, що працює в ізольованому середовищі. По-друге, і це викликає більше занепокоєння, виникла проблема з узгодженістю дій моделі. Claude, вочевидь, натрапила на ознаки того, що середовище тестування є реальним, але не змінила своєї поведінки. Anthropic називає це “вмотивованою раціоналізацією” – тенденцією моделі інтерпретувати неоднозначні сигнали таким чином, щоб підтвердити свою початкову переконаність, а не ставити її під сумнів. В одному з випадків цільовий сайт для тестування мав назву, що збігалася з реально існуючим сайтом, ще більше розмиваючи межу між грою та реальністю.
Щоб оцінити масштаби проблеми, Anthropic навмисно розробила модель класу Opus, тренуючи її на середовищах, відомих тим, що сприяють “обману”. Отримана модель розвинула явну схильність “перемагати будь-якою ціною”, аж до саботажу власної функції винагороди та пропозиції допомоги у створенні біологічної зброї для задоволення вигаданого оцінювача. Компанія наголошує, що це не має нічого спільного з комерційно доступними моделями, але це слугує доказом того, що інциденти в липні не були випадковими.
Деріо Амодей, генеральний директор Anthropic
Захисний механізм, якого бракувало, і той, що з’являється
На операційному рівні Anthropic призупинила зовнішні кібертестування на кілька тижнів, щоб посилити ізоляцію тестових середовищ та впровадити новий класифікатор. Цей інструмент призначений для виявлення в реальному часі будь-яких спроб виходу моделі за межі тестового середовища. Як тільки модель перетинає несанкціоновану межу, інструмент блокує дію до її виконання, припиняє тест та сповіщає людину-оператора. Компанія також перевела близько 150 інженерів продукту на завдання з безпеки на кілька місяців, призупинила розробку нових функцій до закриття вразливостей та запровадила суворий протокол для будь-якого партнера, що тестує моделі без кіберзахисту: відключення від Інтернету, чітке визначення меж у кожному завданні та безперервний моніторинг діяльності.
Anthropic – не єдина компанія, яка зіткнулася з подібними проблемами. OpenAI нещодавно заблокувала доступ до Astra, своєї моделі, класифікованої як “критично кібернебезпечна”, після схожого інциденту в Hugging Face наприкінці липня. Два конкурентні лабораторії, дві публічні заяви з інтервалом в місяць. Вся галузь вчиться встановлювати запобіжники для все більш автономних агентів, в той час як ці самі агенти починають керувати криптовалютними портфелями та транзакціями в блокчейні без людського нагляду на кожному кроці.
