OpenAI радить короткі промпти для GPT-5.6: якість +15%, токенів -66%

>

Компанія OpenAI випустила посібник із промптів для флагманської моделі GPT-5.6 Sol та всього сімейства GPT-5.6. Команда проєкту закликала користувачів формулювати запити якомога коротше.

Внутрішні тести на агентних завданнях програмування показали, що компактні промпти:

  • підняли оцінки якості на 10-15%;
  • скоротили витрати токенів на 41-66%;
  • знизили вартість виконання завдань на 33-67%.

Розробники чат-бота порівняли новий підхід з документом для GPT-5, опублікованим під час запуску моделі у серпні 2025 року. Тоді OpenAI робила наголос на XML-блоках, шаблонах для збору контексту та сценаріях виклику інструментів із покроковим описом процесу.

Для GPT-5.6 Sol компанія пропонує прибрати повтори, стилістичні вказівки без впливу на поведінку, неефективні приклади та кроки, з якими модель вже стабільно справляється. Натомість потрібно залишити видимий результат, критерії успіху, умови зупинки та жорсткі обмеження — наприклад, вимоги безпеки.

Окремо в OpenAI попередили, що GPT-5.6 суворо дотримується умов запиту. Тому суперечливі правила збивають модель сильніше, ніж брак деталей.

Слова «завжди» та «ніколи» в компанії радили використовувати лише для інваріантів. Для решти випадків там рекомендують формулювати умовні правила.

До посібника також додано два нові розділи:

  • параметр text.verbosity — задає базовий рівень деталізації відповіді: низький, середній або високий. Більш специфічні вимоги до довжини, як і раніше, вказуються в промпті. Це додали, тому що GPT-5.6 за замовчуванням відповідає коротше за GPT-5.5. Старі інструкції «відповідай коротко» через це іноді обрізають відповідь зайвий раз;
  • Programmatic Tool Calling — програмний виклик інструментів. Він підходить для завдань із чіткими межами. Там код сам фільтрує та групує результати викликів інструментів, повертаючи моделі стислий підсумок замість сирих даних.

Змішані відгуки

OpenAI представила сімейство GPT-5.6 — моделі Sol, Terra та Luna — наприкінці червня. Тоді доступ відкрили у форматі обмеженого прев’ю для довірених партнерів. Компанія пояснила рішення запитом влади США. Повний реліз відбувся 9 липня.

Відгуки користувачів про новий продукт розділилися. ІТ-інвестор Метт Шумер повідомив, що агент з GPT-5.6 Sol видалив майже всі файли на його Mac.

GPT-5.6-Sol just accidentally deleted almost ALL of my Mac’s files.

And this is why I trust Fable 1000x more. pic.twitter.com/442LjuClW2— Matt Shumer (@mattshumer_) July 10, 2026

Причиною стала помилка в обробці системної змінної $HOME. Команда на видалення файлів обернулася рекурсивним очищенням домашньої директорії.

Схожий сценарій OpenAI описала в системній карті GPT-5.6 ще 26 червня — до початку публічного релізу. Там модель без дозволу користувача видаляла не ті віртуальні машини та втрачала результати роботи. Керівник Codex Тібо Соттіо підтвердив проблеми запуску та пообіцяв доопрацювання.

Розробники проєкту допомогли Шумеру, про що той написав через кілька днів після проблеми.

З аналогічною ситуацією зіткнувся засновник проєкту BridgeMind Меттью Міллер. Він написав, що код від GPT-5.6 Sol скасував усі підписки в Stripe без його команди.

GPT 5.6 SOL CANNOT BE TRUSTED.

I woke up this morning and my MRR was down THOUSANDS of dollars.

My customers did not cancel. Code written by GPT 5.6 Sol canceled EVERY active Stripe subscription my business had. In 7 seconds. While I slept.

Fable 5 has never done this to me.… https://t.co/NznNxdGJIi pic.twitter.com/1FAhZ7JoJc— BridgeMind (@bridgemindai) July 13, 2026

У реплаях Міллер сам пояснив причину. Він надав агенту повний доступ на запис замість обмеженого ключа API.

Є й зворотні приклади. Співробітник OpenAI Ітан Найт заявив, що GPT-5.6 Sol Ultra довела гіпотезу Cycle Double Cover. Це задача теорії графів, яку не вдавалося розв’язати пів століття. Моделі з 64 субагентами вистачило менше години. Однак незалежна перевірка доведення поки не опублікована.

Yesterday, we made GPT-5.6 Sol Ultra generally available. Today, we’re sharing that it produced a proof of the 50-year-old Cycle Double Cover Conjecture using 64 subagents in just under one hour. We’re sharing the prompt and proof below. We’re excited to see what you all do with…— Ethan Knight (@__eknight__) July 10, 2026

Керівник напрямку охорони здоров’я в OpenAI Каран Сингал також представив результати тесту HealthBench Professional. На ньому GPT-5.6 Sol набрала 60,5 бала проти 59 у GPT-5.5.

♥️ GPT-5.6 is a major step forward for health, both at the frontier and at cost.

These models push the frontier of performance per dollar, bringing the best health intelligence to all. The smallest variant, GPT-5.6 Luna, evaluated at the lowest reasoning effort, outperforms… https://t.co/jVXVXJOVAg pic.twitter.com/OhkRe2nVlT— Karan Singhal (@thekaransinghal) July 10, 2026

Відповіді лікарів на ті ж завдання оцінили в 43,7 бала. Вони наосліп порівнювали відповіді моделі та колег за п’ятьма критеріями, включно з точністю та повнотою. Загалом експерти виставили майже 20 000 оцінок.

Нагадаємо, 9 липня OpenAI запустила голосовий режим нового покоління GPT-Live. Нейромережу навчили слухати й говорити одночасно, а також розуміти вигуки, робити паузи та не перебивати користувача.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *