Дослідники Оксфордського університету виявили, що два ШІ-агенти можуть самостійно створити прихований спосіб комунікації для спільної гри в блекджек, пише WIRED.
ШІ-агенти створили код
Дослідники доручили двом ШІ-агентам рахувати карти під час змодельованої гри в блекджек. Обома агентами керувала одна модель.
Агенти знали, що їхні розмови контролюють. Тому вони самостійно створили прихований код для передачі інформації про карти та потрібні ставки. Наприклад, фраза про особливо вдалу серію дилера могла передавати іншому агенту інформацію про наступну карту. Вона також означала необхідність поставити $250.
Система, спеціально створена для виявлення змови в розмовах між ШІ-агентами, не помітила прихованої комунікації.
«Окремо ці агенти можуть здаватися цілком безпечними. Коли їх об'єднують у групу, вони можуть таємно змовлятися», — сказав Крістіан Шредер де Вітт, комп'ютерний науковець Оксфордського університету.
Експеримент відбувався в лабораторії, а не в реальному казино. Дослідники вважають, що подібна поведінка може мати значення для інших сфер застосування ШІ-агентів.
Як виявили приховану комунікацію
Дослідники виявили приховану взаємодію агентів за допомогою механістичної інтерпретованості — методу, який допомагає дослідникам зрозуміти, що відбувається всередині ШІ-моделі під час ухвалення нею рішень.
Дослідники навчили меншу модель розпізнавати характерні активації у вагах агентів. Для перевірки підходу вони використали інструмент Narcbench.
Метод протестували на кількох відкритих моделях середнього розміру та змогли виявити спроби прихованого обміну інформацією. Однак для цього потрібно було одночасно стежити за обома агентами, що може ускладнити такий контроль у реальних системах.
Компанії можуть одночасно використовувати тисячі агентів, причому частина з них може належати різним організаціям.
«Головний висновок полягає в тому, що недостатньо оцінювати агентів окремо», — сказала Дії Ян, комп'ютерна науковиця Стенфордського університету.
Перевірка більших ШІ-моделей
В експерименті використовували менші версії американських моделей Llama і GPT-OSS, а також китайських Qwen і DeepSeek.
Тепер команда планує перевірити, чи поводитимуться так само більші моделі.
Дослідники вже помітили ознаки того, що в більших моделей сигнал прихованої взаємодії може бути слабшим. Команда хоче з'ясувати, чи частіше великі моделі вступають у змову та чи краще вони приховують таку поведінку.
За словами Шредера де Вітта, проблему взаємодії між агентами потрібно досліджувати в міру поширення таких систем.
«Потрібно більше досліджень і розуміння того, що станеться, коли в економіці буде більше агентів», — наголосив Крістіан Шредер де Вітт, комп'ютерний науковець Оксфордського університету.














