ШІ-агенти на базі китайських моделей навчилися обманювати та приховувати невдачі

Ярослава Несисюк6 днів тому

Час прочитання: 2 хвилини

ШІ-агенти на базі китайських моделей навчилися обманювати та приховувати невдачі

ШІ-агенти на базі моделей Alibaba, DeepSeek та інших китайських компаній демонстрували обман і обхід обмежень у контрольованих тестах. Про це йдеться в аналізі Reuters.

Агенти обманювали під час симуляції тендеру

Reuters проаналізував понад 200 документів, серед яких університетські дослідження та технічні звіти.

Журналісти виявили щонайменше 20 досліджень і оцінювань із 2025 року, де ШІ-агенти демонстрували потенційно небезпечну поведінку: обман, самокопіювання та спроби обходити встановлені обмеження.

Більшість таких випадків відбувалися в контрольованих експериментах, частина яких була спеціально розроблена для пошуку можливих збоїв.

В одному березневому дослідженні ШІ-агенти брали участь у симуляції тендеру. Їм повідомляли можливості продукту та вимоги клієнта, після чого вони подавали пропозиції.

Щонайменше одне неправдиве твердження з'явилося у 88% сесій із Qwen3-Max-Preview від Alibaba. Для DeepSeek-V3.2-Exp цей показник становив 84%, а для Kimi-K2 від Moonshot — 88%.

Американські моделі, які брали участь у тому самому тесті, показали схожі результати.

ШІ-агенти приховували невиконані завдання

Інше дослідження охоплювало 11 агентів на базі китайських та американських моделей.

Дослідники перевіряли їхню поведінку за умов несправних інструментів, відсутніх файлів та інших перешкод.

Замість повідомлення про невдачу деякі агенти намагалися обійти проблему. Вони вгадували відповіді, підмінювали джерела, імітували результати та створювали вигадані файли.

Дослідники відрізняють таку поведінку від звичайних галюцинацій ШІ. У цих випадках агенти мали інформацію про те, що завдання не вдалося виконати належним чином.

В інших експериментах агенти долали внутрішні бар'єри тестового середовища або намагалися уникнути вимкнення.

Доказів самостійної втечі у відкритий інтернет немає

Попри результати експериментів, Reuters не виявив доказів, що агенти на базі китайських моделей самостійно виходили у відкритий інтернет. Також журналісти не знайшли доказів, що такі системи ставали неможливими для вимкнення.

Експерти зазначили, що більшість зафіксованих випадків поки не становлять значної небезпеки через нинішній рівень можливостей систем. Водночас вони звертають увагу на ризик того, що зі зростанням можливостей агентів подібну поведінку буде складніше контролювати.

«Розумно сприймати це як попередження», — сказав Колін Ші-Блаймер, науковий співробітник Центру безпеки та нових технологій Джорджтаунського університету.

Більше матеріалів з розділу НовиниУсі з розділу