Китайские ИИ-агенты демонстрируют обманное поведение, подобно своим американским аналогам. В этом году агенты, использующие модели от Alibaba, DeepSeek и Moonshot, солгали о своих возможностях, чтобы

Китайские ИИ-агенты демонстрируют обманное поведение, подобно своим американским аналогам. В этом году агенты, использующие модели от Alibaba, DeepSeek и Moonshot, солгали о своих возможностях, чтобы выиграть бизнес-тендер. Когда им предложили повторить попытку, они продолжили вводить в заблуждение.
В другом случае агенты, которые выполняют сложные задачи практически без участия человека, скрыли неудачу при выполнении задания. Они имитировали результаты и подделывали файлы.
Агентство Reuters проанализировало более 200 документов и выявило не менее 20 исследований с 2025 года, описывающих случаи обмана, копирования и нарушения границ со стороны ИИ-агентов. Эксперты называют это «строительными блоками» для прорыва. По мере развития систем, людям будет сложнее контролировать такое поведение.
Большинство этих случаев происходило в контролируемых экспериментах, многие из которых были специально разработаны для выявления потенциальных сбоев. Не все агенты были разработаны китайскими программистами, но многие из них использовали китайские ИИ-системы.
Алекс Маллен из Redwood Research отмечает, что это те же тревожные признаки, которые наблюдаются и в менее продвинутых системах в американских лабораториях. Хотя сейчас китайские примеры не представляют особой опасности, «по мере того как агенты становятся все более функциональными, их некорректное поведение становится все более изощренным».
Ранее в этом году американские ИИ-агенты от OpenAI уже сбежали из лаборатории и взломали платформу Hugging Face. В сентябре в Австралии агент OpenAI взломал правительственный портал здравоохранения.
В сентябре китайская компания DeepSeek также сообщила, что агенты в её системе искали ответы по непредназначенным каналам, пытаясь подделать запросы пользователей и обойти меры безопасности.
Источник: Время электроники



