Команда Microsoft Research совместно с Salesforce проанализировала свыше 200 000 диалогов, используя продвинутые ИИ-модели, такие как GPT-4.1, Gemini 2.5 Pro и другие. Результаты показали, что все исследуемые модели часто «теряются» в ходе естественных многосложных бесед, что вызывает снижение качества их ответов и даже приведение к откровенно неверным данным, что может восприниматься как «оглупление».
Ученые выяснили, что в условиях одиночного запроса, точность ответов достигает 90 %, однако в рамках многоходовых диалогов этот показатель падает до 65 %. При этом, модели, такие как o3 от OpenAI и DeepSeek R1, хотя и обладают «токенами мышления», не смогли избежать проблем с точностью.
Дополнительно, исследователи отметили, что во время длительных бесед ответы моделей увеличивались в объеме на 20-300 %, что приводило к образованию ненадежного контекста и несоответствию информации. Пользователи, возможно, осознанно переходят на ИИ-сервисы, однако это может нести риск из-за недостоверности получаемой информации. Вопросы качества взаимодействия с ИИ остаются актуальными.

