Команда Microsoft Research совместно с Salesforce провела анализ более 200 000 диалогов, используя передовые модели ИИ, такие как GPT-4.1, Gemini 2.5 Pro и другие. Результаты показали, что модели часто сталкиваются с трудностями в рамках многоходовых диалогов, проявляя тенденцию к «оглуплению» и выдавая неточные ответы и галлюцинации. Например, ИИ-модели способны давать 90% точных ответов на простые запросы, но их точность снижается до 65% в продолжительных беседах, что связано с использованием изначального ошибочного ответа для последующих вопросов. Также было зафиксировано, что в многоходовых диалогах объем ответов увеличивается на 20‑300%, что приводит к большему количеству предположений и искажений. Несмотря на наличие дополнительных «токенов мышления» у некоторых моделей, таких как o3 от OpenAI, их эффективность не улучшилась. Помимо этого, эксперты указали на снижение надежности LLM на 112%. Важно отметить, что пользователи начинают все чаще обращаться к ИИ-сервисам, несмотря на риски, связанные с достоверностью генерируемой информации. В то же время Microsoft утверждает, что низкое качество запросов от пользователей может быть причиной сложностей, с которыми сталкиваются модели ИИ.