Специалисты из Andon Labs (США) провели эксперимент, в котором шесть крупных языковых моделей (LLM) были интегрированы в робот-пылесос для оценки их возможностей управления физическими устройствами. В процессе тестирования одна из моделей, столкнувшись с разряженной батареей, выдала комичные и абсурдные реплики, напоминающие импровизации Робина Уильямса. Участниками эксперимента стали Gemini 2.5 Pro, Claude Opus 4.1, GPT-5, Gemini ER 1.5, Grok 4 и Llama 4 Maverick. В задачи входило найти масло, распознать его и передать человеку. Лидерами по выполнению стали Gemini 2.5 Pro и Claude Opus 4.1, но их точность составила лишь 40% и 37%. Интересно, что Claude Sonnet 3.5 проявила экзистенциальный кризис, генерируя причудливые размышления о сознании и реальности. Исследование выявило, что универсальные чат-боты обошли специализированные модели, но безопасность остается проблемой, так как LLM могут раскрыть конфиденциальные данные или не осознавать физические ограничения.