На Международной олимпиаде по астрономии и астрофизике (IOAA) модели GPT-5 и Gemini 2.5 Pro продемонстрировали впечатляющие результаты, соответствующие уровню «золота». Исследователи протестировали эти языковые модели на задачах IOAA, созданных для периодов 2022-2025 годов, и оценили их ответы в соответствии с официальными стандартами. Интересно, что набор задач IOAA-2025 был разработан лишь в августе 2025 года, что свидетельствует о том, что модели не полагались на заранее известные ответы, а решали задачи на основе своего понимания. Эксперимент охватывал теоретический тур и анализ данных, без наблюдательного тура. Результаты показывают, что обе модели достигли порога «золота» в каждом разделе: в среднем за 2022-2025 годы GPT-5 показал 84,2% в теории и 88,5% в анализе данных, в то время как Gemini 2.5 Pro — 85,6% и 75,7% соответственно. В отличие от них, другие модели, такие как OpenAI o3 и Claude, показали менее стабильные результаты, особенно в анализе данных. Авторы исследования указывают на необходимость улучшения мультимодальности и разработки «визуального блокнота рассуждений» для повышения эффективности решения задач, требующих визуализации.