На Международной математической олимпиаде 2024 года произошел уникальный случай: искусственный интеллект AlphaProof, разработанный Google DeepMind, показал результаты, сопоставимые с серебряной медалью, что стало историческим событием для ИИ. AlphaProof ориентирована на создание строгих формальных доказательств и способна обнаруживать и исправлять собственные ошибки, в отличие от традиционных языковых моделей, которые иногда выдают неверные результаты.

Для обучения AlphaProof использовались 300 миллиардов токенов, а затем система была подвергнута обучению на 300 тысячах готовых доказательств. Завершающим этапом стало решение 80 миллионов формализованных задач с помощью метода обучения с подкреплением.

Система также использует Test-Time Reinforcement Learning для генерации упрощенных версий задач, что позволяет развивать собственные стратегии решения. Такой подход делает AlphaProof мощным инструментом не только для олимпиад, но и для верификации математических текстов и поиска ошибок.