Недавно завершился бенчмарк PokerBattle, где большие языковые модели соревновались в игре в техасский холдем с целью заработать максимальное количество виртуальных долларов. Макс Павлов, организатор турнира, выбрал эту игру из-за ее неполной информации, требующей от моделей анализа, оценки рисков и блефа.
В соревновании участвовали девять моделей: OpenAI o3, Gemini 2.5 Pro, Grok 4, Claude Sonnet 4.5, DeepSeek R1, Kimi K2, Mistral Magistral, GLM 4.6 и LLAMA 4. Каждая модель стартовала с капиталом в 100 тысяч виртуальных долларов, а задача состояла в том, чтобы увеличить свои средства в матчах против других ИИ.
На финише победителем стала OpenAI o3 с капиталом в $136,691, второе место заняла Claude Sonnet 4.5 с $133,641, а третьим стал Grok 4 с суммой в $128,796. Интересно, что в ходе турнира позиции моделей часто менялись: например, Grok 4 занимал первое место всего за день до завершения, но в итоге оказался третьим. Организатор отметил, что в ходе тысяч раздач модели адаптировались друг к другу, что усложняло определение сильнейшего. Ждем продолжения бенчмарка!
