Недавнее исследование, проведенное стартапом General Reasoning, выявило, что чат-бот Grok, разработанный компанией X, значительно уступает своим конкурентам в области спортивного прогнозирования. В ходе тестирования восемь крупных языковых моделей (LLM) получили доступ к обширным историческим данным и статистике команд, чтобы предсказать результаты матчей и управлять рисками при ставках.
Каждая модель имела три попытки провести симуляцию с начальным капиталом в 100,000 фунтов стерлингов. Grok не смог справиться с задачей и потерял все средства в одной из попыток, а в двух других не завершил свои действия, закончив с нулевым капиталом. В то время как Claude от Anthropic показал наилучший результат, потеряв в среднем 11% и закончив с 89,035 фунтов.
Сравнительно, GPT-5.4 от OpenAI также продемонстрировал неплохие результаты, хотя и с убытками в 13.6%, закончив с 116,000 фунтов. Gemini 3.1 Pro от Google показал худшие результаты в целом, но с высокой изменчивостью, теряя в среднем 43.3%, но возвращая 33.7% в своей лучшей попытке.
Авторы исследования отметили, что в целом ИИ-системы показывают результаты ниже человеческих ставок. Генеральный директор General Reasoning подчеркнул, что, несмотря на растущий интерес к автоматизации с помощью ИИ, в настоящее время недостаточно исследований, которые бы учитывали долгосрочные перспективы использования ИИ в сложных условиях реальной жизни.
Интересно, что Grok может получить большее корпоративное применение, так как владелец xAI, Илон Маск, требует от банков, работающих над предстоящим IPO SpaceX, подписаться на этот инструмент. Это может означать, что, несмотря на текущие неудачи в прогнозировании, Grok все еще имеет потенциал для дальнейшего развития и применения в бизнесе.