На этой неделе OpenAI анонсировала новую модель GPT-5.5, которая нацелена на конкуренцию с Claude Opus 4.7 от Anthropic и Gemini 3.1 Pro от Google. Эта версия обещает значительные улучшения в области кодирования и научных исследований, а также в агентных способностях.
Как же GPT-5.5 выглядит на фоне своих конкурентов? В тестах на эффективность и агентные задачи GPT-5.5 показала лучшие результаты, но по точности кода все еще уступает Claude. Gemini 3.1 Pro, в свою очередь, сохраняет преимущество в области академического мышления.
В различных тестах GPT-5.5 (включая Pro-версию) заняла первое место в 15 категориях, в то время как Claude Opus 4.7 лидировала в 7, а Gemini 3.1 Pro — в 2. Например, в тесте Terminal-Bench 2.0, который оценивает сложные командные процессы, GPT-5.5 достигла 82.7% точности, опередив Claude (69.4%) и Gemini (68.5%).
На тесте GDPval, который измеряет способность модели выполнять профессиональные задачи, GPT-5.5 набрала 84.9%, что также выше, чем у Claude (80.3%) и Gemini (67.3%). В тесте на независимую работу с компьютером GPT-5.5 также немного опередила конкурентов, набрав 78.7%.
Однако Claude Opus 4.7 продолжает доминировать в задачах, требующих реального кодирования и сложного извлечения данных. Например, на SWE-Bench Pro, который оценивает решение реальных задач на GitHub, Claude показала 64.3%, в то время как GPT-5.5 — 58.6%, а Gemini — 54.2%.
Gemini 3.1 Pro, хотя и отстает в кодировании, демонстрирует превосходство в высокоуровневом мышлении. На тесте GPQA Diamond, который оценивает уровень знаний, Gemini набрала 94.3%, опередив Claude (94.2%) и GPT-5.5 (93.6%).
Реакция пользователей на запуск GPT-5.5 оказалась смешанной. Некоторые отмечают, что новая модель стала более интуитивной и способной создавать приложения с помощью Codex. Другие же считают, что изменения незначительны и напоминают улучшения предыдущей версии.
В целом, GPT-5.5 демонстрирует значительный прогресс, но конкуренция с Claude и Gemini показывает, что каждый из этих инструментов имеет свои сильные и слабые стороны.