
Бенчмарк включает более 1500 задач, приближенных к реальным рабочим ситуациям, и охватывает 55 профессий, среди которых разработка программного обеспечения, графический дизайн, сельское хозяйство и морское дело. В ходе испытаний специалисты оценили возможности моделей Anthropic Fable 5, OpenAI GPT-5.5, Cursor Composer 2.5 и Google Gemini 3.1 Pro.
Лучший результат продемонстрировала GPT-5.5, успешно выполнившая 24% предложенных заданий. Однако на наиболее сложном уровне ни одна из протестированных моделей не смогла справиться с поставленными задачами. По мнению авторов исследования, современные ИИ-системы пока значительно уступают человеку, когда требуется длительное логическое рассуждение, глубокие знания предметной области и надежное выполнение сложной работы.
Вместе с тем исследователи отмечают, что искусственный интеллект уже способен эффективно выполнять часть рутинных и четко структурированных задач. По их оценке, именно такие процессы остаются наиболее перспективной сферой применения современных ИИ-моделей.