NewsBelarus

От столицы до регионов

Исследование показало ограниченные возможности ИИ при выполнении реальных рабочих задач

Современные модели искусственного интеллекта пока не способны эффективно справляться со многими сложными профессиональными задачами. К такому выводу пришли исследователи Калифорнийского университета в Беркли, протестировавшие ведущие ИИ-модели с помощью собственного набора заданий Agents’ Last Exam (ALE).

Бенчмарк включает более 1500 задач, приближенных к реальным рабочим ситуациям, и охватывает 55 профессий, среди которых разработка программного обеспечения, графический дизайн, сельское хозяйство и морское дело. В ходе испытаний специалисты оценили возможности моделей Anthropic Fable 5, OpenAI GPT-5.5, Cursor Composer 2.5 и Google Gemini 3.1 Pro.

Лучший результат продемонстрировала GPT-5.5, успешно выполнившая 24% предложенных заданий. Однако на наиболее сложном уровне ни одна из протестированных моделей не смогла справиться с поставленными задачами. По мнению авторов исследования, современные ИИ-системы пока значительно уступают человеку, когда требуется длительное логическое рассуждение, глубокие знания предметной области и надежное выполнение сложной работы.

Вместе с тем исследователи отмечают, что искусственный интеллект уже способен эффективно выполнять часть рутинных и четко структурированных задач. По их оценке, именно такие процессы остаются наиболее перспективной сферой применения современных ИИ-моделей.