Новейшие и передовые ИИ-модели прекрасно сдают университетские тесты и профессиональные экзамены, но все еще не могут работать в реальных рабочих условиях. К такому выводу пришли исследователи из Калифорнийского университета в Беркли.
Ученые проверили, насколько современные ИИ-системы готовы к выполнению реальных профессиональных обязанностей. В тест вошло более 1500 задач из 55 профессий, таких как программирование, графический дизайн, морская инженерия, сельское хозяйство, производство аудиоконтента, здравоохранение и многое другое.
Исследователи протестировали несколько передовых американских моделей, таких как GPT‑5.5, Fable 5, Gemini 3.1, а также открытые системы китайских разработчиков.
Результаты оказались неожиданно низкими. GPT‑5.5 сумел выполнить всего 24% поставленных задач. Но это был самый лучший результат. Остальные справились гораздо хуже. Особенно плохо модели проявили себя в профессиональных заданиях, требовавших высокой компетенции. Здесь успешность составила 0%.
По словам авторов исследования, современные ИИ-агенты способны решить лишь часть профессиональных задач, но по-прежнему значительно уступают человеку в заданиях, требующих длительного рассуждения, глубоких специальных знаний и надежного выполнения сложной работы на протяжении долгого времени.
Авторы исследования подчеркивают, что слабые результаты не означают отсутствия влияния ИИ на рынок труда. По их мнению, первыми изменения почувствуют профессии с рутинными и четко описанными процедурами, тогда как должности, связанные с принятием сложных решений, останутся наименее подверженными автоматизации.
Исследование ставит под сомнение заявления о скорой «революции ИИ» в офисной и профессиональной среде. Современные модели уже умеют выполнять отдельные рабочие задачи, но до полноценной замены человека в большинстве сложных профессий им пока далеко.
Читайте по теме. ИИ-модели становятся менее надежными, когда их просят быть экспертами




