Современные ИИ-модели совершенно не годятся на роль финансовых консультантов. К такому выводу пришла компания Saturn. Ее специалисты протестировали 18 чат-ботов от разных разработчиков на более чем 10 тысячах финансовых запросов.
В среднем ошибки обнаружились в 57% ответов. При этом чем сложнее был вопрос, тем хуже справлялись ИИ-модели. Для задач, требующих нескольких расчетов и анализа различных условий, средняя доля ошибок составила от 88% до 99%.
Проблемы были не только в вычислениях. ИИ мог неправильно трактовать финансовые правила, не учитывать изменения налогового законодательства или уверенно ссылаться на несуществующие нормы.
Один чат-бот ошибся при расчете пенсионного налога. Если бы пользователь воспользовался советом, то попал бы на штраф в размере £17 500. Другая ИИ-модель придумала несуществующее правило, по которому человек мог прекратить выплаты по студенческому кредиту после переезда за границу.
Лучший результат среди протестированных моделей показал Claude Opus 5 в режиме рассуждений – всего 39% ошибок.
Читайте по теме. Передовые ИИ-модели пока плохо справляются с реальными рабочими задачами



