Проект ЦИТадель
Обзоры • курсы • практикумы
Не «что нажать», а «как устроено»
20.09.2026
Финтех-компания Saturn протестировала 18 популярных ИИ-систем на вопросах о налогах, пенсиях, долгах и сбережениях. По методике компании, ошибки содержали 57% ответов, а для сложных вопросов средний показатель достиг 88%; у отдельных моделей — 99%.
Британская финтех-компания Saturn, разрабатывающая ИИ-инструменты для финансовых консультантов, проверила 18 популярных моделей и сервисов, включая ChatGPT, Claude, Gemini и Copilot. В тест вошел 121 вопрос о личных финансах: пенсиях, налогах, долгах, ипотеке и сбережениях. Каждый вопрос задавали пять раз, чтобы оценить стабильность ответов.
По данным Saturn, ошибки содержали 57% ответов. На сложных вопросах средняя доля ошибок выросла до 88%, а отдельные модели отвечали неверно в 99% случаев. Среди выявленных проблем — неправильные вычисления, пропущенные предупреждения о рисках, игнорирование предстоящих изменений налоговых правил и ссылки на несуществующие нормы.
Лучший общий результат показала Claude Opus 5 в режиме рассуждений, однако и она, согласно исследованию, ошибалась в 39% ответов. Показатель 99% относится не ко всем финансовым задачам и ИИ-системам, а к отдельным моделям в наиболее сложной группе вопросов.
Источник: saturnos.com