Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
26.09.2026
Модель OpenAI показала лучший результат в тесте Epoch AI, сопоставляя фотографии частично собранной мебели IKEA с инструкциями. Однако исследование охватило только 60 изображений, а обработка одной фотографии занимала у модели около трёх минут.
Исследовательская организация Epoch AI опубликовала результаты Furniture Assembly Benchmark (FAB) — теста на визуальное и пространственное рассуждение при сборке мебели. Моделям предлагали по фотографии и инструкции определить, допущена ли ошибка, указать соответствующий этап сборки и описать проблему.
GPT-6 Astra от OpenAI правильно выполнила 80% заданий. Следующие места заняли Claude Fable 5.1 с результатом 70% и Claude Opus 5 с 61%. Для сравнения, лучшая из протестированных в ноябре 2025 года моделей — Claude Opus 4.5 — набрала 28%.
Набор данных включает 60 фотографий трёх предметов мебели IKEA с намеренно допущенными ошибками. Медианное время анализа одного изображения у GPT-6 Astra составило три минуты — быстрее остальных протестированных систем, но пока недостаточно для подсказок в реальном времени.
Авторы подчёркивают ограниченность эксперимента: результаты на трёх изделиях нельзя автоматически переносить на другие задачи по сборке и ремонту, а показатели человека в этом тесте пока не измерялись.
Источник: epoch.ai