20.07.2026
Команда с участием Google DeepMind представила GenCeption — модель, адаптирующую генератор видео для оценки глубины, сегментации, определения позы камеры и других задач. По данным авторов, единая архитектура сопоставима со специализированными системами, хотя требует значительно меньше данных для дообучения.
Исследователи Google DeepMind и нескольких университетов представили GenCeption — систему компьютерного зрения на основе предварительно обученной диффузионной модели генерации видео. Архитектура выполняет задачу за один прямой проход, а нужный режим — например, оценка глубины или сегментация — задаётся текстовой инструкцией.
GenCeption поддерживает оценку глубины и нормалей поверхности, определение положения камеры, сегментацию объектов по описанию и поиск трёхмерных ключевых точек. Авторы сообщают, что в отдельных тестах модель достигает результатов специализированных систем или превосходит их, используя в 7–500 раз меньше обучающих кадров.

Дообучение проводилось преимущественно на синтетических видео с людьми, однако модель смогла обрабатывать реальные записи, сцены с несколькими объектами, а также ранее не встречавшиеся категории — животных и роботов. Исследователи считают это признаком того, что видеогенераторы усваивают универсальные пространственно-временные представления, пригодные для создания многоцелевых моделей компьютерного зрения.
Источник: arxiv.org