21.07.2026
Xiaomi представила Xiaomi-Robotics-1 — модель класса vision-language-action, преобразующую изображения и текстовые команды в действия робота. Эксперименты показали, что на текущем масштабе увеличение набора данных дает более заметный эффект, чем рост модели с 2 до 10 млрд параметров.
Исследовательская команда Xiaomi опубликовала препринт Xiaomi-Robotics-1 — базовой модели класса vision-language-action (VLA), объединяющей обработку изображений и команд на естественном языке с генерацией управляющих действий для роботов.
Для предобучения использовалось более 100 тыс. часов траекторий манипуляций, собранных в 1700 с лишним средах. Вместо физических роботов люди работали с переносными захватами Universal Manipulation Interface (UMI), оснащенными камерами. Записи автоматически разбивались на фрагменты и снабжались текстовыми описаниями изменений сцены с помощью модели Qwen3.5-27B; по оценке Xiaomi, обработка всего массива заняла около двух недель.

Xiaomi испытала варианты модели на 2, 5 и 10 млрд параметров. Увеличение их размера снижало ошибку предсказания действий, однако разница между вариантами оказалась меньше, чем при изменении объема обучающих данных. После дополнительного обучения доля успешных выполнений заданий в незнакомых средах выросла с 53% при использовании 12,5% данных до 75% при использовании полного экспериментального набора. Масштабирование модели с 2 до 10 млрд параметров повысило этот показатель с 61% до 79%.

При адаптации к четырем новым заданиям с менее чем десятью часами демонстраций на каждое Xiaomi-Robotics-1 достигла средней успешности 75% против 40% у модели π0.5 в тестах авторов. Xiaomi также сообщает о лучших результатах на четырех симуляционных тестах, хотя абсолютные показатели остаются неоднородными: например, успешность в RoboDojo составила 13,93%.
Работа пока опубликована как препринт. Код и контрольные точки модели в репозитории проекта еще не размещены — Xiaomi обещает выпустить их позднее.
Источник: arxiv.org