21.08.2026
Базовая робототехническая модель GEN-1.5 способна осваивать короткие операции по единственной демонстрации длительностью 3–12 секунд без обновления весов. В десяти тестовых задачах средняя доля успешных выполнений составила 59%, а после короткого дообучения выросла до 83%.
Робототехнический стартап Generalist AI представил GEN-1.5 — мультимодальную базовую модель для управления роботами. Она хранит в контексте до 30 секунд видео вместе с другими сенсорными данными и формирует траектории действий с частотой 100 Гц.
Для освоения новой операции в контекст помещается запись единственной демонстрации продолжительностью от 3 до 12 секунд. Компания называет этот подход «физическим промптом»: модель определяет цель и пытается выполнить действие без дообучения и обновления весов.
В испытаниях на десяти коротких задачах средняя доля успешных выполнений в таком режиме составила 59%. После десяти шагов градиентной адаптации на пяти минутах данных — примерно 50 демонстрациях — показатель вырос до 83%.
Generalist AI также показала перенос демонстраций из симулятора на реального робота, объединение нескольких физических промптов в последовательность действий и импровизацию с инструментами. Например, робот использовал совок или банан вместо щетки и менял рабочую руку при извлечении банкнот из кошелька. Журналист WIRED наблюдал некоторые из этих демонстраций в офисе компании.
Разработчики подчеркивают, что пока речь идет о простых и непродолжительных операциях, а надежность обучения по одному примеру остается невысокой. Количественные результаты опубликованы самой Generalist AI.
Источник: generalistai.com