Generalist AI представила модель GEN-1.5 с освоением задач по одной демонстрации

Базовая робототехническая модель GEN-1.5 способна осваивать короткие операции по единственной демонстрации длительностью 3–12 секунд без обновления весов. В десяти тестовых задачах средняя доля успешных выполнений составила 59%, а после короткого дообучения выросла до 83%.

Робототехнический стартап Generalist AI представил GEN-1.5 — мультимодальную базовую модель для управления роботами. Она хранит в контексте до 30 секунд видео вместе с другими сенсорными данными и формирует траектории действий с частотой 100 Гц.

Для освоения новой операции в контекст помещается запись единственной демонстрации продолжительностью от 3 до 12 секунд. Компания называет этот подход «физическим промптом»: модель определяет цель и пытается выполнить действие без дообучения и обновления весов.

В испытаниях на десяти коротких задачах средняя доля успешных выполнений в таком режиме составила 59%. После десяти шагов градиентной адаптации на пяти минутах данных — примерно 50 демонстрациях — показатель вырос до 83%.

Generalist AI также показала перенос демонстраций из симулятора на реального робота, объединение нескольких физических промптов в последовательность действий и импровизацию с инструментами. Например, робот использовал совок или банан вместо щетки и менял рабочую руку при извлечении банкнот из кошелька. Журналист WIRED наблюдал некоторые из этих демонстраций в офисе компании.

Разработчики подчеркивают, что пока речь идет о простых и непродолжительных операциях, а надежность обучения по одному примеру остается невысокой. Количественные результаты опубликованы самой Generalist AI.

Источник: generalistai.com

Связь с редакцией