Три секунды на обучение и 600 млн долларов инвестиций. Модель GEN-1.5 приближает эру универсальных роботов
Generalist получил почти $200 млн новых инвестиций и теперь оценивается в $3 млрд. Вместе с июньским раундом стартап привлёк уже $600 млн. Инвесторы делают ставку на технологию, которая должна научить роботов быстрее осваивать новые действия и меньше зависеть от долгой настройки под каждую задачу.
Всего за несколько дней до новости о финансировании Generalist представила модель GEN-1.5. Компания утверждает, что роботу достаточно одной демонстрации длительностью от 3 до 12 секунд, после которой машина сразу пытается повторить показанное без дополнительного обучения. В тестах на десяти коротких задачах средняя успешность достигла 59%, поэтому до безошибочных универсальных роботов пока далеко.
Механизм напоминает обучение через показ. В контекст GEN-1.5 помещают короткий пример движения, после чего модель управляет роботом и воспроизводит действие. В отдельных опытах человек показывал задачу собственными руками перед камерами, а машина повторяла её сама. Модель также смогла объединить два отдельных навыка в одну последовательность и перенести демонстрацию из симуляции в реальный мир.
Generalist идёт дальше простой имитации. Предыдущую GEN-1 обучали на более чем 500 тысячах часов физических взаимодействий с примерно 9000 вариантами захватов и инструментов. Разработчики хотят создать единый «мозг», способный работать с разными роботами и механическими руками, чтобы под каждую новую конструкцию не приходилось создавать интеллект практически заново.
Практический смысл такого подхода заключается в более простом обучении машин новым операциям. Вместо длительной подготовки под каждую задачу робот в перспективе сможет получить несколько физических примеров и адаптироваться к новому инструменту или обстановке. Generalist рассчитывает применять подобный интеллект в роботах для фабрик, складов, лабораторий, ресторанов, ферм и домов.
Однако нынешние демонстрации GEN-1.5 пока состоят из коротких и сравнительно простых действий, а обучение с одного показа срабатывает далеко не всегда. Инвесторы уже рассчитывают на собственный «момент ChatGPT» для робототехники, когда одной машине не потребуется отдельное обучение для каждой операции, но создание действительно универсальных моделей может занять ещё несколько лет.