Этот склад занимает компания Encord, которая создает инструменты для обработки данных, используемых при обучении моделей ИИ. Эндрю Сеха — пилот (так в компании называют операторов-роботов) — аккуратно вытаскивает деревянные бруски из шатающейся башни, надев гарнитуру с камерой, отслеживающей его взгляд. Сама по себе такая методика довольно распространена для сбора данных для обучения роботов, но эта гарнитура оснащена датчиками, измеряющими мозговые волны в процессе разбора башни.
Encord — один из небольшого, но растущего числа стартапов, которые ставят на то, что следующим реальным ограничением для гуманоидных и складских роботов станет не архитектура модели, а острая нехватка реальных физических данных для обучения. Вместо того чтобы просто помогать робототехническим компаниям управлять имеющимися данными, Encord строит бизнес на создании недостающих данных.
Гарнитуру для считывания мозговых волн, которую носит Сеха, разработала Zander Labs — немецкий нейротехнологический стартап, который считает, что измерение мозговой активности (для определения таких психических состояний, как ошибка, намерение и удивление) может создать более полезный набор данных для обучения моделей. Работа Encord с Zander пока является пробной: в Encord заявляют, что цель — создать первоначальный набор данных с разметкой мозговых волн, прогнать его через клиентские модели роботов и оценить, действительно ли он улучшает производительность, прежде чем принимать решение о масштабировании.
Лукас Герке, нейробиолог из Zander, курирующий работу, говорит, что объем мозговой активности, задействованной в любой момент выполнения задачи, дает подсказки разработчикам моделей, пытающимся понять, когда необходимо задействовать наиболее ресурсоемкие модели.
По словам Винита Велмуругана, руководителя отдела обучения роботов Encord, это «передний край» усилий по решению проблемы узкого места в данных для робототехники. Ветеран робототехнической лаборатории OpenAI и компании Berkshire Grey (занимающейся складской автоматизацией), Велмуруган присоединился к Encord, чтобы создать внутреннюю команду по генерации данных.
Encord была основана, чтобы помогать компаниям, создающим приложения машинного зрения, аннотировать данные и оценивать модели. Когда их клиенты (Велмуруган говорит, что они работают со многими ведущими робототехническими фирмами, но не уполномочен называть их) начали применять сквозное обучение для задач роботизированного манипулирования, руководство поняло, что им придется самостоятельно создавать обучающие данные, а не просто управлять ими. «Таких данных просто не существует», — сказал Велмуруган.
Ставка на то, что генеративный ИИ сделает для роботов то же, что он сделал для чат-ботов, постоянно наталкивается на эту же стену. Большие языковые модели (LLM) были построены на текстах всего интернета и даже больше. Найти то же сырье для обучения нейросетей физическому манипулированию сложно: компании, занимающиеся беспилотными автомобилями, собирают его сами, но это трудно масштабировать. Обучение на видео может работать, но ему не хватает точности данных реального мира. Велмуруган говорит, что для прорыва потребуется набор данных примерно в пять раз больше, чем видеокорпус YouTube — масштаб, который отчасти объясняет, почему генерация данных сама по себе стала бизнесом, а не просто исследовательской задачей.
Удовлетворите потребность в эгоцентричных данных
Компании, создающие «мозги» для роботов, теперь обращаются к двум основным источникам: «эгоцентричное» видео, снятое работниками в камерах, часто дополненное другими углами обзора и метриками, и сбор данных с роботов, управляемых удаленно. Encord делает и то, и другое: получает эгоцентричные данные с нескольких заводов по всему миру и использует свою лабораторию в Сан-Леандро для экспериментов с новыми модальностями, такими как мозговые волны, или для сбора наборов данных по конкретным навыкам для тонкой настройки.
Когда TechCrunch посетил лабораторию, пилоты использовали установки «ведущий-ведомый» (парные роботизированные руки, одна управляется человеком, а другая повторяет ее движения) для создания данных о таких задачах, как разлив кофе из кофейника в чашки (очень расплескивается) и складывание фишек для покера. «Каждая компания, занимающаяся гуманоидными роботами, просила у нас эти данные», — говорит Велмуруган.
На стеллажах стояли коробки с искусственными цветами в вазах, книги, пластиковые овощи, лотки и совки для кошачьего туалета, пакеты и связки проводов — все это необходимо для обучения манипуляторов выполнению бытовых задач.
На одной из таких станций другой пилот, София Инфанте, управляет роботизированными руками, чтобы подключать и отключать ethernet-кабели от задней панели сервера — именно такую работу операторы центров обработки данных хотели бы автоматизировать, если бы роботы могли манипулировать ими с требуемой точностью. Попробовав управление сам, я понял, почему это все еще недостижимо: клешни гораздо менее ловки, чем человеческие пальцы, и им не хватает степеней свободы, которые мы считаем само собой разумеющимися в наших руках.
Еще одна новая модальность данных, которую разрабатывает Encord, использует набор датчиков, закрепленных на предплечье, для обнаружения электрических сигналов в мышцах. Видео, снятое с человеческими руками, манипулирующими объектами, обычно не захватывает всю кисть, но Велмуруган надеется построить 3D-изображение положения кисти в любой момент времени на основе датчиков на руке, создавая более полное понимание для моделей.
Наборы данных Encord аннотируются физическими описаниями того, что содержит каждое видео — «правая рука затягивает болт» — чтобы помочь моделям на основе LLM понять, что происходит. Велмуруган оценивает, что такая плотная аннотация стоит в 100 раз дороже «мусорных эго-данных» для обучения конкретным задачам, а ее создание обходится лишь в 20 раз дороже, что на бумаге является выгодным обменом.
Но «в 20 раз дороже» — это все еще реальные деньги, и в этом загвоздка: сбор текстов из интернета, как это делали создатели LLM, вытягивая данные со Stack Overflow и остального веба, практически ничего не стоил ведущим лабораториям. Генерация физических обучающих данных стоит дорого, и это ограничивает сравнение физического ИИ с LLM. Такие данные нужно производить, а не просто собирать, и это меняет экономику создания подобных моделей.
Велмуруган говорит, что прогресс есть — благодаря доступу Encord к программам по всей отрасли он может видеть, как стартапы и ведущие лаборатории выясняют, что работает, а что нет для улучшения моделей физического ИИ. Эта точка обзора — нахождение между множеством робототехнических компаний одновременно — также является частью предложения Encord. Компания может заметить, какие методы работы с данными набирают обороты в отрасли, раньше, чем любой отдельный клиент.
Это обеспечит работой дюжину пилотов в лаборатории Encord. И Инфанте, и Сеха являются частью растущей рабочей силы, создающей строительные блоки для нейросетей; ранее они работали в Scale, другой фирме по аннотации данных ИИ, прежде чем присоединиться к Encord.
Сеха работал в компании по управлению отходами, где его интерес к технологиям привел к тому, что он отвечал за поддержание в рабочем состоянии роботизированного сортировщика мусора. Теперь, когда башня из Jenga рухнула, он говорит, что ему нравится решать задачи по обучению роботов: «Каждый день что-то новое!»
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tim Fernholz




